13 · AI 智能体派单 + 人工核查模式设计
定位:将平台核心派单从"规则引擎派单 + 事后人工客服"升级为 「AI 智能体自主决策 + 人工核查兜底」(Human-in-the-Loop, HITL) 模式。AI 负责绝大多数常规决策,人工核查负责关键、高风险、低置信度决策的确认与修正,两者形成"能 AI 则 AI、该人查必人查、全程可审计、反馈可进化"的闭环。
1. 设计目标与原则
1.1 目标
| 指标 |
目标值 |
说明 |
| AI 自主处理率 |
≥ 90% |
常规订单由智能体直接决策执行 |
| 人工核查修正率 |
≤ 5% |
过高说明 AI 不稳,过低说明核查冗余(校准区间 2%~5%) |
| 平均接驾时长 |
较纯规则引擎 -15% |
智能分流替代全量广播 |
| 完单率 |
≥ 92% |
决策质量提升的直接结果 |
| 决策延迟 |
P99 < 800ms |
含感知汇总 + 决策 + 置信度评估 |
| 决策留痕率 |
100% |
监管审计与算法备案要求 |
1.2 原则
- 能 AI 则 AI:常规决策(90%+)智能体自主完成,不打扰人工。
- 该人查必人查:低置信度、大额、安全类、投诉纠纷类决策必须人工介入。
- 决策留痕可解释:每个决策记录输入、方案、置信度、理由、结果,可审计、可回放。
- 反馈闭环进化:人工修正作为标注数据回流训练,模型持续校准。
2. 智能体架构(多智能体协作)
┌──────────────────────────────────────────────────────────────┐
│ AI 智能体决策层 │
│ ┌──────────┐ ┌──────────┐ ┌──────────┐ ┌──────────┐ │
│ │ 感知智能体│ │ 决策智能体│ │ 谈判智能体│ │ 风控智能体│ │
│ └──────────┘ └──────────┘ └──────────┘ └──────────┘ │
│ ┌──────────┐ ┌──────────┐ │
│ │ 解释智能体│ │ 学习智能体│ │
│ └──────────┘ └──────────┘ │
└────────────────────────┬─────────────────────────────────────┘
│ 决策方案 + 置信度 + 风险等级 + 解释
┌────────────────────────▼─────────────────────────────────────┐
│ 分级执行与人工核查层(HITL) │
│ A 级 高置信 → 直接执行(异步 1% 抽样审计) │
│ B 级 中置信 → 执行 + 10%~30% 抽样人工核查 │
│ C 级 低置信/高风险 → 进入核查队列,人工确认/改派后执行 │
│ D 级 安全事件 → 立即执行安全预案 + 事后 100% 核查复盘 │
└────────────────────────┬─────────────────────────────────────┘
│
┌────────────────────────▼─────────────────────────────────────┐
│ 决策日志(全量留痕) → 人工修正标注 → 学习智能体离线训练 → 灰度发布 │
└──────────────────────────────────────────────────────────────┘
2.1 各智能体职责
| 智能体 |
输入 |
输出 |
技术选型 |
| 感知智能体 |
实时供需、路况、天气、事件(活动/封路)、运力方在线状态、司机行为流 |
结构化场景快照(状态向量) |
时序预测、图神经网络(GNN)、事件流处理 |
| 决策智能体(主) |
场景快照 + 订单特征 + 平台政策约束 |
派单方案(运力方分配/司机指派/价格建议)+ 置信度 + 风险等级 |
强化学习 / 上下文赌博机(Contextual Bandit)+ 硬约束规则 |
| 谈判智能体 |
候选运力方 + 乘客偏好 + 历史响应 |
多轮询价结果(报价/ETA/可用车/响应概率) |
LLM 工具调用(调 qz-open API)+ 响应预测模型 |
| 风控智能体 |
订单/司机/车辆/设备/历史行为 |
风险评分 + 处置建议 |
风控规则引擎 + 图计算(团伙识别) |
| 解释智能体 |
决策方案 + 场景快照 |
人可读的自然语言决策理由 |
LLM(绑定决策事实,防幻觉) |
| 学习智能体 |
决策日志 + 人工修正标注 |
模型更新 / 规则调整建议 |
离线训练管道(每周)+ A/B 灰度 |
2.2 智能体之间的协作流
感知 → 场景快照
→ 决策: 生成候选方案集(约束过滤后 Top-K)
→ 谈判: 对候选运力方并发询价(仅广播 Top-3, 而非全量)
→ 风控: 候选方案风险评分
→ 决策: 综合评分 + 置信度评估 + 分级(A/B/C/D)
→ 解释: 生成理由(人工可见/可审计)
→ 执行或进入人工核查
3. 分级决策与人工核查流程
3.1 分级规则(Confidence Gating)
| 级别 |
触发条件 |
执行方式 |
核查要求 |
| A |
置信度 ≥ 0.85 且无风险标记 |
智能体自动执行 |
异步 1% 抽样审计 |
| B |
0.65 ≤ 置信度 < 0.85 或存在低风险标记 |
智能体自动执行 |
10%~30% 抽样人工核查(SLA 30s) |
| C |
置信度 < 0.65 或高风险标记(大额 > 500 元、投诉纠纷、轨迹异常、新司机首单、跨城订单) |
进入人工核查队列,人工确认/改派后执行 |
100% 人工核查 |
| D |
安全事件(一键报警、事故、失联) |
立即执行安全预案(同步 110/安全组),不等待人工 |
事后 100% 核查复盘 |
分级是双通道的:置信度低(AI 自我评估不可靠)或风险高(风控智能体标记)任一命中即降级处理——宁可多核查,不可漏核查。
3.2 人工核查中心(管理端新增模块,详见 09 文档页面 13)
| 能力 |
说明 |
| 核查队列 |
按 级别(C 优先)→ 风险分 → 金额 排序;B 级抽样自动入队 |
| 核查工作台 |
订单全链路(轨迹/费用/IM)+ AI 决策方案 + 解释智能体生成的理由 + 相似历史案例推荐 |
| 核查动作 |
通过 / 修改参数后执行 / 拒绝并改派 / 升级双人核查 / 转客服 |
| 双人核查 |
金额 > 500 元、安全类、跨城订单强制双人 |
| SLA |
C 级 30s 内响应、5 分钟处理完;超时自动升级主管 |
| 绩效 |
核查时效、修正率、误判率,纳入团队 KPI |
3.3 决策日志(Decision Log,可审计)
decision_log 每单决策全量记录:
input_snapshot 感知快照(供需/路况/候选集, 敏感字段脱敏)
candidates Top-K 候选方案及评分
decision 最终决策(派单/分流/定价建议/补偿)
confidence 置信度
risk_level 风险等级
grade A/B/C/D
executed_by AI / 人工
corrected_by 人工修正内容(若有)
result 执行结果(接单/完单/取消/投诉)
- 用途:监管审计(算法备案)、线上问题回溯、学习智能体训练语料。
- 存储:ClickHouse 冷热分层,保留 ≥ 2 年;查询支持按订单号/场景/置信度区间检索。
4. 与聚合模式的结合(智能体的决策场景)
| 场景 |
传统做法 |
智能体做法 |
| 多运力方分流 |
全量广播比价(5 家都发) |
预测各家响应概率/完单率/服务质量 → 只广播 Top-3,节省运力方资源、降低骚扰 |
| 指派/抢单 |
规则评分(距离/服务分) |
决策智能体综合评分(顺路度/接单率/历史行为/时段偏好)+ 置信度分级 |
| 动态定价建议 |
固定比例溢价 |
供需预测 → 建议溢价幅度(归运力方)→ 运力方确认,溢价建议也走分级(大额人工) |
| 异常处置 |
乘客投诉后人工处理 |
迟到/绕路/多收费自动检测 → 补偿方案建议:小额(< 20 元)自动执行,大额转人工 |
| 热区预测与调度 |
人工看报表 |
提前 30 分钟预测供需热区 → 生成司机调度建议(引导而非强制) |
| 乘客体验 |
无响应等广播 |
智能等待:预测等待原因与剩余时间,主动告知替代方案(转出租车/换车型) |
| 客服 |
人工/简单机器人 |
AI 客服(意图理解 + 订单上下文 + 解释智能体理由)兜底人工,复杂单自动建工单 |
5. 反馈闭环与进化机制
人工核查修正
→ 形成标注数据(决策 + 执行结果 + 人工判定)
→ 学习智能体每周离线重训
→ 历史数据回放回归测试(防劣化)
→ A/B 灰度对比(完单率 / 接驾时长 / 核查修正率)
→ 全量发布 → 置信度校准(用核查结果回灌,校准置信度阈值)
- 版本管理:每个决策模型版本可回滚;决策日志记录 model_version,便于责任追溯。
- 防漂移:监控"修正率上升"与"置信度分布漂移",触发人工复盘与重训。
6. 监管与合规要点
| 事项 |
要求与对策 |
| 算法备案 |
按《互联网信息服务算法推荐管理规定》完成算法备案,提交可解释性说明材料(决策日志即证据) |
| 责任边界 |
"AI 建议 + 人工兜底"模式下,平台(聚合平台)对乘客的先行赔付等法定义务不变,AI 不成为责任豁免理由 |
| 生成式 AI 合规 |
解释智能体/客服若用 LLM:《生成式人工智能服务管理暂行办法》要求内容审核、防幻觉——解释文本必须绑定决策事实(模板 + 关键数值填充,而非自由生成) |
| 数据合规 |
决策日志含位置等敏感信息 → 脱敏存储、权限最小化、保留期限管理(PIPL) |
| 审计证据 |
每个决策保留 model_version + 输入快照 + 人工痕迹,满足监管与司法取证 |
7. 实施路线(与 MVP 及后续阶段衔接)
| 阶段 |
范围 |
验收 |
| MVP(14 周) |
规则引擎派单 + 模型 A(轻量 AI 排序评分) + 置信度分级(规则近似)+ 人工核查中心 v1(C/D 级 + 投诉 + 大额订单 100% 人工) |
核查中心可处理 C/D 级;AI 自主处理率 ≥ 60%(常规订单);决策日志 100% 落库 |
| P1(6~12 月) |
完整多智能体(感知/决策/谈判/风控/解释)+ B 级抽样核查 + 反馈闭环上线 |
AI 自主处理率 ≥ 85%;修正率 ≤ 5%;接驾时长 -10% |
| P2(12 月+) |
强化学习端到端派单 + 热区预测 + 与运力方联合优化 + 智能体对外能力(谈判自动化) |
AI 自主处理率 ≥ 90%;完单率 ≥ 92%;决策延迟 P99 < 800ms |
关键原则:人工核查中心先行上线(MVP 就有),AI 能力逐步增强——先把"兜底"建好,再让 AI 飞得更高。
8. 与既有文档的衔接
| 文档 |
变更 |
| 05-技术架构设计 |
新增智能体调度服务/人工核查服务/决策日志,见 §3 与 §6 |
| 10-MVP技术任务拆解与排期 |
新增 W19 工作包(模型 A + 置信度分级 + 核查中心 v1),团队扩充算法 2 人 |
| 04-PRD-平台管理端 |
新增"核查员"角色与"人工核查中心"模块 |
| 09-原型线框图-管理端 |
新增"人工核查中心"页面(页面 13) |
| 02-PRD-乘客端 |
行程中"智能等待"、异常自动检测补偿在 P1 随智能体上线,MVP 不阻塞 |