项目是什么
将 29 个 L1、122 个 L2、418 个 L3 标签,拆为 5 类原子能力。围绕能力边界重新组织任务路由、证据、决策和反馈。
5 原子能力EvidenceConfidenceHuman Review
我负责什么
我负责能力路由、结构化证据表达、规则优先级、冲突处理、不确定性协议及回归和灰度验证机制设计。
怎么把它做出来
- 从复制人工 SOP 转向围绕 Agent 能力组织信息、路由与规则。
- 高置信且证据充分的案例进入自动处理;低置信、冲突或证据不足的案例进入结构化人工仲裁。
- 仲裁结果回流规则和数据集,通过 Harness 回归门禁后再决定灰度、扩展或回滚。
结果,也包括边界
已完成试点架构与验证机制设计。标签准确性、证据充分性、人工复核率、万 Case 成本和回归稳定性为后续验证指标,不把目标写成已实现的规模化收益。
摊开看看,项目证据。
