项目是什么
以智能客服为例,把真实咨询、Agent 执行日志、DeepEval 评分、Badcase 归因与发布回归连起来。这里展示方法,不虚构一套自研评测平台。
DatasetDeepEvalTraceBadcaseRegression
我负责什么
设计用例结构、业务评分口径、版本对照和失败归因。日志与评测脚本承担记录和执行;DeepEval 承担语义评估,高风险判断保留人工复核。
怎么把它做出来
- Dataset:把 FAQ、负反馈、多轮咨询和转人工样本,整理为输入、预期知识、工具与风险标签。
- Agent Run:固定模型、Prompt、知识库和工具版本,记录回答、检索片段、调用轨迹与时延。
- DeepEval:确定性字段先用规则校验;DeepEval 评估回答相关性、忠实度、检索质量、多轮表现与工具正确性。
- Badcase:按意图、知识、工具、生成、上下文与人工兜底归因;修改对应环节,避免盲目调 Prompt。
- Regression Gate:比较版本与风险切片。关键错误未解决就阻止放量,不用总体均分掩盖高风险失败。
- Gray Release:用线上质量、人工接管、时延与成本验证;新失败进入数据集,开启下一轮。
结果,也包括边界
确定性结果用代码或 API 校验,开放回答用语义指标与人工复核;最终以业务质量、接待效果、风险和成本共同判断能否发布。
摊开看看,项目证据。
这里提供评测方法说明,未附公司原始数据或虚构平台截图。技术概念可对照 DeepEval 官方文档 ↗。