← 回到海报墙
EVALUATE → ITERATE / 工作方法

Agent Evaluation

不是只看回答好不好,而是让每次迭代都有证据。

项目是什么

以智能客服为例,把真实咨询、Agent 执行日志、DeepEval 评分、Badcase 归因与发布回归连起来。这里展示方法,不虚构一套自研评测平台。

DatasetDeepEvalTraceBadcaseRegression

我负责什么

设计用例结构、业务评分口径、版本对照和失败归因。日志与评测脚本承担记录和执行;DeepEval 承担语义评估,高风险判断保留人工复核。

怎么把它做出来

  1. Dataset:把 FAQ、负反馈、多轮咨询和转人工样本,整理为输入、预期知识、工具与风险标签。
  2. Agent Run:固定模型、Prompt、知识库和工具版本,记录回答、检索片段、调用轨迹与时延。
  3. DeepEval:确定性字段先用规则校验;DeepEval 评估回答相关性、忠实度、检索质量、多轮表现与工具正确性。
  4. Badcase:按意图、知识、工具、生成、上下文与人工兜底归因;修改对应环节,避免盲目调 Prompt。
  5. Regression Gate:比较版本与风险切片。关键错误未解决就阻止放量,不用总体均分掩盖高风险失败。
  6. Gray Release:用线上质量、人工接管、时延与成本验证;新失败进入数据集,开启下一轮。

结果,也包括边界

确定性结果用代码或 API 校验,开放回答用语义指标与人工复核;最终以业务质量、接待效果、风险和成本共同判断能否发布。

摊开看看,项目证据。

这里提供评测方法说明,未附公司原始数据或虚构平台截图。技术概念可对照 DeepEval 官方文档 ↗。

去小岛里看看↗