AI 效果怎么评测?从通过率到真实价值的三级指标
直接回答:AI 评测分三步走——先定义“什么是好”(验证清单 + Rubric),再测量“是否稳定”(通过率、耗时、失败类型),最后区分“被采用”和“通过检查”(实际采用率、业务结果)。没有评测就没有改进方向。
团队常犯的错误是:有感受、有案例、有截图,但没有数字。没有数字不只是汇报问题——你不知道哪个场景在退化,不知道一次提示词修改是进步还是退步。
一、第一级:定义“好”
先用验证清单做“是/否”判断:格式是否正确、必含字段是否齐全、有无事实错误、有无越界承诺。清单必须包含业务侧易错点,而不是只检查格式。
对于质量连续的维度(准确性、完整性、语气),再用 Rubric 评分:
- 选 3–5 个维度;
- 每个维度定义 2–4 个评分等级并写清判断标准;
- 计算综合得分并设定通过阈值(阈值由错误代价决定,不是通用 75%);
- 定期让两个以上评审人给同一批样本打分,校验评分一致性。
二、第二级:测量“是否稳定”
核心指标:
| 指标 | 定义 | 用途 |
|---|---|---|
| 一次通过率 | 一次通过验证清单的比例 | 衡量稳定性核心指标 |
| 实际采用率 | 被直接或小改后使用的比例 | 衡量真实业务价值 |
| 平均总耗时 | 提交到可用输出的完整时间(含人工验证) | 衡量效率提升 |
| 失败类型分布 | 幻觉、格式、遗漏、过期知识的占比 | 指导改进方向 |
| 知识更新及时率 | 按时完成知识库更新的比例 | 衡量知识维护质量 |
关键区分:“通过了检查”不等于“被业务采用”。采用率低说明输出虽然符合形式标准,但可能不贴合业务语境、时效或使用入口。
三、第三级:连接业务结果
单用例指标之外,还要回答三个决策问题:
- 停止或限量:出现不可接受错误、无法解释的退化、来源或权限异常时,暂停扩大、转人工或回退。
- 升级:业务价值、质量、人工负担、来源控制和运行证据都满足闸门时,才扩大范围或提高自主性。
- 改进:失败呈现重复模式时,针对任务定义、上下文、知识、工具或培训专项修复,变更后回归。
组合层面,不要把所有“节省时间”直接相加为财务收益。区分流程效率证据、业务结果证据和能力建设投入。成本口径见企业 AI ROI 怎么算。
四、Agent 评测:不仅测答案,还要测行为
Agent 上线前至少覆盖五类评测:上下文层、Skill 层、任务层、安全与权限层、运行与恢复层。必看指标:
- 端到端任务成功率;
- 人工接管率与接管成功率;
- 错误动作率(越权调用、错误路由、错误写入);
- 平均步骤数、工具调用数与单位任务成本(发现循环);
- 来源可定位率与过期/冲突拦截情况;
- 熔断触发率与恢复时间。
一次通过率不能单独代表 Agent 的可靠性。
五、评测数据怎么用
用最简单的记录表按周填写:日期、场景/版本、执行范围、质量与采用结论、主要失败信号、本期改进动作与证据。
评测数据是用来做决策的,不是用来证明价值给领导看的。如果数据表明场景在退化,就应暂停、修复或停止,而不是选择性汇报好看的数字。
下一步
- 阅读第 11 章价值评估与评测体系获取 TCO、ROI 与 Rubric 完整方法。
- 使用周度评测记录表开始记录。
- 使用Golden Set 与评测集模板建立回归样本。
- 返回AI 输出质量与稳定产出指南查看全部专题。