附录 B 常用指标与评测方法
本附录提供用于衡量 AI 工作流、Skill 和 Agent 的指标定义与评测方法。指标的作用是支持用例的扩大、维持、修复、暂停或退役决策,而不是制造统一排名,或替代业务、风险与专业判断。
使用边界:本附录不提供跨行业、跨团队通用的通过率、采用率、耗时或成本目标。不同任务的容错率、验证成本、数据条件、人工责任和业务关键性不同。每个用例应在立项和试点时记录自己的基线、观察周期、预期变化、不可接受情形和决策阈值,并在阶段变化时复核。
一、核心指标定义
1. 一次通过率
定义:输出在完成预先定义的验证清单后,可直接采用或仅需约定范围内的轻微格式调整的比例。
计算:
一次通过率 = 一次通过任务数 ÷ 总执行任务数 × 100%记录时应说明:验证清单的版本;“轻微调整”的定义;被排除的任务;以及通过是否仍需人工最终采用。一次通过率不等于事实完全正确,也不等于业务已经采用。
2. 端到端平均耗时
定义:从任务启动到完成验证并形成最终可用结果的平均时间。应包含输入准备、模型或工具处理、人工审核、修改、转人工与必要记录,而不是只计算生成耗时。
计算:
端到端平均耗时 = 所有纳入统计任务的总耗时 ÷ 总执行任务数对比方式:与采用 AI 前的同类人工流程,或当前稳定版本的工作流进行同口径对比。样本范围、任务难度、人员经验和统计周期应在记录中注明。
3. 实际采用率
定义:最终被业务人员采用,或在预先约定的允许修改范围内被采用的输出占总输出的比例。
计算:
实际采用率 = 实际采用任务数 ÷ 总执行任务数 × 100%“通过验证”不等于“被业务采用”。采用率较低可能来自质量、场景匹配、知识时效、审核负担、入口设计或业务流程变化,应结合失败原因和使用者反馈判断。
4. 失败类型与风险信号
定义:未通过验证、未被采用、被转人工、触发回退或出现异常时的主要原因分布。
建议按用例定义分类,例如:格式不符合契约、关键信息遗漏、事实或知识错误、建议被误写为结论、规则过期、权限/工具异常、人工接管失败、超出适用范围,以及其他经审核确认的原因。分类应足够稳定,以便比较变化;也应允许在新风险出现时更新。
5. 知识、提示词或配置更新及时性
定义:规则、知识、Prompt、模型、工具、权限或验证条件发生变化后,相关资产在约定控制窗口内完成影响分析、更新、回归与发布/回退决定的比例。
这一指标不应只看“更新是否完成”,还应看受影响样本是否覆盖、知识 Owner 是否确认、以及变更后是否留存可定位证据。
二、建立本组织基线与决策边界
在首次试运行前,业务 Owner、Skill/流程 Owner 和适用的知识、技术、风险角色应共同记录以下内容:
| 项目 | 要回答的问题 | 记录位置 |
|---|---|---|
| 任务边界 | 哪类任务纳入统计,哪些任务不纳入,为什么? | 用例立项卡、工作流合约 |
| 当前基线 | 现有人工流程的质量、耗时、返工、队列或客户影响如何? | 基线记录、健康卡 |
| 质量边界 | 哪类错误不可接受,哪些需转人工,哪些可在审核中修正? | Rubric、风险初筛/AIA、Runbook |
| 观察周期 | 需要覆盖哪些任务类型、业务周期或知识变化才足以判断? | 发布登记、评测计划 |
| 决策规则 | 哪些信号会导致扩大、维持、修复、暂停或退役? | 阶段闸门、健康卡、组合台账 |
| 证据责任 | 谁记录、复核、解释和批准指标结论? | RACI、证据索引 |
对于低风险、内部、任务结构简单的试点,记录可以轻量;对于对外沟通、写入、敏感数据、重要决策、Agent 或高关键性流程,应提高样本、审核、风险和运行证据的要求。
三、评测方法与执行节奏
1. 例行快速复核
在用例活跃期,按业务节奏定期更新执行次数、质量结论、采用情况、耗时、主要失败类型、知识/配置变更和异常信号。频率可以是每周、每两周、每月,或由事件和发布触发;关键是让周期与任务量、风险和变化速度相匹配。
例行复核至少应回答:当前数据是否与上一个可比周期一致;是否出现新的失败类型或风险信号;指标变化是否可能来自任务范围、人员、知识、模型、工具或配置变化;以及是否需要调整范围或启动回归。
2. 阶段性深度回顾
在阶段闸门、重大变更、观察期结束、异常事件或移交前,建议进行深度回顾。除核心指标外,还应审查 Golden Set、回归报告、风险/AIA、发布登记、健康卡、Runbook、人工备用和接棒能力是否仍与实际运行一致。
深度回顾的输出不是一张“达标”结论,而是一个有 Owner、证据、遗留项和下一决策的记录:扩大、维持、修复、限量继续、暂停或退役。
四、指标解释与决策参考
| 观察到的情况 | 可能解释 | 建议动作 |
|---|---|---|
| 质量低于预先约定的控制边界,或出现不可接受错误 | 任务边界、知识、Prompt、模型、工具、审核或权限控制可能失效 | 暂停扩大范围;保留证据;按影响完成修复、回归、发布/回退判断。 |
| 耗时没有改善,或审核负担上升 | 输入准备、验证、格式转换或例外处理成本抵消了生成收益 | 复核端到端流程;不要仅凭模型响应时间宣布提效。 |
| 采用率明显低于质量通过率 | 输出虽符合形式标准,但可能不贴合业务语境、时效或使用入口 | 访谈使用者;补充业务 Rubric、知识或流程设计。 |
| 同类失败反复出现 | 根因未被修复,或样本/验证未覆盖真实问题 | 更新 Skill、知识、Golden Set、Runbook 或培训,并在变更后复验。 |
| 质量与运行准备度持续满足扩大条件 | 用例可能具备扩大或移交基础 | 仍需检查风险、人工接管、证据、Owner 和组合资源,再由阶段闸门决定。 |
| 数据不足或样本不可比 | 不能从当前指标得出趋势结论 | 延长观察、补充代表性样本,或明确标记为“结论不足”。 |
五、简易记录表
1. 用例运行记录
| 周期 | 用例/版本 | 纳入统计的任务范围 | 总任务数 | 一次通过数 | 实际采用数 | 端到端耗时 | 主要失败/风险信号 | 变更或事件 | 证据位置 | Owner 结论 |
|---|---|---|---|---|---|---|---|---|---|---|
2. 阶段回顾记录
回顾周期:
关联用例 / 工作流 / Skill 或 Agent 版本:
本周期纳入统计的任务范围与样本边界:
一、证据摘要
- 质量与 Golden Set / 回归结论:
- 采用、耗时、成本与人工负担:
- 知识、上下文包、记忆、模型、工具、连接器、权限或流程变化:
- 来源可定位、过期/冲突/越权拦截、工具异常及记忆纠错情况:
- 风险、事件、回退、人工接管与 Runbook 情况:
二、解释与决定
- 与基线或上一可比周期的主要变化:
- 不能从现有数据得出的结论:
- 遗留问题、Owner、到期日和复验方式:
- 阶段决定:扩大 / 维持 / 修复 / 限量继续 / 暂停 / 退役
- 复核人和证据索引位置:六、Skill 与 Agent 的补充评测
通过率、端到端耗时和采用率仍是基础指标。进入 Skill 或 Agent 阶段后,团队还应观察那些会影响长期可运营性的信号。其目的不是增加考核负担,而是识别“单次输出看起来正常、系统实际已失控”的情形。
| 指标 | 适用对象 | 定义 | 主要用途 | 解释原则 |
|---|---|---|---|---|
| Skill 复现成功率 | Skill | 非原作者依据 Skill 卡完成同类任务并通过约定验证的比例 | 判断经验是否成为团队能力 | 首次封装、重大变更或移交前,应安排第二人复现。 |
| 回归样本覆盖率 | Skill、工作流、Agent | 已对受影响计划样本完成重新评测的比例 | 判断变更是否只覆盖“好看的样本” | 先定义正常、边界和历史失败样本;未覆盖时结论应标记为不足。 |
| 变更后质量差异 | Skill、工作流、Agent | 候选版本与上一稳定版本在质量、耗时、采用、成本或风险信号上的差异 | 识别静默退化 | 差异需要结合样本、任务范围和变更内容解释。 |
| 人工接管率 | Agent、复杂工作流 | 因异常、缺少信息、审批拒绝或风险触发而交回人工的任务比例 | 识别边界设计与人工容量 | 接管率上升不一定表示失败;应同时看是否及时、可解释和可完成。 |
| 接管完成率 | Agent、复杂工作流 | 转人工后按既定流程完成或获得明确下一步的比例 | 验证回退是否可用 | 接管无法完成时,应优先修复人工备用、权限或交接。 |
| 错误动作/越权尝试 | Agent | 未授权调用、错误路由、错误参数或不应发生的写入尝试 | 观察权限和状态控制 | 高影响情形应按事件与风险流程处理,而不是只计入指标。 |
| 熔断触发情况 | Agent | 因步骤、工具调用、时间、成本或并发限制而自动停止的任务 | 发现循环、异常输入或容量问题 | 区分正常保护与设计缺陷;持续变化时检查原因。 |
| 来源可定位率 | Skill、工作流、Agent | 输出、建议或关键动作能够定位到已使用来源、版本、生效范围或工具记录的比例 | 判断上下文是否可解释、可复核 | 对高影响事实或对外结论,应优先检查来源质量与适用范围,而不只计数量。 |
| 过期/冲突/越权上下文拦截情况 | Skill、工作流、Agent | 系统在遇到过期、冲突、无来源、超范围或无权资料时,正确停止、标记或转人工的情况 | 检查信息面控制是否真正生效 | 不能将“模型继续生成了看似合理的答案”视为可接受处理。 |
| 工具返回与参数异常 | Agent | 工具参数错误、空结果、超时、无效返回、超长返回或不安全内容的情况 | 发现工具描述、接口、权限或上下文预算问题 | 应同时观察 Agent 是否在异常后正确停止、重试受限或转人工。 |
| 记忆纠错与失效信号 | 使用持久记忆的 Agent | 被发现、纠正、删除或按规则失效的记忆事项及其影响 | 识别错误记忆、过期与隔离问题 | 该指标不能替代对记忆合约和数据边界的定性审查。 |
| 上下文与工具成本 | Skill、工作流、Agent | 每任务用于检索、工具调用、上下文处理和人工审核的资源消耗 | 识别无效加载、重复调用与成本异常 | 与质量、接管和业务结果一起解释,不以 Token 或调用数单独判定价值。 |
| 运行证据完整性 | Agent | 日志、来源、审批、版本和必要运行记录可定位的任务比例 | 支持审计与复盘 | 缺失证据的任务不应被当作充分受控的运行证明。 |
1. 设定补充指标的原则
不要将上述指标直接套用为跨团队统一 KPI。Skill 的复现结论应关注第二位使用者能否在明确边界内独立完成;Agent 的越权和错误动作应按影响程度分级;人工接管则应结合场景解释,因为及时转人工可能证明控制有效。
每个新 Skill 或 Agent 在立项时应写明六件事:哪些来源、工具和记忆允许使用;哪些异常必须停止;哪些异常可以转人工;哪些变化必须回归;以及什么证据支持恢复。这些内容应与附录 A 第 15 节的变更影响与回归评测记录、附录 A 第 48–51 节的上下文与工具控制资产配套使用。
2. Skill 与 Agent 的最小试运行记录表
若用例不包含 Agent,可留空 Agent 相关字段。
| 周期 | 资产名称/版本 | 执行次数 | 一次通过率 | 采用率 | 端到端耗时 | 主要失败类型 | 上下文/工具异常 | 是否有变更 | 回归结论 | 人工接管 | 熔断 | 错误动作/越权尝试 | 来源与运行证据完整性 | 决定与备注 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 是/否 | 通过/不通过/不适用 |
七、培训与采纳健康度指标
培训与变革的目标不是让更多人“用过一次 AI”,而是让适当的角色能够在批准边界内,以正确方式持续完成真实工作,并在不确定时知道如何停止、转人工和上报。以下指标用于观察组织能力,不应用于简单的个人排名或惩罚。
| 指标 | 定义 | 说明 | 建议使用方式 |
|---|---|---|---|
| 实践认证覆盖率 | 已完成对应角色实践任务并通过复核的人数 ÷ 目标角色人数 | 区别于“参加培训人数” | 按角色查看缺口,不以同一课程覆盖所有人。 |
| 受控采用率 | 在批准的 Skill、工作流或工具边界内完成真实任务的比例 | 衡量正式流程是否真正可用 | 与质量和采用率一起看;较低时先检查流程、工具或培训障碍。 |
| 第二人复现率 | 非原始设计者能依据资产独立完成任务的比例 | 观察经验是否脱离个人 | 用于 Skill 和团队交接,不用于个人绩效排名。 |
| 反馈闭环及时性 | 在约定时限内得到分类、处理或明确回告的有效反馈情况 | 衡量组织是否认真对待一线问题 | 定期分析未及时处理的原因,改善分流资源。 |
| 重复反馈变化 | 同类培训困惑、知识缺口或流程障碍持续出现的变化 | 判断改进是否触及根因 | 不应要求归零;应识别高频主题并更新培训、Skill 或知识。 |
| 绕过或非受控使用信号 | 因正式流程不可用、权限不匹配、速度过慢或认知不足而出现的绕过反馈 | 帮助组织提供安全替代方案 | 关注原因和修复,不将报告本身作为惩罚依据;涉及敏感数据时按安全流程处理。 |
不建议作为核心绩效指标的内容
模型调用次数、Token 消耗、登录时长、生成字数和使用排行榜位置可能有运营参考价值,但不应单独作为“AI 采用好坏”或员工绩效的判断依据。它们容易诱导“为了被看见而使用”,不能直接证明业务价值、质量、合规或能力提升。
与月度组合评审的衔接
当某个用例质量稳定但受控采用率较低时,不应立即认定员工“抗拒变化”。应检查:该任务是否真的高频且有价值;使用入口是否嵌入原有 SOP;人工审核是否过重;知识和权限是否齐备;经理人是否提供试点时间;使用者是否知道何时不该用。分角色能力地图、经理人行动和反馈模板见附录 A 第 22、23、24 节。