附录 A 可直接复用的清单与模板
本附录汇总全书中提到的核心清单与模板,可直接复制使用。建议根据自身场景微调后,保存为团队共享文件。
1. 最小场景选择标准清单
在启动任何 AI 工作流前,用此清单快速判断场景是否适合作为最小闭环。 必须同时满足:
- [ ] 任务每周至少重复出现 2 次以上
- [ ] 输入信息完整且可稳定获取
- [ ] 输出有明确的对错或好坏判断标准
- [ ] 单次人工耗时在 15–90 分钟之间
- [ ] 失败后可以人工纠正,不会造成严重业务损失或不可逆后果
- [ ] 不涉及最终决策权或对外正式承诺
结果判断:
- 全部勾选→可进入最小闭环设计
- 有任何一项不满足→暂缓,或拆成更小的子任务
2. 任务定义模板
复制后填写,作为工作流的起点。
任务名称:触发条件:(什么情况下启动)输入:
- 需要哪些信息
- 从哪里获取
- 格式要求输出:
- 最终交付物是什么
- 格式要求(Markdown/表格/JSON 等)质量标准:(怎样算合格,尽量具体)当前人工平均耗时:目标耗时:(含人工检查)禁止事项:(明确不能做什么)3. 通用提示词模板
适用于大多数生成类任务。使用时只替换【】中的内容。
角色:你是【具体角色】,负责【具体任务】。任务目标:【用一句话说清楚要完成什么】输入信息:【在此处粘贴完整输入】必须遵守的规则:
- 【规则 1】-【规则 2】-【规则 3】-...输出格式(严格按此格式返回,不得增加其他内容):【明确的结构,推荐使用 Markdown 标题或表格】参考示例:【放 1 个简短正确示例,可选】现在开始处理。4. 通用验证检查清单(基础版)
每次模型输出后,必须逐项检查。全部通过才可进入使用环节。
- [ ] 输出格式完全符合预设模板
- [ ] 所有必含字段/内容均已出现
- [ ] 无新增未要求的内容
- [ ] 无明显事实错误(对照输入或已知信息)
- [ ] 无把讨论/建议误写为结论或承诺
- [ ] 关键数字、日期、名称与输入一致
- [ ] 语气/风格符合规定要求
使用规则: 任何一项不通过,返回修改或转人工处理。
5. 会议纪要专用验证清单
- [ ] 所有明确决议均已记录
- [ ] 待办包含负责人
- [ ] 待办包含具体可执行的行动描述
- [ ] 待办包含截止日期(未明确则标注“待定”)
- [ ] 无把讨论中的建议写成决议
- [ ] 格式与模板完全一致
- [ ] 无明显事实错误
6. 客户回复起草专用验证清单
- [ ] 使用了正确问题类型的最新标准要点
- [ ] 包含规定的必须提示信息
- [ ] 无额外承诺或超出口径的内容
- [ ] 语气符合团队规范
- [ ] 关键政策/规则与现行版本一致
- [ ] 格式符合发送要求
7. 周度评测记录表
建议用在线表格记录,每周更新一次。
| 周次 | 总执行次数 | 一次通过次数 | 通过率 | 平均总耗时(分钟) | 主要失败类型 | 实际采用率 | 备注 |
|---|---|---|---|---|---|---|---|
| 第 1 周 | 第 2 周 | ... |
目标参考(基于实践经验):
- 通过率≥80%
- 平均总耗时比原方式下降≥30%
- 实际采用率≥75%
8. 版本命名规范
正式使用的文件统一按以下格式命名: 内容名称_v主版本.次版本_年月日 示例:
- 会议纪要提示词_v1.3_20260819
- 客户回复草拟 Skill_v1.0_20260819
- 待办检查清单_v1.1_20260815
- 标准答复要点_v2.0_20260801
- 异常工单 Agent 运行合约_v1.0_20260819
规则:
- 小幅修改规则或示例→次版本+1
- 结构性调整或适用范围变化→主版本+1
- 旧版本保留至少 30 天
9. 问题升级路径模板
提前填写并告知相关人员。
Skill/工作流/Agent 名称:日常使用者:业务责任人:提示词、Skill 定义或检查清单修改权限人:知识内容责任人:技术责任人(如适用):升级触发条件:
- 连续出现同类严重错误
- 输出可能影响客户或正式决策
- 有人绕过验证清单直接使用结果
- 其他:【补充】升级对象与响应时限:
- 一级:【姓名/角色】,【X 小时内响应】-二级:【姓名/角色】,【X 小时内响应】10. 最小闭环成功判断标准
同时满足以下条件,视为第一阶段成功,可考虑扩大范围:
- [ ] 连续 5 次真实任务中,至少 4 次通过验证清单
- [ ] 单次总耗时(生成+检查)比原人工方式降低 30%以上
- [ ] 输出可被直接使用或只需要少量修改
- [ ] 至少 1 名其他同事能独立按同样方法完成
未全部满足前,继续在当前场景迭代,不急于增加新场景。
11. Skill 卡模板
用于把一个已验证的高频任务封装为团队可发现、可调用、可测试、可版本化和可退役的能力单元。Skill 不是一段更长的提示词;它应同时包含业务边界、输入输出、知识、验证、责任和回退。
Skill 名称:
Skill 版本:
关联用例编号:
关联工作流编号(如适用):
当前阶段:候选 / 试点 / 限量生产 / 受控生产 / 规模化 / 退役
业务目的:
适用范围:
禁止使用的情形:
触发条件:
输入契约:
- 必填输入:
- 输入来源:
- 格式/数据质量要求:
- 不可接受的输入:
输出契约:
- 输出对象:
- 输出格式:
- 质量标准/Rubric:
受控组件:
- Prompt 模板及版本:
- 知识来源及版本:
- 可调用工具及权限:
- 模型/平台及版本(如适用):
验证与人工控制:
- 自动检查:
- 人工检查节点:
- 必须转人工的条件:
失败与回退:
- 缺少输入时:
- 验证不通过时:
- 工具/知识异常时:
- 回退路径:
责任与运行:
- 业务责任人:
- 知识责任人:
- 修改权限人:
- 日常使用者:
- 评测指标及频率:
- 变更记录:Skill 进入正式使用前的最低检查:
- [ ] 已有清晰的输入与输出契约
- [ ] 已有可执行的验证标准与回退路径
- [ ] 已指定业务、知识与修改责任人
- [ ] 已用真实样本验证,并保留成功与失败样本
- [ ] 其他同事能依据 Skill 卡独立完成一次任务
12. Agent 运行合约模板
仅当固定工作流无法满足任务、且动态编排确有额外价值时使用。Agent 应只编排已验证的 Skill、最小必要上下文和受限工具,不应拥有无限制的目标、资料、工具、记忆或权限。
Agent 名称:
Agent 版本:
关联用例编号:
关联工作流编号(如适用):
当前阶段:候选 / 试点 / 限量生产 / 受控生产 / 规模化 / 退役
业务目标:
不承担的决策/禁止事项:
自主等级:L1 / L2 / L3 / L4 / L5
可调用 Skill:
- Skill 名称、版本、允许使用的状态:
上下文包与来源:
- 上下文包编号、版本与适用任务:
- 允许来源、来源优先级与排除来源:
- 预置内容与按需检索/加载逻辑:
- 来源版本、生效日期、适用范围与失效条件:
- 数据分级、可读取范围、内容/返回量预算:
可调用工具、MCP 与连接器:
- 工具/MCP/连接器名称、版本与 Owner:
- 允许动作与参数范围:
- 数据范围、返回字段与返回量限制:
- 读/写权限、凭证与身份范围:
- 超时、错误、审计和退出/禁用方式:
持久记忆(如适用):
- 允许读取/写入的记忆类别:
- 事实、假设、待办的标记方式:
- 租户/用户隔离、保留期、删除和失效方式:
- 重新读取时的来源定位和人工纠错方式:
状态与路径:
- 合法状态:
- 合法状态转移:
- 终止状态:
- 信息缺失/异常输入时的状态:
预算与熔断:
- 最大步骤数:
- 最大工具调用数:
- 最大运行时长:
- 单任务最大成本:
- 并发上限:
验证与审批:
- 需要独立验证的事实:
- 需要人工审批的动作:
- 审批人/替补人:
接管与回退:
- 触发条件:
- 接管人:
- 降级方式:
- 恢复上线所需证据:
责任与审计:
- 业务责任人:
- 技术责任人:
- 知识责任人:
- 上下文/记忆 Owner(如与知识 Owner 不同):
- 工具/MCP/连接器 Owner:
- 日志内容与留存方式(任务、状态、来源、Skill/工具/记忆版本、审批、异常):
- 变更与回归评测要求:Agent 进入试运行前的最低检查:
- [ ] 每个关键任务都已封装为有验证和回退的 Skill
- [ ] 上下文包、来源白名单、排除来源、版本、范围、预算和失效条件已验证
- [ ] 可调用工具、MCP/连接器、数据范围、返回量、读写权限和凭证均遵循最小权限原则
- [ ] 持久记忆(如使用)的写入、隔离、失效、删除与人工纠错已验证
- [ ] 已设置步骤、调用、时间、成本与并发熔断
- [ ] 已覆盖正常、边界、异常、上下文冲突/过期/越权和人工接管的评测样本
- [ ] 已演练工具超时、审批拒绝、空结果或熔断触发后的回退
- [ ] 已明确暂停、恢复和变更的责任人与权限
以上清单与模板可直接复制到团队文档中使用。建议每跑通一个新闭环,就同步更新对应的 Skill 卡、检查清单和版本记录。
13. 已填写示例:产品周会纪要提取 Skill
以下示例基于第 16 章“周会纪要与待办提取”案例。它的目的不是提供唯一正确的写法,而是展示一张 Skill 卡如何把 Prompt、知识、验证、责任和回退放在同一处管理。使用前,应替换团队名称、具体工具、数据边界和责任角色。
Skill 名称:产品周会纪要提取与核验
Skill 标识:SK-PROD-MINUTES
Skill 版本:v1.0
关联用例编号:UC-PROD-001
关联工作流编号:WF-PROD-MINUTES-001
当前阶段:试点
业务目的:
将产品周会转写整理为可直接贴入协作文档的结构化纪要和待办列表,减少产品经理整理时间,并降低决议与待办遗漏。
适用范围:
- 产品团队内部周会和双周战略会
- 已获得会议参与者授权、且可在批准工具内处理的会议转写
- 仅用于生成草稿,由会议主持人或指定记录人确认后发布
禁止使用的情形:
- 会议转写不完整、来源不明或含有不应上传至当前工具的数据
- 要求系统自行判断尚未达成的决议、人员绩效结论或对外承诺
- 无人能够核对决议、负责人和截止日期
触发条件:
会议结束后,主持人或指定记录人提供完整转写及会议日期、参会人信息。
输入契约:
- 必填输入:会议日期、参会人、完整会议转写
- 输入来源:批准的会议转写工具或人工整理文本
- 格式要求:保留说话轮次或时间戳(如可获得);不得混入其他会议内容
- 不可接受的输入:只含摘要、缺少主要讨论段落、无权处理的敏感信息
输出契约:
- 输出对象:会议主持人或指定记录人
- 输出格式:会议基本信息;关键决议列表;待办表(待办事项、负责人、行动描述、截止日期)
- 质量标准:只记录明确达成的决议;每项待办均可执行;未明确的负责人或日期必须标为“待定”
受控组件:
- Prompt 模板:会议纪要提取 Prompt_v1.0
- 知识材料:团队待办字段规范_v1.0;历史正确/错误示例各 2 份
- 可调用工具:无;如使用转写工具,仅接收其导出的文本
- 模型/平台:按组织批准的平台与模型版本填写
验证与人工控制:
- 自动检查:待办表字段齐全;输出格式符合模板;“待定”字段格式统一
- 人工检查:主持人核对所有关键决议;确认负责人、行动描述和截止日期;检查未把讨论建议写成决议
- 必须转人工的条件:转写缺失;决议存在争议;出现人员评价、预算承诺或对外事项
失败与回退:
- 缺少输入时:提示补充会议日期、参会人或完整转写,不生成正式纪要
- 验证不通过时:带着具体失败项重新生成一次;仍不通过则由记录人按原流程人工整理
- 知识异常时:停用当前版本,回退到已验证的上一版本或纯人工模板
- 回退路径:人工会议记录模板 + 主持人确认后发布
责任与运行:
- 业务责任人:产品负责人
- 知识责任人:产品运营/项目管理角色
- 修改权限人:指定的产品运营与 AI 工作流维护人
- 日常使用者:会议主持人、项目经理或指定记录人
- 评测指标:一次通过率、平均总耗时、决议/待办完整率、采用率
- 评测频率:前 4 周每周;稳定后每月
- 当前变更记录:v1.0 为试运行基线,任何规则或示例变更需记录并用历史样本回归检查首轮演练建议:从最近 5 次真实会议中选取转写,先不接入自动发布。每次由同一位业务审核人依据附录 A 第 5 节检查,记录遗漏、误判、人工修改时间和是否被采用。只有在第二位使用者能够独立运行、并且回退路径已实际走通后,才将其视为可共享的正式 Skill。
14. 已填写示例:异常工单调查 Agent 运行合约
以下是一个 L3 建议式编排 的示例。它只读取已授权的内部信息,输出调查建议,不发送对外消息、不修改工单、不执行恢复操作。该示例的重点是说明:Agent 的价值在于受限状态下编排已验证的 Skill,而不是获得无限制的自主权。
Agent 名称:异常工单调查助手
Agent 标识:AG-OPS-TRIAGE
Agent 版本:v1.0
关联用例编号:UC-OPS-TRIAGE-001
关联工作流编号:WF-OPS-TRIAGE-001
当前阶段:试点
业务目标:
对内部低风险异常工单进行初步信息归集,输出“已知事实、缺失信息、建议下一步”,帮助人工值班人员更快完成调查。
不承担的决策/禁止事项:
- 不直接修改工单状态、优先级、负责人或标签
- 不执行服务重启、配置修改、数据删除或任何写操作
- 不向客户、供应商或外部系统发送信息
- 不对根因、影响范围或修复方案作未经人工确认的结论
自主等级:L3(建议式编排)
可调用 Skill:
- 工单字段规范化 Skill v1.0:只提取并校验工单已存在的字段
- 异常类别初筛 Skill v1.0:基于预定义类别输出候选分类及依据
- 运行知识检索 Skill v1.0:从已批准的内部 Runbook 中检索相关操作说明
- 调查摘要生成 Skill v1.0:生成“事实/证据/不确定项/建议下一步”四段式摘要
可调用工具与权限:
- 工单读取工具:仅读取当前工单及其关联的已授权记录
- 日志查询工具:只读;时间范围限制为工单发生前后 24 小时;返回结果条数限制为 200 条
- 知识库检索工具:只读;仅检索已批准的内部 Runbook 集合
- 不配置写入工具、消息工具、代码执行工具或外部网页访问工具
合法状态与路径:
1. 接收工单 → 2. 校验输入 → 3. 初筛分类 → 4. 查询允许范围内的日志/知识 → 5. 生成调查建议 → 6. 人工审阅 → 7. 结束
- 信息缺失、工具异常、权限拒绝、置信不足或检测到敏感信息时:进入“转人工”状态并停止后续调用
- 不允许从任何状态跳回前一状态反复循环;不允许发明新工具、新 Skill 或新目标
预算与熔断:
- 最大状态转移数:6
- 最大工具调用数:4
- 最大运行时长:90 秒
- 单任务最大模型调用数:5
- 单任务成本上限:由组织按平台预算填写
- 任一上限触发:立即停止,记录原因,并转人工
验证与审批:
- 调查摘要必须区分“已验证事实”“推测”“缺失信息”
- 任何日志、知识或工单字段引用均须显示来源标识
- 人工值班人员审阅后,才可将摘要复制到工单或据此采取行动
接管与回退:
- 触发条件:输入不完整、工具超时、返回异常、熔断、敏感数据、审批人拒绝或审核人无法理解摘要
- 接管人:当班运营/技术支持人员
- 降级方式:按既有工单调查 Runbook 人工检索与记录
- 恢复上线所需证据:异常原因已修复;相关 Skill 和工具样本回归通过;责任人批准恢复
责任与审计:
- 业务责任人:运营支持负责人
- 技术责任人:平台/自动化维护人
- 知识责任人:Runbook 维护人
- 日志内容:任务标识、时间、状态转移、调用的 Skill 与版本、工具与参数摘要、来源标识、熔断/异常、人工审阅结果
- 变更要求:任何 Skill、权限、状态逻辑、工具或模型变更均须完成受影响样本的回归评测首轮演练建议:使用 10 个已经关闭的历史工单,其中至少包含 3 个信息缺失、2 个日志查询为空、1 个权限拒绝或工具超时的模拟情形。测试目标不是让 Agent “猜中根因”,而是确认它会在允许范围内检索、明确表达不确定性、在异常时停止并把任务平滑交回人工。
15. 变更影响与回归评测记录模板
任何正式 Skill、工作流或 Agent 的 Prompt、知识、模型、工具、权限、状态逻辑或验证规则发生变化时,使用本模板判断影响范围并记录回归结果。小改动也可能改变质量、成本或风险;不要只凭主观感觉直接覆盖生产版本。
变更编号:
变更日期:
变更发起人:
受影响资产:
- Skill/工作流/Agent 名称及当前版本:
- 受影响的下游资产:
变更类型(可多选):
[ ] Prompt 或示例
[ ] 知识内容/检索配置
[ ] 模型或平台版本
[ ] 工具、接口或数据源
[ ] 权限、读写范围或凭证
[ ] 状态逻辑、预算或熔断
[ ] 验证规则/Rubric
[ ] 其他:
变更目的与预期收益:
不变的业务边界与禁止事项:
潜在风险:
回退版本与回退负责人:
回归样本:
- 正常样本数量:
- 边界/异常样本数量:
- 必须覆盖的历史失败样本:
回归结果:
- 质量/Rubric:
- 一次通过率:
- 端到端耗时:
- 采用率或人工修改负担:
- Agent 工具行为/权限验证(如适用):
- 熔断与人工接管演练(如适用):
发布决策:通过 / 限量试运行 / 退回修改 / 不发布
审批人:
上线后观察期与指标:
最终结论与后续动作:最低发布规则:变更不得扩大既定业务边界或权限;如质量显著下降、出现新的高严重度风险、熔断/接管失效或回归结果无法解释,应保持或回退到上一稳定版本。对 Agent 的权限、工具或状态逻辑变更,应视为高影响变更,不应只测试最终文本输出。
16. 已填写示例:客户咨询标准回复草拟与核验 Skill
以下示例基于第 16 章“客户咨询标准回复起草”案例。它面向外部沟通,因此比会议纪要 Skill 多了一层知识时效、来源展示和发送前人工确认控制。示例只覆盖物流、退换货、活动规则等口径清晰的高频问题;补偿、投诉升级、价格例外、合约承诺和敏感个人信息相关问题必须转人工。
Skill 名称:客户咨询标准回复草拟与核验
Skill 标识:SK-CS-STANDARD-REPLY
Skill 版本:v1.0
关联用例编号:UC-CS-001
关联工作流编号:WF-CS-REPLY-001
当前阶段:试点
业务目的:
在不改变人工最终决定权的前提下,为已定义的高频咨询生成与当前政策一致的回复草稿,缩短起草时间并减少口径遗漏。
适用范围:
- 已批准的高频问题类型:物流进度、退换货条件、活动规则、基础产品信息等
- 使用者能够选择或确认问题类型
- 当前标准答复要点已标注来源、生效日期、适用范围和知识责任人
禁止使用的情形:
- 补偿、退款金额、价格例外、投诉升级、法律/合同解释或对外承诺
- 无法确定问题类型,或当前标准答复要点缺失、过期、冲突
- 客户消息包含不应输入当前工具的敏感个人信息
- 使用者意图绕过人工确认直接发送
触发条件:
客服或销售支持人员收到属于已批准问题类型的客户咨询,并在批准工具中选择问题类型后发起草拟。
输入契约:
- 必填输入:客户原话、问题类型、当前标准答复要点标识及版本
- 可选输入:客户已知订单状态、适用活动标识、已批准的个性化背景
- 输入来源:批准的客服系统、知识库或人工粘贴的已脱敏文本
- 不可接受的输入:无问题类型、知识来源不明、含未获授权的敏感信息、要求作出例外承诺的内容
输出契约:
- 输出对象:客服或销售支持人员,不直接发送给客户
- 输出格式:回复正文;使用的要点来源(文档标识、版本、生效日期);待人工确认项
- 质量标准:准确对应问题类型;包含必须提示;不添加知识库之外的承诺;语气符合团队规范;不确定时明确提示转人工
受控组件:
- Prompt 模板:客户标准回复草拟 Prompt_v1.0
- 知识材料:标准答复要点库;每条要点均标记问题类型、政策版本、生效日期、适用范围、知识责任人
- 示例材料:每个问题类型至少保留一个正确示例和一个典型错误示例
- 可调用工具:仅允许读取批准知识库;不连接发送、退款、定价、订单修改或客户账户写入工具
- 模型/平台:按组织批准的平台与模型版本填写
验证与人工控制:
- 自动检查:输出含来源标识;使用的要点版本未过期;关键提示字段齐全;禁止承诺词未出现
- 人工检查:确认问题类型正确;核对来源要点;确认没有额外承诺;补充必要的个性化信息;决定是否发送
- 必须转人工的条件:政策版本不明确、知识冲突、客户要求例外处理、客户投诉升级、涉及敏感信息或审核人无法确认
失败与回退:
- 缺少输入时:要求补充问题类型或当前政策来源,不生成可发送草稿
- 知识过期/冲突时:停止草拟,展示“知识待确认”,由知识责任人处理后恢复
- 验证不通过时:根据具体失败项重新生成一次;仍不通过则使用人工标准回复模板
- 工具异常时:按人工检索知识库 + 人工草拟流程处理
- 回退路径:人工标准回复模板;必要时升级至业务负责人或投诉处理流程
责任与运行:
- 业务责任人:客服/销售支持负责人
- 知识责任人:各问题类型对应的政策或运营负责人
- 修改权限人:客户沟通规范维护人及 AI 工作流维护人
- 日常使用者:经培训的客服与销售支持人员
- 评测指标:一次通过率、采用率、平均总耗时、知识过期拦截次数、人工转交率、口径相关投诉/纠错信号
- 评测频率:试运行前两周每周;稳定后每月
- 当前变更记录:任何标准答复要点、Prompt、模型、知识检索、验证规则或权限变更均需走附录 A 第 15 节的变更记录试运行与限量发布安排
该 Skill 不应因为离客户“只差一步发送”就直接全量启用。建议采用四个阶段:先用历史咨询离线回归;再由小范围、已培训人员使用并对每一条草稿做 100% 人工审核;确认质量、知识时效和回退稳定后,才逐步扩大到更多问题类型或更多使用者;在任何阶段出现口径错误、知识冲突、异常转人工或无法解释的质量下降时,立即回退到人工标准回复流程。
| 阶段 | 使用范围 | 人工控制 | 必须证明的事实 | 不满足时的动作 |
|---|---|---|---|---|
| 离线回归 | 已关闭的历史咨询 | 不接触真实客户 | 每类问题均能引用正确、有效的要点;异常案例会转人工 | 修复知识、Prompt 或验证规则 |
| 小范围试运行 | 少量已培训使用者、少量问题类型 | 每条草稿 100% 审核 | 审核人能理解来源;人工修改负担可接受;回退可用 | 保持试运行,不扩大范围 |
| 限量发布 | 已验证的问题类型与班组 | 每条仍由人工发送;按日复核异常与抽样质量 | 质量、采用、时效与转人工信号稳定 | 降级到小范围试运行或暂停 |
| 稳定运行 | 已批准范围内的常规使用 | 维持发送前人工确认;按月回顾 | 知识更新和变更回归持续执行 | 进入变更/问题处理流程 |
17. 知识变更→影响分析→回归评测→限量发布模板
客户沟通类 Skill 最常见的风险不是模型突然“变笨”,而是业务规则、活动条件、产品状态或话术口径已经变化,而知识、Prompt、示例和验证规则没有同步更新。以下模板将一次知识更新变成可追溯的运营闭环。
| 阶段 | 责任角色 | 最低动作 | 必须留下的证据 | 不通过时 |
|---|---|---|---|---|
| 1.触发与登记 | 业务/知识责任人 | 记录变化来源、生效时间、适用范围和紧急程度 | 变更编号、原始来源、拟生效日期 | 暂不进入生产知识库 |
| 2.知识更新 | 知识责任人 | 更新权威知识条目;标记新旧版本、适用范围和失效内容 | 知识版本、更新说明、责任人 | 退回核对业务规则 |
| 3.影响分析 | Skill/流程责任人 | 列出受影响的问题类型、Skill、Prompt、示例、验证规则、工具和在运行任务 | 影响清单与风险判断 | 将受影响资产置为“待确认”或暂停使用 |
| 4.回归设计 | Skill/流程责任人 + 业务审核人 | 选择正常、边界、历史失败和新规则样本;明确人工判定标准 | 回归样本清单、Rubric、预期结果 | 补充样本或明确规则 |
| 5.回归与审核 | 使用者 + 业务审核人 | 运行新版本并核对内容、来源、禁止承诺、转人工与回退行为 | 回归结果、失败项、修复记录 | 修复后重新回归;保留上一稳定版本 |
| 6.发布决策 | 业务责任人 | 决定不发布、限量试运行或正式恢复;明确观察期 | 决策记录、批准人、回退版本 | 不发布或回退 |
| 7.限量观察 | 使用者 + Skill 责任人 | 在受限范围运行,密切查看质量、过期拦截、人工转交和投诉/纠错信号 | 观察期周报、异常记录 | 缩小范围、暂停或回退 |
| 8.资产沉淀 | 知识/Skill 责任人 | 将新规则、成功样本、失败样本和复盘写回知识与 Skill 资产 | 更新后的 Skill 卡、示例、失败案例 | 继续保留观察状态 |
客户回复知识变更记录示例
以下记录展示“活动规则变更”如何影响一个客户回复 Skill。内容为演练示例,实际企业应替换为自身政策和审批角色。
变更编号:KB-CS-2026-001
变化来源:活动运营负责人发布的已批准规则更新
生效时间:2026-09-01 00:00
变化范围:活动问题类型中的参与条件、适用商品与截止日期
受影响资产:
- 标准答复要点库:活动规则条目 v2.3 → v2.4
- 客户咨询标准回复草拟与核验 Skill:SK-CS-STANDARD-REPLY v1.0
- Prompt:客户标准回复草拟 Prompt_v1.0
- 示例:活动规则正确示例 2 条、历史错误示例 1 条
- 验证:活动截止日期、适用商品、例外承诺禁止项
风险判断:
若旧规则继续被引用,可能造成客户误解、错误承诺或投诉;属于“对外口径/知识时效”高优先级变更。
回归样本:
- 2 条正常活动咨询
- 2 条边界咨询(不符合参与条件、活动已结束)
- 1 条历史失败样本(模型曾遗漏截止日期)
- 1 条要求例外补偿的咨询,预期必须转人工
发布决策:
先在离线回归中验证;通过后,仅允许已培训人员在活动问题类型中使用,所有草稿继续人工确认。观察期内若出现错误日期、错误商品范围、未转人工的例外承诺,立即回退至活动规则条目 v2.3 与人工回复流程。这个闭环的目的不是放慢业务变化,而是让组织能回答四个关键问题:规则何时变了?影响了什么?新版本如何被证明可用?出问题时回退到哪里?
18. AI 用例组合台账模板
当团队拥有多个 Skill、工作流或 Agent 后,不能只分别保存若干 Prompt、文档和评测表。应建立一张面向业务结果的用例组合台账:每行代表一个业务用例,而不是一个工具账号或技术组件;Skill、工作流和 Agent 是该用例所依赖的能力资产。
台账的目的不是增加审批手续,而是让管理者和交付团队能在同一张表中回答:正在运行什么、谁对业务结果负责、处于什么阶段、值不值得继续投入、有什么共用依赖、下一个决策是什么。
| 字段 | 填写说明 |
|---|---|
| 用例编号与名称 | 采用稳定编号,例如 UC-CS-001;名称使用业务语言,如“高频客户咨询回复草拟” |
| 业务问题与目标 | 说明要改善的流程问题、目标用户和预期业务结果,不写成“建设一个 Agent” |
| 当前阶段 | 候选 / 试点 / 限量生产 / 受控生产 / 规模化 / 退役;定义见第 8 章第八节 |
| 业务价值假设 | 期望节省的端到端时间、质量/风险改善、容量释放或其他业务指标,以及当前证据等级 |
| 风险等级与边界 | 低/中/高;是否对外、是否含敏感数据、是否有写入或自动行动、不可接受的错误 |
| 业务责任人 | 对业务结果、范围和继续/暂停建议负责的角色 |
| Skill/流程/Agent 资产 | 关联的 Skill 标识及版本、工作流版本、Agent 运行合约及自主等级 |
| 知识与数据依赖 | 知识库/数据源、知识责任人、最近更新日期、是否被其他用例共用 |
| 技术与权限依赖 | 模型/平台、工具、读写权限、关键系统依赖和技术责任人 |
| 运行健康度 | 通过率、采用率、总耗时、主要失败、接管/熔断(如适用)、上次评测日期 |
| 成本与维护负担 | 工具成本、人工验证/维护投入、单位任务成本或 TCO 估算 |
| 当前决策与下一闸门 | 继续试点/限量发布/扩大/暂停/退役;下一次需要提交的证据和日期 |
| 关联风险与依赖 | 与其他用例的共享知识、共享工具、共享责任人、未解决事件或待办 |
最小台账示例
| 用例 | 阶段 | 业务责任人 | 关键资产 | 当前证据 | 下一决策 |
|---|---|---|---|---|---|
| 【状态示例】产品周会纪要与待办提取 | 受控生产 | 产品负责人 | SK-PROD-MINUTES v1.0 | 示例:已取得 6 周稳定运行与人工确认使用证据 | 示例:评估是否复用到双周战略会 |
| 【状态示例】高频客户咨询回复草拟 | 限量生产 | 客服支持负责人 | SK-CS-STANDARD-REPLY v1.0 | 示例:已完成历史样本回归;发送前 100%人工确认 | 示例:完成活动规则变更观察期后决定是否扩大问题类型 |
| 异常工单调查建议 | 试点 | 运营支持负责人 | AG-OPS-TRIAGE v1.0,L3 | 仅历史工单演练;无写入权限 | 验证人工接管与工具异常回退后决定是否进入限量试运行 |
使用规则:新用例在正式投入人力或采购工具前必须登记;每次阶段变更、重大事件、知识/权限高影响变更或退役决定后更新;台账只记录关键决策信息,详细 Prompt、样本和日志仍留在对应的 Skill 卡、Agent 运行合约与事件记录中。
19. 用例责任矩阵(企业最小 RACI)
单个 Skill 可以由一名业务人员维护;但多个用例共同运行后,必须区分“谁做事”和“谁拍板”。下表是轻量级 RACI,可按组织岗位名称调整。每项活动只能有一个最终负责的 A(Accountable),避免出现“大家都参与、没有人对结果负责”。
R(Responsible):实际执行工作;A(Accountable):对结果拍板并承担最终责任;C(Consulted):必须被征询;I(Informed):需要知会。
| 活动/决策 | 业务赞助人 | 用例 Owner | Skill/流程 Owner | 知识 Owner | 技术/平台 Owner | 安全/风险代表 | 使用者/审核人 |
|---|---|---|---|---|---|---|---|
| 用例立项、业务目标与风险边界 | A | R | C | C | C | C | C |
| Skill、工作流和验证设计 | I | A | R | C | C | C | C |
| 知识更新与失效处理 | I | A | C | R | I | C | I |
| 模型、工具、权限或状态逻辑变更 | I | A | R | C | R | C | I |
| 离线回归、限量发布与观察期 | I | A | R | C | C | C | R |
| 日常运行、人工审核与问题上报 | I | A | R | C | C | I | R |
| 重大异常的暂停、回退与恢复 | I | A | R | C | R | C | I |
| 阶段提升、规模化、资源投入或退役 | A | R | C | I | C | C | I |
最低责任规则:每个正式用例必须有业务 Owner;每个可变更的知识资产必须有知识 Owner;每个含工具、权限、日志或自动化运行的用例必须有技术 Owner;涉及高风险数据、外部影响或高自主性的用例,应有相应的安全/风险代表参与关键决策。外部顾问、FDE 或 AI COE 可以承担设计和辅导工作,但不能长期替代客户方的业务 Owner 和知识 Owner。
20. 用例阶段闸门与组合决策卡
阶段不是“成熟度打分比赛”,而是为了避免尚未证明稳定、价值或控制能力的用例被过早扩大。每次阶段提升或退役都应在用例组合台账中留下一个简短决策记录。
| 阶段 | 用例状态 | 进入该阶段的最低条件 | 升级/退出所需证据 | 可做的管理决定 |
|---|---|---|---|---|
| G0:候选 | 已识别问题,尚未启动正式试验 | 业务问题、目标用户和当前人工基线可描述;存在潜在 Owner | 用例立项卡、初步风险判断、是否值得投入的理由 | 启动设计 / 暂缓 / 合并到已有用例 |
| G1:试点 | 正在验证最小闭环 | 有工作流或 Skill 卡草案、真实样本、人工回退、责任人 | 在小范围真实任务中证明可用;失败可解释且可修复;第二人可复现 | 进入限量生产 / 延长试点 / 停止 |
| G2:限量生产 | 在受控范围内处理真实工作 | 质量、采用、成本和知识更新已开始记录;人工审核与异常升级可用 | 观察期稳定;变更能回归;风险边界被遵守 | 进入受控生产 / 保持限量 / 回退试点 |
| G3:受控生产 | 被正式团队持续使用 | 版本、责任、评测、回退、运行节奏稳定;关键依赖可追溯 | 连续稳定运行;业务价值假设获得证据;维护负担可承受 | 复制到相邻场景 / 保持运行 / 优化 / 退役评估 |
| G4:规模化 | 已跨团队或跨场景复制 | 共享知识、平台、支持与培训机制就绪;组合层面有资源与风险管理 | 复用后仍能保持质量;共享依赖变更可控;Owner 覆盖充分 | 扩大投资 / 限制扩张 / 拆分资产 / 退役低价值用例 |
| G5:退役 | 不再适合继续运行 | 价值消失、维护成本过高、风险不可接受、被更优方案替代或业务流程取消 | 业务 Owner 批准;人工/替代流程可用;数据、权限、资产和日志按政策处置 | 停止运行 / 归档资产 / 移交替代方案 |
阶段决策记录模板
用例编号与名称:
当前阶段 → 申请阶段:
本次决策类型:进入 / 保持 / 扩大 / 降级 / 暂停 / 退役
业务证据:
- 当前基线与目标:
- 质量、采用、效率、成本或业务结果:
- 主要未解决问题:
控制证据:
- 责任人是否齐全:
- 知识/数据是否处于受控状态:
- 回退、接管、权限与审计(如适用)是否已验证:
- 最近重大变更和回归结果:
组合影响:
- 共享知识/工具/人员依赖:
- 是否挤占或重复其他用例:
- 所需新增资源和预算:
决策:
决策理由:
下一次复核日期:
业务 Owner:
业务赞助人/授权人:阶段闸门使用原则:不要因为一个用例“看起来很受欢迎”就跳过质量、知识、权限或回退验证;也不要因为未达到某一条统一数字而机械停止。应同时看业务价值、错误后果、证据完整度和维护能力。高风险或高自主性用例需要更强的控制证据;低风险内部辅助用例可以采用更轻的节奏。
21. 月度用例组合评审模板
当正式或试运行用例达到 3 个以上时,建议每月举行一次 45–60 分钟的组合评审。会议不是逐个汇报工具使用次数,而是做资源、风险和阶段决策。
| 议题 | 会前输入 | 会议需要决定什么 | 输出 |
|---|---|---|---|
| 组合总览 | 最新用例组合台账 | 哪些用例处于试点、限量、生产、规模化或退役 | 更新后的阶段与 Owner |
| 健康与风险 | 质量、采用、成本、异常、知识变更、接管/熔断数据 | 哪些需要修复、降级、暂停或升级 | 优先级行动清单 |
| 价值与资源 | 业务结果、TCO、维护负担、共享依赖 | 资源应投向哪里;哪些不再值得投入 | 投入、停止或延后决定 |
| 共享资产 | 知识库、平台、工具权限、培训和共用 Skill | 哪些资产可以复用;哪些变更需要协调 | 资产 Owner 与变更计划 |
| 下月试验 | 候选用例及立项卡 | 只启动能力与资源允许的新用例 | 新用例、试点范围和复核日期 |
会议结束后,至少更新三项内容:用例组合台账、阶段决策记录和有明确 Owner 与截止日期的行动项。若没有任何阶段、资源或风险决定需要作出,则可用异步审阅替代会议,避免制造无效治理负担。
22. 分角色能力地图与实践认证模板
企业 AI 培训不应以“所有人上一门相同的提示词课”为终点。不同角色承担的工作、风险和决策权不同,因此应学习不同能力,并以真实工作产出而不是听课时长作为验证依据。
| 角色 | 最低应具备的能力 | 必做实践任务 | 可接受的认证证据 |
|---|---|---|---|
| 全员使用者/审核人 | 判断任务是否适合 AI;遵守数据边界;使用批准的 Skill;完成三层自检;发现问题时停止并上报 | 用一个低风险真实任务完成“输入—输出—人工核验—问题记录” | 已填写自检记录;能说明何时转人工;无绕过控制行为 |
| 团队经理/业务 Owner | 选择有业务价值的场景;定义基线与成功标准;保护试点时间;解释何时不该用 AI;依据证据决定扩大或暂停 | 完成一张用例立项卡,并主持一次基于真实数据的周度复盘 | 用例目标、边界、Owner、基线和下一决策清晰;复盘形成行动项 |
| 知识 Owner | 识别权威来源;维护时效、版本和适用范围;处理冲突;完成影响分析 | 完成一次知识变更→回归→限量发布演练 | 更新记录、受影响资产、回归样本与发布/回退决定完整 |
| Skill/流程 Owner、FDE 或 AI COE | 设计输入输出契约、验证、回退、指标和变更机制;辅导第二人复现 | 将一个高频任务封装成 Skill 卡,并带领第二人独立复现 | Skill 卡、成功/失败样本、回归记录、第二人复现结果 |
| 技术/平台 Owner | 落实权限、日志、版本、可用性、成本与异常恢复;验证 Agent 运行控制 | 为一个含工具调用的流程完成权限审查、熔断/接管演练 | 权限矩阵、运行日志样例、演练记录与整改项 |
| 业务赞助人/高管 | 理解价值证据、风险边界和组合决策;避免用错误指标驱动采用 | 审阅一个用例组合台账并就投入、暂停或退役作出有理由的决定 | 有记录的阶段决策;资源与风险取舍可追溯 |
实践认证记录
认证对象:
所属角色:
认证级别:基础使用 / 业务 Owner / 知识 Owner / Skill 流程 Owner / 技术平台 Owner / 赞助人
实践任务名称:
关联用例或 Skill:
完成日期:
提交证据:
- 已完成的文档或运行记录:
- 使用的真实或脱敏样本:
- 发现的问题与处理方式:
审核标准:
[ ] 已遵守适用边界和数据规则
[ ] 已按角色要求完成关键动作
[ ] 能解释何时停止、转人工或升级
[ ] 相关资产可以被他人复核
审核人:
认证结果:通过 / 补充实践后复核 / 不通过
需要补强的能力:
复核或再认证日期:使用原则:认证不应成为追求证书数量的活动,也不应以模型调用次数、Token 消耗或登录时长作为依据。它应证明一个人能够在自己角色的责任边界内做出正确动作、留下可复核证据,并在不确定时知道何时停止和求助。重大角色变化、权限扩大、业务规则重大调整或长时间未实际使用时,可安排有针对性的再认证。
23. 经理人 AI 变革行动手册
员工的使用习惯不会仅因开通账号或举办一次培训而稳定改变。经理人的职责不是要求团队“多用 AI”,而是重构工作方式、消除障碍、保护试点时间,并以业务结果和风险边界为依据带领团队学习。
30 天启动节奏
| 阶段 | 经理人要做什么 | 不该做什么 | 产出 |
|---|---|---|---|
| 第 1 周:定向 | 选择一个低风险、高频、可验证任务;说明为什么做、谁负责、哪些事不能交给 AI | 直接要求所有人都用同一个工具或立即建设 Agent | 用例立项卡、团队边界说明、试点参与者 |
| 第 2 周:共同练习 | 用真实或脱敏样本演示一次完整任务;让成员分别完成一次并比较差异 | 只讲概念、只展示最好的一次结果 | 失败记录、问题清单、更新后的 Skill/检查清单 |
| 第 3 周:嵌入流程 | 将 Skill、验证和人工确认放入实际 SOP;为使用者和知识 Owner 安排固定时间 | 让试点变成额外无偿工作,或让原搭建者独自维护一切 | 运行节奏、Owner、升级路径、周度数据 |
| 第 4 周:基于证据决定 | 回顾质量、采用、总耗时、失败、知识更新与成员反馈;决定扩大、改进或暂停 | 只看“大家觉得不错”、只汇报成功案例 | 阶段决策、下月行动、需升级的风险或资源问题 |
每周经理人检查问题
在周度复盘中,经理人应优先提出以下问题,而不是“本周大家用了多少次 AI”:
- 本周哪些真实任务被采用?哪些没有被采用,为什么?
- 失败、转人工或拒绝发送的案例告诉我们什么?
- 当前知识、Prompt、Skill、流程或权限中,哪一个环节最需要改进?
- 谁在承担额外维护负担;是否需要调整资源或缩小范围?
- 是否有人因为不确定、担忧犯错或工具不合适而绕开正式流程?应如何提供安全、合规的替代路径?
应强化与应避免的行为
| 应强化 | 应避免 |
|---|---|
| 及时上报失败、知识过期、异常输出和控制缺口 | 为了好看而隐瞒失败,或把失败报告视为个人能力不足 |
| 用真实任务练习,允许在低风险范围内试错 | 只看演示、只使用精心准备的“完美样本” |
| 将节省的时间重新投入客户、判断、协作或高价值工作 | 将“使用 AI 次数”作为绩效指标,诱导为用而用 |
| 对边界不清的任务明确转人工或暂停 | 鼓励员工用个人账号或未经批准工具绕过限制 |
| 让使用者、知识 Owner、技术 Owner 共同复盘 | 由单一“AI 高手”长期背负所有维护和决策 |
24. 采纳反馈与问题上报闭环模板
稳定采纳需要让员工相信:提出问题会带来改进,而不是惩罚;不用不合适的 AI、转人工或暂停自动化是被支持的专业判断。团队应提供一个低门槛的反馈入口,并将反馈连到知识、Skill、流程、培训或治理动作。
反馈编号:
提交日期:
提交人/匿名选项:
关联用例/Skill/Agent:
任务类型:
反馈类型:
[ ] 输出错误或遗漏
[ ] 知识过期/冲突
[ ] 不知道何时该用或不该用
[ ] 工具、权限、速度或成本问题
[ ] 数据或合规担忧
[ ] 使用体验/培训需求
[ ] 建议新增或停止某个场景
发生了什么:
影响范围:
已采取的即时动作:继续 / 转人工 / 暂停 / 升级
是否需要保护提交人或限制传播:是/否
分流结果:
- 知识更新:
- Skill/流程改进:
- 技术/权限处理:
- 培训或沟通动作:
- 风险/安全升级:
责任人:
响应时限:
处理结果与回告:
是否写入失败案例、回归样本或培训材料:闭环规则:低风险使用体验问题可以在团队周度复盘中处理;知识、质量和流程问题应进入对应资产的变更记录;涉及数据、安全、对外影响或严重错误的问题应立即按第 12 章升级路径处理。每月汇总反馈类型和处理时效,识别反复出现的培训盲区、知识缺口或流程障碍。
25. 用例立项卡(One-page Use Case Charter)
用例立项卡是所有正式试点的入口。它回答的不是“要不要做一个 Agent”,而是“哪个业务问题值得被解决、在什么边界内试验、谁为结果负责、何时应该继续或停止”。一张卡只对应一个业务用例;其后可以关联多个 Skill、固定工作流或 Agent。
使用顺序:候选用例先填写立项卡,再做风险初筛和工作流设计;进入试点后,用例编号应写入所有 Skill 卡、工作流合约、评测记录、变更单、事件记录和用例组合台账。这样,后续资产才可被关联和追溯。
用例编号:UC-部门-序号
用例名称:
当前阶段:候选 / 试点 / 限量生产 / 受控生产 / 规模化 / 退役
立项日期:
最近复核日期:
一、业务问题与范围
- 要解决的业务问题:
- 目标用户/使用者:
- 当前人工流程及痛点:
- 适用范围(部门、任务类型、地域/客户/系统边界):
- 明确不做什么:
- 与已有用例的区别、重叠或复用关系:
二、当前基线与价值假设
- 任务量/频率:
- 当前端到端耗时(含检查、返工和等待):
- 当前质量/风险信号(错误、投诉、积压、遗漏等):
- 预期改变的业务结果:
- 价值证据类型:流程效率 / 产能释放 / 业务结果 / 风险避免
- 不应宣称的收益:
三、初始边界与风险判断
- 输入数据类别与最高敏感度:
- 是否涉及个人信息、对外沟通、关键决策、写入操作或不可逆动作:
- 最坏可接受错误及不可接受结果:
- 人工必须保留的决策/审核节点:
- 需要征询或批准的角色:
- 初始风险判断及理由:低 / 中 / 高 / 待确认
四、解决方案与依赖假设
- 计划采用的方式:Prompt / Skill / 固定工作流 / 受限 Agent
- 预计关联的 Skill、工作流或 Agent 标识:
- 知识/数据来源及知识 Owner:
- 关键系统、模型、工具或平台依赖:
- 人工备用流程与回退条件:
五、试点设计与决策门
- 业务 Owner:
- Skill/流程 Owner:
- 技术 Owner(如适用):
- 试点范围、参与者和周期:
- 试点样本与验证方式:
- 成功假设(质量、采用、效率、业务结果或风险控制):
- 停止/降级条件:
- 下一决策日期及所需证据:
立项结论:启动设计 / 暂缓 / 合并到已有用例 / 不做
业务 Owner:
批准或复核人:进入试点前的最低检查
| 检查项 | 最低要求 |
|---|---|
| 业务问题 | 可以用业务语言说明当前痛点,而不是只描述工具功能。 |
| Owner | 业务 Owner 和日常维护角色明确,且愿意在试点后作出继续、暂停或调整建议。 |
| 基线 | 至少具备任务频率、端到端耗时或当前质量/风险信号之一;未知的内容必须标记为待测量。 |
| 边界 | 已写明明确不做什么、不可接受结果和人工保留决策。 |
| 回退 | 发生错误、工具不可用或边界不清时,使用者知道如何回到人工或原流程。 |
| 下一决策 | 试点不是无限期运行;已定义何时、依据什么证据作出下一次决定。 |
26. 通用工作流合约(Workflow Contract)
工作流合约适用于需要多人协作、多个步骤或持续维护的正式流程。它不是对 Skill 卡的替代:Skill 卡定义单项可复用能力;工作流合约定义这些能力、确定性步骤和人工控制点如何共同完成一个业务用例。 一个简单用例可以只有一个 Skill;一个复杂用例可以在同一份合约中编排多个 Skill、规则和人工步骤。
工作流编号:WF-部门-序号
工作流名称:
关联用例编号:
版本:
当前状态:设计 / 试点 / 限量生产 / 受控生产 / 暂停 / 退役
业务 Owner:
流程 Owner:
技术 Owner(如适用):
最近复核日期:
一、目标、边界与触发
- 业务目标:
- 触发条件与发起角色:
- 适用范围:
- 禁止/不适用的情形:
- 最终使用者与受影响对象:
二、输入与输出契约
- 必填输入、来源、格式、时效和质量要求:
- 不可接受的输入及处理方式:
- 输出对象、格式、交付渠道和留存要求:
- 必须呈现的来源、版本、置信或待确认信息:
三、步骤、状态与控制点
| 序号 | 状态/步骤 | 执行者(人/系统/Skill) | 输入与输出 | 验证或审批 | 失败/异常后的动作 |
| --- | --- | --- | --- | --- | --- |
| 1 | | | | | |
| 2 | | | | | |
| 3 | | | | | |
四、受控组件与依赖
- 关联 Skill 及版本:
- Prompt、知识、规则与模型版本:
- 可调用工具、数据范围和读写权限:
- 外部系统、人工 SOP 和关键依赖:
五、质量、运行与人工控制
- 质量 Rubric/验证清单:
- 自动检查与人工审核节点:
- 必须停止、转人工或升级的条件:
- 运行指标、数据来源和记录频率:
- 适用的成本、时间、并发或调用预算:
六、变更、发布、回退与退役
- 受控变更类型:Prompt / 知识 / 模型 / 工具 / 权限 / 流程 / 验证规则
- 变更前必须完成的影响分析与回归:
- 发布审批和限量范围:
- 回退版本、人工备用流程和恢复证据:
- 暂停/退役触发条件和资产处置要求:
七、可追溯记录
- 必须记录的输入、输出、版本、审批、异常和人工接管信息:
- 记录位置、访问权限和留存期限:
- 关联的用例立项卡、评测报告、变更单、事件记录和用例组合台账:工作流进入受控生产前的最低检查
- [ ] 已关联一个有效的用例立项卡,并说明为什么该流程仍值得运行。
- [ ] 每个步骤都有执行者、输入输出、验证/审批和异常处理方式。
- [ ] 所有关联 Skill、知识、工具、模型和权限都有版本或可追溯标识。
- [ ] 已定义人工控制点、停止条件、人工备用流程和恢复证据。
- [ ] 已完成真实或脱敏样本的验证,并保留成功、边界和失败样本。
- [ ] 已明确谁可以批准发布、暂停、回退和退役。
27. 已填写示例:客户咨询回复用例立项卡
本示例与附录 A 第 16 节“客户咨询标准回复草拟与核验 Skill”对应,说明如何把一个看似简单的“回复起草”任务放回业务、风险和决策语境中。以下字段为演练示例,组织应以自身政策、数据等级和审批角色替换。
用例编号:UC-CS-001
用例名称:高频客户咨询标准回复草拟与核验
当前阶段:试点
业务问题与范围:
- 客服与销售支持人员对物流、退换货、活动规则等高频咨询反复手写回复,耗时高且口径不一致。
- 试点仅覆盖规则清晰、已批准的六类问题;草稿由人工确认后发送。
- 不处理补偿、退款金额、投诉升级、价格例外、法律/合同解释或敏感个人信息。
当前基线与价值假设:
- 当前人工回复耗时:每次约 8–15 分钟,且存在关键提示遗漏或口径不一致。
- 试点假设:在不增加对外承诺风险的前提下,缩短草拟与核验的端到端时间,并提升标准要点使用一致性。
- 价值证据:先记录流程效率和口径质量;不将节省时间直接宣称为财务收益。
初始边界与风险:
- 输入仅来自批准的客服系统或已脱敏文本;数据等级、留存和权限按第 15 章确认。
- 对外沟通及知识时效属于重点风险;任何来源过期、规则冲突、例外要求或审核人无法确认的情况必须转人工。
- 客服支持负责人为业务 Owner;各问题类型政策负责人为知识 Owner。
试点设计与决策门:
- 先使用已关闭历史咨询做离线回归,再由已培训人员在小范围真实任务中使用,所有草稿维持人工确认。
- 成功证据:回复引用有效来源;必须提示齐全;无额外承诺;人工修改负担和端到端耗时可接受;异常能正确转人工。
- 停止/降级:发生错误口径、错误承诺、知识冲突未拦截或无法解释的质量下降时,立即回到人工标准回复流程。28. 已填写示例:产品周会纪要工作流合约
本示例与附录 A 第 13 节“产品周会纪要提取与核验 Skill”对应。它展示一个无需 Agent 的固定工作流如何连接转写、Skill、人工确认和发布,并保留完整的回退路径。
工作流编号:WF-PROD-MINUTES-001
工作流名称:产品周会纪要与待办确认流程
关联用例编号:UC-PROD-001
版本:v1.0
当前状态:试点
业务目标:
在会议结束后生成结构化纪要和可执行待办,减少整理时间并降低决议、负责人和截止日期遗漏。
触发与边界:
- 由会议主持人或指定记录人提交完整会议转写后发起。
- 仅用于已获得适当授权的内部产品会议;不用于来源不明、不完整或不可在当前工具处理的转写。
- 输出须由主持人确认后发布;系统不得自行发布纪要或替代争议事项判断。
步骤与控制点:
1. 输入校验:记录人确认日期、参会人和完整转写存在;缺失时补充,不进入生成。
2. 纪要生成:调用 SK-PROD-MINUTES v1.0,输出会议基本信息、关键决议和待办表。
3. 自动格式检查:检查待办字段、待定标识和输出结构;失败时返回生成步骤一次。
4. 人工核验:主持人核对决议、负责人、行动和截止日期;争议、缺失或超出范围时人工修订。
5. 发布与记录:人工将确认版本贴入批准的协作文档,并记录 Skill/工作流版本、人工修改和失败类型。
质量与回退:
- 通过条件:无明确决议遗漏;待办可执行;不得把讨论建议写成决议。
- 转人工:转写缺失、决议争议、涉及人员评价/预算承诺/对外事项,或验证无法通过。
- 回退路径:使用人工会议记录模板,由主持人确认后发布。
变更与运行:
- Prompt、示例、字段规范或模型变化前,用历史会议样本回归;不通过时保留上一稳定版本。
- 记录一次通过率、总耗时、决议/待办完整率和采用率;前四周每周回顾,稳定后每月复核。29. Golden Set 与评测集模板
Golden Set 是用于持续验证质量的、经过人工确认的样本集合。它不是一批“看起来效果不错”的示例,也不是让模型记住标准答案的训练材料;它的作用是让团队在 Prompt、知识、模型、工具、权限或流程变化前后,以同一批代表性任务比较结果,发现静默退化。
每个正式用例应有自己的 Golden Set,并用用例编号和工作流编号关联。低风险试点可以先从小集合开始,但必须覆盖实际会遇到的正常、边界和历史失败情形;对外、高影响或 Agent 用例还应覆盖异常输入、转人工、拒绝、熔断和回退情形。
评测集编号:GS-用例编号-序号
关联用例编号:
关联工作流编号:
关联 Skill/Agent 及版本:
评测集版本:
创建日期/最近复核日期:
业务与评测 Owner:
样本数据的来源、脱敏状态和访问权限:
评测目的:试点准入 / 变更回归 / 发布审批 / 定期健康检查 / 事件复盘
适用版本与不适用范围:
评分 Rubric/通过定义:
必须由人工判定的维度:
| 样本编号 | 样本类别 | 场景/输入摘要 | 期望行为或判定准则 | 风险标签 | 必须触发的控制 | 来源版本 | 审核人 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| GS-001 | 正常 | | | | | | |
| GS-002 | 边界 | | | | | | |
| GS-003 | 历史失败 | | | | | | |
| GS-004 | 异常/拒绝/转人工 | | | | | | |
覆盖检查:
[ ] 覆盖高频正常任务
[ ] 覆盖容易遗漏或误判的边界任务
[ ] 覆盖历史失败和已知风险
[ ] 覆盖知识过期/冲突、输入缺失或工具异常(如适用)
[ ] 覆盖对外、写入、权限、人工接管或熔断控制(如适用)
[ ] 所有样本均有人工认可的期望行为或判定准则Golden Set 维护规则
| 触发情形 | 必须动作 |
|---|---|
| 发现真实失败或人工接管案例 | 判断是否应新增为历史失败或边界样本,并记录控制预期。 |
| 业务规则、知识或流程变化 | 审查哪些样本的期望结果失效;更新后保留变更说明。 |
| 模型、Prompt、工具、权限或状态逻辑变化 | 从受影响样本中选择回归范围;高影响变化不得只测试正常样本。 |
| 样本含敏感数据或已无业务代表性 | 脱敏、替换、限制访问或退役;保留替换原因。 |
30. 用例健康卡模板
用例健康卡将业务价值、质量、风险、运行与下一步决策放在一页中。它服务于周度运行会、月度组合评审和阶段闸门,不应被简化成单一通过率看板。
用例编号/名称:
当前阶段:
关联工作流、Skill/Agent 及版本:
业务 Owner / 流程 Owner / 知识 Owner / 技术 Owner:
本期时间范围:
一、业务问题与当前目标
- 当前基线与目标:
- 本期业务结果或价值证据:流程效率 / 产能 / 业务结果 / 风险避免
- 不应货币化或尚未验证的收益:
二、质量与采用
- 执行次数:
- 一次通过率与趋势:
- 实际采用率与趋势:
- Rubric/关键质量项:
- 主要失败类型与数量:
三、效率、成本与维护
- 平均总耗时及与人工基线的比较:
- 工具、人工验证、维护与错误处理成本:
- 本期维护负担和主要依赖:
四、风险与控制
- 知识时效/数据/权限/对外影响状态:
- 人工接管、熔断、错误动作、异常或投诉:
- 运行证据完整性:
- 最近一次回退/演练及结果:
五、变更与评测
- 本期变更及影响范围:
- Golden Set/回归报告编号及结果:
- 未解决风险、阻塞项或需要升级的问题:
六、阶段与决策
- 对照用例立项卡的成功/停止假设:
- 建议:扩大 / 维持 / 限量运行 / 改进 / 降级 / 暂停 / 退役
- 决策理由、责任人和下一复核日期:使用规则:健康卡中的绿色、黄色或红色状态应由用例立项卡中定义的风险容忍度和目标确定,不使用跨部门统一阈值。高风险用例即使效率改善,也不应以质量或控制缺口换取扩大范围。
31. 回归评测报告模板
附录 A 第 15 节记录“发生了什么变更、应测什么”;本报告记录“实际如何测、结果是什么、是否允许发布”。每次进入限量生产、受控生产,或发生影响质量、风险、成本、权限和业务边界的变化时,应有一份可追溯的回归报告。
回归报告编号:RR-用例编号-序号
关联变更编号:
关联用例编号 / 工作流编号:
待发布版本与当前稳定版本:
评测目的:试点准入 / 变更回归 / 发布审批 / 事件修复验证
报告 Owner 与审核人:
一、变更与影响范围
- 变更类型:Prompt / 知识 / 模型 / 工具 / 权限 / 流程 / 验证规则 / 其他
- 变更目的与预期收益:
- 可能退化的质量、风险、成本或控制:
- 受影响的 Skill、Agent、知识、接口和用户范围:
二、评测设计
- 使用的 Golden Set 及版本:
- 选择的正常、边界、历史失败、异常/转人工样本:
- Rubric 与通过/拒绝定义:
- 与当前稳定版本的比较方法:
- 人工复核范围与审核人:
三、结果
| 指标/控制项 | 当前稳定版本 | 待发布版本 | 差异 | 是否满足要求 | 备注 |
| --- | --- | --- | --- | --- | --- |
| 关键质量项 | | | | | |
| 一次通过率 | | | | | |
| 关键失败样本行为 | | | | | |
| 转人工/拒绝/熔断 | | | | | |
| 端到端耗时与成本 | | | | | |
| 权限、来源与日志证据 | | | | | |
四、结论与发布建议
- 未通过项、风险及修复计划:
- 建议:不发布 / 修复后复测 / 限量发布 / 按计划发布 / 回退
- 限量范围、观察指标和观察期(如适用):
- 回退版本与触发条件:
- 业务 Owner / 技术 Owner / 风险或审批角色的决定:变更控制强度参考
| 变更类型 | 最低评测与发布动作 |
|---|---|
| 纯编辑性变更,不改变含义、规则、版本或行为 | 记录变更;由责任人抽样确认。 |
| Prompt、示例、知识条目或验证规则变化 | 审查受影响样本;对正常、边界和历史失败样本回归;必要时限量发布。 |
| 模型、检索、工具、接口、流程状态或成本预算变化 | 比较质量、性能、成本、异常与回退行为;保留当前稳定版本。 |
| 权限扩大、对外范围扩大、写入动作、高风险数据或关键业务规则变化 | 完成风险审查、完整受影响评测、人工控制演练、审批和限量观察;无充分证据不得扩大。 |
32. 发布登记与观察期模板
发布登记将“评测通过”转化为受控上线,而不是把一次测试结果直接等同于生产可用。它记录发布范围、审批、证据、观察期、停止条件和回退责任;与用例立项卡、工作流合约和回归报告共同构成一个可审计的发布链。
发布编号:REL-用例编号-序号
关联用例编号 / 工作流编号:
待发布的 Skill、Agent、Prompt、知识、模型、工具或流程版本:
发布类型:试点 / 限量生产 / 受控生产 / 紧急修复 / 回退 / 退役
一、发布范围
- 生效时间与范围(部门、使用者、问题类型、系统、地域等):
- 明确排除的范围:
- 是否涉及对外、写入、敏感数据或高影响决策:
二、发布前证据
- 用例立项卡与当前阶段:
- 工作流合约与版本:
- 回归报告/Golden Set 版本及结论:
- 需要的安全、风险、业务或技术审批:
- 使用者培训、SOP 和支持入口是否就绪:
三、观察与控制
- 观察期及观察指标:
- 人工审核或抽检比例:
- 必须停止、转人工、缩小范围或回退的条件:
- 回退版本、人工备用流程和执行责任人:
- 值班/升级路径和沟通对象:
四、发布决定与关闭
- 决定:发布 / 限量发布 / 延后 / 回退 / 退役
- 批准人及时间:
- 观察期结果:
- 最终状态及下一阶段决策:
- 需更新的健康卡、组合台账、知识资产、培训或事件记录:最低发布原则
- 没有可验证证据,不扩大范围。 对外沟通、写入、权限扩大或高影响用例,不能仅凭“演示效果不错”发布。
- 评测通过不等于自动放开。 当业务边界、知识时效或人工审核能力仍存在不确定性时,应先限量运行并设观察期。
- 始终保留回退。 发布登记必须指向一个已知稳定版本或可执行的人工备用流程;没有回退就不应进入受控生产。
33. 已填写示例:客户咨询回复 Golden Set
本示例与 UC-CS-001、WF-CS-REPLY-001 和 SK-CS-STANDARD-REPLY v1.0 对应。为避免将任何具体企业政策或客户数据写入手册,样本只说明必须发生的行为,不提供可直接对外使用的政策内容。真实企业应使用经过脱敏、已关闭的历史咨询和已批准的当前政策版本替换。
评测集编号:GS-UC-CS-001-v1.0
关联用例编号:UC-CS-001
关联工作流编号:WF-CS-REPLY-001
关联 Skill:SK-CS-STANDARD-REPLY v1.0
评测目的:试点准入、知识变更回归、限量发布观察
业务 Owner:客服支持负责人
知识 Owner:活动/退换货/物流规则责任人
共同判定要求:
- 草稿必须显示当前有效的来源标识、版本或生效信息。
- 草稿不得超出知识来源作出补偿、价格、法律或其他例外承诺。
- 规则缺失、规则冲突、例外要求或审核人无法确认时,必须明确转人工。| 样本编号 | 样本类别 | 脱敏输入摘要 | 期望行为/通过准则 | 风险标签 | 必须验证的控制 |
|---|---|---|---|---|---|
| GS-CS-001 | 正常 | 客户询问一项当前有效的物流进度规则 | 正确匹配物流问题类型;使用有效要点;生成符合语气的草稿;显示来源;不增加无依据承诺 | 口径一致性 | 来源有效、人工确认前不发送 |
| GS-CS-002 | 边界 | 客户询问退换货条件,但提供的信息不足以判断是否符合适用条件 | 说明需要补充的信息;不擅自判定资格;引用适用条件;将不确定项标记给人工审核 | 信息不完整 | 输入不足时不做结论 |
| GS-CS-003 | 历史失败 | 活动咨询中,旧版本曾遗漏截止日期或引用了已失效范围 | 使用当前活动要点;完整呈现必要时限/范围;不得引用旧版本 | 知识时效 | 知识版本、生效日期、关键字段检查 |
| GS-CS-004 | 异常/转人工 | 客户要求例外补偿、价格调整或投诉升级 | 不生成超权限承诺;清晰说明需由人工处理;保留必要的事实摘要供转交 | 对外承诺/例外处理 | 必须转人工、不得直接发送 |
使用方式
在任何知识、Prompt、模型、工具、权限或验证规则变更前,先对这四类样本运行新旧版本比较,并填写附录 A 第 31 节的回归评测报告。若 GS-CS-003 未能正确使用新规则,或 GS-CS-004 未转人工,即使其他样本表现良好,也不得扩大发布范围。观察期内发现的新失败应经过审核后加入下一版本评测集。
34. 用例级风险初筛与控制分层模板
数据分级是必要但不充分的。相同的数据在“内部草稿、人工确认后发送、自动写入系统、影响个人或关键业务决定”等不同用例中,风险并不相同。因此,用例在立项时应完成一次风险初筛,并在范围、数据、模型、工具、权限、自主性或业务影响变化时重新评估。
本模板用于组织内部的运营分层与控制设计,不替代法律意见、行业监管判断、信息安全评估或采购审查。如适用法律、合同、行业规则或企业制度提出更高要求,应以更高要求为准。
风险初筛编号:RS-用例编号-序号
关联用例编号 / 工作流编号:
评估目的:立项 / 阶段提升 / 重大变更 / 定期复核 / 事件后复核
业务 Owner / 风险或安全复核角色:
评估日期 / 下次复核日期:
一、业务影响
[ ] 仅内部个人辅助或低影响内容草稿
[ ] 影响团队流程、资源分配或内部沟通质量
[ ] 面向客户、合作伙伴或公众的沟通/内容
[ ] 影响个人权益、关键业务决定、财务、医疗、法律、人事或其他高影响领域
[ ] 涉及不可逆、难以补救或大范围传播的后果
二、数据与知识
[ ] 仅使用 L1 公开或经批准的 L2 内部数据
[ ] 包含个人信息、客户信息、合同、定价、源代码或其他 L3 以上数据
[ ] 使用外部来源、用户提交内容、第三方工具返回或可能不可信的输入
[ ] 知识来源尚无 Owner、版本、生效日期或冲突仲裁方式
三、动作与自主性
[ ] 只生成内部草稿,人工逐次决定是否采用
[ ] 生成对外内容,但需人工审核/发送
[ ] 可读取多个系统、调用外部工具或进行多步骤处理
[ ] 可写入、发送、变更记录、分配任务、触发交易或影响真实世界动作
[ ] Agent 可动态选择 Skill/工具、连续执行或在无人值守下运行
四、控制与韧性
[ ] 有明确业务 Owner、知识 Owner 和暂停/回退责任人
[ ] 有可执行的人工审核、转人工和人工备用流程
[ ] 有 Golden Set、回归、发布观察和运行记录
[ ] 有最小权限、数据边界、来源追溯、日志和异常升级机制
[ ] 上述控制尚未具备、无法验证或无法由责任人长期维护
初始控制等级:R1 基础 / R2 受控 / R3 高影响 / R4 暂缓或转专项治理
风险理由与关键不确定项:
需要的后续资产:影响评估 / 安全审查 / 法务或行业审查 / Agent 合约 / 例外审批 / 其他
结论:可按现有控制推进 / 补齐控制后推进 / 缩小范围试点 / 暂缓风险—控制等级参考
风险等级不是自动计算的分数。应以错误后果、数据敏感度、对象受影响程度、动作可逆性、自主性和现有控制成熟度的最高风险因素决定;不确定时应上调等级或缩小范围。
| 等级 | 典型情形 | 最低控制要求 | 阶段限制 |
|---|---|---|---|
| R1 基础 | 低影响内部辅助;公开或批准的内部信息;人工决定是否采用;无写入和对外发送 | 用例立项卡、明确 Owner、输入输出边界、基础验证、版本记录、人工回退 | 可从小范围试点开始;不得因“低风险”跳过质量和记录。 |
| R2 受控 | 外部沟通草稿、跨系统读取、L2/L3 数据、多个 Skill/固定工作流、规则频繁变化 | R1 控制 + AI 影响评估、知识 Owner/版本、Golden Set、回归报告、发布登记、最小权限、人工审核与观察期 | 先限量运行;范围扩大须有健康卡和阶段闸门证据。 |
| R3 高影响 | 高敏感数据、个人权益或关键业务影响、写入/发送、复杂 Agent、较难回退或高扩散后果 | R2 控制 + 业务/安全/风险等适用角色审查、严格权限隔离、关键动作批准、完整异常/接管演练、审计证据索引和定期复核 | 不得直接提升自主性或扩大范围;应采用更严格的专项治理与发布门。 |
| R4 暂缓或转专项治理 | 无法说明目的、Owner、数据边界、人工回退或合法依据;或现有控制无法覆盖不可接受后果 | 停止标准路径的设计/发布;先消除阻塞项,或按组织专门流程处理 | 不得以例外审批替代法律、监管、安全或不可接受风险的基础要求。 |
35. AI 影响评估与风险—控制矩阵模板
风险初筛用于决定控制强度;**AI 影响评估(AIA)**用于在进入试点、限量生产或高影响变更前,系统说明“谁会受影响、可能发生什么、用什么控制、剩余风险是否可接受”。评估应随用例更新,而不是只在首次立项时填写一次。
影响评估编号:AIA-用例编号-序号
关联用例编号 / 工作流编号 / 发布编号:
关联风险初筛编号与控制等级:
评估触发:首次试点 / 阶段提升 / 重大变更 / 事件 / 定期复核
业务 Owner、流程 Owner、知识 Owner、技术 Owner:
参与复核的安全、风险、法务、隐私或行业角色(按组织适用):
一、目的与受影响对象
- 业务目的、预期价值与不应实现的目标:
- 使用者、客户、员工、合作方或其他受影响对象:
- 是否可能影响权益、机会、资源、声誉或安全:
- 明确的使用范围、禁止范围与人工保留决定:
二、系统与数据边界
- Prompt、Skill、工作流、Agent、模型、工具和外部依赖:
- 输入/输出数据类别、敏感度、数据流向和留存:
- 知识来源、Owner、生效日期、冲突处理和更新机制:
- 读写权限、对外发送、自动动作和人工审批边界:
三、影响、风险与控制
| 风险编号 | 可能影响/受影响对象 | 触发情形 | 固有风险 | 现有与拟定控制 | 控制 Owner | 需要的证据 | 残余风险 | 决定 |
| --- | --- | --- | --- | --- | --- | --- | --- | --- |
| R-01 | | | | | | | | |
| R-02 | | | | | | | | |
四、运行与恢复
- 人工审核、转人工、暂停、回退和人工备用流程:
- 事件分级、升级路径、通知对象和恢复所需证据:
- 观察指标、复核频率、触发重新评估的条件:
五、结论
- 残余风险是否在组织可接受范围内:
- 发布建议:不推进 / 补齐控制后试点 / 限量生产 / 受控生产 / 暂停或退役
- 前置条件、例外和到期日:
- 业务 Owner 与适用复核角色的结论:通用风险—控制矩阵
| 风险领域 | 常见触发信号 | 核心控制 | 最低证据 |
|---|---|---|---|
| 数据、隐私与保密 | L3/L4 数据、个人信息、外部模型留存不清、跨境或第三方处理 | 数据分级、最小必要、脱敏、批准的处理环境、访问控制、留存与删除规则 | 数据流与分级记录、配置/合同或批准记录、访问与留存说明 |
| 知识正确性与时效 | 来源无 Owner、规则冲突、旧版本仍在使用、对外口径变化 | 权威来源、版本/生效日期、知识 Owner、冲突仲裁、Golden Set 和回归 | 知识资产记录、来源版本、回归报告、变更记录 |
| 输出质量与误导 | 事实错误、遗漏、幻觉、不可解释或专业领域建议 | 输入输出契约、Rubric、独立验证、人工审核、明确边界与转人工 | Skill/工作流合约、评测集、检查/审批记录、失败样本 |
| 对外沟通与权益影响 | 面向客户/公众、影响资格/资源/评价/机会、承诺或歧视性风险 | 受控范围、人工最终决定、来源显示、禁止承诺、申诉/转人工路径 | 用例边界、审核记录、输出留存、问题处理记录 |
| 工具、权限与 Agent 动作 | 写入、发送、连续工具调用、越权尝试、提示注入或不可信工具返回 | 最小权限、动作白名单、状态限制、参数校验、审批、熔断、日志 | Agent 合约、权限矩阵、异常演练、调用/审批/熔断日志 |
| 运营、成本与韧性 | 模型/供应商故障、成本飙升、人工接管失败、关键人员依赖 | 预算/并发限制、监控、人工备用流程、回退、供应商/模型预案、交接 | 健康卡、Runbook、演练记录、回退与恢复证据 |
| IP、记录与审计 | 输出归属/授权不明、记录缺失、无法追溯采用或变更 | 来源与版本标识、生成/审批/变更记录、留存政策、证据索引 | 审计证据索引、发布登记、日志/留存位置、定期抽查记录 |
36. 风险例外审批与到期复核模板
例外是指某个用例暂时无法满足已定义的内部控制要求,但业务仍希望在明确缩小范围、设置补偿控制和到期日的条件下继续。例外不是对法律、监管、信息安全基本要求或不可接受风险的豁免;无法安全控制的风险应暂停或转专项治理。
例外编号:EX-用例编号-序号
关联用例编号 / 工作流编号 / AIA 编号 / 发布编号:
申请人、业务 Owner、控制 Owner:
申请日期 / 生效日期 / 到期日期:
一、例外内容
- 未满足的控制要求:
- 未满足的原因与业务必要性:
- 受影响的数据、用户、系统、范围和持续时间:
- 不能采用的替代方案及原因:
二、补偿控制与限制
- 缩小后的范围:
- 额外人工审核、抽检、权限、日志、监控或回退措施:
- 必须停止或自动失效的条件:
- 观察指标与复核频率:
三、风险与决定
- 风险初筛/AIA 中的残余风险说明:
- 业务 Owner 意见:
- 安全、风险、法务、隐私或行业复核意见(按组织适用):
- 批准决定:批准 / 不批准 / 补充材料后复核
- 批准范围、到期日与续期条件:
四、关闭
- 到期复核结果:已关闭 / 已补齐控制 / 已续期 / 已暂停或退役
- 证据位置与责任人:37. 审计证据索引模板
审计证据索引不要求把所有内容复制到一个文件。它的作用是让授权人员能在需要时快速定位“这个用例为何存在、如何运行、谁批准过、发生变化或异常时做了什么”。索引应与用例编号关联,并按企业数据留存、访问控制和最小必要原则管理。
| 证据类型 | 对应资产或记录 | 存储位置/访问角色 | Owner | 最近更新 | 留存/复核要求 |
|---|---|---|---|---|---|
| 业务与阶段决定 | 用例立项卡、阶段闸门、组合评审结论 | ||||
| 风险与影响 | 风险初筛、AIA、控制矩阵、例外审批 | ||||
| 运行定义 | 工作流合约、Skill/Agent 合约、权限矩阵、知识版本 | ||||
| 质量与发布 | Golden Set、Rubric、回归报告、发布登记、观察结果 | ||||
| 运行与异常 | 健康卡、日志、人工接管、熔断、异常/事件与回退记录 | ||||
| 人员与能力 | 培训、实践认证、授权角色与审批记录 | ||||
| 依赖与韧性 | 模型/工具配置、供应商信息、人工备用流程与演练记录 |
证据最小原则
- 只记录实现追溯、控制和复盘所必需的信息;不要因为“可能要审计”而无边界复制敏感原始输入或个人信息。
- 任何日志、样本、评测或输出留存都应遵循数据分级、访问控制、保留期限和删除政策。
- 发布、例外、重大变更、事件或阶段提升完成后,应更新证据索引;无法定位关键证据的用例不应被认定为已受控运行。
38. 已填写示例:客户咨询回复的风险初筛与 AI 影响评估
本示例对应 UC-CS-001、WF-CS-REPLY-001 和 SK-CS-STANDARD-REPLY v1.0。其目的不是为任何具体企业确定法律或合规结论,而是演示一个面向外部沟通、但由人工最终发送的 R2 受控用例,如何将风险判断连接到控制、证据和限量发布。
风险初筛编号:RS-UC-CS-001-v1.0
关联用例/工作流:UC-CS-001 / WF-CS-REPLY-001
评估目的:首次试点
初始控制等级:R2 受控
判断依据:
- 输出面向客户,错误可能被理解为承诺,且业务规则会随活动、库存、时效和政策变化。
- 试点仅生成草稿;经培训的人工审核者逐条确认后发送,系统没有发送、退款、补偿、改价或写入权限。
- 输入只使用批准的内部工单摘要或经过处理的文本;个人身份信息不进入评测集或不必要的提示上下文。
- 用例只覆盖规则清晰的六类高频问题;例外补偿、投诉升级、价格/合同解释、敏感信息或知识冲突一律转人工。
结论:可在完成影响评估、Golden Set 回归、人工审核准备和限量发布登记后进入小范围试点;不得提升为自动发送或扩大到例外类问题。| 风险编号 | 可能影响/受影响对象 | 触发情形 | 核心控制 | 所需证据 | 残余风险与决定 |
|---|---|---|---|---|---|
| R-CS-01 | 客户收到错误、过期或不完整的规则说明 | 活动/退换货/物流规则更新后,旧知识仍被引用 | 权威来源与知识 Owner;版本/生效日期;Golden Set 历史失败样本;回归与限量观察 | 知识更新记录、GS-CS-003 结果、回归报告、发布登记 | 残余风险可在人工确认和观察期内接受;知识冲突或错误口径即回退。 |
| R-CS-02 | 客户被作出未经授权的补偿、价格或其他承诺 | 客户请求例外,或模型根据不完整信息推断承诺 | 禁止事项;问题类型白名单;例外强制转人工;发送前人工审核 | Skill 卡、GS-CS-004 结果、审核/转人工记录 | 不允许系统直接发送;任何未拦截承诺属于停止条件。 |
| R-CS-03 | 客户或企业信息处理超出必要范围 | 输入含不必要个人信息,或使用未经批准的工具/留存配置 | 数据分级、最小必要、脱敏/摘要、批准环境、访问和留存控制 | 数据流说明、工具配置/批准记录、抽检或日志 | 超出批准数据边界时暂停该类输入并交由人工处理。 |
| R-CS-04 | 客户体验下降或处理延迟 | 转人工规则过宽、审核者不清楚来源或流程无法接管 | 明确转人工 SOP、培训、人工备用标准回复、健康卡监控接管与处理结果 | 认证记录、工作流合约、健康卡、反馈/升级记录 | 接管率上升应分析原因;接管无法完成时暂停扩大范围。 |
发布结论示例:仅向已完成实践认证的少量客服支持人员开放;所有输出仍需人工确认;观察来源有效性、例外转人工、关键字段遗漏和人工审核耗时;任何错误承诺、无法解释的规则来源或未按要求转人工,均触发暂停和回退到人工标准回复流程。
39. FDE / AI COE 共创交付章程模板
本章程用于内部 AI COE、FDE 团队或外部交付团队与业务团队在启动时对齐目标、责任、边界、工作方式和接棒标准。它不是项目合同的替代,也不替代数据、采购或法律审批;其作用是避免交付团队把“搭好原型”误当成“客户已经具备运营能力”。
交付编号:DLV-用例编号-序号
关联用例编号 / 工作流编号:
客户/业务单元:
交付模式:内部 AI COE / FDE 共创 / 外部交付辅导 / 其他
交付负责人:
业务 Owner / 知识 Owner / 技术 Owner / 风险或安全角色:
启动日期 / 计划验收日期 / 计划移交日期:
一、业务目标与范围
- 要解决的业务问题、基线与成功/停止假设:
- 本期可交付的用例、使用者、系统和数据范围:
- 明确不做什么(业务、数据、权限、对外动作或自主性边界):
- 关联的风险初筛/AIA、用例阶段与发布限制:
二、交付与客户共同责任
- FDE / AI COE 负责:发现、共创设计、资产化、辅导、评测/控制设计、移交支持。
- 业务团队负责:业务判断、真实样本、范围确认、日常使用、验收和持续运营决策。
- 知识团队负责:权威来源、规则更新、冲突仲裁和知识变更确认。
- 技术团队负责:批准环境、集成、权限、配置、日志、运行与回退。
- 风险/安全等适用角色负责:按组织流程审查高影响边界、例外或专项事项。
三、工作方式与节奏
- 发现/共创工作坊安排:
- 样本、数据和访问的批准方式:
- 周度运行/问题同步:
- 阶段闸门和决策人:
- 变更、异常、风险升级和沟通路径:
四、验收与移交的预期
- 验收所需业务、质量、风险、运行和培训证据:
- 必须完成的第二人复现、回退与基础变更演练:
- 客户接棒 Owner、支持窗口、知识转移方式:
- 退出条件、遗留问题处理和后续组合决策:40. 共创交付看板与阶段检查模板
此表把“发现—共创—试运行—验收—移交—退出/扩展”转换为透明的短周期协作。每个用例一行,证据应链接到现有资产,而不是在看板中重复填写。
| 阶段 | 本阶段问题 | FDE / AI COE 产出 | 客户方确认/产出 | 所需证据或链接 | 决策人 | 状态/下一步 |
|---|---|---|---|---|---|---|
| 发现 | 业务问题是否值得做? | 访谈摘要、基线、候选流程 | 业务 Owner 与范围 | 用例立项卡、风险初筛 | 业务 Owner | |
| 共创设计 | 怎样以最低复杂度实现? | Skill/工作流设计、验证与回退 | 知识来源、人工控制与权限边界 | 工作流合约、AIA(如适用)、事实卡 | 业务/技术 Owner | |
| 试运行 | 在真实范围内是否可用? | 配置、辅导、失败分析 | 真实使用、检查与反馈 | Golden Set、周度记录、回归报告 | 业务 Owner | |
| 验收 | 是否达到接受标准? | 证据汇总、边界/回退演示 | 业务验收、第二人复现 | 验收记录、发布登记、健康卡 | 业务 Owner | |
| 移交 | 是否可以独立运行? | 资产交接、培训、支持窗口 | 接棒运行、变更/异常演练 | 移交清单、认证/演练记录 | 接棒 Owner | |
| 退出/扩展 | 是否结束当前支持或启动下一个用例? | 复盘、遗留项与组合建议 | 运营接管/下一决策 | 退出记录、组合台账、证据索引 | 业务 Owner |
41. 用例验收记录模板
验收记录用于判断“交付成果是否可以被业务团队接收”,而不是只确认演示是否顺利。验收应对照立项卡中的成功/停止假设、风险等级和阶段目标填写。
验收编号:ACC-用例编号-序号
关联交付编号 / 用例编号 / 工作流编号 / 发布编号:
验收范围与时间:
业务 Owner / 接棒 Owner / 交付负责人 / 参与复核角色:
一、业务与使用证据
- 试点范围、执行次数、使用者与代表性:
- 对照基线的质量、采用、效率、业务结果或风险避免证据:
- 用例立项卡中的成功/停止假设结论:
二、质量与运行证据
- Golden Set、Rubric 与回归报告编号及结论:
- 关键失败类型、未解决问题与处理计划:
- 工作流/Skill/Agent 版本、健康卡与发布观察结果:
- 人工接管、回退和必要异常演练是否完成:
三、风险与控制证据
- 风险初筛/AIA/例外(如适用)编号与当前结论:
- 数据、知识、权限、日志、审批与证据索引是否完整:
- 未接受的残余风险、范围限制和观察期要求:
四、接棒能力证据
- 指定接棒 Owner 和替补人:
- 第二人是否能独立运行并通过验证:
- 是否完成一次基础变更和一次异常/回退演练:
- 资产、权限、支持入口和升级路径是否可定位:
验收结论:接收 / 附条件接收 / 不接收
附条件接收或不接收的原因、限制和到期动作:
业务 Owner 签字/确认:
接棒 Owner 签字/确认:42. 能力移交与接棒清单模板
移交不等于发送一批链接。接棒方必须能用、能判断、能改、能停。以下清单用于在交付支持结束前验证实际能力。
移交编号:HTO-用例编号-序号
关联交付编号 / 验收编号:
交付方负责人 / 客户接棒 Owner / 替补人:
移交日期 / 支持窗口结束日期:
一、资产与访问
[ ] 用例立项卡、风险初筛/AIA、工作流合约、Skill/Agent 卡已移交并可访问
[ ] Golden Set、Rubric、回归报告、发布登记、健康卡和证据索引已定位
[ ] Prompt、知识、模型/工具事实卡、配置、日志和版本历史可按权限访问
[ ] 数据、工具、平台、项目、密钥/凭证、审批和暂停/恢复权限已转给适当角色
二、运行与变更
[ ] 接棒 Owner 能用真实或脱敏任务独立运行一次,并完成验证
[ ] 接棒 Owner 能解释适用边界、禁止事项、人工控制与转人工条件
[ ] 接棒 Owner 已完成一次低风险知识/Prompt 变更的影响分析与回归演练
[ ] 接棒 Owner 已完成一次异常、熔断或人工回退演练,并知道升级路径
三、组织与支持
[ ] 业务 Owner、知识 Owner、技术 Owner、风险/安全角色和替补人已确认责任
[ ] 周度运行、月度组合评审、知识更新、事实复核和例外到期机制已排期
[ ] 支持窗口内可咨询的问题、响应时间和不支持事项已经明确
[ ] 遗留风险、债务、已知限制和下一次阶段决策已记录
接棒结论:可独立运营 / 需延长辅导 / 暂不具备接棒条件
未满足项、责任人、完成日期与复核方式:43. 交付退出、扩展与复盘记录模板
退出是把责任从交付团队转回运营团队的控制动作,不是项目关系的简单结束。退出记录应说明当前用例是否已由客户接管、哪些事项仍有限制、是否值得扩大或是否应停止。
退出/扩展编号:EXT-用例编号-序号
关联交付编号 / 验收编号 / 移交编号:
当前用例阶段:
退出类型:按计划结束支持 / 转入客户运营 / 延长辅导 / 启动下一用例 / 暂停或退役
一、交付回顾
- 已实现的业务、质量、风险与能力结果:
- 未实现或不应宣称的结果:
- 关键失败、回退、例外和修复经验:
- 可复用的 Skill、工作流、事实卡、样本或培训资产:
二、客户运营状态
- 当前业务/知识/技术/风险 Owner 与替补人:
- 支持窗口结束后的运行、变更、升级与事实复核节奏:
- 遗留问题、技术债务、知识债务、风险或依赖:
- 需要限量运行、暂停或退役的条件:
三、下一步决定
- 建议:结束支持 / 延长辅导 / 扩大当前用例 / 启动相邻用例 / 暂停/退役
- 决策依据:健康卡、组合台账、验收、风险和资源情况:
- 责任人、目标日期与下次复核:
- 已更新的证据索引、组合台账和阶段闸门:44. 用例事件运行手册(Runbook)模板
运行手册面向实际执行者,而不是只面向项目设计者。它应在用例上线、阶段提升或移交前完成,并在模型、工具、知识、权限、业务范围或人工备用流程变化时更新。
Runbook 编号:RB-用例编号-序号
关联用例 / 工作流 / Skill 或 Agent / 发布编号:
业务关键性:低 / 中 / 高
业务 Owner / 技术 Owner / 知识 Owner / 接棒 Owner 与替补人:
最近演练日期 / 下次复核日期:
一、业务与运行边界
- 服务对象、关键业务结果和不可接受后果:
- 当前允许范围、禁止事项、人工保留决定和对外/写入边界:
- 正常运行入口、工作流版本、健康卡和证据索引位置:
二、依赖与健康信号
| 依赖 | 当前版本/配置或事实卡 | 失效信号 | Owner | 降级/备用路径 |
| --- | --- | --- | --- | --- |
| 模型/API | | | | |
| 工具/集成 | | | | |
| 知识/数据 | | | | |
| 身份/权限/预算 | | | | |
| 人员/审批 | | | | |
三、暂停、升级与沟通
- E0/E1/E2/E3 触发条件(按本用例具体化):
- 谁可以停止生成、发送、写入或自动动作:
- 事件频道/工单、通知对象、升级路径与替补人:
- 何种情形必须直接转人工或按专项安全/合规流程处理:
四、人工备用与回退
- 人工备用流程、模板、队列或系统入口:
- 上一稳定版本、回退步骤和不可回退动作:
- 已验证的备用模型/工具/降级条件(如有):
- 恢复前必须核验的样本、权限、知识和数据边界:
五、记录与复盘
- 需保全的输入/输出、版本、配置、日志、时间线和审批记录:
- 事件记录、回归、发布登记、健康卡和证据索引位置:
- 复盘 Owner、关闭标准与必须更新的资产:45. 事件记录与无责复盘模板
事件记录用于受控保存具体问题的事实、决策和恢复过程;无责复盘用于分析系统性原因和改进,而不是将正常升级或人为失误简单归咎于个人。敏感数据、保密信息和法务/安全材料应按组织规则存放,附录 G 只沉淀必要的去标识化失败模式。
事件编号:INC-用例编号-序号
关联 Runbook / 用例 / 工作流 / 发布 / 风险初筛或 AIA 编号:
事件级别:E0 / E1 / E2 / E3
发现时间 / 结束时间 / 记录人:
事件指挥/业务 Owner/技术 Owner/参与角色:
一、事实与影响
- 发生了什么(仅记录已验证事实):
- 受影响的用户、业务流程、数据、输出、动作或范围:
- 是否有外部采用、写入、发送、权限/数据或合规影响:
- 已采取的暂停、隔离、转人工、回退和沟通动作:
二、时间线与证据
| 时间 | 观察到的信号/动作 | 决策人 | 证据或链接 |
| --- | --- | --- | --- |
| | | | |
三、恢复验证
- 恢复或继续人工备用的决定及理由:
- 用于恢复验证的样本、权限、知识、配置和测试结论:
- 是否需要风险/AIA、事实卡、回归报告或发布登记重新审批:
四、无责复盘
- 促成因素:任务边界 / 知识 / 模型或工具 / 配置 / 权限 / 验证 / 人员 / 流程 / 其他
- 哪些控制有效,哪些控制缺失或未被执行:
- 根因与系统性改进假设:
- 改进行动、Owner、到期日和验证方式:
- 是否沉淀去标识化模式到附录 G:是 / 否
- 关闭结论与复核人:46. 韧性与恢复演练计划模板
演练用于检验实际恢复能力,不是纸面审核。可从桌面推演开始,但高关键性、R3、外部沟通、写入、Agent 或关键依赖用例应逐步完成受控的实操演练。
演练编号:DRILL-用例编号-序号
关联用例 / Runbook / 工作流 / 发布编号:
演练类型:桌面推演 / 受控技术演练 / 人工接管演练 / 模型或工具切换 / 知识失效 / 权限或预算异常
场景与假设:
参与者、观察者与授权边界:
演练日期:
一、演练目标
- 要验证的业务最低服务、停止权、通知、人工备用、切换或恢复条件:
- 不在本次演练范围内的系统、数据或动作:
- 成功标准与安全停止条件:
二、执行记录
| 步骤 | 预期动作 | 实际结果 | 偏差/问题 | Owner |
| --- | --- | --- | --- | --- |
| 发现与分级 | | | | |
| 暂停/隔离 | | | | |
| 通知与升级 | | | | |
| 人工备用/切换 | | | | |
| 恢复验证 | | | | |
| 记录与复盘 | | | | |
三、结果与改进
- 实际发现、决策、切换、人工接管和恢复耗时:
- 是否维持了约定的最低服务;未达标原因:
- 必须更新的 Runbook、事实卡、权限、样本、培训、移交或风险资产:
- 改进行动、Owner、到期日、复验方式:
- 演练结论:通过 / 附条件通过 / 不通过;下次演练日期:47. 人工备用流程与能力基线卡模板
人工备用是用例设计的一部分。它不要求每个人在每项任务上都拒绝 AI,而是为关键业务定义在 AI 不可用、输出不可信或自动动作被暂停时,谁能以什么最低质量继续完成服务。
备用能力编号:MANUAL-用例编号-序号
关联用例 / Runbook / 交付或移交编号:
业务关键性与最低服务目标:
业务 Owner / 接棒 Owner / 替补人:
一、人工备用流程
- 触发条件:AI 不可用 / 质量或知识异常 / 权限或工具失效 / 其他
- 手工模板、系统入口、队列和所需知识来源:
- 可以继续做的范围与必须暂停/升级的范围:
- 对外沟通、写入或关键决定的人工确认方式:
二、能力基线
- 执行者需要理解的业务规则、验证要点与禁止事项:
- 可接受的手工完成质量、交接和记录标准:
- 何种情形必须升级给业务/知识/技术/风险 Owner:
- 新员工或替补人如何通过真实任务、检查或演练证明具备能力:
三、验证与维护
- 最近一次独立执行/演练日期及结果:
- 当前可执行人员与替补覆盖:
- 发现的知识、工具、培训或流程缺口:
- 下次复核日期、Owner 和改进动作:48. 上下文包(Context Pack)模板
上下文包用于说明在特定任务、状态和权限下,哪些信息允许进入模型推理,以及为什么、以何种范围、何时失效。它不是完整知识库或长 Prompt 的复制品,而是可版本化、可审计的最小必要运行资产。
上下文包编号:CTX-用例编号-序号
上下文包名称与版本:
关联用例 / 工作流 / Skill / Agent:
当前阶段:候选 / 试点 / 限量生产 / 受控生产 / 规模化 / 退役
业务 Owner / 知识 Owner / 上下文 Owner / 技术 Owner:
一、任务与边界
- 当前要支持的任务、对象和输出:
- 本上下文包不支持的决策、对象或动作:
- 不可接受后果与必须停止/转人工的条件:
- 适用地区、产品、团队、客户或业务范围:
二、允许来源与优先级
| 来源编号/名称 | 类型(规则/记录/示例/工具结果/记忆) | Owner | 版本/生效日期 | 适用范围 | 允许用途 | 优先级 |
| --- | --- | --- | --- | --- | --- | --- |
| | | | | | | |
三、排除来源与数据边界
- 不得读取、保存、外发或作为结论依据的资料:
- 数据分级、脱敏、租户/用户隔离与访问限制:
- 未批准、无 Owner、来源不明、已失效或存在冲突内容的处置:
四、选择与加载逻辑
- 必须预置的最小信息:
- 可按需检索的条件、过滤字段、来源优先级和停止条件:
- 工具返回的字段、条数、时间范围或内容预算:
- 来源冲突、空结果、信息不足或低置信时的处理:
- 是否允许生成/读取持久记忆;如允许,关联记忆合约编号:
五、版本、证据与失效
- 当前来源、索引、Prompt、工具和记忆版本:
- 证据位置与最后核验日期:
- 失效/复核触发条件:规则变化 / 权限变化 / 连接器变化 / 事件 / 定期复核 / 其他
- 回退版本、人工备用路径和批准恢复条件:
- 受影响的 Golden Set、回归报告、健康卡和发布登记:最低检查: 上下文包不得把“所有可获得资料”定义为允许来源;每项高影响规则必须可以定位到来源、版本和适用范围;信息不足或冲突时应停止、询问或转人工,不得默认为模型自行补全。
49. Agent 记忆合约模板
持久记忆只在确有跨轮次价值、目的明确且组织能够管理其写入、隔离、失效、删除和审计时使用。工作笔记、任务状态、用户偏好和权威知识具有不同的风险与生命周期,不能放入同一个未分类的“长期记忆”。
记忆合约编号:MEM-用例编号-序号
关联 Agent / 用例 / 上下文包:
版本:
业务目的与不可替代性:
Owner:业务 / 知识 / 技术 / 风险(如适用)
一、允许的记忆类别
| 类别 | 允许写入的内容 | 禁止写入的内容 | 写入者/触发条件 | 读取范围 | 保留期与失效 |
| --- | --- | --- | --- | --- | --- |
| 已确认决定 | | | | | |
| 任务状态/待办 | | | | | |
| 工作笔记/摘要 | | | | | |
| 用户或客户偏好(如获批准) | | | | | |
二、事实、假设与来源
- 已确认事实的最低证据与来源定位要求:
- 待核验假设的标记、读取限制和失效方式:
- 摘要/压缩时必须保留的决定、版本、未解决项和原始证据位置:
- 人工纠错、撤销、删除或失效的入口与 Owner:
三、隔离、权限与审计
- 租户、用户、项目、区域或数据分级隔离方式:
- 谁可读、谁可写、谁可导出、谁可删除:
- 写入前是否需要人工确认或确定性验证:
- 审计日志中应保留的内容:写入原因、来源、版本、读写主体、时间、纠错/删除记录:
四、变更与回退
- 记忆结构、写入策略、范围或保留期变化的影响分析与回归要求:
- 记忆污染、越权、过期或错误写入时的暂停、隔离、清理和人工备用路径:
- 已验证的恢复条件与批准人:最低检查: 不将未经确认的推测写成事实;不跨用户、客户或租户默认复用记忆;不将完整会话、全量工具返回或敏感原文默认保存为长期记忆;每条可用于高影响决策的记忆都应能够定位其来源和失效条件。
50. Agent 工具、MCP 与连接器控制卡模板
工具、MCP 和其他连接器既提供行动能力,也向 Agent 提供运行时上下文。每个进入正式用例的连接器都应有独立控制记录;“已连接”不等于“可在生产中使用”。
控制卡编号:TOOL-用例编号-序号
工具 / MCP / 连接器名称与版本:
关联用例 / Skill / Agent / 上下文包:
业务 Owner / 技术 Owner / 安全或风险 Owner(如适用):
当前状态:候选 / 沙箱验证 / 试点 / 已批准 / 暂停 / 退役
一、用途与边界
- 业务用途及本工具不应承担的用途:
- 允许调用的 Agent/Skill、环境和用户角色:
- 不允许的动作、对象、字段、系统或外网访问:
二、接口、数据与权限
| 动作/端点 | 读取或写入 | 允许参数与范围 | 返回字段与返回量限制 | 数据分级 | 审批/人工确认 |
| --- | --- | --- | --- | --- | --- |
| | | | | | |
- 身份、凭证、有效期、密钥轮换与最小权限:
- 默认过滤、分页、截断、脱敏和错误返回要求:
- 工具描述、参数说明、示例和错误信息的维护 Owner:
三、运行与异常
- 超时、速率、成本、并发和重试限制:
- 空结果、冲突结果、异常结果、恶意内容或超长返回的处理:
- 日志、审计、任务追踪和证据留存位置:
- 暂停、禁用、凭证撤销和人工备用方式:
四、评测、变更与退出
- 正常、边界、越权、参数错误、超时和异常返回评测样本:
- 变更时需要回归的用例、上下文包、Skill 和 Agent:
- 最近核验/发布记录、下一复核日期:
- 退出/替代计划、数据处置和依赖通知:最低检查: 优先只读、沙箱、窄范围和短期凭证;工具应返回完成下一步所需的高信号信息,而非默认返回整库内容;写入、发送、代码执行、身份/权限变更和外部访问必须依据业务风险设置独立审批与可回退路径。
51. Agent 上下文与工具评测记录模板
此模板补充 Golden Set、回归报告和健康卡,用于评测 Agent 是否在正确边界内选择、解释和使用上下文与工具,而不仅是检查最终答案是否流畅。
评测编号:CTX-EVAL-用例编号-序号
关联用例 / Agent / 上下文包 / 工具控制卡 / 版本:
评测目的:首次试点 / 变更回归 / 事件复验 / 阶段提升 / 定期健康检查
业务审核人 / 知识审核人 / 技术审核人:
| 样本编号 | 样本类型 | 预期上下文与来源 | 预期工具/动作 | 预期停止或转人工条件 | 实际行为与证据 | 结论 |
| --- | --- | --- | --- | --- | --- | --- |
| | 正常 / 边界 / 失败 / 异常 / 滥用 | | | | | |
一、必测控制点
[ ] 来源是否在白名单内,且版本、日期、适用范围正确
[ ] 是否避免加载排除来源、过量或超出权限的信息
[ ] 来源冲突、过期、空结果或信息不足时是否停止、标记或转人工
[ ] 工具选择、参数、权限、返回量和异常处理是否符合控制卡
[ ] 记忆读取/写入是否符合记忆合约,且事实、假设与待办区分清楚
[ ] 审核者是否能看到足以判断的来源、版本、工具结果摘要和拟执行动作
[ ] 最终任务质量、人工接管、回退和日志证据是否满足用例标准
二、指标与判断
- 来源可定位率:
- 过期/冲突/越权上下文正确拦截情况:
- 工具参数或返回异常率:
- 无效加载、无效调用或成本异常信号:
- 人工接管率与接管结果:
- 未解决风险、修复 Owner、到期日与复验方式:
发布/阶段决策:通过 / 附条件通过 / 限量试运行 / 退回修改 / 暂停
审批/复核记录:使用规则: 上下文包、记忆、工具/MCP、连接器、权限、来源选择逻辑或状态机发生变化时,应按风险等级选择受影响样本回归。对于对外沟通、写入操作、高影响决策或跨系统 Agent,评测结果应与风险初筛、AI 影响评估、发布登记和审计证据索引关联。
52. Coding Agent 受控实践包
Coding Agent 的价值在于帮助团队理解代码、拆解问题、生成候选修改、运行受控验证和准备交付物;它不应被默认授予生产环境、真实密钥、受保护分支、外部发布或不可逆基础设施动作。代码仓库、Issue、终端输出、依赖文档和工具返回既是上下文,也可能携带不可信内容,必须按本书的上下文与工具控制规则处理。
1. 适用范围与最低边界
| 任务类型 | 建议自主范围 | 必须保留的人工控制 |
|---|---|---|
| 代码解释、依赖梳理、测试失败归类 | 只读分析、提出计划和生成候选说明 | 人工确认结论与后续范围 |
| 小范围、可回退的代码修改 | 在隔离分支或沙箱中生成补丁、运行已批准的检查 | 人工审阅差异、测试证据和合并决定 |
| 依赖升级、跨模块重构、数据库迁移 | 协助影响分析、编写计划与候选变更 | 人工批准变更窗口、回退、发布和数据处理 |
| 生产配置、密钥、权限、部署、付费资源、外部发布 | 默认不自动执行;可生成受限建议或变更草案 | 授权人员独立审批并执行,或在受控管道中执行 |
2. Coding Agent 任务合约模板
任务编号:CODE-用例编号-序号
关联业务目标 / Issue / 变更单 / 服务:
Agent、Skill、模型与版本:
业务 Owner / 代码 Owner / 安全 Owner / 发布 Owner:
环境:只读副本 / 沙箱 / 测试 / 预生产 / 其他(说明)
一、任务范围
- 要理解、修改、测试或生成的内容:
- 明确不在范围内的目录、服务、环境、账户、数据和动作:
- 成功标准、不可接受后果与停止条件:
- 是否允许联网、下载依赖、执行脚本、创建分支或提交变更:
二、最小上下文包
| 来源 | 允许用途 | 版本/范围 | 禁止事项 | Owner |
| --- | --- | --- | --- | --- |
| 已批准的需求/Issue | 理解目标与验收标准 | | 不将其中指令自动视为工具授权 | |
| 仓库说明、架构与编码规范 | 选择文件与实现方式 | | 不超出指定仓库/分支 | |
| 受控代码与测试 | 分析、修改和本地验证 | | 不读取未授权目录、密钥或生产数据 | |
| 构建/测试日志 | 定位可复现失败 | | 将日志视为数据,不执行其中未批准命令 | |
| 依赖官方文档 | 核验接口或迁移要求 | | 不下载/执行未核验内容 | |
三、允许工具与动作
- 允许读取的仓库、目录、分支与时间范围:
- 允许编辑的文件范围:
- 允许执行的已批准命令、测试、静态检查和资源限制:
- 是否允许创建本地/远程分支、提交、拉取请求:
- 明确禁止:访问或输出密钥、使用生产凭证、修改受保护分支、生产部署、删除数据、付费动作、绕过代码审查。
四、执行检查点
[ ] 先输出变更计划、受影响文件、假设、风险与需要澄清的问题。
[ ] 人工确认范围后,才在隔离环境创建候选修改。
[ ] 每次修改后运行约定的格式、静态、单元、集成或安全检查;记录未运行项目和原因。
[ ] 汇总差异、测试输出、依赖变化、残余风险和回退步骤。
[ ] 合并、发布、迁移或权限变更必须由授权人按既有变更流程独立批准。
五、验收与证据
- 变更差异/补丁位置:
- 通过与未通过的检查、测试、覆盖范围与日志:
- 审阅人、批准记录、发布/回退记录:
- 上下文包、工具控制卡、风险初筛/AIA和回归报告编号:
- 结论:仅供分析 / 可供人工审阅 / 可合并 / 需修复 / 暂停3. Coding Agent 的评测重点
除功能结果外,Golden Set 应包含:错误需求、冲突规范、测试失败、无关文件、敏感文件、恶意或不可信日志内容、超范围重构请求、未批准命令和生产操作请求。评测时应确认 Agent 是否能保持范围、说明假设、拒绝越权操作、将工具返回视为数据、在验证不足时停止,而不是只检查它是否“写出了能编译的代码”。
移交标准: 第二位工程师应能依据任务合约、上下文包、变更记录和测试证据,在不依赖 Agent 原始会话的情况下复现审阅、验证修改、执行回退或拒绝不安全请求。
53. Work Agent 受控实践包
Work Agent 是指帮助员工处理研究、资料整理、工单分类、客户沟通草稿、会议跟进、运营协调、报告准备或内部知识问答等工作任务的 Agent。它的主要风险通常不在“能否写一段文字”,而在于是否使用了正确上下文、是否把内部或外部内容误作权威依据、是否越权读取系统、是否在未经批准时发送、写入、承诺或代表组织作出决定。
1. 任务类型与人类保留决定
| 工作任务 | Agent 可协助的内容 | 必须由人保留的决定 |
|---|---|---|
| 内部资料研究与摘要 | 来源整理、差异标记、问题清单、草稿摘要 | 来源权威性、结论采用与敏感内容处置 |
| 客户/供应商沟通 | 分类、检索已批准资料、生成草稿、检查格式 | 立场、承诺、价格、例外、发送和对外代表性表达 |
| 会议与项目跟进 | 纪要草稿、待办提取、风险提示、状态汇总 | 决议确认、责任分配、截止日期和外部同步 |
| 工单与运营协作 | 分类、受控查询、建议下一步、准备交接信息 | 优先级、处理决定、写入/关闭工单和跨部门升级 |
| 招聘、绩效、权益或高影响事项 | 准备受控材料、提示需专业审查的点 | 任何可能影响个人权益、资格、待遇或决定的结论和动作 |
2. Work Agent 运行与审批模板
任务编号:WORK-用例编号-序号
关联业务流程 / 服务对象 / 用例:
Agent、Skill、模型与版本:
业务 Owner / 知识 Owner / 上下文或记忆 Owner / 技术或工具 Owner:
当前阶段与允许范围:
一、业务目标与不可做事项
- 要帮助员工完成的子任务:
- 服务对象、地区、语言、产品或客户范围:
- 不承担的判断、承诺、外发、写入、审批或高影响决定:
- 必须停止、询问、转人工或专项升级的情形:
二、最小上下文包
| 来源 | 权威性/优先级 | 允许用途 | 适用范围与版本 | 不足、冲突或过期时的处理 |
| --- | --- | --- | --- | --- |
| 已批准业务规则/政策 | | | | |
| 当前任务材料 | | | | |
| 受控检索/业务系统结果 | | | | |
| 已确认任务状态或记忆(如适用) | | | | |
三、工具、连接器与行动边界
| 工具/连接器 | 只读/写入/外发 | 允许对象与参数 | 返回量/数据限制 | 是否需人工审批 | 异常与回退 |
| --- | --- | --- | --- | --- | --- |
| | | | | | |
四、员工操作检查点
[ ] 发起前:确认任务范围、数据级别、所用 Agent/Skill 和来源是否获批准。
[ ] 运行中:检查来源、版本、未确认项、工具结果和拟执行动作是否与任务相关。
[ ] 审批前:人工确认事实、业务立场、对外表达、写入/发送或高影响动作。
[ ] 完成后:记录输出、来源、批准、异常、转人工和需要更新的知识/上下文/工具资产。
五、质量、风险与证据
- Golden Set/Rubric/上下文评测记录:
- 人工审核、接管、回退和异常升级规则:
- 风险初筛/AIA/例外(如适用):
- 发布登记、观察期、健康卡和 Runbook:
- 结论:草稿辅助 / 限量试运行 / 受控生产 / 降级或暂停3. Work Agent 的评测重点
Work Agent 的样本应同时覆盖正确任务、信息不足、来源冲突、过期规则、不可信内容、敏感数据、无权限查询、工具空结果、外发/写入请求和需要人工判断的高影响事项。评测不应以“回复是否自然”替代控制判断;至少应检查:它是否引用正确来源、是否说明未知项、是否拒绝或升级超范围请求、是否将工具返回与业务决定区分、是否在外发或写入前保留人工批准。
移交标准: 使用者、业务 Owner、知识 Owner 和技术/工具 Owner 应分别完成一次真实或脱敏任务演练;指定接棒人能够解释可用范围、来源边界、审批点、人工备用与问题上报入口。未完成此类能力验证时,不应因 Agent 演示成功而宣布业务团队已具备独立运营能力。
54. Agent 目标契约模板
目标契约用于把“希望 Agent 帮忙”转化为可授权、可评测、可停止的任务说明。它位于业务目标与技术运行合约之间:业务 Owner 定义要实现和不应实现的结果;技术与控制角色据此配置上下文、工具、验证和回退。目标契约不授权 Agent 自行改变组织目标、扩大范围、提高权限或接受不可逆后果。
目标契约编号:GOAL-用例编号-序号
关联用例 / 工作流 / Skill 或 Agent / 发布编号:
业务 Owner / 运行 Owner / 知识或上下文 Owner / 工具 Owner:
当前阶段:设计 / 试点 / 限量生产 / 受控生产 / 复核 / 退役
一、业务目标与完成证据
- 要改善的业务结果:
- Agent 受托完成的任务及交付物:
- 成功证据(质量、时效、服务、风险或其他可复核信号):
- 非目标:本次明确不追求或不允许实现的结果:
二、范围与上下文
- 允许的对象、时间、地区、系统和业务范围:
- 必须排除的对象、情形、问题或决定:
- 可使用的上下文包/权威来源/当前版本:
- 信息不足、冲突、过期或不可信时的默认动作:停止 / 询问 / 转人工 / 其他
三、工具、权限与预算
| 工具或动作 | 可读取/可执行范围 | 是否可写入或外发 | 是否需人工批准 | 调用/时间/成本预算 | 禁止事项 |
| --- | --- | --- | --- | --- | --- |
| | | | | | |
四、验证、审批与责任
- 自动验证、Golden Set、Rubric 或其他检查:
- 必须由人确认的事实、判断、承诺、写入或对外动作:
- 谁可批准范围扩大、权限变化、例外或发布:
- 必须留存的计划、来源、工具调用、输出、审批和异常证据:
五、停止、升级与回退
- 停止条件(质量、来源、权限、成本、运行或风险信号):
- 转人工或专项升级条件与接收角色:
- 回退版本、人工备用流程和恢复前验证:
- 下次复核日期与触发重新评估的条件:
结论:允许设计 / 允许受控试点 / 限量运行 / 暂缓或缩小范围
业务 Owner 确认:
适用的技术、风险、安全、法务或其他复核角色确认:使用提示
- 低风险内部辅助可用一页卡片填写,但仍应明确非目标、人工 Owner 和停止条件。
- 涉及对外沟通、写入、敏感数据、权限扩大、复杂 Agent 或高影响决定时,应关联风险初筛、AI 影响评估、运行合约、发布登记和 Runbook。
- 目标、范围、来源、工具、权限或成功证据发生实质变化时,不应只修改 Prompt;应复核目标契约及其受影响的评测、风险和发布资产。