高管执行摘要:企业 AI 稳定产出的决策要览
本页写给谁:CEO、事业部负责人、CIO/CDO 以及任何需要对 AI 投入拍板的管理者。目标是让你在 15 分钟内掌握决策所需的核心判断:为什么做、按什么节奏做、用什么指标管、由谁签字承担风险。
一、核心论点:企业 AI 的价值在“运行系统”,不在模型
企业 AI 失败,通常不是模型不够强,而是局部提效没有变成组织能力:个人用 AI 很快,进入多人协作、关键流程或长期运行后,输出波动、知识过期、责任不清、无法复用。因此,衡量 AI 的标准不是调用量、Token 消耗或 Demo 效果,而是三个能力:
- 可复核:结果能追溯到输入、来源、版本和验证记录;
- 可维护:知识、上下文、工具有 Owner、版本和更新责任;
- 可接管:AI 失效时,知道谁判断、如何回退、怎样恢复。
把预算和注意力投向这三个能力,而不是“换更强模型”,是企业 AI 投入的第一原则。
管理者的一页复述:主张、理由、证据与决定
在一次阶段评审中,管理者不必复述全书,但应能按下面四句检查投入是否有根据:
| 复述位置 | 管理者应能说出的句子 | 对应记录 |
|---|---|---|
| 主张 | 我们要改善的是____业务结果,不是增加 AI 使用量;本轮明确不做____。 | 战略一页纸、用例立项卡、不做清单 |
| 理由 | 这个任务之所以值得试探,是因为它有____频率/负担,输入____,质量可由____验证,失败可____。 | 任务定义、基线、风险初筛 |
| 证据 | 本轮已经观察到____样本、____版本、____人工审核和____回退记录;这些证据只支持____范围。 | 运行记录、验证清单、事实卡、阶段记录 |
| 决定 | 由____依据____记录决定扩大、修复、缩小、暂停或退役;若缺少____,就不继续扩大。 | 组合台账、决策记录、责任与签字安排 |
如果这四句无法完整说出,正确动作不是补一页汇报,而是回到相应资产补齐或明确暂停。这样,“价值在运行系统,不在模型”的判断才从口号变成可检查的管理论证。
二、90 天路线:一个可调整的示例节奏
以下“90 天”用于帮助尚未建立节奏的团队先安排一轮发现、受控试点和组合决策;它不是所有行业、部门或风险等级都应照搬的 KPI。任务频率、错误后果、审核能力、已有资产和审批周期不同,阶段可以缩短、拉长、拆分或在阻塞条件出现时暂缓。真正不变的是:每次扩大前都要有相称的业务、质量、控制与接管证据。
第 1 个月:定方向
- 完成企业 AI 战略与业务对齐:诊断 → 指导方针 → 不做清单;
- 确定 AI 总投入上限(工具 + 人力 + 验证 + 维护);
- 确定风险偏好:哪些风险等级由谁签字;
- 在团队审核与维护能力允许的范围内,为每个业务 Owner 选择少量可控的候选场景;不要用固定数量代替判断。
第 2 个月:看证据
- 审阅当前能力和风险边界下能够获得代表性证据的最小闭环(例如 1–2 个,而非必须恰好两个),查看通过率、采用率、端到端耗时、成本与控制信号;
- 用第 11 章的口径提问,不接受“效率提升”四个字;
- 对未达标试点明确“修复、缩小或停止”,不无限期观望。
第 3 个月:做组合决策
- 召开第一次月度组合评审,使用用例组合台账;
- 决定扩大、维持、暂停或退役,并把决定和理由归档;
- 把已验证用例纳入预算与人员计划,启动季度战略复盘。
详细到周的行动清单见角色化快速开始。
业务赞助人不是只签预算,而是在阶段中清障
业务赞助人的作用不是替业务 Owner、知识 Owner 或技术/安全 Owner 作专业判断,而是让这些判断能够在当前授权范围内形成决定。每次阶段评审只需留下下面四项记录;它们可以写入现有的阶段决策记录,不另设会议或表单。
| 当前阶段 | 业务赞助人需要确认的取舍 | 需要清除或转交的阻断 | 下次复核前必须说清的事项 |
|---|---|---|---|
| 候选 / 试点 | 是否仍值得占用业务、审核、知识和技术支持资源。 | Owner 缺失、跨部门资料无法取得、试点时间未获支持。 | 本轮只验证什么;什么证据会导致暂缓或停止。 |
| 限量运行 | 是否继续限制人群、任务类型或权限,还是补资源验证。 | 审核积压、知识更新无人负责、技术/安全控制未能落实。 | 质量、采用、端到端负担和回退是否足以支持下一阶段。 |
| 扩大 / 退役 | 扩大是否挤占更优先场景;退役后人工或替代路径是否可用。 | 跨团队责任冲突、共享资产依赖、残余风险超出当前授权。 | 决定、依据、责任人和下次复核时间;哪些问题转组织专项处理。 |
这张表不预设赞助人必须按周介入,也不把“持续推动”理解为无条件扩大。赞助人的专业动作是让取舍、阻断、失败后的连续性和下一次决定不悬空。
高管的反证追问
高管不应只问“指标有没有改善”,而应在每次阶段评审追问四件事:什么证据会说明不应继续;即使指标改善,哪些控制缺口仍要求缩小或暂停;是否把前置条件缺失伪装成“再调 Prompt”;谁对分歧作出解释、记录结论并有权阻断。
继续、缩小改进、暂停或退役的最低事实、反证问题与解释/阻断权限,以第 11 章的反证式决策卡为唯一权威。本页只保留高管的追问,不再重写同一套决策表;下方阶段闸门仅说明各阶段需要什么证据。
三、10 条治理铁律
- 先有业务问题,再谈 AI:没有用例立项卡,就没有预算。
- 个人提效不等于组织价值:用证据衡量,不用调用量或登录次数。
- 一个场景一个业务 Owner:无人对结果拍板,不启动。
- 先试点后扩大:不满足阶段闸门,缩小、修复或停止都是正确决策。
- 知识、上下文、工具必须有 Owner 和版本:不允许“大家都负责”。
- 高风险动作必须人工审批:自主等级不能高于控制能力。
- 出错要有 Runbook:知道谁暂停、谁恢复、怎样回退。
- 残余风险由明确层级签字接受:不允许“出事再讨论”。
- 评测数据用于决策,不用于表演:退化就停,不选择性汇报。
- 供应商可以换,数据和控制权不能外包:始终保留退出能力。
四、阶段闸门:用例如何从候选走到规模化
| 阶段 | 进入条件 | 关键证据 | 典型决策 |
|---|---|---|---|
| 候选 | 业务问题真实、有 Owner、值得投入 | 立项卡、初始风险初筛 | 启动设计 / 暂缓 / 不做 |
| 试点 | 边界清楚、数据可获取、失败成本可控 | 最小闭环运行记录 | 修复 / 限量运行 / 停止 |
| 限量生产 | 质量、采用、成本达标,人工回退可用 | Golden Set、回归、发布登记 | 扩大范围 / 继续观察 |
| 受控生产 | 责任、版本、知识、评测持续有效 | 健康卡、组合台账 | 维持 / 改进 / 降级 |
| 规模化 | 第二团队能独立运行维护 | 移交清单、接棒验证 | 跨团队复制 / 暂缓 |
| 退役 | 价值消失、风险不可接受、被替代 | 退役记录、人工替代流程 | 停止权限、归档资产 |
阶段提升不是“汇报通过”,而是证据通过:业务价值、质量与采用、知识/数据、责任、回退、运行控制六类证据同时满足。
五、关键指标:管理层看什么
| 指标 | 定义 | 管理层关注点 |
|---|---|---|
| 一次通过率 | 输出一次通过验证清单的比例 | 稳定性;连续下降且无法解释=暂停扩大 |
| 实际采用率 | 最终被直接或小改后使用的比例 | 通过检查 ≠ 被采用;低采用率=标准脱离业务 |
| 端到端耗时 | 从提交到可用输出的完整时间(含验证) | 只算生成时间=假账 |
| 失败类型分布 | 幻觉、遗漏、过期知识等占比 | 指导改进方向 |
| 知识更新及时率 | 按时完成知识更新的比例 | 越用越差的根因常在知识 |
| 人工接管率(Agent) | 交回人工处理的任务比例 | 上升可能=系统在悄悄退化 |
| 错误动作率(Agent) | 越权调用、错误写入的比例 | 高=权限与状态控制失效 |
| 来源可定位率 | 输出能定位到来源/版本的比例 | 可复核性的直接度量 |
| 单任务成本 | 每任务工具+验证+维护成本 | 与质量、采用一起看,不单独看 |
完整的指标口径与计算方式见附录 B。
指标不是结论:管理层的反证解释表
每期看板都应同时带上下面四类解释;没有解释责任人的单一绿灯不应触发扩大决定。
| 指标组 | 容易被误读为 | 即使改善仍应缩小或暂停的情形 | 解释分歧由谁组织、谁可阻断 |
|---|---|---|---|
| 一次通过率、失败类型 | “平均通过率高,所以每类任务都安全。” | 不可接受错误、边界/失败样本退化、审核标准不一致或无法复现。 | 业务 Owner 组织业务解释;知识 Owner 对规则/来源问题、技术/安全 Owner 对控制问题可阻断。 |
| 采用率、端到端耗时 | “用得多、变快,就说明创造了价值。” | 使用者被迫采用、人工返工转移到下游、关键对象体验变差,或节省时间没有形成可观察业务结果。 | 业务 Owner 与使用者共同解释;业务赞助人决定是否投入更多资源。 |
| 知识更新及时率、来源可定位率 | “记录齐全,就说明内容可靠。” | 来源已失效、适用范围不明、冲突未解决,或来源能定位但无权/不应使用。 | 知识 Owner 解释并可停止相关知识的使用;业务 Owner 决定业务降级。 |
| 接管率、错误动作率、运行异常 | “接管少,就说明自动化成熟。” | 接管入口失效、异常未被记录、权限/熔断失效,或使用者因不敢上报而绕过流程。 | 技术/安全 Owner 解释并可先行停用运行或权限;业务 Owner 负责人工替代。 |
| 单任务成本 | “成本下降,就可以扩大。” | 质量、人工审核、维护、风险处置或供应商依赖成本被漏算,或成本节省以控制缺口换取。 | 业务 Owner 汇总全成本;技术 Owner 说明技术成本;业务赞助人作资源取舍。 |
六、风险分级与签字责任
| 风险等级 | 典型场景 | 最低控制 | 签字层级 |
|---|---|---|---|
| R1 基础 | 内部草稿、人工最终采用、无写入 | 边界、Owner、验证、回退 | 业务 Owner |
| R2 受控 | 外部草稿、跨系统读取、L2/L3 数据 | 影响评估、Golden Set、限量发布 | 业务 Owner + 知识/技术 Owner |
| R3 高影响 | 写入/发送、敏感数据、复杂 Agent | 专门审查、严格审批、审计证据 | 部门负责人 / 风险责任人 |
| R4 暂缓 | 目的、Owner、数据边界不清 | 暂停标准路径,先解决阻塞 | 高管层介入决策 |
原则:签字人接受的是“残余风险”,不是“零风险”;签字必须基于证据(风险初筛、AIA、运行记录),并定期复核。风险初筛与 AI 影响评估模板见附录 A。
七、决策节奏
- 月度组合评审(45–60 分钟):看用例台账、健康指标、共享依赖风险;决定扩大、修复、暂停、退役。
- 季度战略复盘(90 分钟):看业务目标、预算、外部条件是否变化;调整战略一页纸与下季度资源。
评审输入是证据和风险,不是汇报材料;不以工具登录次数或 Token 消耗作为主要内容。
八、高管最容易犯的六个错误
- 采购即落地:买账号、全员开通不等于价值实现;
- Demo 即验收:演示成功只说明“能跑”,不说明“能稳定跑、出错能回退”;
- 调用量当 KPI:诱导为用而用,无法证明业务价值;
- 无限期观望:试点不达标不停止也不修复,资源空耗;
- 影子 AI 失控:员工用个人账号处理公司数据,出事才被发现;
- 单点依赖:核心流程绑定单一模型/供应商,无切换与退出预案。
九、配套入口
- 角色化快速开始:各角色的第一周/第一个月行动清单;
- 企业 AI 战略与业务对齐:战略内核与预算排序;
- 第 11 章价值评估与评测体系:TCO 与 ROI 口径;
- 第 12 章治理与组织协同:组合治理与 FDE/AI COE 交付;
- 启动套件:起步必用的 7 个模板:从立项到验收的最小资产集。