企业 AI Agent 落地指南:治理、评测与人工接管
直接回答:企业 AI Agent 的价值不来自自主性,而来自受控编排。一个可用的企业 Agent = LLM + 最小必要上下文 + 受控工具 + 任务契约 + 身份权限 + 验证批准 + 可观测性 + 人工接管与回退。
Agent 的能力上限很高:能理解复杂任务、结合中间结果选择下一步、调用外部工具。但对企业的关键问题不是“能否做出一个 Agent”,而是“在什么情况下提高自主性,才能带来超过额外风险与运营成本的业务价值”。
一、先区分四种形态
| 形态 | 下一步由谁决定 | 适合的问题 | 首选控制 |
|---|---|---|---|
| 传统自动化 | 预先写定的规则 | 数据搬运、固定审批、确定性计算 | 规则测试、权限控制 |
| 固定 AI 工作流 | 预定义的步骤 | 顺序明确的多步 AI 任务 | 验证节点、人工审批 |
| Skill | 对一类任务的受控封装 | 高频、可验证、可复用的单类任务 | 输入输出契约、版本、Owner |
| Agent | 模型在受限范围内选择 | 步骤不能预先固定的动态任务 | 白名单、最小权限、熔断、接管 |
推荐建设顺序:先稳定 Prompt,再封装 Skill;先连接固定工作流,再评估是否需要 Agent。如果固定规则或确定性流程能完成任务,就不应为“更智能”而增加自主性。
二、Agent 更容易失控的三个原因
- 多步骤成功率快速衰减:五步流程每步 90% 成功率,端到端约 59%。单步看着不错,不等于多步系统可以直接上生产。
- 错误沿链路传播放大:早期错误会成为后续决策的输入,Agent 会在错误上下文上继续“合理化”。
- 存在额外的运行风险:工具参数错误、权限越界、循环、成本失控、状态丢失、人工接管失败——评测必须覆盖这些,而不只是“最后生成的文字好不好”。
三、治理是 Agent 落地的核心
每个进入试运行的 Agent 都应有运行合约,明确:业务目标与边界、自主等级(L1–L5)、可调用 Skill、上下文包与来源白名单、工具白名单与读写权限、持久记忆规则、状态与路径、预算与熔断、验证与审批、人工接管与回退、责任与审计。
具体治理方法见AI Agent 如何治理。
四、评测不止测答案,还要测行为与恢复
上线前至少覆盖五类评测:上下文层(来源与权限)、Skill 层(输入输出)、任务层(端到端目标)、安全与权限层(越权与注入)、运行与恢复层(循环、超预算、接管)。
必看运行指标:端到端任务成功率、人工接管率、错误动作率、平均步骤数与工具调用数、熔断触发率、来源可定位率。详见AI 效果怎么评测。
五、本专题文章
- AI Agent 如何治理?权限、上下文、工具与人工接管——运行合约、最小权限、熔断与回退的具体做法。
- AI Agent 和 AI 工作流有什么区别?什么时候才需要 Agent——避免为“更智能”而增加复杂度的决策框架。
六、配套模板
- Agent 运行合约模板:定义自主等级、Skill、上下文、工具、记忆、预算与接管。
- 上下文包模板:限制 Agent 允许依据什么。
- 工具/MCP 控制卡:管理工具权限、参数、返回量与退出方式。
本专题内容基于《企业 AI 稳定产出手册》整理,手册正文是方法细节的唯一真源。完整方法论见第 9 章 Agent 与自动化治理与第 13 章人机协同与组织生产方式。