第 3 章 认知校准:AI 的真实能力边界
在企业实际使用中,产出结果不稳定的起点往往是对 AI 能力边界的误判。有人把它当作可以完全信赖的决策助手,直接采用输出作为最终结论;有人则因一次明显错误而彻底放弃,重新回到纯人工方式。两种极端都会降低使用的持续性与可靠性。
要让 AI 稳定产出,首先需要建立准确的能力边界认知。本章给出相对稳定的判断原则与选型方法;会频繁变化的模型版本、基准、价格、上下文、功能支持、数据处理条件与工具能力,不作为正文的长期结论,而应记录在模型与工具动态事实卡登记册中,并按附录 D 与登记册中的机制复核。
阅读原则:公开榜单和供应商资料可帮助缩小候选范围,却不能证明某个模型或工具适合你的业务。正式选择必须以你的用例立项卡、数据边界、Golden Set、回归结果和发布条件为依据。
一、应关注的能力与边界,而非“当前最强模型”
不同模型、版本和部署方式的能力会持续变化,但以下判断对企业工作设计更稳定。
1. 文本生成、整理与结构化输出
大模型可用于邮件、报告、会议纪要、摘要、分类、翻译和初稿等工作。效果通常取决于任务目标是否清楚、输入是否完整、输出格式是否明确,以及是否有可执行的验证标准。它们能提高生成和整理速度,但不能替代事实核查与业务判断。
2. 代码与工程辅助
模型可以协助生成代码片段、测试、文档、重构建议和问题排查思路。对结构清晰、可测试、可回退的工程任务,价值通常更容易验证;对安全敏感、性能关键、架构级或生产部署决定,仍应保留适当的人工设计、审查和测试责任。
能力提升不等于验证要求降低。 生成更快或候选方案更多,只会使验证、回退和变更控制更重要。
3. 模式识别、语言处理与多模态理解
模型适合从已有材料中提取模式、转换格式、识别类别、进行多语言处理,或对文本、图像、音频等输入做初步理解。对于缺少明确事实依据、跨来源冲突、带有强情境判断或影响个人权益的任务,应把模型结果视为待验证输入,而不是最终结论。
4. 多步骤与工具调用
模型可以在受限条件下规划步骤、调用工具和整合中间结果;同时,错误也可能沿步骤链传播。能否使用多步骤工作流或 Agent,不取决于“某模型是否宣称支持 Agent”,而取决于任务是否已被拆成可验证的 Skill、权限是否最小化、异常能否接管,以及组织是否能够持续评测、审计和回退。第 9 章给出了相应决策框架。
5. 能力事实必须与服务条件一起理解
模型名称本身不是充分的选型信息。同一模型在不同 API、区域、项目配置、工具组合、数据处理安排或版本快照下,可能具有不同的功能、限制、价格、留存或合规条件。任何“支持”“可用”“零留存”“长上下文”之类的结论,都必须带上适用的端点、版本、部署方式、合同或配置前提,以及验证日期。
二、必须正视的固有局限
与能力相对应,当前大模型存在几类无法通过简单提示词完全消除的局限。
1.事实性幻觉。 模型会生成看似合理、实则错误的内容。它不会可靠地主动标记不确定性,高置信度表达与准确性之间没有稳定对应关系。
2.上下文与长期状态的条件性。 当前 Agent 可借助更长上下文、检索、工具、压缩摘要、外部记忆和子 Agent 执行较长任务;但任务链条变长后,早期信息仍可能丢失、被压缩、过期或被后续信息覆盖。跨会话“记忆”依赖外部系统、数据边界、写入规则和状态设计,不能被视为天然可靠。
3.目标、责任与现实世界状态的错位。 模型和 Agent 可以在外部工具、状态与清晰任务定义支持下规划步骤、追踪进度、纠错并完成多约束任务;但它们不拥有业务目标、法律责任、授权边界或对现实后果的独立判断。组织不能把“能够完成步骤”误写为“可以自行承担长期目标和责任”。
4.非确定性输出。 同一提示词在不同时间、参数、模型版本或服务环境下,可能产生不同结果。这对需要高度一致性和可复现的企业流程构成直接挑战。
5.对数据与知识质量的强依赖。 输入信息过时、冲突或不完整时,输出质量会快速下降。模型无法自行识别企业私有知识的权威性、适用范围或生效日期。
6.工具调用与行动的脆弱性。 在调用外部系统、执行多步骤操作或处理不可信输入时,错误会沿调用链放大。没有校验、最小权限、状态限制与回退机制,能力越强反而可能扩大影响范围。
这些局限不会因模型、上下文窗口或工具能力提升而自动消失;它们是工作流、风险控制、评测、权限边界和人工责任必须存在的原因。
三、能力边界判断框架
面对具体任务时,可用以下维度判断 AI 的参与深度与人工介入方式。
| 维度 | 适合 AI 深度参与 | 需要严格人工主导 |
|---|---|---|
| 结果容错率 | 允许一定波动,后续可修正 | 要求高度准确、不可逆或影响权益 |
| 信息完整性 | 输入清晰、来源可追溯、上下文有限 | 依赖大量未结构化、冲突或实时变化的信息 |
| 可验证性 | 输出易于人工或规则快速检查 | 验证成本高、专业门槛高或缺少权威依据 |
| 行动影响 | 仅生成内部草稿或建议 | 直接发送、写入、交易、分配资源或对外承诺 |
| 回退能力 | 可快速转人工或恢复稳定版本 | 错误难以补救、影响范围大或恢复成本高 |
多数企业任务处于中间地带:AI 负责生成与初步处理,人工负责关键校验、决策与最终确认。清晰划分两者责任,是稳定产出的前提。
四、模型与工具选型框架
模型和工具选型不是一次性决策。企业需要的是一套能在版本、价格、功能和供应商变化后重复执行的选择机制,而不是记住某个“当前最佳”名称。
1. 先区分三类证据
| 证据类型 | 回答的问题 | 主要载体 | 不能替代什么 |
|---|---|---|---|
| 动态事实 | 某个版本/功能/服务条件在何时、何范围内被官方声明为可用 | 事实卡、官方文档、合同或配置证据 | 不能替代企业自己的业务测试。 |
| 内部评测 | 它在我们的任务、数据边界和质量标准下表现如何 | Golden Set、Rubric、回归报告 | 不能替代安全、法律或采购审查。 |
| 运行证据 | 上线后是否持续带来价值且保持可控 | 健康卡、发布登记、日志、事件与回退记录 | 不能替代新版本或新范围的重新评估。 |
附录 D 与动态事实卡登记册规定如何维护动态事实;附录 A 第 29、31、32 节分别规定如何建立评测集、形成回归结论和受控发布。
2. 选型的六个核心维度
| 维度 | 评估什么 | 如何验证 | 对稳定产出的影响 |
|---|---|---|---|
| 任务适配度 | 在具体任务上的质量、完成度与可解释性 | 用脱敏的 Golden Set 比较候选方案 | 同一提示词在不同模型上可能产生不同业务效果。 |
| 输出一致性 | 相同或相近输入下的稳定程度 | 对关键样本重复测试并比较差异 | 一致性不足会增加验证与返工负担。 |
| 格式与接口契约 | 是否稳定符合 JSON、表格、字段或工具调用约束 | 对固定格式、异常输入和边界条件测试 | 格式不稳会破坏下游自动化与审计。 |
| 性能与全成本 | 响应、吞吐、失败重试、模型费用、验证与维护成本 | 在业务负载下记录端到端耗时与成本 | 低单价不等于低总拥有成本。 |
| 数据与控制条件 | 留存、训练使用、区域、访问、日志、权限、工具/端点限制 | 以当前官方文档、合同与实际项目配置核验 | 处理条件不匹配时,质量再好也不能进入相应用例。 |
| 退出与韧性 | 是否可导出资产、替换模型、降级或回到人工流程 | 演练切换、回退和人工接管 | 单一依赖会提高运营中断与锁定风险。 |
3. 按任务分层,而不是迷信单一模型
多数企业不需要为所有任务选择同一个模型或工具。可按任务的复杂度、风险、成本、数据条件和验证能力分层使用:对简单转换类任务优先选择满足质量门的低复杂度方案;对常规生成类任务选择通过内部评测、方便运营的通用方案;对高风险或高约束任务,先提高人工控制、证据和回退能力,再考虑更强的模型或更复杂的编排。
分层策略的价值是让“能力、成本和控制”一起被优化,而不是只比较单次生成效果。
4. 探索界面、正式服务与企业控制面
| 使用方式 | 适合场景 | 最低要求 | 不适合直接承担的职责 |
|---|---|---|---|
| 个人或团队探索界面 | 个人探索、临时任务、验证想法 | 遵循组织的数据与使用政策;不输入未经批准的数据 | 正式工作流、关键知识、需审计或需回退的生产任务。 |
| API 或受控平台 | 团队工作流、结构化输出、需要版本和日志的任务 | 记录端点、版本、项目配置、权限、数据处理条件和成本预算 | 未经评测和风险审查就自动扩大到高影响范围。 |
| 企业网关或平台控制面 | 多团队共用、需要集中身份、成本、审计、路由与数据控制 | 最小权限、配置管理、日志、模型切换和退出预案 | 把网关本身误当成对输出质量或合规的自动保证。 |
正式使用不等于必须使用某一种技术形态;它要求所选形态能够满足工作流合约中定义的版本、权限、数据、日志、回退和责任要求。
5. 版本、工具与服务条件变化的应对
模型提供商和工具平台会更新版本、端点、价格、功能、数据处理方式和弃用计划。每次变化都应先由动态事实卡确认“发生了什么、适用于何处、来源是什么、何时验证”,再判断它是否影响用例立项卡、风险初筛、工作流合约、Golden Set、回归报告或发布登记。
推荐顺序是:事实更新 → 影响分析 → 受影响样本回归 → 发布/回退决定 → 健康卡观察 → 更新事实卡与证据索引。 没有验证的“新版本更强”或“新工具更便宜”不应成为正式工作流切换依据。
6. 最小选型流程
- 使用用例立项卡明确业务问题、数据边界、成功/停止条件与 Owner。
- 用动态事实卡收集候选模型或工具的官方来源、版本、处理条件、权限和退出信息。
- 对候选方案完成风险初筛;R2/R3 或重大变化时完成 AI 影响评估。
- 使用 Golden Set 和 Rubric 做内部比较,而不是用公开榜单直接作决定。
- 将通过方案写入工作流或 Agent 合约,记录版本、配置、权限与回退方式。
- 通过回归报告和发布登记限量上线;以健康卡和真实运行证据决定是否扩大、替换或退役。
五、常见认知偏差及其影响
在企业环境中,几种认知偏差会显著降低结果稳定性。
- 过度信赖:将模型输出、供应商宣传或公开榜单直接当作最终结论,跳过内部验证。
- 一次失败即放弃:因单次错误全面否定工具价值,而不是定位任务、知识、配置或控制问题。
- 成本低估:只比较单价,忽视验证时间、错误修复、工具依赖、维护和组织协调成本。
- 能力外推:将某个模型或工具在一种任务、版本、区域或配置下的表现,直接推广到不同业务场景。
- 事实与决策混淆:把“供应商说支持某功能”误认为“本组织已经批准且适合使用”。
这些偏差的共同点是,未能把外部动态事实、内部评测和实际运行证据分开管理。
六、本章小结
准确认识 AI 的能力与局限,是稳定产出的起点。模型和工具的动态能力可能扩大可行场景范围,却不会取消幻觉、非确定性、知识时效、权限与行动风险,也不会取代人工责任。
企业应以用例和证据而非模型名作选型:动态事实卡回答“当前外部条件是什么”,内部评测回答“它在我们的任务中是否通过”,运行证据回答“它是否值得继续”。把这三类证据与风险、发布和回退机制连在一起,才能在技术变化中保持稳定产出。
下一章将在此基础上,讨论如何从单次生成走向可复现的工作流设计。