附录 C 模型与工具核验指南
本附录不再维护“当前推荐工具”或静态产品排行榜。模型、API、网关、编排平台、RAG 与记忆组件、安全工具、MCP 和第三方集成的名称、版本、价格、能力、部署方式、数据处理与弃用计划变化很快;将它们直接写成长期推荐,容易让读者把过期信息当成生产决策依据。
本附录提供的是工具分类、尽调问题和决策入口。每项可能进入正式用例的外部模型、平台、端点、MCP、连接器或组件,都应在模型与工具动态事实卡登记册中有一张可复核事实卡,并与用例立项、风险初筛、上下文包、记忆合约、工具控制卡、工作流合约、评测、发布和退出计划连接。
使用原则:工具选择不是“找功能最多的平台”,而是为已明确的业务用例选择能够满足质量、数据、权限、运营、成本和退出要求的最小方案。
一、工具与模型的六类能力
| 类别 | 主要作用 | 常见价值 | 必须避免的误解 |
|---|---|---|---|
| 模型与 API 服务 | 生成、推理、嵌入、多模态或结构化输出 | 为 Skill、工作流或 Agent 提供基础能力 | 模型名、榜单或上下文数字不能证明适配业务或满足数据要求。 |
| 网关与控制面 | 身份、密钥、路由、成本、日志、限额、模型切换 | 集中控制多个团队和供应商依赖 | 网关不能自动解决输出质量、知识正确性或合规责任。 |
| 工作流与 Agent 编排 | 编排确定性步骤、Skill、上下文、工具、状态和审批 | 将能力连接为可运行流程 | 图形化编排不等于已经具备评测、来源边界、权限、回退和审计。 |
| 知识、检索与记忆组件 | 文档处理、索引、检索、权限、版本、引用、任务状态和记忆 | 支撑需用企业知识或跨轮次状态的 Skill/Agent | 有“知识库”或“记忆”不等于内容权威、及时、已隔离、可删除或可追溯。 |
| 安全与防护组件 | 输入输出过滤、DLP、提示注入防护、权限和审计 | 降低特定风险并提供可见性 | 安全工具可能误拦截或漏拦截,不能取代人工边界和风险治理。 |
| 第三方集成与连接器 | 连接业务系统、外部工具、数据或动作 | 扩展工作流和自动化价值 | 集成常带来额外数据流、权限、留存和写入风险,必须单独评估。 |
二、进入正式用例前的工具核验问题
工具不应只按“好不好用”选型。以下问题应由对应事实卡、内部配置、风险初筛和工作流合约共同回答。
1. 功能与适用范围
| 需要回答的问题 | 最低证据 |
|---|---|
| 具体版本、端点、功能和部署方式是否适用于此用例? | 官方文档/版本说明、事实卡、内部环境确认。 |
| 哪些能力、限制、地区、计划或配置前提会影响使用? | 事实卡中的适用范围、不适用范围和核验日期。 |
| 是否存在弃用、配额、速率、服务状态或兼容性风险? | 官方公告/状态页、合同或实际配置、回退计划。 |
2. 数据与合规条件
| 需要回答的问题 | 最低证据 |
|---|---|
| 哪些输入、上下文包、检索/工具返回、记忆、输出、文件、日志、状态或元数据会离开组织边界? | 数据流、事实卡、上下文包、工具控制卡、工作流合约和 AIA。 |
| 留存、训练使用、区域、加密、子处理者或删除条件是否符合组织要求? | 官方政策、合同、项目配置和组织审查记录。 |
| 第三方工具、浏览器插件、远程 MCP 或外部连接器的数据处理是否已单独核验? | 集成事实卡、权限/数据流说明、风险初筛。 |
3. 权限、动作与运营条件
| 需要回答的问题 | 最低证据 |
|---|---|
| 谁可访问、配置、调用、修改或导出数据? | 身份/权限设计、审计日志、责任人和变更记录。 |
| 工具/MCP/连接器是否可读写、发送、执行代码、访问网络或持续运行? | 工作流/Agent 合约、工具控制卡、动作白名单、审批与熔断设计。 |
| 上下文来源、检索、记忆与工具返回能否按用例范围过滤、定位、失效、隔离或删除? | 上下文包、记忆合约、权限/数据流说明与回归记录。 |
| 是否可导出 Prompt、知识、上下文包、记忆、评测集、配置、日志与历史记录? | 退出路径、迁移测试、备份或人工备用流程。 |
三、按用例选择最小方案
1. 先选控制形态,再选具体产品
| 用例特征 | 优先控制形态 | 工具选择重点 |
|---|---|---|
| 一次性、低风险个人探索 | 经批准的探索环境 | 数据边界、个人使用政策、不可把结果直接作为正式结论。 |
| 高频、可验证的单类任务 | 受控 Prompt 或 Skill | 版本、最小上下文包、输入输出、评测、知识、人工回退与第二人复现。 |
| 多步骤但顺序明确的任务 | 固定工作流 | 状态、受控数据/上下文传递、验证、审批、日志与失败处理。 |
| 动态编排确有价值的任务 | 受限 Agent | 已验证 Skill、上下文白名单、记忆边界、最小权限、状态限制、预算、接管、审计与风险评估。 |
| 涉及企业知识或文件 | 知识组件或 RAG | 权威来源、版本、生效日期、访问控制、删除/归档、引用证据与检索评测。 |
| 涉及业务系统查询或动作 | 工具/MCP/连接器 | 最小权限、参数/返回量、审批、超时/熔断、日志、回退与退出。 |
2. 不要复制“按月份堆工具”的演进路线
团队不应因为进入某个时间阶段就自动引入网关、RAG、Agent、私有部署或评测平台。更合理的升级信号是:用例数量和共享依赖增加;真实质量/成本/权限问题无法由现有机制解决;责任人有能力长期维护;风险初筛和发布机制要求更强控制;或演练已证明需要更好的回退和切换能力。
任何新组件都应先回答:它要解决哪个用例或控制缺口?如果不使用它,什么风险或成本无法被现有工作流承受?增加它后,谁维护、如何测试、怎样导出和如何退出?
四、工具事实卡、内部评测与发布的连接
候选模型或工具
↓
创建/更新动态事实卡(版本、范围、数据、权限、限制、来源、日期、退出)
↓
关联用例立项卡与风险初筛;R2/R3 或重大变化时完成 AIA
↓
建立/更新上下文包、记忆合约与工具控制卡
↓
在批准环境中用 Golden Set、Rubric 与上下文/工具评测做内部验证
↓
写入工作流/Agent 合约,完成回归报告和发布登记
↓
限量运行、观察健康卡;事实或配置变化时重新分析影响| 决策问题 | 主要资产 |
|---|---|
| 供应商或工具官方说了什么,适用于什么范围? | 动态事实卡登记册 |
| 这个用例是否值得做、数据/影响是否可接受? | 用例立项卡、风险初筛、AI 影响评估 |
| 候选方案在本组织真实任务上是否通过? | Golden Set、Rubric、回归评测报告 |
| 谁能用、可依据什么、可保存什么、可做什么、怎样停止和回退? | 工作流合约、Agent 运行合约、上下文包、记忆合约、工具控制卡、发布登记 |
| 上线后是否仍健康、何时替换或退役? | 用例健康卡、组合评审、证据索引、韧性演练 |
五、退出与迁移的最小要求
对关键用例,工具选择时就应考虑退出,而不是等供应商停服、涨价、弃用或不再满足数据要求后才临时迁移。最低要求包括:业务规则、Prompt、Skill、上下文包、记忆、工具/连接器控制、工作流、评测集和关键配置不只保存在单一平台;模型/工具版本与数据处理条件可追溯;组织知道哪个 Owner 负责切换;存在可以验证的替代方案或人工备用流程;迁移后可以对同一 Golden Set 回归比较。
对外部平台、第三方插件或连接器,退出并不一定意味着“立即替换”。它意味着组织有权知道数据、权限和资产在哪里,并能在合理时间内暂停、导出、降级或回到人工流程。
六、最小核验清单
在将模型或工具接入正式用例前,逐项确认:
- [ ] 已创建或更新事实卡,且记录版本、范围、限制、来源、核验日期和下次复核。
- [ ] 已核验实际项目配置,而不只阅读了公共营销页或产品名称。
- [ ] 已关联用例立项卡、风险初筛;需要时已完成 AIA。
- [ ] 已在批准的数据与权限边界内使用 Golden Set、上下文与工具评测完成内部验证。
- [ ] 已建立或更新上下文包、记忆合约和工具/MCP/连接器控制卡。
- [ ] 已将版本、端点、来源、记忆、权限、工具调用和回退要求写入工作流或 Agent 合约。
- [ ] 已完成回归报告、发布登记、观察期和证据索引的更新。
- [ ] 已明确可导出资产、替代路径、人工备用流程与责任 Owner。
七、本附录的维护规则
本附录只维护稳定的分类、问题和控制方法。具体外部事实、链接和核验记录维护在 facts/ 目录中;过期事实应标记失效并保留历史原因,新的产品、功能或政策变化通过新增或更新事实卡管理。这样,手册正文不因短期产品变化频繁改写,读者仍能获得可追溯、可复核的当前信息。
如需进一步了解事实卡字段、样例、复核节奏与来源优先级,请直接阅读模型与工具动态事实卡登记册。