附录 D 来源、公开案例与事实维护规范
本附录是全书外部事实、公开案例、动态产品信息与方法框架的统一来源登记册。其目标不是堆积链接,而是使读者能够判断一项说法来自何处、适用于什么范围、何时被核验、不能推出什么结论,以及变化后由谁复核。
核心规则: 没有来源、适用范围和核验日期的外部断言,不得作为正式用例、风险分级、发布决定或价值承诺的依据。真实案例、教学情景、内部运行证据、动态事实与社区线索必须清楚区分。
本附录记录的公开链接在 2026-08-21 核验。链接可访问不代表其内容永久不变;模型、工具、价格、功能、合同、政策和地区可用性等动态信息,以 facts/模型与工具动态事实卡登记册.md 为准。
一、全书内容的事实状态标签
| 标签 | 适用内容 | 可以支撑的结论 | 不得被误读为 |
|---|---|---|---|
| 公开案例 | 裁决、官方库存、机构公告、可追溯新闻或公开复盘 | 特定组织、时间、情境下发生或披露的事实及其有限控制启示 | 所有企业、行业或辖区的普遍规律 |
| 教学情景 | 用于演练 Skill 卡、风险评估、回归或 Runbook 的去标识化设定 | 模板如何填写、控制如何衔接 | 实际客户项目、已验证收益或真实事故 |
| 内部证据 | 样本、评测、发布、运行、事件、验收和移交记录 | 本组织特定用例的实际表现和决定 | 对其他组织、模型或场景的保证 |
| 动态事实 | 模型、端点、工具、数据处理、价格、权限、地区和弃用条件 | 在卡片定义的版本、配置和合同范围内的外部事实 | 同一品牌下全部产品、端点、集成或合同的结论 |
| 社区线索 | X、Reddit、Hacker News、论坛、演讲和个人博客 | 值得调查的高频问题、待验证假设和 Golden Set 候选 | 案例事实、行业比例、ROI、性能阈值或法律结论 |
| 框架参照 | 标准机构、政府或权威组织发布的方法框架 | 组织可借鉴的治理语言、过程和问题集 | 自动合规、认证或法律意见 |
二、来源等级与使用规则
来源等级反映某项材料能支撑的结论强度,而非对来源整体的褒贬。同一来源可能只适合支撑部分事实。
| 等级 | 来源或证据 | 适合使用场景 | 最低记录要求 |
|---|---|---|---|
| A | 原始裁决、法律/监管公开文件、标准机构资料、官方用例库存、实际合同、项目配置、内部运行证据 | 事实确认、组织决定、方法框架和项目验收 | 发布主体、原始链接、版本/日期、适用范围、Owner |
| B | 组织官方公告、产品/开发者文档、可信媒体对原始文件或当事人陈述的报道 | 产品条件、公开部署、特定事件背景 | 链接、发布日期、消息来源、未知事项和核验日期 |
| C | 同行评审研究、公开技术报告、独立调查和多源分析 | 方法背景、风险趋势、研究性讨论 | 版本、样本/方法、适用边界和发布日期 |
| D | 供应商案例、二手分析、论坛、社交媒体、演讲和个人博客 | 发现线索、补充背景、提出待验证问题 | 来源性质、发布时间、待核验状态;不得单独支撑高影响决定 |
对高影响用例、对外沟通、敏感数据、写入动作或自动化决策,至少应同时具备:本组织的内部证据、适用的风险/合规审查,以及在需要时的 A 或 B 级外部资料。媒体报道和供应商案例可提供背景,但不能替代合同、配置、权限和实际测试。
三、公开案例来源登记册
下表登记可用于本手册的真实公开案例。每个案例只能被用于说明表中列出的控制问题;“不可外推”一栏是案例卡的必填部分。
| 案例 ID | 公开案例与来源状态 | 已核验的有限事实 | 适用章节 | 不可外推事项 |
|---|---|---|---|---|
CA-001 | Air Canada 聊天机器人信息错误;A 级,公开裁决 | 加拿大卑诗省民事纠纷审裁处在 Moffatt v. Air Canada, 2024 BCCRT 149 中认定,Air Canada 应对其网站聊天机器人提供的错误丧亲票价信息负责。1 | 第 6、14、15 章;附录 G | 不是全球通用的法律规则;不代表所有聊天机器人或所有错误均产生相同责任。 |
CA-002 | 纽约市 MyCity 商业信息聊天机器人;A/B 级,调查报道与后续回应 | The Markup 测试报道该机器人给出与纽约市规则不一致的劳动、住房和现金支付信息;其后续报道记录纽约市长承认系统存在问题,且网站强化了“不得作为法律或专业建议使用”的提示。2 3 | 第 6、11、15 章 | 不是对所有公共服务系统的质量结论;报道不能替代具体辖区的法律意见。 |
CA-003 | 三星员工向公共聊天工具输入敏感内部信息;B 级,媒体报道 | CNBC 报道称三星确认出现误用后,暂时限制员工在公司个人电脑上使用相关生成式 AI;Cybersecurity Dive 转述韩国媒体称,员工曾向 ChatGPT 输入敏感公司数据。具体输入内容属于媒体转述,三星未在该报道中公开完整输入清单。4 5 | 第 7、14、15 章 | 不能据此证明数据被训练、向其他用户泄露,或禁令在所有组织中有效。 |
CA-004 | Morgan Stanley 内部知识助理与会议摘要工具;A/B 级,机构与供应商共同公开 | Morgan Stanley 官方公告称 AskResearchGPT 支持研究材料的检索、综合和带链接的发现转邮件草稿,供员工修改后分享;OpenAI 案例页描述其专家评测、回归与人工审核做法。6 7 | 第 5、11、15 章 | 采用率、效率和覆盖率属于当事方自述,不能作为一般企业目标、ROI 或验收阈值。 |
CA-005 | GSA 与美国劳工部公开 AI 用例库存;A 级,官方公开 | 两个机构公开用例名称、用途、阶段或部署状态,显示可区分预部署、试点与已部署用例。8 9 | 第 8、12、15 章 | 政府分类、公开义务和效率目标不自动适用于私营组织;项目意图不等于已验收价值。 |
CA-006 | PocketOS 公开报道的 AI 编码 Agent 数据破坏事故;B 级,媒体依据创始人陈述报道 | Guardian 报道该公司创始人称,Cursor 集成的 AI 编码 Agent 删除了生产数据库及备份;报道也说明 Anthropic 未立即回应置评。10 | 第 9、13、15 章;附录 G | 未公开完整独立技术复盘,不能证明特定模型、IDE 或 Agent 框架必然忽略规则,也不能推导一般概率。 |
1. 公开案例的写法
正文第一次引用案例时,必须包含案例 ID、事实状态和来源。例如:
公开案例(
CA-001): 加拿大卑诗省民事纠纷审裁处在特定纠纷中认定,航空公司应对其网站聊天机器人提供的错误信息负责。1 该案例提示对外回复必须管理知识版本、承诺边界和人工升级;它不构成其他司法辖区的法律结论。
正文不应将案例中的金额、时间、样本数或当事方自述的效果,转写为本组织的目标阈值。教学情景必须在标题或首段标注“教学情景,非实际运行记录”。
2. 社区线索的用途与禁区
X、Reddit 和 Hacker News 可用于发现 RAG 知识版本、元数据、检索归因、Agent 权限、可观测性、成本和人工接管等问题。它们应转化为风险登记问题、Golden Set 样本或待验证假设,而不是案例事实。例如,社区讨论提出“复杂否定条件检索容易出错”时,团队应将此类问题加入 Golden Set,记录本组织的实际结果。
单一社交帖文、论坛评论、个人博客或供应商营销材料,不得单独支撑以下内容:具体事故事实、行业比例、准确率、成本、ROI、模型优劣、法律责任或采购决定。只有在找到原始裁决、官方公告、完整技术复盘或独立多源报道后,才可升级为公开案例。11 12 13
四、框架与标准参照
NIST AI RMF 及其生成式 AI 配套资料为跨行业、自愿使用的风险管理资源;其 Playbook 将建议组织为 Govern、Map、Measure 和 Manage,并明确不是所有组织都必须逐项执行的清单。14 15 ISO/IEC 42001:2023 提供 AI 管理体系的建立、实施、维护和持续改进要求与指南。16
| 手册资产 | 可参考的框架维度 | 编辑与使用边界 |
|---|---|---|
| 用例立项卡、用例组合台账、RACI | 治理与情境识别 | 应按组织风险、职责和业务目标调整,不复制为固定清单。 |
| 风险初筛、AI 影响评估、风险—控制矩阵 | 情境识别、评测与管理 | 不以框架名称替代实际法律、隐私或安全审查。 |
| Golden Set、回归报告、健康卡 | 评测与管理 | 指标、阈值和停止条件应由本组织基线及风险边界决定。 |
| 发布登记、事件 Runbook、演练与复盘 | 治理与管理 | 需保留内部证据;不能仅因使用框架而宣称合规或认证。 |
| FDE/AI COE 交付、培训与移交 | 治理、能力与持续改进 | 业务 Owner、知识 Owner 和风险 Owner 的责任不能被外部团队替代。 |
五、动态模型与工具事实
模型和工具事实不是本附录的静态推荐清单。候选模型、端点、工具、平台、连接器或 Agent 框架进入正式用例前,应在 facts/模型与工具动态事实卡登记册.md 建立或复核事实卡,并关联用例立项、风险初筛、工作流合约、Golden Set、发布登记和退出路径。
OpenAI 与 Anthropic 的官方数据处理资料均明确,不同 API、功能、项目配置、组织资格、第三方集成和合同安排可能具有不同的留存或数据处理条件。17 18 因而,正文不得把“使用某品牌”“使用 API”“开启企业版”“设置零留存”等笼统说法写成充分的数据安全结论。任何涉及敏感数据、状态化功能、文件、工具调用、第三方服务、地区处理或合规要求的用例,均应按实际端点、功能、配置、合同和数据流单独核验。
当前 Agent、Coding Agent、计算机使用、视觉和图像生成能力可参阅供应商的官方发布、开发者文档和权限资料。19 20 21 22 23 24 这些均属于 B 级动态事实来源:它们可以说明特定日期、版本和产品条件下公开提供或声明的功能与控制选项,不能单独证明任一企业的质量、成本、可靠性、数据合规性或无监督生产可行性。采用前仍须建立事实卡,并以本组织的任务样本、权限配置、风险分级和运行证据验证。
| 触发情形 | 必须动作 |
|---|---|
| 候选模型、工具或连接器进入正式用例 | 建立/复核事实卡;完成风险初筛;明确数据、权限、成本与退出边界。 |
| 模型、功能、端点、价格、留存、地区、合同或弃用计划变化 | 更新事实卡,识别受影响资产;必要时运行回归并复核发布决定。 |
| 来源失效、事实过期或公开说明与实际配置不一致 | 标记待复核;暂停依赖该事实的新发布;记录原因、Owner 和恢复条件。 |
| 发现论坛或媒体中的新事件 | 先登记为社区线索;按来源等级核验后,才决定是否进入案例登记册或风险资产。 |
1. 价值评估与生产率证据的使用边界
NBER 的客服现场研究使用每小时解决问题数、客户体验和人员结果等指标,MIT 公开的 Coding Agent 现场实验使用 Pull Request、构建、审查时间和错误等流程数据,说明端到端时间、处理量、质量和采用/使用数据可用于评估 AI 辅助工作的变化。25 26 两项研究均披露了任务、人群、实验或统计局限,因此不应把其提升幅度或任一单项指标直接抄为企业目标、ROI 或通过阈值。
Klarna 与 OpenAI 的公开案例同时披露客户服务处理量、解决时间、客户体验、容量等价和预计财务影响,说明企业会采用多维价值口径。27 该材料属于供应商与客户共同发布的当事方陈述,不能替代独立审计,也不能证明对其他组织的财务效果。第 11 章据此采用“全成本、已实现财务收益、容量价值代理、质量与控制证据分开呈现”的方法,而不使用任何公开案例数字作为通用基准。
2. 人机协同与组织生产方式观察的使用边界
OpenAI 与 Anthropic 的署名工程文章、官方团队实践和开发者指南,公开了其在 Agent-first 工程、AI 原生工程生命周期、跨职能使用 Coding Agent、Skill 资产和多 Agent 编排方面的做法与观点。28 29 30 31 32 33 这些属于 B 级动态实践来源:可用于说明当事团队在特定时间、产品、环境和组织条件下披露的机制,例如结构化上下文、委托—复核—拥有分工、可复用 Skill、评测和受控工具协作。
不得将上述材料的吞吐、采用、代码生成比例、模型能力、组织结构或效率结论外推为其他企业的目标、ROI、人员决策或安全结论。第 13 章仅以其作为“协作形态与机制观察窗”;企业是否扩大自主性,仍须根据自身任务、数据、权限、风险、人工接管、评测和运行证据决定。
六、内部证据与来源维护
外部资料不能替代内部证据。组织应在受控空间保存并按权限管理:合同与数据处理协议、供应商安全问卷、项目配置、数据流图、风险评估、评测样本、审核记录、发布登记、事件复盘、恢复演练和移交证明。敏感合同、配置和个人信息不应复制到公开仓库。
每季度或在重大变更发生时,来源 Owner 应复核本附录和动态事实卡,并回答四个问题:谁在什么范围内作出了这项说法?它适用于哪个版本、端点、地区、配置或合同?何时核验?它影响哪些已运行用例,变化后谁负责处理?