附录 F 术语表
本附录定义全书使用的关键术语,供团队在立项、设计、评测、发布、运行和移交时统一使用。除非上下文另有说明,以下定义描述本手册的工作方法,不代表特定产品、法律、合同或行业标准的唯一解释。
一、模型与能力
Token(词元)
模型处理文本的基本单位。一个汉字、英文单词、符号或词片段可能对应一个或多个 Token。计费、上下文限制和使用额度的具体口径取决于模型、端点和服务条件,应以动态事实卡中的当前资料为准。
上下文窗口(Context Window)
单次模型调用可处理的上下文范围。不同模型、端点、配置和输入类型的限制可能不同;超出限制时,内容可能被拒绝、截断、压缩或以其他方式处理。关键事实不能只依赖“更长上下文”,仍应通过任务拆分、知识管理和验证控制。
幻觉(Hallucination)
模型生成看似合理、但与事实、权威来源、任务边界或上下文不一致的内容。模型是否显式表达不确定性不能替代验证;提示词、检索和工具可以降低部分风险,但不能消除所有错误可能。
概率预测系统
大模型通常基于既有上下文生成后续内容的概率分布。这有助于解释输出为何会随输入、参数、版本、工具、服务环境和任务设计而变化,也说明模型不能自行承担真实世界的业务、法律或伦理责任。
非确定性输出
相同或相近输入在不同调用中可能产生不同结果的现象。对需要一致性的用例,应通过结构化输出、版本管理、Golden Set、人工验证和回退机制控制影响,而不是假设输出会自然保持一致。
Agent(智能体)
在受限范围内执行多步任务的系统。它可以根据状态选择下一步,调用经授权的 Skill 与工具,并依据中间结果继续、停止或转人工。企业使用 Agent 时,应以已验证的 Skill 为基础,并配置最小权限、状态约束、预算/步数限制、人工接管、日志和审计要求。见第 9 章。
二、数据、知识与动态事实
RAG(Retrieval-Augmented Generation,检索增强生成)
在生成前从知识库检索相关材料,并将检索结果作为受控上下文提供给模型的技术模式。它适合知识量较大、更新频繁且需要来源管理的场景,但不自动保证检索结果权威、完整、适用或最新。见第 4、5、10 章。
微调(Fine-tuning)
在基础模型上使用特定数据继续训练的技术方法,常用于调整输出风格、格式或特定模式。它不等同于实时知识更新;是否适合、如何评测及如何处理训练数据,应由用例、风险、成本和维护能力决定。
Shadow AI(影子 AI)
员工使用未经组织批准、未纳入正式控制或不符合既定数据/权限边界的 AI 工具、账号或工作方式处理工作任务的现象。其风险取决于实际数据、工具、权限、合同、地区和业务影响,不应仅以是否使用个人账号作唯一判断。
知识 Owner
对某项知识资产的权威来源、版本、生效范围、更新、冲突处理和影响分析承担明确责任的角色。知识 Owner 可以是个人或经授权的团队;复核频率应与变化速度、用例影响和组织制度相匹配。见第 5、12 章。
动态事实卡
用于记录模型、端点、工具、数据处理、权限、价格、地区、弃用、退出或其他易变化外部条件的受控记录。事实卡应包含来源、适用范围、核验日期、Owner、变化触发器和关联用例;它不替代内部评测、风险审查或发布决定。见 facts/模型与工具动态事实卡登记册.md。
知识库三层结构
本手册建议的一种知识组织方式:基础层保存权威业务规则与文档;示例层保存经审查的成功、失败或边界案例;反馈层保存运行中发现的问题与改进信号。是否采用三层结构应由知识规模、变更频率和使用场景决定。见第 5 章。
三、工作流与验证
可复现工作流
相对于单次生成的工作方式,工作流将任务边界、输入输出、验证、责任、版本和回退等要素明确化,使不同人员能够在已定义条件下重复执行、检查和改进。其控制强度应与用例风险相称。见第 4 章。
最小闭环
在有限范围内验证一个用例是否具备业务价值、质量控制、人工责任和回退能力的最小运行单元。它不以固定时长定义,而应覆盖足以代表目标任务和关键边界的样本、验证与决策。见第 6 章。
Prompt 模板
将角色、任务目标、规则、输出格式和参考示例固化为可复用结构的提示词资产。Prompt 是 Skill 或工作流的一个受控组件;它本身不等于可运营能力,也不应替代知识、验证、责任或回退机制。
Skill(能力单元)
针对一类重复业务任务的可运营能力包。它可以包含输入输出契约、Prompt、知识、工具、验证、人工控制、回退、Owner、版本和运行指标,并可被团队发现、调用、测试、授权、观测和退役。Skill 不是某个平台专有功能的同义词,也不只是更长的提示词。见第 4 章和附录 A。
工作流合约(Workflow Contract)
对正式工作流或 Skill 的业务目标、适用范围、输入输出、质量标准、人工控制、责任、版本、指标、依赖和回退进行统一定义的文档。它支持交接、评测、变更和审计。
Agent 运行合约(Agent Runtime Contract)
对 Agent 的业务目标、禁止事项、自主等级、可调用 Skill、工具权限、合法状态、预算与熔断、审批、接管、责任和日志要求作出的共同约定。它将“能做什么、不能做什么”转化为可执行的控制。
Golden Set(黄金评测集)
为用例维护的一组已审查样本,用于比较候选与稳定版本,并覆盖正常、边界、历史失败、异常或转人工等行为。Golden Set 的样本、期望行为和适用范围应随知识、流程和风险变化更新。
Rubric(评分量表)
将质量要求拆解为可观察、可解释、可复核标准的评测工具。它可以由人工、规则或受控模型评测辅助使用,但评分结论应保留样本、版本、理由和适用边界。
验证清单(Validation Checklist)
在输出采用、发送、写入或阶段提升前逐项核对的质量和控制检查表。不同用例的清单不同;关键错误、例外或不确定情形应触发修改、转人工、回退或升级,而不是只追求勾选数量。
回退路径
预先定义的异常处理方式,例如使用上一稳定版本、转人工、缩小功能、停止自动动作或终止流程。有效回退不仅需要文档,还需要明确的权限、接棒人、人工备用和演练证据。
Runbook(运行手册)
面向实际执行者的操作资产,用于说明健康信号、依赖、暂停与升级权、人工备用、回退、恢复验证和证据保全方式。见第 14 章与附录 A 第 44 节。
四、评测、风险与治理
一次通过率
在约定统计范围内,一次性通过验证清单的任务比例。其定义必须说明验证版本、允许修改范围、排除规则和任务边界;它不等于事实完全正确、业务采用或风险可接受。指标解释见附录 B。
采用率
在约定统计范围内,最终被业务采用,或在允许修改范围内被采用的输出比例。采用率应与质量、任务边界、审核负担、知识时效和使用者反馈一起解释,不应套用统一目标值。
上下文债务与知识债务
随着使用增加而累积的隐性负担。上下文债务表现为 Prompt、规则或例外不断堆积并相互冲突;知识债务表现为来源、版本、适用范围或冲突处理缺失。两者都可能降低可维护性,应通过资产重构、知识治理、回归与复盘逐步处理。
版本管理
对 Prompt、Skill、检查清单、知识、工作流、Agent 合约、评测和发布资产进行编号、变更说明、影响分析和可定位记录的机制。保留、归档和回退策略应依据业务、审计、数据和运行要求确定;不应使用固定天数替代组织政策。
问题升级路径
预先定义在何种情形下由谁接收、判断、处理、通知和关闭问题的机制。触发条件、响应目标、替补人和证据要求应与用例关键性、事件等级和组织流程相匹配。见第 13、14 章。
风险初筛与 AI 影响评估(AIA)
风险初筛用于依据业务影响、数据、对外或写入动作、自主性、回退和控制能力确定用例的初始控制强度。AIA 用于进一步说明受影响对象、数据和知识、可能不利影响、控制、残余风险、人工接管和证据。它们是内部治理工具,不替代适用的法律、行业或安全评估。
RACI
用于明确“负责执行、最终负责、提供咨询、被告知”的责任分配方式。本书使用的最小 RACI 应与业务 Owner、知识 Owner、技术 Owner、风险角色、审核者和接棒角色相连接。具体角色名称可随组织调整。
五、案例与证据状态
方法示例
为解释模板字段、控制链或决策方式而设计的示例。方法示例可以包含虚构、脱敏或抽象化场景;除非明确链接到受控证据,不应被理解为特定组织已经实现的生产结果。
运行证据
支持用例阶段判断的内部记录,例如经批准的样本、审核结论、Golden Set、回归报告、发布登记、健康卡、事件记录、演练和接棒记录。运行证据需要说明版本、范围、时间、Owner 和存放位置。
试点证据包
将用例立项、风险、工作流、评测、发布、运行和移交资产集中组织的文件包。evidence/ 目录中的两个证据包已明确标注待现场验证的项目;在缺少真实样本、审核、配置和业务确认时,不应视为验收结论。
术语如有遗漏、冲突或定义不适用,应通过团队治理机制提出修订。组织内部推广时,可引用本表作为共同语言,但仍应根据实际业务、制度和专业要求确定最终定义与责任。