在开始之前
首先设置操作边界。
- 一个狭窄的任务,具有代表性、非敏感的输入。
- 两到三个可以在类似条件下运行的模型或提示变体。
- 任务特定的成功标准在输出揭示之前编写。
- 一个命名的人类审查员,负责最终结论。
逐步
从范围转移到一个已检查的成果。
聚焦一个实际任务
写出目标、预期用户、约束、所需证据、不可接受的失败模式,以及可用结果必须包含的内容。保持任务足够狭窄,使得每个候选输出都适用相同的评审标准。
- 检查点
- 评审员可以在不知道哪个模型生成了输出的情况下决定其是否通过。
- 工件
- 版本化任务包
冻结运行条件
记录完整的提示、提供方、精确的模型标识符、日期、温度、top-p、令牌限制、工具和上下文文件。说明任何阻止精确再现的提供方行为。
- 检查点
- 另一位评审者有足够的信息来重复运行或解释为何无法精确复现。
- 工件
- 运行清单
在编辑之前捕获原始输出
将每个响应存储为不可变的快照并分配一个中性标签。保持原始输出与注释、更正、重写和交付副本分开,以便在审查后证据不会无声地更改。
- 检查点
- 该记录准确显示了每个模型在人类更改之前返回的内容。
- 工件
- 标记的输出快照
对每个输出使用一个评分标准进行审查
对每个候选人应用相同的任务特定标准。区分指令遵循、事实正确性、证据质量、不确定性以及可用性。将有后果的事实性陈述与当前来源联系起来,并说明每个来源支持什么。
- 检查点
- 流畅性、正确性、证据和任务适配性分别进行评分或描述。
- 工件
- 审查评分标准和主张清单
发布一个有限的结论
在第一次判断后揭示模型身份。说明哪个输出最适合此任务,需要哪些更正,哪些输出未实现,谁批准了审查,以及哪些限制阻止了更广泛的结论。
- 检查点
- 该结论有助于完成此任务,而不会成为永久的模型排名。
- 工件
- 已审查决策记录
定义下一步实验
记录哪个缺失证据或失败最为重要,然后改变一个重要的变量:提示、上下文、模型版本、检索输入或审查标准。保留原始记录而不是覆盖它。
- 检查点
- 下一次运行可以教授特定内容,而不仅仅是产生更多答案。
- 工件
- 下一步测试假设
交付成果
保持工作可重复使用和可检查。
- 版本化任务包
- 使用精确的模型ID和参数运行清单
- 不可变的原始输出快照
- 任务特定的评分标准和声明账本
- 已审查决策记录及限制
- 单变量下一步实验
决策边界
本教程不证明的内容。
- 一个小的受控比较支持一个任务的决策,而不是永久的模型排行榜。
- 提供方更新、工具、系统指令和隐藏的运行时行为可能会改变后续结果。
- 盲审减少了品牌偏见的一个来源,但不会消除审查者的主观性或评分标准的错误。
- 高影响使用需要领域特定的评估、合格的监督和更强的控制。
来源台账
检查当前的主要指导。
- NIST AI 600-1:生成式AI配置文件
针对特定上下文评估、治理、测量和管理的风险管理参考。
- RichBay:转换不确定性案例
一个包含任务包、捕获的输出、证据清单、有限的结论和审查记录的已发布示例。