逐步
将该方法应用于一个真实的任务。
在阅读前定义成功标准
在流畅的散文降低标准之前,写出任务、所需事实、格式约束、可接受的不确定性以及不可接受的失败模式。
- 检查点
- 评审员可以在不查看答案或模型名称的情况下解释通过、部分通过和失败的条件。
将主张与展示分开
独立列出有影响的声明,不考虑语气、格式和风格。将一个经过润色但无支持的声明视为声明失败,而不是展示优势。
- 检查点
- 正确性、证据、指令遵循和可用性可以分别评估。
将主张追溯到证据
对于每个重要的事实性声明,确定支持它的来源或任务输入。明确标记缺失、过时、次级或不匹配的证据。
- 检查点
- 每个被接受的事实声明都有可见的支持,说明答案所说的内容。
定位不确定性和缺失的上下文
询问未观察到的内容,什么可能改变结果,添加了哪些假设,以及什么新证据会改变决策。
- 检查点
- 该回答指出了一个有用的边界,而不是将不确定性转化为信心。
为这个任务选择,最后揭示身份
首先记录结果和原因。然后揭示模型身份,注意更正,并说明结果是否或是否不超出此任务之外。
- 检查点
- 该记录支持有限的决策,而不会成为通用模型排名。
决策规则
明确边界。
- 如果一个必要的实质性声明缺乏支持,不要将答案标记为完全满足任务。
- 如果多个答案符合标准,根据任务的剩余需求(如可审计性或简洁性)进行选择,而不是根据品牌偏好。
- 如果没有答案符合标准,就发布一个无胜者结论,并说明需要更正或下一步测试。
- 对于高影响的使用,即使答案通过了此检查表,也要求领域专家进行审查。
可重复使用的工件
AI输出审查记录
将模板复制到您的笔记中,或下载Markdown文件并将其与任务证据一起保存。
预览模板
# AI 输出审查记录
## 任务和成功标准
- 任务:
- 所需证据:
- 格式约束:
- 可接受的不确定性:
- 不可接受的失败:
## 盲审输出
- 输出标签:
- 指令遵循:符合 / 部分 / 未符合
- 后果性索赔和支持:
- 不支持的假设:
- 不确定性或缺失上下文:
- 此任务的可用性:
## 模型揭示前的决策
- 结果:符合 / 部分 / 未符合
- 接受 / 更正 / 拒绝:
- 原因:
## 身份和边界
- 模型和版本:
- 运行条件:
- 所需更正:
- 此结果不能证明什么:
- 下一个证据或实验:
链接证据
检查此方法的应用位置。
- 预算计算已审查案例
显示多个正确的输出仍可能在可审计性方面有所不同。
- 试点证据审查案例
当每个输出都跨越证据边界时,显示无胜者结果。
- 转换不确定性审查案例
显示因果不确定性如何改变接受决策。
- NIST AI 600-1:生成式AI配置文件
主要风险管理参考,用于特定上下文的评估和可问责审查。