跳至内容
richbay.ai
实验场案例学习工具团队服务
richbay.ai

通过解决问题来学习。解决实际问题,测试哪些方法有效,并将证据转化为可重复使用的方法、工作流程和堆栈。

探索

  • 实验场
  • 案例

资源

  • 学习
  • 工具

RichBay

  • 团队服务
  • 关于
  • 隐私

© 2026 RichBay

RichBay.ai是独立的,与本网站上提到的模型提供商或公司无关联,也未得到其认可或推荐。

方法与指南 · 证据连接

不要猜测模型来评判AI答案

在模型身份影响决策之前,审查任务匹配度、主张、证据、不确定性及可用性。

10–20分钟RichBay 实际使用已审查 2026-09-06
← 所有方法与指南开始方法

当

你有两个或多个针对同一任务的AI输出,或者一个需要可辩护接受决策的后果性输出。

你将生成的内容

一个任务特定的审查记录,包含接受的输出、所需更正或明确的无胜者决定。

在此页面上步骤决策规则可重复使用的模板链接证据
RichBay 实际使用

RichBay在盲测挑战和已审核案例中使用此序列。它减少了品牌偏见,但结论仍受限于任务、评分标准、捕获版本和评审员判断。

逐步

将该方法应用于一个真实的任务。

01

在阅读前定义成功标准

在流畅的散文降低标准之前,写出任务、所需事实、格式约束、可接受的不确定性以及不可接受的失败模式。

检查点
评审员可以在不查看答案或模型名称的情况下解释通过、部分通过和失败的条件。
02

将主张与展示分开

独立列出有影响的声明,不考虑语气、格式和风格。将一个经过润色但无支持的声明视为声明失败,而不是展示优势。

检查点
正确性、证据、指令遵循和可用性可以分别评估。
03

将主张追溯到证据

对于每个重要的事实性声明,确定支持它的来源或任务输入。明确标记缺失、过时、次级或不匹配的证据。

检查点
每个被接受的事实声明都有可见的支持,说明答案所说的内容。
04

定位不确定性和缺失的上下文

询问未观察到的内容,什么可能改变结果,添加了哪些假设,以及什么新证据会改变决策。

检查点
该回答指出了一个有用的边界,而不是将不确定性转化为信心。
05

为这个任务选择,最后揭示身份

首先记录结果和原因。然后揭示模型身份,注意更正,并说明结果是否或是否不超出此任务之外。

检查点
该记录支持有限的决策,而不会成为通用模型排名。

决策规则

明确边界。

  • 如果一个必要的实质性声明缺乏支持,不要将答案标记为完全满足任务。
  • 如果多个答案符合标准,根据任务的剩余需求(如可审计性或简洁性)进行选择,而不是根据品牌偏好。
  • 如果没有答案符合标准,就发布一个无胜者结论,并说明需要更正或下一步测试。
  • 对于高影响的使用,即使答案通过了此检查表,也要求领域专家进行审查。

可重复使用的工件

AI输出审查记录

将模板复制到您的笔记中,或下载Markdown文件并将其与任务证据一起保存。

预览模板
# AI 输出审查记录

## 任务和成功标准
- 任务:
- 所需证据:
- 格式约束:
- 可接受的不确定性:
- 不可接受的失败:

## 盲审输出
- 输出标签:
- 指令遵循:符合 / 部分 / 未符合
- 后果性索赔和支持:
- 不支持的假设:
- 不确定性或缺失上下文:
- 此任务的可用性:

## 模型揭示前的决策
- 结果:符合 / 部分 / 未符合
- 接受 / 更正 / 拒绝:
- 原因:

## 身份和边界
- 模型和版本:
- 运行条件:
- 所需更正:
- 此结果不能证明什么:
- 下一个证据或实验:

链接证据

检查此方法的应用位置。

  1. 预算计算已审查案例

    显示多个正确的输出仍可能在可审计性方面有所不同。

  2. 试点证据审查案例

    当每个输出都跨越证据边界时,显示无胜者结果。

  3. 转换不确定性审查案例

    显示因果不确定性如何改变接受决策。

  4. NIST AI 600-1:生成式AI配置文件

    主要风险管理参考,用于特定上下文的评估和可问责审查。

继续循环

使用结果进行练习、检查或构建。

通过挑战进行练习运行完整的比较教程使用比较堆栈