跳至内容
richbay.ai
实验场案例学习工具团队服务
richbay.ai

通过解决问题来学习。解决实际问题,测试哪些方法有效,并将证据转化为可重复使用的方法、工作流程和堆栈。

探索

  • 实验场
  • 案例

资源

  • 学习
  • 工具

RichBay

  • 团队服务
  • 关于
  • 隐私

© 2026 RichBay

RichBay.ai是独立的,与本网站上提到的模型提供商或公司无关联,也未得到其认可或推荐。

教程 · 评估工作流程

运行一次已审核的AI输出比较

定义一个任务,捕获受控输出,根据证据审查声明,并发布一个有限的决策记录。

30–45分钟中级RichBay 实际使用已审查 2026-09-05
← 所有教程从步骤开始

你将生成的内容

一个版本化比较记录和一个明确限定的下一步实验。

在此页面上在开始之前步骤交付成果决策边界来源
RichBay 实际使用

RichBay使用此方法构建其公开的盲测挑战和已审核案例。这些发现适用于已发布的任务包和捕获版本,而不是模型家族的每一次使用。

在开始之前

首先设置操作边界。

  • 一个狭窄的任务,具有代表性、非敏感的输入。
  • 两到三个可以在类似条件下运行的模型或提示变体。
  • 任务特定的成功标准在输出揭示之前编写。
  • 一个命名的人类审查员,负责最终结论。

逐步

从范围转移到一个已检查的成果。

01

聚焦一个实际任务

写出目标、预期用户、约束、所需证据、不可接受的失败模式,以及可用结果必须包含的内容。保持任务足够狭窄,使得每个候选输出都适用相同的评审标准。

检查点
评审员可以在不知道哪个模型生成了输出的情况下决定其是否通过。
工件
版本化任务包
02

冻结运行条件

记录完整的提示、提供方、精确的模型标识符、日期、温度、top-p、令牌限制、工具和上下文文件。说明任何阻止精确再现的提供方行为。

检查点
另一位评审者有足够的信息来重复运行或解释为何无法精确复现。
工件
运行清单
03

在编辑之前捕获原始输出

将每个响应存储为不可变的快照并分配一个中性标签。保持原始输出与注释、更正、重写和交付副本分开,以便在审查后证据不会无声地更改。

检查点
该记录准确显示了每个模型在人类更改之前返回的内容。
工件
标记的输出快照
04

对每个输出使用一个评分标准进行审查

对每个候选人应用相同的任务特定标准。区分指令遵循、事实正确性、证据质量、不确定性以及可用性。将有后果的事实性陈述与当前来源联系起来,并说明每个来源支持什么。

检查点
流畅性、正确性、证据和任务适配性分别进行评分或描述。
工件
审查评分标准和主张清单
05

发布一个有限的结论

在第一次判断后揭示模型身份。说明哪个输出最适合此任务,需要哪些更正,哪些输出未实现,谁批准了审查,以及哪些限制阻止了更广泛的结论。

检查点
该结论有助于完成此任务,而不会成为永久的模型排名。
工件
已审查决策记录
06

定义下一步实验

记录哪个缺失证据或失败最为重要,然后改变一个重要的变量:提示、上下文、模型版本、检索输入或审查标准。保留原始记录而不是覆盖它。

检查点
下一次运行可以教授特定内容,而不仅仅是产生更多答案。
工件
下一步测试假设

交付成果

保持工作可重复使用和可检查。

  1. 版本化任务包
  2. 使用精确的模型ID和参数运行清单
  3. 不可变的原始输出快照
  4. 任务特定的评分标准和声明账本
  5. 已审查决策记录及限制
  6. 单变量下一步实验

决策边界

本教程不证明的内容。

  • 一个小的受控比较支持一个任务的决策,而不是永久的模型排行榜。
  • 提供方更新、工具、系统指令和隐藏的运行时行为可能会改变后续结果。
  • 盲审减少了品牌偏见的一个来源,但不会消除审查者的主观性或评分标准的错误。
  • 高影响使用需要领域特定的评估、合格的监督和更强的控制。

来源台账

检查当前的主要指导。

  1. NIST AI 600-1:生成式AI配置文件

    针对特定上下文评估、治理、测量和管理的风险管理参考。

  2. RichBay:转换不确定性案例

    一个包含任务包、捕获的输出、证据清单、有限的结论和审查记录的已发布示例。

继续循环

将教程与证据和工具连接。

运行示例挑战检查已审核的案例使用评估堆栈