跳至内容
richbay.ai
实验场案例学习工具团队服务
richbay.ai

通过解决问题来学习。解决实际问题,测试哪些方法有效,并将证据转化为可重复使用的方法、工作流程和堆栈。

探索

  • 实验场
  • 案例

资源

  • 学习
  • 工具

RichBay

  • 团队服务
  • 关于
  • 隐私

© 2026 RichBay

RichBay.ai是独立的,与本网站上提到的模型提供商或公司无关联,也未得到其认可或推荐。

输出比较

你能审计预算计算吗?

一个简单的算术任务说明了为什么共识是不够的:展示方式决定了评审员审计结果的速度。

已审查已发布RichBay编辑审核Aug 27, 2026challenge-budget-math-check-r1

RichBay裁决

所有三个捕获的输出都满足算术任务。有意义的差异是可审计性——不是模型排名。

此结论仅适用于本记录中显示的捕获任务、输出和评审标准。

在此页面上

  1. 任务
  2. 完整提示
  3. 评估标准
  4. 输出比较
  5. 证据台账
  6. 限制
  7. 可重复使用的要点

01 · 任务

目标和约束

选择预算计算正确且最容易审计的答案。

  • 仅使用任务包中的数字。
  • 在固定成本后应用应急措施,并在最后一步保留美分。
  • 为每个模型评估一次捕获的运行;不要推断出一般模型排名。

02 · 再现输入

完整提示

阅读用译文

一个发布预算为1200美元。固定成本为249美元的软件费用和180美元的研究费用。在固定成本之后,预留剩余资金的15%作为应急资金。还剩多少用于广告?展示计算并说明最终的金额。

原始提示词(英文)

A launch budget is $1,200. Fixed costs are $249 for software and $180 for research. Set aside a contingency equal to 15% of the money remaining after fixed costs. How much remains for ads? Show the calculation and state the final dollar amount.

为便于复核,捕获时的提示词和模型输出保留原文。译文仅辅助阅读,不代表重新运行模型。

03 · 评估范围

此任务使用的标准

扣除固定成本后剩余771美元。应急资金为115.65美元,正好剩下655.35美元用于广告。强大的答案会展示计算过程,而不会提前四舍五入。

  1. 检查固定成本小计。
  2. 在固定成本之后仅应用15%。
  3. 拒绝早期四舍五入或不支持的总数。

04 · 不可变快照

捕获的输出和审查

从比较摘要开始。仅在需要完整输出、运行元数据和编辑审查时打开快照。

输出 1满足要求

OpenAI

openai/gpt-oss-20b

强度
完整、标记的计算
审查边界
比小计算所需的更长
打开快照
输出 2满足要求

通义千问

qwen/qwen3-30b-a3b-fp8

强度
简洁且完全可检查
审查边界
对固定成本后应用的应急措施解释较少
打开快照
输出 3满足要求

Mistral AI

mistralai/mistral-small-3.1-24b-v2

强度
正确顺序和结果
审查边界
最终的未标记金额更难扫描
打开快照
输出 1原始捕获输出 · 默认折叠OpenAI · openai/gpt-oss-20b
快照 ID
output-budget-math-check-1
案例修订
challenge-budget-math-check-r1
内容哈希
sha256:56e60e6df589a932b37186dddfc2a37ac99ebd833c9c43032e45761559144699
运行请求 ID
chatcmpl-ecf04c7920454deab58e942676651b6d
捕获于
Aug 27, 2026, 5:31 AM UTC
模型开发者
OpenAI
运行时提供方
Cloudflare Workers AI
模型标识符
@cf/openai/gpt-oss-20b
模型许可证
Apache-2.0
参数
最大标记数 2000; 温度 0.2; top-p 0.9
输出使用依据
在适用的运行时和模型条款下,为 RichBay 评估而捕获。模型许可证不被视为输出的许可证。

原始输出

Calculation

  1. Total budget: $1,200
  2. Fixed costs:
    • Software: $249
    • Research: $180
    • Total fixed costs = $249 + $180 = $429
  3. Money remaining after fixed costs:
    $1,200 – $429 = $771
  4. Contingency (15 % of $771):
    0.15 × $771 = $115.65
  5. Amount left for ads:
    $771 – $115.65 = $655.35

Final dollar amount available for ads: $655.35

满足要求

优势: 完整、标记的计算 在最后一步保持美分

风险: 比小计算所需的更长

最佳用途: 当可审计的计算最为重要时。

输出 2原始捕获输出 · 默认折叠通义千问 · qwen/qwen3-30b-a3b-fp8
快照 ID
output-budget-math-check-2
案例修订
challenge-budget-math-check-r1
内容哈希
sha256:753968e3567a6bd4a449755b7d2a7f3644de6c49030dc71c1e96168cf4886ad4
运行请求 ID
chatcmpl-77a95ee2-9b23-483e-a007-25f728d00d29
捕获于
Aug 27, 2026, 5:31 AM UTC
模型开发者
通义千问
运行时提供方
Cloudflare Workers AI
模型标识符
@cf/qwen/qwen3-30b-a3b-fp8
模型许可证
Apache-2.0
参数
最大标记数 2000; 温度 0.2; top-p 0.9
输出使用依据
在适用的运行时和模型条款下,为 RichBay 评估而捕获。模型许可证不被视为输出的许可证。

原始输出

Total budget: $1,200
Fixed costs: $249 + $180 = $429
Remaining after fixed costs: $1,200 - $429 = $771
Contingency: 15% of $771 = 0.15 × $771 = $115.65
Amount remaining for ads: $771 - $115.65 = $655.35

Final answer: $655.35

满足要求

优势: 简洁且完全可检查 说明正确的655.35美元结果

风险: 对固定成本后应用的应急措施解释较少

最佳用途: 当速度和可追溯的算术都重要时。

输出 3原始捕获输出 · 默认折叠Mistral AI · mistralai/mistral-small-3.1-24b-v2
快照 ID
output-budget-math-check-3
案例修订
challenge-budget-math-check-r1
内容哈希
sha256:4f820aaec1e2cd2b274a7de49e0a9a4efd12ec71c333e783e26b281bca17f651
运行请求 ID
chatcmpl-786890a9-adf2-4906-93b6-5470a3af121d
捕获于
Aug 27, 2026, 5:31 AM UTC
模型开发者
Mistral AI
运行时提供方
Cloudflare Workers AI
模型标识符
@cf/mistralai/mistral-small-3.1-24b-v2
模型许可证
Apache-2.0
参数
最大标记数 2000; 温度 0.2; top-p 0.9
输出使用依据
在适用的运行时和模型条款下,为 RichBay 评估而捕获。模型许可证不被视为输出的许可证。

原始输出

Fixed costs: $249 + $180 = $429 Remaining after fixed costs: $1,200 - $429 = $771 Contingency: 15% of $771 = 0.15 * $771 = $115.65 Remaining for ads: $771 - $115.65 = $655.35

$655.35

满足要求

优势: 正确顺序和结果 没有不必要的声明

风险: 最终的未标记金额更难扫描

最佳用途: 当紧凑计算足够时。

05 · 主张核验台账

主张、来源、证据和边界

主张 1

可用的广告预算是655.35美元。

来源
已发布的任务包和确定性算术
支持
2400美元 − 1629美元 = 771美元;771美元的15% = 115.65美元;771美元 − 115.65美元 = 655.35美元。
边界
这仅验证提供的算术;它不验证业务假设。

主张 2

所有三个捕获的输出达到相同的最终金额。

来源
在这种情况下,不可变的输出快照
支持
每个显示的原始输出在遵循相同固定提示后显示$655.35。
边界
每个模型的一个输出并不能建立稳定的模型级性能率。

06 · 审查结论

此证据支持的内容

优先选择中间值使最终数字最容易验证的答案,而不是模型名称。

已知限制

  • 该任务是确定性的,不代表开放式的财务分析。
  • 该审查比较了每个模型在单个提示下的一个捕获输出。
  • 格式偏好仅在影响可审计性时进行评估。

可重复使用的要点

在接受生成的计算之前,使用中间值审计检查表。

使用支持方法

在此页面上

  1. 任务
  2. 完整提示
  3. 评估标准
  4. 输出比较
  5. 证据台账
  6. 限制
  7. 可重复使用的要点

发布记录

已审查并已版本化

状态
已审查 · 已发布
负责任的审阅者
RichBay编辑审核
修订
challenge-budget-math-check-r1
已发布
Aug 27, 2026
审查到期
Nov 25, 2026
尝试游乐场使用方法

对输出或证据条目的重大更改需要新的修订;此记录不会被静默覆盖。