コンテンツにスキップ
richbay.ai
プレイグラウンド事例学ぶツールチーム向け
richbay.ai

実用的な問題を解決し、効くものをテストし、証拠を再利用可能な方法、ワークフロー、スタックに変換します。

探索

  • プレイグラウンド
  • 事例

リソース

  • 学ぶ
  • ツール

RichBay

  • チーム向け
  • について
  • プライバシー

© 2026 RichBay

RichBay.aiは独立しており、このサイトに記載されているモデル提供者や企業とは関係ありません。また、それらの企業によって推奨や承認されているわけではありません。

実験 · 制御された出力比較

この変換結果は改善を証明していますか?

タスクとパラメータを固定し、モデルを変更し、各モデルが因果的不確実性をどのように処理するかを比較してください。

タスク プロンプトと設定を固定するアクション 比較対象のモデル実行を変更する結果 変更と結論の制限を確認する

制御変数: モデル出力; プロンプトと生成設定は固定されます

実験の設定

タスクを固定します。モデルの実行を変更します。

参考訳

バージョンAは100人の訪問者のうち8人がコンバートしました。バージョンBはその後の7日間で100人の訪問者のうち14人がコンバートしました。ランダムな分割は行われず、週ごとのトラフィックソースも異なりました。これはBが優れていることを証明していますか?決定の推奨と不確実性を特定してください。

元のプロンプト(英語)

Version A converted 8 of 100 visitors. Version B converted 14 of 100 visitors during the following seven days. No randomized split was used, and traffic sources differed between the weeks. Does this prove B is better? Give a decision recommendation and identify the uncertainty.

再現性のため、取得時のプロンプトとモデル出力は原文を保持しています。翻訳は読解補助であり、新たなモデル実行の結果ではありません。

変更された変数
解決済みモデルID
固定条件
プロンプト · max 2000 トークン · 温度 0.2 · top-p 0.9
証拠セット
1つのバージョン化された生成バッチから3つの出力を収集

変数を変更する

2つのキャプチャされたランを選択してください。

複数のペアリングを試してください。出力とタスク固有のレビューは一緒に更新されます。

ランA

OpenAI

要件を満たす

openai/gpt-oss-20b

No – the data do not prove that Version B is superior.

Why not?

  • The two weeks were not randomized; traffic sources (e.g., referral, paid, organic) differed, so any conversion difference could be due to those sources rather than the version.
  • The sample size is small (100 visitors per week), so the observed 8 % vs. 14 % difference could be due to random variation.
  • External factors (seasonality, day‑of‑week, marketing campaigns) could have changed between the weeks.

Decision recommendation
Run a properly randomized A/B test (or multivariate test) with a larger, balanced sample and control for traffic source. Only then can you statistically assess whether B truly outperforms A.

Uncertainty

  • Confounding by traffic source and other time‑varying factors.
  • Statistical uncertainty due to the small sample size.
  • Potential interaction with other variables (device, location, etc.) that were not controlled.
この実行のレビューを確認する
強み
  • 統計的不確実性と交絡を名前付けます
  • バランスの取れたランダムテストを推奨します
リスク
  • パケットで観測されていない可能性のある要因を追加します

最適な使用法: 不確実性を説明する必要がある意思決定メモです。

ランB

Qwen

要件を満たす

qwen/qwen3-30b-a3b-fp8

No, this does not prove B is better. The lack of a randomized split and differing traffic sources introduce confounding variables. Recommendation: Conduct a controlled experiment with random assignment. Uncertainty: Results may be influenced by external factors.

この実行のレビューを確認する
強み
  • 証拠を直接拒否します
  • 混同およびランダム割当を特定します
リスク
  • 小さなサンプルを明示的に言及しません

最適な使用法: 簡潔なエグゼクティブ向けの回答です。

境界付きの結論

この実行セットがサポートする内容のみを述べます。

すべての3つは因果的結論を拒否します。それらはどのように明確にサンプルの不確実性と週ごとの混同を識別するかで異なります。

評価対象

強力な回答は、観測が因果関係を証明していないことを述べ、小規模なサンプルや時間/トラフィックの混同を特定し、永続的な展開の前にランダム化された並行テストを推奨します。

再利用可能な比較方法
  1. 観察された率を因果関係から分離する。
  2. 非ランダムな割り当てとトラフィックソースの変更を名前付けます。
  3. 並行したランダム比較を推奨します。

1つのプロンプトとパラメータセットの下で3つの出力を収集; 審査済み Aug 27, 2026。この実験はこれらの実行のみを説明しており、グローバルなモデルランク付けではありません。

次のステップを構築する

この結果を再利用可能な方法に変換します。

順次変換比較のための結論の境界です。

レビューされたケースを確認するレビュー方法を学ぶ