コンテンツにスキップ
richbay.ai
プレイグラウンド事例学ぶツールチーム向け
richbay.ai

実用的な問題を解決し、効くものをテストし、証拠を再利用可能な方法、ワークフロー、スタックに変換します。

探索

  • プレイグラウンド
  • 事例

リソース

  • 学ぶ
  • ツール

RichBay

  • チーム向け
  • について
  • プライバシー

© 2026 RichBay

RichBay.aiは独立しており、このサイトに記載されているモデル提供者や企業とは関係ありません。また、それらの企業によって推奨や承認されているわけではありません。

方法とガイド · 証拠を接続

モデルを推測せずにAIの回答を評価する

モデルのアイデンティティが決定に影響を与える前に、タスクの適合性、主張、証拠、不確実性、および使いやすさをレビューします。

10~20分RichBay で使用実績ありレビュー済み 2026-09-06
← 全ての方法とガイド方法を開始

使用する場合

あなたは同じタスクに対する2つ以上のAI出力を持っています、または重要な出力で説得力のある受け入れの決定が必要です。

あなたが生成するもの

受け入れられた出力、必要な修正、または明確な勝者なしの決定を含むタスク固有のレビュー記録。

このページでステップ決定ルール再利用可能なテンプレートリンクされた証拠
RichBay で使用実績あり

RichBayはこのシーケンスをその盲検チャレンジとレビュー済みケースで使用しています。これはブランドバイアスを軽減しますが、結論はタスク、ルーブリック、キャプチャされたバージョン、レビュワーの判断に限定されます。

ステップバイステップ

その方法を一つの実際のタスクに適用してください。

01

読み込み前に成功を定義

流暢な文章が基準を低下させる前に、タスク、必要な事実、フォーマット制約、許容可能な不確実性、許容できない失敗モードを書きます。

チェックポイント
レビュワーは、答えやモデル名を見ることなく、通過、部分的、失敗の条件を説明できる。
02

主張をプレゼンテーションから分離する

トーン、フォーマット、スタイルとは独立して、重要な主張をリストアップしてください。整った支持されていない主張をプレゼンテーションの強みではなく、主張の失敗と見なしてください。

チェックポイント
正しさ、証拠、指示の遵守、および使いやすさは別々に評価できます。
03

証拠に該当する主張を確認

重要な事実的な主張ごとに、それをサポートするソースまたはタスク入力を特定してください。欠落している、古くなった、二次的な、または不一致な証拠を明確にマークしてください。

チェックポイント
すべての受け入れられた事実的な主張には、答えが何を述べているかを示す視覚的なサポートがあります。
04

不確実性と欠けた文脈を特定する

観測されなかったことは何ですか?結果を変えることができるのは何ですか?どの仮定が追加されましたか?どのような新しい証拠が決定を変えることになりますか?

チェックポイント
答えは、不確実性を確信に変える代わりに、有用な境界を示しています。
05

このタスクのために選択し、アイデンティティを最後に明らかにします

結果とその理由を最初に記録してください。その後、モデルの識別情報を記録し、修正点を示し、その結果がこのタスクを超えて転送されるかどうかを説明してください。

チェックポイント
この記録は、普遍的なモデルランク付けになることなく、限られた決定をサポートします。

決定ルール

境界を明確にする。

  • 必要な結果的な主張に裏付けがない場合、答えがタスクを完全に満たしているとマークしないでください。
  • 複数の答えが基準に合致する場合、審査可能性や簡潔さなどのタスクの残りのニーズに基づいて選択してください。ブランドの好みに基づいて選ばないでください。
  • 基準に合致する答えがない場合、勝者なしの結論を公開し、修正または次のテストを指定してください。
  • 高影響力の使用では、このチェックリストを通過しても、専門分野のレビューを必要とします。

再利用可能なアーティファクト

AI出力レビュー記録

テンプレートをノートにコピーするか、Markdownファイルをダウンロードしてタスク証拠と一緒に保持してください。

テンプレートをプレビューする
# AI出力レビュー記録

## タスクと成功基準
- タスク:
- 必要な証拠:
- フォーマット制約:
- 許容可能な不確実性:
- 許容できない失敗:

## ブランディング出力レビュー
- 出力ラベル:
- 指示の遵守:満たす/部分的/見逃す
- 結果的な請求およびサポート:
- サポートされていない仮定:
- 不確実性または欠如した文脈:
- このタスクにおける使いやすさ:

## モデルの公開前の決定
- 結果:満たす/部分的/見逃す
- 受け入れる/修正する/拒否する:
- 理由:

## アイデンティティと境界
- モデルとバージョン:
- 実行条件:
- 必要な修正:
- この結果が証明しないもの:
- 次の証拠または実験:

リンクされた証拠

この方法が適用された場所を確認する

  1. 予算計算のレビュー済みケース

    いくつかの正しい出力が依然として監査可能性において異なる可能性があることを示します。

  2. ピロット証拠レビュー事例

    すべての出力が証拠の境界を越える場合、ノーウィナーの結果を示します。

  3. 変換の不確実性のレビュー済みケース

    因果の不確実性が受け入れの決定にどのように影響するかを示します。

  4. NIST AI 600-1: ジェネレーティブAIプロファイル

    文脈に応じた評価と責任あるレビューのためのプライマリリスク管理の参照。

ループを続ける

結果を使って練習、検証、または構築する

チャレンジで練習するフル比較チュートリアルを実行比較スタックを使用してください