開始する前に
まずオペレーティング境界を設定する。
- 代表的で非センシティブな入力を持つ1つの狭いタスク。
- 2つまたは3つのモデルまたはプロンプトのバリアントで、同等の条件の下で実行できます。
- 出力が公開される前に書かれたタスク固有の成功基準。
- 最終的な結論を所有する名前付きのヒューマンリービュワーです。
ステップバイステップ
範囲からチェック済みアーティファクトに移動します。
1つの実用的なタスクを範囲に設定
目標、意図されたユーザー、制約、必要な証拠、許容できない失敗モード、および使用可能な結果が含むべき内容を書きます。タスクを狭く保ち、すべての候補出力に同じレビュー基準が適用されるようにします。
- チェックポイント
- レビュワーは、どのモデルが生成したかを知らなくても出力を通過させるかどうかを決定できる。
- アーティファクト
- バージョン付きタスクパケット
実行条件を凍結する
完全なプロンプト、提供者、正確なモデル識別子、日付、温度、top-p、トークン制限、ツール、およびコンテキストファイルを記録してください。正確な再現を妨げる提供者の動作を記述してください。
- チェックポイント
- もう一つのレビュアーは、実行を再現するか、なぜ正確な再現が不可能であるかを説明する十分な情報を備えています。
- アーティファクト
- ランマニフェスト
編集する前に元の出力をキャプチャする
各応答を不変のスナップショットとして保存し、中立的なラベルを付与してください。出力の元データを、コメント、修正、再作成、配信コピーとは分離して保持し、レビュー後に証拠が静かに変更されないようにしてください。
- チェックポイント
- この記録は、人間が変更する前に各モデルが返した内容を正確に公開しています。
- アーティファクト
- ラベル付き出力スナップショット
すべての出力を1つの基準でレビューします
すべての候補者に対して同じタスク固有の基準を適用してください。指示の遂行、事実の正確性、証拠の質、不確実性、および使いやすさを分離してください。結果に影響を与える事実的な主張は、現在のソースに結びつけ、それぞれのソースが何を支持しているかを述べてください。
- チェックポイント
- フローシー、正しさ、証拠、タスクの適合性は別々にスコア付けまたは説明されます。
- アーティファクト
- レビュー基準と主張台帳
限界のある結論を公開する
最初の判断の後にモデルのアイデンティティを明らかにします。このタスクに最も適した出力を明記し、必要な修正、出力が達成できなかった点、レビューを承認した人物、および広範な結論を妨げる制限を述べます。
- チェックポイント
- この結論は、このタスクに役立ちますが、永続的なモデルランク付けにはなりません。
- アーティファクト
- レビュー済みの決定記録
次の実験を定義
最も重要な欠落した証拠または失敗の点を記録してください。その後、1つの重要な変数を変更してください: プロンプト、コンテキスト、モデルバージョン、検索入力、またはレビュー基準。元の記録を上書きせず、保持してください。
- チェックポイント
- 次の実行は、単に答えを生成するだけでなく、特定のことを教えることができます。
- アーティファクト
- 次の仮説をテストします
出力物
作業を再利用可能で検査可能に保ちます。
- バージョン付きタスクパケット
- 正確なモデルIDとパラメータでランマニフェストを実行
- 変更不可能な元の出力スナップショット
- タスク固有のルーブリックとクレームレジスター
- 制限付きのレビュー済み決定記録
- 1変数の次の実験
決定境界
このチュートリアルが証明しないこと
- 小さな制御された比較は、1つのタスクの決定をサポートするが、永続的なモデルランク付けにはならない。
- 提供者のアップデート、ツール、システム指示、および非表示の実行時動作は、後の結果に変更を加える可能性があります。
- ブラインドレビューはブランドバイアスの1つの要因を軽減しますが、レビューアの主観性や基準の誤りを完全に排除するものではありません。
- 高影響の使用には、ドメイン固有の評価、資格のある監督、およびより強力な制御が必要です。
出典台帳
現在の主要なガイドラインを確認する
- NIST AI 600-1: ジェネレーティブAIプロファイル
文脈に応じた評価、ガバナンス、測定、管理のためのリスク管理の参考資料。
- RichBay:変換の不確実性ケース
タスクパケット、キャプチャードアウトプット、証拠ロジック、限界評価、レビュー記録を含む公開例。