Étape par étape
Appliquez la méthode à une tâche réelle.
Définir le succès avant de lire
Écrivez la tâche, les faits requis, les contraintes de format, l'incertitude acceptable et les modes d'échec inacceptables avant que le langage fluide ne baisse la barre.
- Point de vérification
- Un réviseur peut expliquer les conditions de passage, de partialité et d'échec sans voir la réponse ou le nom du modèle.
Séparer les affirmations de la présentation
Listez les affirmations conséquentes indépendamment du ton, de la mise en forme et du style. Traitez une affirmation bien rédigée mais non soutenue comme un échec, pas comme une force de présentation.
- Point de vérification
- La correction, l'évidence, le respect des instructions et l'utilisabilité peuvent être évalués séparément.
Faire correspondre les affirmations aux preuves
Pour chaque affirmation factuelle importante, identifiez la source ou l'entrée de tâche qui la soutient. Marquez explicitement les preuves manquantes, obsolètes, secondaires ou incompatibles.
- Point de vérification
- Toute affirmation factuelle acceptée a un soutien visible qui dit ce que la réponse dit qu'elle dit.
Localisez l'incertitude et le contexte manquant
Demandez ce qui n'a pas été observé, ce qui pourrait changer le résultat, quelles hypothèses ont été ajoutées et quelle nouvelle preuve changerait la décision.
- Point de vérification
- La réponse énonce une limite utile au lieu de transformer l'incertitude en confiance.
Choisissez pour cette tâche et révélez l'identité en dernier
Enregistrer d'abord le résultat et les raisons. Ensuite, révéler l'identité du modèle, noter les corrections et expliquer pourquoi le résultat est ou n'est pas transférable au-delà de cette tâche.
- Point de vérification
- Le registre soutient une décision bornée sans devenir un classement universel des modèles.
Règles de décision
Définir clairement les limites.
- Si une affirmation conséquente requise manque de soutien, ne marquez pas la réponse comme répondant pleinement à la tâche.
- Si plusieurs réponses répondent aux critères, choisissez selon les besoins restants de la tâche - tels que la traçabilité ou la concision - et non selon la préférence de la marque.
- Si aucune réponse ne répond aux critères, publiez une conclusion de « pas de gagnant » et nommez les corrections ou le prochain test.
- Pour une utilisation à haut impact, exigez une revue par un expert du domaine même si la réponse passe cette liste de vérification.
Artifact réutilisable
Enregistrement de la revue des sorties de l'IA
Copiez le modèle dans vos notes, ou téléchargez un fichier Markdown et conservez-le avec les preuves de la tâche.
Aperçu du modèle
# Registre de revue de la sortie de l'IA
## Tâche et critères de réussite
- Tâche :
- Preuves requises :
- Contraintes de format :
- Incertitude acceptable :
- Échecs inacceptables :
## Revue de sortie aveugle
- Étiquette de sortie :
- Suivi des instructions : Répond / Partiel / Manque
- Réclamations conséquentes et support :
- Hypothèses non prises en charge :
- Incertitude ou manque de contexte :
- Utilisabilité pour cette tâche :
## Décision avant révélation du modèle
- Résultat : Répond / Partiel / Manque
- Accepter / Corriger / Refuser :
- Raison :
## Identité et limites
- Modèle et version :
- Conditions d'exécution :
- Corrections requises :
- Ce que ce résultat ne prouve pas :
- Prochaine preuve ou expérience :
Preuves liées
Examiner où cette méthode a été appliquée.
- Calcul du budget pour le cas revu
Montre comment plusieurs sorties correctes peuvent encore différer en termes d'auditabilité.
- Cas examiné en phase pilote
Affiche un résultat sans gagnant lorsque chaque sortie dépasse une limite de preuve.
- Cas d'incertitude de conversion Révisé
Montre comment l'incertitude causale change la décision d'acceptation.
- NIST AI 600-1 : Profil d'IA générative
Référence principale de gestion des risques pour l'évaluation contextuelle spécifique et la revue responsable.