Avant de commencer
Définir d'abord la limite d'exécution.
- Une seule tâche étroite avec des entrées représentatives et non sensibles.
- Deux ou trois variantes de modèle ou de requête qui peuvent fonctionner sous des conditions comparables.
- Critères de succès spécifiques à la tâche rédigés avant la révélation des sorties.
- Un réviseur humain nommé qui possède la conclusion finale.
Étape par étape
Passer d'une portée à un artefact vérifié.
Définir une tâche pratique
Écrivez le but, l'utilisateur cible, les contraintes, les preuves nécessaires, les modes d'échec inacceptables et ce qu'un résultat utilisable doit contenir. Gardez la tâche suffisamment étroite pour que les mêmes critères de revue s'appliquent à chaque sortie candidate.
- Point de vérification
- Un réviseur peut décider si une sortie passe sans savoir quel modèle l'a produite.
- Artifact
- Paquet de tâche versionné
Verrouiller les conditions d'exécution
Enregistrer le prompt complet, le fournisseur, l'identifiant exact du modèle, la date, la température, top-p, la limite de tokens, les outils et les fichiers contextuels. Indiquer tout comportement du fournisseur qui empêche la reproduction exacte.
- Point de vérification
- Un autre réviseur dispose d'informations suffisantes pour répéter l'exécution ou expliquer pourquoi la reproduction exacte est impossible.
- Artifact
- Manifeste d'exécution
Capturez les sorties brutes avant de les éditer
Stockez chaque réponse sous forme d'instantané immuable et attribuez une étiquette neutre. Gardez la sortie brute séparée des annotations, corrections, réécritures et copies de livraison afin que les preuves ne changent pas silencieusement après la revue.
- Point de vérification
- Le registre révèle exactement ce que chaque modèle a renvoyé avant qu'un humain ne le modifie.
- Artifact
- Instantanés de sortie étiquetés
Examiner chaque sortie selon un seul critère
Appliquez les mêmes critères spécifiques à la tâche à chaque candidat. Séparez la suivance des instructions, la correction des faits, la qualité des preuves, l'incertitude et l'utilisabilité. Reliez les affirmations factuelles conséquentes aux sources actuelles et indiquez ce que chaque source soutient.
- Point de vérification
- La fluidité, la correction, les preuves et l'adéquation à la tâche sont notées ou décrites séparément.
- Artifact
- Critère d'examen et registre des allégations
Publier une conclusion bornée
Révéler l'identité du modèle uniquement après la première évaluation. Indiquer quelle sortie correspond le mieux à cette tâche, quels correctifs sont nécessaires, ce qu'aucune sortie n'a accompli, qui a approuvé l'examen et quelles limites empêchent des conclusions plus larges.
- Point de vérification
- La conclusion aide à cette tâche sans devenir un classement permanent du modèle.
- Artifact
- Décision examinée
Définir la prochaine expérience
Enregistrer quel élément d'évidence manquant ou échec est le plus important, puis modifier une variable importante : prompt, contexte, version du modèle, entrée de récupération ou critère de revue. Conserver l'enregistrement original au lieu de le remplacer.
- Point de vérification
- La prochaine exécution peut apprendre quelque chose de spécifique plutôt que simplement produire plus de réponses.
- Artifact
- Prochaine vérification de l'hypothèse
Livraisons
Gardez le travail réutilisable et inspectable.
- Paquet de tâche versionné
- Manifeste d'exécution avec des identifiants de modèle et des paramètres exacts
- Fichiers de sortie bruts immuables
- Grille de notation spécifique à la tâche et registre des revendications
- Décision examinée avec limites
- Prochain essai à une variable
Limites des décisions
Ce que ce tutoriel ne prouve pas.
- Une petite comparaison contrôlée soutient une décision pour une seule tâche, pas un classement permanent du modèle.
- Les mises à jour du fournisseur, les outils, les instructions du système et le comportement d'exécution caché peuvent changer les résultats futurs.
- La revue aveugle réduit une source de biais de marque, mais ne supprime pas la subjectivité du réviseur ou les erreurs de critères.
- Une utilisation à haut impact nécessite une évaluation spécifique au domaine, une surveillance qualifiée et des contrôles plus stricts.
Registre des sources
Vérifier la guidance actuelle.
- NIST AI 600-1 : Profil d'IA générative
Référence de gestion des risques pour l'évaluation, la gouvernance, la mesure et la gestion spécifiques au contexte.
- Cas d'incertitude de conversion de RichBay
Un exemple publié contenant un paquet de tâche, des sorties capturées, un registre de preuves, un verdict borné et un enregistrement de revue.