Aller au contenu
richbay.ai
LaboratoiresÉtudes de casApprendreOutilsPour les équipes
richbay.ai

Apprendre en résolvant. Résolvez des problèmes pratiques, testez ce qui fonctionne, et transformez les preuves en méthodes, flux de travail et piles réutilisables.

Explorer

  • Laboratoires
  • Études de cas

Ressources

  • Apprendre
  • Outils

RichBay

  • Pour les équipes
  • À propos
  • Vie privée

© 2026 RichBay

RichBay.ai est indépendant et n'est pas affilié ou approuvé par les fournisseurs de modèles ou les entreprises mentionnées sur ce site.

Tutoriels · Flux d'évaluation

Exécutez une comparaison des sorties d'IA révisées

Définir une tâche, capturer les sorties contrôlées, examiner les affirmations par rapport aux preuves et publier un enregistrement de décision borné.

30 à 45 minutesIntermédiaireUtilisé chez RichBayExaminé 2026-09-05
← Tous les TutorielsCommencez par les étapes

Ce que vous produirez

Un enregistrement de comparaison versionné et une prochaine expérience clairement bornée.

Sur cette pageAvant de commencerÉtapesLivraisonsLimites des décisionsSources
Utilisé chez RichBay

RichBay utilise cette méthode pour construire ses défis publics aveugles et ses cas révisés. Les résultats s'appliquent au paquet de tâche publié et aux versions capturées, et non à chaque utilisation d'une famille de modèles.

Avant de commencer

Définir d'abord la limite d'exécution.

  • Une seule tâche étroite avec des entrées représentatives et non sensibles.
  • Deux ou trois variantes de modèle ou de requête qui peuvent fonctionner sous des conditions comparables.
  • Critères de succès spécifiques à la tâche rédigés avant la révélation des sorties.
  • Un réviseur humain nommé qui possède la conclusion finale.

Étape par étape

Passer d'une portée à un artefact vérifié.

01

Définir une tâche pratique

Écrivez le but, l'utilisateur cible, les contraintes, les preuves nécessaires, les modes d'échec inacceptables et ce qu'un résultat utilisable doit contenir. Gardez la tâche suffisamment étroite pour que les mêmes critères de revue s'appliquent à chaque sortie candidate.

Point de vérification
Un réviseur peut décider si une sortie passe sans savoir quel modèle l'a produite.
Artifact
Paquet de tâche versionné
02

Verrouiller les conditions d'exécution

Enregistrer le prompt complet, le fournisseur, l'identifiant exact du modèle, la date, la température, top-p, la limite de tokens, les outils et les fichiers contextuels. Indiquer tout comportement du fournisseur qui empêche la reproduction exacte.

Point de vérification
Un autre réviseur dispose d'informations suffisantes pour répéter l'exécution ou expliquer pourquoi la reproduction exacte est impossible.
Artifact
Manifeste d'exécution
03

Capturez les sorties brutes avant de les éditer

Stockez chaque réponse sous forme d'instantané immuable et attribuez une étiquette neutre. Gardez la sortie brute séparée des annotations, corrections, réécritures et copies de livraison afin que les preuves ne changent pas silencieusement après la revue.

Point de vérification
Le registre révèle exactement ce que chaque modèle a renvoyé avant qu'un humain ne le modifie.
Artifact
Instantanés de sortie étiquetés
04

Examiner chaque sortie selon un seul critère

Appliquez les mêmes critères spécifiques à la tâche à chaque candidat. Séparez la suivance des instructions, la correction des faits, la qualité des preuves, l'incertitude et l'utilisabilité. Reliez les affirmations factuelles conséquentes aux sources actuelles et indiquez ce que chaque source soutient.

Point de vérification
La fluidité, la correction, les preuves et l'adéquation à la tâche sont notées ou décrites séparément.
Artifact
Critère d'examen et registre des allégations
05

Publier une conclusion bornée

Révéler l'identité du modèle uniquement après la première évaluation. Indiquer quelle sortie correspond le mieux à cette tâche, quels correctifs sont nécessaires, ce qu'aucune sortie n'a accompli, qui a approuvé l'examen et quelles limites empêchent des conclusions plus larges.

Point de vérification
La conclusion aide à cette tâche sans devenir un classement permanent du modèle.
Artifact
Décision examinée
06

Définir la prochaine expérience

Enregistrer quel élément d'évidence manquant ou échec est le plus important, puis modifier une variable importante : prompt, contexte, version du modèle, entrée de récupération ou critère de revue. Conserver l'enregistrement original au lieu de le remplacer.

Point de vérification
La prochaine exécution peut apprendre quelque chose de spécifique plutôt que simplement produire plus de réponses.
Artifact
Prochaine vérification de l'hypothèse

Livraisons

Gardez le travail réutilisable et inspectable.

  1. Paquet de tâche versionné
  2. Manifeste d'exécution avec des identifiants de modèle et des paramètres exacts
  3. Fichiers de sortie bruts immuables
  4. Grille de notation spécifique à la tâche et registre des revendications
  5. Décision examinée avec limites
  6. Prochain essai à une variable

Limites des décisions

Ce que ce tutoriel ne prouve pas.

  • Une petite comparaison contrôlée soutient une décision pour une seule tâche, pas un classement permanent du modèle.
  • Les mises à jour du fournisseur, les outils, les instructions du système et le comportement d'exécution caché peuvent changer les résultats futurs.
  • La revue aveugle réduit une source de biais de marque, mais ne supprime pas la subjectivité du réviseur ou les erreurs de critères.
  • Une utilisation à haut impact nécessite une évaluation spécifique au domaine, une surveillance qualifiée et des contrôles plus stricts.

Registre des sources

Vérifier la guidance actuelle.

  1. NIST AI 600-1 : Profil d'IA générative

    Référence de gestion des risques pour l'évaluation, la gouvernance, la mesure et la gestion spécifiques au contexte.

  2. Cas d'incertitude de conversion de RichBay

    Un exemple publié contenant un paquet de tâche, des sorties capturées, un registre de preuves, un verdict borné et un enregistrement de revue.

Continuer la boucle

Connectez le tutoriel aux preuves et outils.

Exécutez le Défi exempleExaminer le dossier examinéUtilisez la pile d'évaluation