Antes de comenzar
Establezca primero el límite de operación.
- Una tarea estrecha con entradas representativas y no sensibles.
- Dos o tres variantes de modelo o prompt que pueden ejecutarse bajo condiciones comparables.
- Criterios de éxito específicos de la tarea escritos antes de revelar las salidas.
- Un revisor humano designado que posee la conclusión final.
Paso a paso
Moverse del alcance a un artefacto verificado.
Definir una tarea práctica
Escribe el objetivo, el usuario previsto, las restricciones, la evidencia requerida, los modos de falla inaceptables y lo que debe contener un resultado utilizable. Mantén la tarea lo suficientemente estrecha como para que los mismos criterios de revisión se apliquen a cada salida candidata.
- Punto de control
- Un revisor puede decidir si un resultado pasa sin saber qué modelo lo produjo.
- Artificio
- Paquete de tarea versionado
Congela las condiciones de ejecución
Registrar el prompt completo, proveedor, identificador exacto del modelo, fecha, temperatura, top-p, límite de tokens, herramientas y archivos contextuales. Indicar cualquier comportamiento del proveedor que impida la reproducción exacta.
- Punto de control
- Otro revisor tiene suficiente información para repetir la ejecución o explicar por qué la reproducción exacta es imposible.
- Artificio
- Manifesto de ejecución
Capture salidas sin editar
Almacene cada respuesta como una instantánea inmutable y asigne una etiqueta neutral. Mantenga la salida cruda separada de anotaciones, correcciones, reescrituras y copia de entrega para que la evidencia no cambie silenciosamente después de la revisión.
- Punto de control
- El registro expone exactamente lo que devolvió cada modelo antes de que un humano lo cambiara.
- Artificio
- Instantáneas de salida etiquetadas
Revisar cada salida contra un único criterio
Aplicar los mismos criterios específicos de tarea a cada candidato. Separar el seguimiento de instrucciones, la corrección factual, la calidad de la evidencia, la incertidumbre y la usabilidad. Conectar las afirmaciones consecuentes con fuentes actuales y señalar qué soporta cada fuente.
- Punto de control
- Fluidez, corrección, evidencia y ajuste a la tarea se puntúan o describen por separado.
- Artificio
- Criterio de revisión y registro de afirmaciones
Publicar una conclusión acotada
Revelar la identidad del modelo solo después de la primera decisión. Indique qué salida se ajusta mejor a esta tarea, qué correcciones son necesarias, qué salida no logró, quién aprobó la revisión y qué limitaciones impiden conclusiones más amplias.
- Punto de control
- La conclusión ayuda con esta tarea sin convertirse en un ranking permanente del modelo.
- Artificio
- Registro de decisión revisada
Definir el siguiente experimento
Registrar qué evidencia faltante o fallo es más importante, luego cambiar una variable importante: prompt, contexto, versión del modelo, entrada de recuperación o criterio de revisión. Conservar el registro original en lugar de sobrescribirlo.
- Punto de control
- La siguiente ejecución puede enseñar algo específico en lugar de simplemente producir más respuestas.
- Artificio
- Siguiente, prueba la hipótesis
Entregables
Mantén el trabajo reutilizable e inspectable.
- Paquete de tarea versionado
- Manifesto de ejecución con identificadores de modelo exactos y parámetros
- Instantáneas de salida cruda inmutables
- Rúbrica específica de tarea y libro de reclamaciones
- Registro de decisión revisada con limitaciones
- Siguiente experimento de una variable
Límites de decisión
¿Qué no demuestra este tutorial.
- Una pequeña comparación controlada apoya una decisión para una tarea específica, no una clasificación permanente del modelo.
- Las actualizaciones del proveedor, herramientas, instrucciones del sistema y el comportamiento oculto del entorno de ejecución pueden cambiar los resultados posteriores.
- La revisión ciega reduce una fuente de sesgo de marca, pero no elimina la subjetividad del revisor ni los errores en el criterio.
- El uso de alto impacto requiere evaluación específica del dominio, supervisión calificada y controles más fuertes.
Registro de fuentes
Verificar la guía primaria actual.
- NIST AI 600-1: Perfil de IA Generativa
Referencia de gestión de riesgos para evaluación específica del contexto, gobernanza, medición y gestión.
- Caso de incertidumbre de conversión de RichBay
Un ejemplo publicado que contiene un paquete de tarea, salidas capturadas, libro de evidencia, veredicto acotado y registro de revisión.