Aller au contenu
richbay.ai
LaboratoiresÉtudes de casApprendreOutilsPour les équipes
richbay.ai

Apprendre en résolvant. Résolvez des problèmes pratiques, testez ce qui fonctionne, et transformez les preuves en méthodes, flux de travail et piles réutilisables.

Explorer

  • Laboratoires
  • Études de cas

Ressources

  • Apprendre
  • Outils

RichBay

  • Pour les équipes
  • À propos
  • Vie privée

© 2026 RichBay

RichBay.ai est indépendant et n'est pas affilié ou approuvé par les fournisseurs de modèles ou les entreprises mentionnées sur ce site.

Expérience · Comparaison des sorties contrôlées

Ce résultat de conversion prouve-t-il une amélioration ?

Maintenir la tâche et les paramètres fixes, varier le modèle et comparer comment chaque modèle gère l'incertitude causale.

Tâche Maintenir le prompt et les paramètres fixesAction Changer les exécutions de modèles comparésRésultat Examiner les limites des changements et de la conclusion

Variable contrôlée : Sortie du modèle ; les paramètres de prompt et de génération restent fixes

Configuration de l'expérience

Maintenir la tâche fixe. Changer le modèle exécuté.

Traduction de lecture

La version A a converti 8 visiteurs sur 100. La version B a converti 14 visiteurs sur 100 durant les sept jours suivants. Aucun fractionnement aléatoire n'a été utilisé, et les sources de trafic diffèrent entre les semaines. Cela prouve-t-il que B est meilleur ? Donnez une recommandation de décision et identifiez l'incertitude.

Prompt original (anglais)

Version A converted 8 of 100 visitors. Version B converted 14 of 100 visitors during the following seven days. No randomized split was used, and traffic sources differed between the weeks. Does this prove B is better? Give a decision recommendation and identify the uncertainty.

Les prompts et les sorties capturées conservent leur langue d’origine pour permettre la reproduction. Les traductions facilitent la lecture ; elles ne constituent pas de nouvelles exécutions.

Variable modifiée
Identifiant de modèle résolu
Conditions fixes
Prompt · max 2000 jetons · température 0.2 · top-p 0.9
Ensemble de preuves
Trois sorties capturées à partir d'un seul lot de génération versionné

Changer la variable

Sélectionnez deux exécutions capturées à comparer.

Essayez plus d'une paire. La sortie et la revue spécifique à la tâche s'ajoutent.

Exécution A

OpenAI

Répond aux exigences

openai/gpt-oss-20b

No – the data do not prove that Version B is superior.

Why not?

  • The two weeks were not randomized; traffic sources (e.g., referral, paid, organic) differed, so any conversion difference could be due to those sources rather than the version.
  • The sample size is small (100 visitors per week), so the observed 8 % vs. 14 % difference could be due to random variation.
  • External factors (seasonality, day‑of‑week, marketing campaigns) could have changed between the weeks.

Decision recommendation
Run a properly randomized A/B test (or multivariate test) with a larger, balanced sample and control for traffic source. Only then can you statistically assess whether B truly outperforms A.

Uncertainty

  • Confounding by traffic source and other time‑varying factors.
  • Statistical uncertainty due to the small sample size.
  • Potential interaction with other variables (device, location, etc.) that were not controlled.
Examiner la revue de cette exécution
Points forts
  • Nomme l'incertitude statistique et la confusion
  • Recommande un test aléatoire équilibré
Risques
  • Ajoute des facteurs possibles non observés dans le paquet

Meilleure utilisation : Un mémo de décision qui doit expliquer l'incertitude.

Exécution B

Qwen

Répond aux exigences

qwen/qwen3-30b-a3b-fp8

No, this does not prove B is better. The lack of a randomized split and differing traffic sources introduce confounding variables. Recommendation: Conduct a controlled experiment with random assignment. Uncertainty: Results may be influenced by external factors.

Examiner la revue de cette exécution
Points forts
  • Rejette directement la preuve
  • Identifie les biais et l'affectation aléatoire
Risques
  • Ne mentionne pas explicitement l'échantillon petit

Meilleure utilisation : Une réponse exécutive concise.

Conclusion bornée

Indiquez uniquement ce que cet ensemble d'exécution soutient.

Les trois réponses rejettent une conclusion causale. Elles diffèrent dans la clarté avec laquelle elles identifient l'incertitude de l'échantillon et les biais hebdomadaires.

Objectif d'évaluation

Les réponses fortes disent que l'observation ne prouve pas la causalité, identifient les petits échantillons et les confusions temporelles ou de trafic, et recommandent un test aléatoire simultané avant un déploiement durable.

Méthode de comparaison réutilisable
  1. Séparer les taux observés de la causalité.
  2. Nom d'allocation non aléatoire et de changement des sources de trafic.
  3. Recommander une comparaison aléatoire concurrente.

Trois sorties capturées sous une seule requête et un ensemble de paramètres ; examinées Aug 27, 2026. Cet essai décrit uniquement ces exécutions et n'est pas un classement global des modèles.

Construisez la prochaine étape

Transformez ce résultat en une méthode réutilisable.

Une limite de conclusion pour les comparaisons de conversions séquentielles.

Examiner le dossier examinéApprenez la méthode de révision