01 · Tâche
Objectif et contraintes
Testez comment trois sorties de modèle gèrent une comparaison de conversion qui ne peut pas isoler la causalité.
- Gardez le paquet de tâche et les paramètres de génération fixes tout en faisant varier le modèle.
- Séparer les taux observés d'une affirmation de causalité.
- Exiger une prochaine expérience capable de réduire l'incertitude déclarée.
02 · Entrée de reproduction
Prompt complet
Traduction de lecture
La version A a converti 8 visiteurs sur 100. La version B a converti 14 visiteurs sur 100 durant les sept jours suivants. Aucun fractionnement aléatoire n'a été utilisé, et les sources de trafic diffèrent entre les semaines. Cela prouve-t-il que B est meilleur ? Donnez une recommandation de décision et identifiez l'incertitude.
Prompt original (anglais)
Version A converted 8 of 100 visitors. Version B converted 14 of 100 visitors during the following seven days. No randomized split was used, and traffic sources differed between the weeks. Does this prove B is better? Give a decision recommendation and identify the uncertainty.
Les prompts et les sorties capturées conservent leur langue d’origine pour permettre la reproduction. Les traductions facilitent la lecture ; elles ne constituent pas de nouvelles exécutions.
03 · Portée d'évaluation
Critères utilisés pour cette tâche
Les réponses fortes disent que l'observation ne prouve pas la causalité, identifient les petits échantillons et les confusions temporelles ou de trafic, et recommandent un test aléatoire simultané avant un déploiement durable.
- Séparer les taux observés de la causalité.
- Nom d'allocation non aléatoire et de changement des sources de trafic.
- Recommander une comparaison aléatoire concurrente.
04 · Instantanés immuables
Sorties capturées et revue
Commencez par le résumé de comparaison. Ouvrez un instantané uniquement lorsque vous avez besoin de la sortie complète, d'exécuter les métadonnées et d'une revue éditoriale.
OpenAI
openai/gpt-oss-20b
- Force
- Nomme l'incertitude statistique et la confusion
- Limite de revue
- Ajoute des facteurs possibles non observés dans le paquet
Qwen
qwen/qwen3-30b-a3b-fp8
- Force
- Rejette directement la preuve
- Limite de revue
- Ne mentionne pas explicitement l'échantillon petit
Mistral AI
mistralai/mistral-small-3.1-24b-v2
- Force
- Rejette la preuve et nomme les deux défauts de conception déclarés
- Limite de revue
- S'arrête avant de recommander un test aléatoire simultané
Sortie 1Sortie capturée brute · réduite par défautOpenAI · openai/gpt-oss-20b
Sortie brute
No – the data do not prove that Version B is superior.
Why not?
- The two weeks were not randomized; traffic sources (e.g., referral, paid, organic) differed, so any conversion difference could be due to those sources rather than the version.
- The sample size is small (100 visitors per week), so the observed 8 % vs. 14 % difference could be due to random variation.
- External factors (seasonality, day‑of‑week, marketing campaigns) could have changed between the weeks.
Decision recommendation
Run a properly randomized A/B test (or multivariate test) with a larger, balanced sample and control for traffic source. Only then can you statistically assess whether B truly outperforms A.
Uncertainty
- Confounding by traffic source and other time‑varying factors.
- Statistical uncertainty due to the small sample size.
- Potential interaction with other variables (device, location, etc.) that were not controlled.
Répond aux exigences
Forces : Nomme l'incertitude statistique et la confusion Recommande un test aléatoire équilibré
Risques : Ajoute des facteurs possibles non observés dans le paquet
Meilleure utilisation : Un mémo de décision qui doit expliquer l'incertitude.
Sortie 2Sortie capturée brute · réduite par défautQwen · qwen/qwen3-30b-a3b-fp8
Sortie brute
No, this does not prove B is better. The lack of a randomized split and differing traffic sources introduce confounding variables. Recommendation: Conduct a controlled experiment with random assignment. Uncertainty: Results may be influenced by external factors.
Répond aux exigences
Forces : Rejette directement la preuve Identifie les biais et l'affectation aléatoire
Risques : Ne mentionne pas explicitement l'échantillon petit
Meilleure utilisation : Une réponse exécutive concise.
Sortie 3Sortie capturée brute · réduite par défautMistral AI · mistralai/mistral-small-3.1-24b-v2
Sortie brute
No, this does not prove that Version B is better. The decision recommendation is to not conclude that Version B is better based on this data alone.
Uncertainty:
- No randomized split was used, introducing potential bias.
- Traffic sources differed between the weeks, which could affect conversion rates.
- The sample size is small, making the results less reliable.
Répond partiellement
Forces : Rejette la preuve et nomme les deux défauts de conception déclarés
Risques : S'arrête avant de recommander un test aléatoire simultané «Petit» est affirmé sans quantifier l'incertitude
Meilleure utilisation : Une conclusion prudente nécessitant un prochain test concret.
05 · Registre des affirmations
Revendications, sources, preuves et limites
Revendication 1
Le taux de conversion observé est plus élevé dans le deuxième échantillon.
- Source
- Paquet de tâche publié
- Support
- Le paquet rapporte un taux de 8 % pour une période séquentielle et de 14 % pour une autre.
- Limite
- Une différence dans les taux observés ne permet pas d'identifier ce qui a causé la différence.
Revendication 2
Le paquet ne prouve pas que la version de la page a causé l'augmentation.
- Source
- Conception de la tâche et revue des sorties capturées
- Support
- Les échantillons ont eu lieu dans différentes semaines avec un trafic différent et sans affectation aléatoire simultanée.
- Limite
- Le résultat reste un signal utile pour un test ultérieur mieux contrôlé.
06 · Conclusion de revue
Ce que ces preuves soutiennent
Un taux plus élevé observé est une preuve d'une différence entre ces échantillons, mais pas une preuve que la version l'a causé.
Limitations connues
- Aucun intervalle de confiance ou données au niveau des visiteurs n'est fourni.
- Les deux échantillons sont séquentiels plutôt que simultanés et randomisés.
- Changer le modèle est la seule variable de sortie contrôlée dans cette comparaison RichBay.
Point clé réutilisable
Utilisez la liste de vérification des limites de causalité et spécifiez un suivi aléatoire simultané.
Utilisez la méthode de soutien