Aller au contenu
richbay.ai
LaboratoiresÉtudes de casApprendreOutilsPour les équipes
richbay.ai

Apprendre en résolvant. Résolvez des problèmes pratiques, testez ce qui fonctionne, et transformez les preuves en méthodes, flux de travail et piles réutilisables.

Explorer

  • Laboratoires
  • Études de cas

Ressources

  • Apprendre
  • Outils

RichBay

  • Pour les équipes
  • À propos
  • Vie privée

© 2026 RichBay

RichBay.ai est indépendant et n'est pas affilié ou approuvé par les fournisseurs de modèles ou les entreprises mentionnées sur ce site.

Rapport d'expérience

Ce résultat de conversion prouve-t-il une amélioration ?

Un changement de 8 % à 14 % semble convaincant, mais des semaines consécutives avec un trafic différent ne peuvent isoler l'effet de la version de la page.

ExaminéPubliéAvis éditorial de RichBayAug 27, 2026challenge-conversion-uncertainty-r1

Décision de RichBay

Les sorties 1 et 2 satisfont aux critères spécifiques à la tâche. La sortie 3 identifie l'incertitude mais nécessite un suivi aléatoire concret parallèle.

Cette conclusion s'applique uniquement à la tâche capturée, aux sorties et aux critères d'examen présentés dans cet enregistrement.

Sur cette page

  1. Tâche
  2. Prompt complet
  3. Critères d'évaluation
  4. Comparaison des sorties
  5. Registre des preuves
  6. Limitations
  7. Point clé réutilisable

01 · Tâche

Objectif et contraintes

Testez comment trois sorties de modèle gèrent une comparaison de conversion qui ne peut pas isoler la causalité.

  • Gardez le paquet de tâche et les paramètres de génération fixes tout en faisant varier le modèle.
  • Séparer les taux observés d'une affirmation de causalité.
  • Exiger une prochaine expérience capable de réduire l'incertitude déclarée.

02 · Entrée de reproduction

Prompt complet

Traduction de lecture

La version A a converti 8 visiteurs sur 100. La version B a converti 14 visiteurs sur 100 durant les sept jours suivants. Aucun fractionnement aléatoire n'a été utilisé, et les sources de trafic diffèrent entre les semaines. Cela prouve-t-il que B est meilleur ? Donnez une recommandation de décision et identifiez l'incertitude.

Prompt original (anglais)

Version A converted 8 of 100 visitors. Version B converted 14 of 100 visitors during the following seven days. No randomized split was used, and traffic sources differed between the weeks. Does this prove B is better? Give a decision recommendation and identify the uncertainty.

Les prompts et les sorties capturées conservent leur langue d’origine pour permettre la reproduction. Les traductions facilitent la lecture ; elles ne constituent pas de nouvelles exécutions.

03 · Portée d'évaluation

Critères utilisés pour cette tâche

Les réponses fortes disent que l'observation ne prouve pas la causalité, identifient les petits échantillons et les confusions temporelles ou de trafic, et recommandent un test aléatoire simultané avant un déploiement durable.

  1. Séparer les taux observés de la causalité.
  2. Nom d'allocation non aléatoire et de changement des sources de trafic.
  3. Recommander une comparaison aléatoire concurrente.

04 · Instantanés immuables

Sorties capturées et revue

Commencez par le résumé de comparaison. Ouvrez un instantané uniquement lorsque vous avez besoin de la sortie complète, d'exécuter les métadonnées et d'une revue éditoriale.

Sortie 1Répond aux exigences

OpenAI

openai/gpt-oss-20b

Force
Nomme l'incertitude statistique et la confusion
Limite de revue
Ajoute des facteurs possibles non observés dans le paquet
Ouvrir l'instantané
Sortie 2Répond aux exigences

Qwen

qwen/qwen3-30b-a3b-fp8

Force
Rejette directement la preuve
Limite de revue
Ne mentionne pas explicitement l'échantillon petit
Ouvrir l'instantané
Sortie 3Répond partiellement

Mistral AI

mistralai/mistral-small-3.1-24b-v2

Force
Rejette la preuve et nomme les deux défauts de conception déclarés
Limite de revue
S'arrête avant de recommander un test aléatoire simultané
Ouvrir l'instantané
Sortie 1Sortie capturée brute · réduite par défautOpenAI · openai/gpt-oss-20b
ID de l'instantané
output-conversion-uncertainty-1
Révision du cas
challenge-conversion-uncertainty-r1
Hachage du contenu
sha256:4bbecf77709dc31d3e3ac51f634260d3d23a73fd0040c16e9a41ef4bac0c5ee9
ID de demande d'exécution
chatcmpl-ea9b73439deb4680a50bb08e6f53cc27
Capturé à
Aug 27, 2026, 5:32 AM UTC
Développeur du modèle
OpenAI
Fournisseur d'exécution
Cloudflare Workers AI
Identifiant du modèle
@cf/openai/gpt-oss-20b
Licence du modèle
Apache-2.0
Paramètres
nombre maximum de jetons 2000; température 0.2; top-p 0.9
Base d'utilisation de la sortie
Capturé pour l'évaluation de RichBay conformément aux conditions d'exécution et de modèle applicables. Le licence du modèle n'est pas présentée comme une licence pour la sortie.

Sortie brute

No – the data do not prove that Version B is superior.

Why not?

  • The two weeks were not randomized; traffic sources (e.g., referral, paid, organic) differed, so any conversion difference could be due to those sources rather than the version.
  • The sample size is small (100 visitors per week), so the observed 8 % vs. 14 % difference could be due to random variation.
  • External factors (seasonality, day‑of‑week, marketing campaigns) could have changed between the weeks.

Decision recommendation
Run a properly randomized A/B test (or multivariate test) with a larger, balanced sample and control for traffic source. Only then can you statistically assess whether B truly outperforms A.

Uncertainty

  • Confounding by traffic source and other time‑varying factors.
  • Statistical uncertainty due to the small sample size.
  • Potential interaction with other variables (device, location, etc.) that were not controlled.

Répond aux exigences

Forces : Nomme l'incertitude statistique et la confusion Recommande un test aléatoire équilibré

Risques : Ajoute des facteurs possibles non observés dans le paquet

Meilleure utilisation : Un mémo de décision qui doit expliquer l'incertitude.

Sortie 2Sortie capturée brute · réduite par défautQwen · qwen/qwen3-30b-a3b-fp8
ID de l'instantané
output-conversion-uncertainty-2
Révision du cas
challenge-conversion-uncertainty-r1
Hachage du contenu
sha256:bf14ddfe43384e1f7bb2d2e9a8cd0ba9bc55b4e178cdcc6da88086f88f3e0e83
ID de demande d'exécution
chatcmpl-5c44a5bc-2908-4aca-a2c6-155c3e874803
Capturé à
Aug 27, 2026, 5:32 AM UTC
Développeur du modèle
Qwen
Fournisseur d'exécution
Cloudflare Workers AI
Identifiant du modèle
@cf/qwen/qwen3-30b-a3b-fp8
Licence du modèle
Apache-2.0
Paramètres
nombre maximum de jetons 2000; température 0.2; top-p 0.9
Base d'utilisation de la sortie
Capturé pour l'évaluation de RichBay conformément aux conditions d'exécution et de modèle applicables. Le licence du modèle n'est pas présentée comme une licence pour la sortie.

Sortie brute

No, this does not prove B is better. The lack of a randomized split and differing traffic sources introduce confounding variables. Recommendation: Conduct a controlled experiment with random assignment. Uncertainty: Results may be influenced by external factors.

Répond aux exigences

Forces : Rejette directement la preuve Identifie les biais et l'affectation aléatoire

Risques : Ne mentionne pas explicitement l'échantillon petit

Meilleure utilisation : Une réponse exécutive concise.

Sortie 3Sortie capturée brute · réduite par défautMistral AI · mistralai/mistral-small-3.1-24b-v2
ID de l'instantané
output-conversion-uncertainty-3
Révision du cas
challenge-conversion-uncertainty-r1
Hachage du contenu
sha256:c3d1c3f97980ddebe52082fb0f8d25e06b7254ce35abc3688f52e6306d722298
ID de demande d'exécution
chatcmpl-425443ad-33dd-45af-a372-01c465bdd1bf
Capturé à
Aug 27, 2026, 5:32 AM UTC
Développeur du modèle
Mistral AI
Fournisseur d'exécution
Cloudflare Workers AI
Identifiant du modèle
@cf/mistralai/mistral-small-3.1-24b-v2
Licence du modèle
Apache-2.0
Paramètres
nombre maximum de jetons 2000; température 0.2; top-p 0.9
Base d'utilisation de la sortie
Capturé pour l'évaluation de RichBay conformément aux conditions d'exécution et de modèle applicables. Le licence du modèle n'est pas présentée comme une licence pour la sortie.

Sortie brute

No, this does not prove that Version B is better. The decision recommendation is to not conclude that Version B is better based on this data alone.

Uncertainty:

  • No randomized split was used, introducing potential bias.
  • Traffic sources differed between the weeks, which could affect conversion rates.
  • The sample size is small, making the results less reliable.

Répond partiellement

Forces : Rejette la preuve et nomme les deux défauts de conception déclarés

Risques : S'arrête avant de recommander un test aléatoire simultané «Petit» est affirmé sans quantifier l'incertitude

Meilleure utilisation : Une conclusion prudente nécessitant un prochain test concret.

05 · Registre des affirmations

Revendications, sources, preuves et limites

Revendication 1

Le taux de conversion observé est plus élevé dans le deuxième échantillon.

Source
Paquet de tâche publié
Support
Le paquet rapporte un taux de 8 % pour une période séquentielle et de 14 % pour une autre.
Limite
Une différence dans les taux observés ne permet pas d'identifier ce qui a causé la différence.

Revendication 2

Le paquet ne prouve pas que la version de la page a causé l'augmentation.

Source
Conception de la tâche et revue des sorties capturées
Support
Les échantillons ont eu lieu dans différentes semaines avec un trafic différent et sans affectation aléatoire simultanée.
Limite
Le résultat reste un signal utile pour un test ultérieur mieux contrôlé.

06 · Conclusion de revue

Ce que ces preuves soutiennent

Un taux plus élevé observé est une preuve d'une différence entre ces échantillons, mais pas une preuve que la version l'a causé.

Limitations connues

  • Aucun intervalle de confiance ou données au niveau des visiteurs n'est fourni.
  • Les deux échantillons sont séquentiels plutôt que simultanés et randomisés.
  • Changer le modèle est la seule variable de sortie contrôlée dans cette comparaison RichBay.

Point clé réutilisable

Utilisez la liste de vérification des limites de causalité et spécifiez un suivi aléatoire simultané.

Utilisez la méthode de soutien

Sur cette page

  1. Tâche
  2. Prompt complet
  3. Critères d'évaluation
  4. Comparaison des sorties
  5. Registre des preuves
  6. Limitations
  7. Point clé réutilisable

Enregistrement de publication

Examiné et versionné

Statut
Examiné · Publié
Réviseur responsable
Avis éditorial de RichBay
Révision
challenge-conversion-uncertainty-r1
Publié
Aug 27, 2026
Examen dû
Nov 25, 2026
Essayez la zone de jeuUtilisez la méthode

Un changement matériel dans une sortie ou une entrée de preuve nécessite une nouvelle révision ; ce registre n'est pas remplacé silencieusement.