Aller au contenu
richbay.ai
LaboratoiresÉtudes de casApprendreOutilsPour les équipes
richbay.ai

Apprendre en résolvant. Résolvez des problèmes pratiques, testez ce qui fonctionne, et transformez les preuves en méthodes, flux de travail et piles réutilisables.

Explorer

  • Laboratoires
  • Études de cas

Ressources

  • Apprendre
  • Outils

RichBay

  • Pour les équipes
  • À propos
  • Vie privée

© 2026 RichBay

RichBay.ai est indépendant et n'est pas affilié ou approuvé par les fournisseurs de modèles ou les entreprises mentionnées sur ce site.

Enregistrement des décisions

Souhaitez-vous élargir ce pilote ?

Des chiffres de pilote rares tentent des étiquettes confiantes. Ce cas montre comment une interprétation plausible devient non étayée lorsqu'aucun référentiel n'existe.

ExaminéPubliéAvis éditorial de RichBayAug 27, 2026challenge-pilot-evidence-boundary-r1

Décision de RichBay

Aucune sortie capturée ne répond pleinement à la tâche : chacune ajoute une étiquette non prise en charge, omet une décision requise ou introduit une condition non mentionnée.

Cette conclusion s'applique uniquement à la tâche capturée, aux sorties et aux critères d'examen présentés dans cet enregistrement.

Sur cette page

  1. Tâche
  2. Prompt complet
  3. Critères d'évaluation
  4. Comparaison des sorties
  5. Registre des preuves
  6. Limitations
  7. Point clé réutilisable

01 · Tâche

Objectif et contraintes

Décidez si un petit pilote soutient l'expansion tout en maintenant les observations séparées de l'inférence.

  • Traitez les comptes du paquet comme des observations, et non comme un échantillon représentatif de tous les invités.
  • Ne pas inventer une norme de succès ou un seuil de décision.
  • Recommander une étape suivante de collecte d'évidence bornée.

02 · Entrée de reproduction

Prompt complet

Traduction de lecture

Dossier de preuves : Un bêta a 48 utilisateurs invités, 18 utilisateurs actifs hebdomadaires et sept entretiens terminés. Cinq interviewés ont demandé l'export CSV. Le pilote a duré trois semaines, donc il n'y a plus de preuve de rétention à long terme. Recommandez si le pilote doit être élargi, mis en pause ou arrêté. Séparez les observations des inférences et nommez la prochaine preuve à collecter.

Prompt original (anglais)

Evidence packet: A beta has 48 invited users, 18 weekly active users, and seven completed interviews. Five interviewees requested CSV export. The pilot has run for three weeks, so there is no longer-term retention evidence. Recommend whether to expand, pause, or stop the pilot. Separate observations from inference and name the next evidence to collect.

Les prompts et les sorties capturées conservent leur langue d’origine pour permettre la reproduction. Les traductions facilitent la lecture ; elles ne constituent pas de nouvelles exécutions.

03 · Portée d'évaluation

Critères utilisés pour cette tâche

Les réponses fortes distinguent les comptages observés des inférences, évitent de généraliser cinq entretiens à tous les utilisateurs, et recommandent un prochain pas borné avec des preuves de rétention et d'utilisation.

  1. Séparer les observations de l'inférence.
  2. Ne pas traiter cinq entretiens comme représentatifs de 48 invités.
  3. Demandez des preuves de rétention et de comportement avant une expansion large.

04 · Instantanés immuables

Sorties capturées et revue

Commencez par le résumé de comparaison. Ouvrez un instantané uniquement lorsque vous avez besoin de la sortie complète, d'exécuter les métadonnées et d'une revue éditoriale.

Sortie 1Répond partiellement

OpenAI

openai/gpt-oss-20b

Force
Sépare clairement les observations et les inférences
Limite de revue
Activité d'appel « modeste » sans référence
Ouvrir l'instantané
Sortie 2Répond partiellement

Qwen

qwen/qwen3-30b-a3b-fp8

Force
Garde les observations séparées
Limite de revue
Étiquette d'engagement « faible » sans objectif ou comparaison
Ouvrir l'instantané
Sortie 3Répond partiellement

Mistral AI

mistralai/mistral-small-3.1-24b-v2

Force
Évite les revendications exagérées
Limite de revue
Ne choisit pas d'élargir, de suspendre ou d'arrêter comme demandé
Ouvrir l'instantané
Sortie 1Sortie capturée brute · réduite par défautOpenAI · openai/gpt-oss-20b
ID de l'instantané
output-pilot-evidence-boundary-1
Révision du cas
challenge-pilot-evidence-boundary-r1
Hachage du contenu
sha256:0c5239bc5151b086f27e0eaa65fb748e8f5958754df89fe63ce2769d21184a10
ID de demande d'exécution
chatcmpl-a35bdc9152824768acb77fd97765c1ce
Capturé à
Aug 27, 2026, 5:31 AM UTC
Développeur du modèle
OpenAI
Fournisseur d'exécution
Cloudflare Workers AI
Identifiant du modèle
@cf/openai/gpt-oss-20b
Licence du modèle
Apache-2.0
Paramètres
nombre maximum de jetons 2000; température 0.2; top-p 0.9
Base d'utilisation de la sortie
Capturé pour l'évaluation de RichBay conformément aux conditions d'exécution et de modèle applicables. Le licence du modèle n'est pas présentée comme une licence pour la sortie.

Sortie brute

Observations

  • 48 users were invited to the beta.
  • 18 users (37.5 %) are active on a weekly basis.
  • 7 users (14.6 %) completed an interview.
  • 5 of those interviewees (71 %) requested a CSV export.
  • The pilot has run for only three weeks; no data exist on retention beyond that period.

Inference

  • The active‑user rate is modest, and the interview‑completion rate is low relative to the invitation pool.
  • The high proportion of interviewees who asked for CSV export suggests that the feature is useful for a subset of engaged users.
  • Without longer‑term retention data, it is unclear whether the pilot is gaining traction or merely attracting a small, highly motivated group.

Recommendation
Pause the pilot for now. Extend the trial to at least 6–8 weeks to capture retention and usage depth, and gather more qualitative feedback from both active and inactive participants.

Next evidence to collect

  1. Retention metrics (e.g., % of users still active after 4, 6, and 8 weeks).
  2. Frequency and depth of feature usage (e.g., number of CSV exports per user, time spent).
  3. Qualitative feedback from users who did not become active or who did not complete interviews.
  4. Conversion data (if applicable) to see whether active users move toward paid plans or higher engagement.

Répond partiellement

Forces : Sépare clairement les observations et les inférences Nomme la rétention et les preuves d'utilisateurs inactifs

Risques : Activité d'appel « modeste » sans référence Ajoute une durée de 6 à 8 semaines non fournie par le paquet

Meilleure utilisation : Un plan de recherche détaillé après suppression des benchmarks non soutenus.

Sortie 2Sortie capturée brute · réduite par défautQwen · qwen/qwen3-30b-a3b-fp8
ID de l'instantané
output-pilot-evidence-boundary-2
Révision du cas
challenge-pilot-evidence-boundary-r1
Hachage du contenu
sha256:c295a47b9a8080928bb935b55d191c2dcfd00ec09bb14c1a8994a78f12863120
ID de demande d'exécution
chatcmpl-e4352df2-573d-45dc-8f82-f03de0f96653
Capturé à
Aug 27, 2026, 5:31 AM UTC
Développeur du modèle
Qwen
Fournisseur d'exécution
Cloudflare Workers AI
Identifiant du modèle
@cf/qwen/qwen3-30b-a3b-fp8
Licence du modèle
Apache-2.0
Paramètres
nombre maximum de jetons 2000; température 0.2; top-p 0.9
Base d'utilisation de la sortie
Capturé pour l'évaluation de RichBay conformément aux conditions d'exécution et de modèle applicables. Le licence du modèle n'est pas présentée comme une licence pour la sortie.

Sortie brute

Observations:

  • 48 users invited
  • 18 weekly active users
  • 7 completed interviews
  • 5 interviewees requested CSV export
  • Pilot has run for 3 weeks
  • No long-term retention evidence

Inference:

  • Engagement appears low (18 out of 48 active weekly)
  • Limited feedback (only 7 interviews)
  • No data on long-term retention

Recommendation: Pause the pilot.

Next evidence to collect: Long-term retention metrics and additional user feedback.

Répond partiellement

Forces : Garde les observations séparées Recommande la collecte d'évidence de rétention

Risques : Étiquette d'engagement « faible » sans objectif ou comparaison La recommandation de pause est sous-expliquée

Meilleure utilisation : Un brouillon compact qui a besoin d'une discipline de benchmarking.

Sortie 3Sortie capturée brute · réduite par défautMistral AI · mistralai/mistral-small-3.1-24b-v2
ID de l'instantané
output-pilot-evidence-boundary-3
Révision du cas
challenge-pilot-evidence-boundary-r1
Hachage du contenu
sha256:20e95812bc1cbe5f35ed8611504d4f5e360d3bf9852d1f1ed2b59e0869178703
ID de demande d'exécution
chatcmpl-2b2b1cf8-3be4-4798-bff2-85981ca5a4c3
Capturé à
Aug 27, 2026, 5:31 AM UTC
Développeur du modèle
Mistral AI
Fournisseur d'exécution
Cloudflare Workers AI
Identifiant du modèle
@cf/mistralai/mistral-small-3.1-24b-v2
Licence du modèle
Apache-2.0
Paramètres
nombre maximum de jetons 2000; température 0.2; top-p 0.9
Base d'utilisation de la sortie
Capturé pour l'évaluation de RichBay conformément aux conditions d'exécution et de modèle applicables. Le licence du modèle n'est pas présentée comme une licence pour la sortie.

Sortie brute

Observations:

  • 48 invited users
  • 18 weekly active users
  • 7 completed interviews
  • 5 interviewees requested CSV export
  • Pilot run for three weeks

Inference:

  • It is uncertain whether to expand, pause, or stop the pilot. The data is insufficient to make a clear recommendation.

Next evidence to collect:

  • Longer-term retention data
  • User feedback from the remaining invited users
  • Specific reasons for requesting CSV export
  • Any reported issues or bugs from users

Répond partiellement

Forces : Évite les revendications exagérées Demandes nécessitant un suivi à long terme et des retours plus larges

Risques : Ne choisit pas d'élargir, de suspendre ou d'arrêter comme demandé Ne pas expliquer comment les preuves changent la prochaine décision

Meilleure utilisation : Une vérification d'évidence prudente, pas un mémo de décision complet.

05 · Registre des affirmations

Revendications, sources, preuves et limites

Revendication 1

Le paquet ne soutient pas encore une décision d'expansion large.

Source
Paquet de tâche publié et les trois sorties capturées
Support
Le paquet fournit des comptes limités d'interviews et d'activités sans référence, échantillon représentatif ou fenêtre de rétention.
Limite
Les preuves ne montrent pas que le pilote a échoué ; elles montrent que la prêter à l'expansion reste non résolu.

Revendication 2

Les étiquettes telles que « faible » ou « bonne » nécessitent une référence.

Source
Critères d'avis éditorial de RichBay
Support
La tâche fournit des comptes, mais pas de cible, de groupe de comparaison ou de règle de décision pour ces étiquettes.
Limite
Une équipe peut appliquer une norme existante si elle est documentée et pertinente.

06 · Conclusion de revue

Ce que ces preuves soutiennent

Les comptes sont des observations ; « bon », « faible » et « prêt à s'étendre » sont des inférences qui nécessitent une référence ou une règle de décision.

Limitations connues

  • Le paquet est intentionnellement peu fourni et omet les critères de succès spécifiques au domaine.
  • La revue n'estime pas la demande du marché ou la fidélisation future.
  • La comparaison décrit les sorties capturées, et non les capacités plus larges de chaque fournisseur.

Point clé réutilisable

Utilisez un registre d'observation versus inférence avant de prendre une décision d'échelle.

Utilisez la méthode de soutien

Sur cette page

  1. Tâche
  2. Prompt complet
  3. Critères d'évaluation
  4. Comparaison des sorties
  5. Registre des preuves
  6. Limitations
  7. Point clé réutilisable

Enregistrement de publication

Examiné et versionné

Statut
Examiné · Publié
Réviseur responsable
Avis éditorial de RichBay
Révision
challenge-pilot-evidence-boundary-r1
Publié
Aug 27, 2026
Examen dû
Nov 25, 2026
Essayez la zone de jeuUtilisez la méthode

Un changement matériel dans une sortie ou une entrée de preuve nécessite une nouvelle révision ; ce registre n'est pas remplacé silencieusement.