Définition en une phrase
Une fenêtre de contexte est la capacité en tokens qu'un modèle peut traiter pour une seule séquence d'inférence ou une requête [1].
Réponse rapide
Une fenêtre de contexte est l'espace de travail qu'un modèle a pendant une seule requête. Elle est généralement mesurée en tokens, qui sont des petites pièces de texte. Le produit peut placer le message de l'utilisateur, les instructions du système, les exemples, les passages récupérés, l'historique de conversation, les résultats des outils et les contraintes de sortie dans cet espace avant que le modèle ne génère une réponse.
La fenêtre de contexte n'est pas la même que la mémoire. L'historique de conversation n'affecte la demande actuelle que lorsque le produit réinsère cet historique dans le contexte du modèle. La mémoire du produit, les préférences des utilisateurs stockées, la récupération et la fenêtre de contexte sont des mécanismes séparés, même lorsqu'un produit les combine dans une seule interface.
Pourquoi c'est important
Les fenêtres de contexte déterminent ce qu'un modèle peut utiliser lors d'une seule interaction. Si un utilisateur collé un court contrat, le modèle peut avoir de la place pour l'ensemble du document et la question. Si l'utilisateur collé un long dossier de notes, le produit peut avoir besoin de tronquer, résumer, récupérer des extraits sélectionnés ou rejeter une partie de l'entrée.
Cela compte car les gens supposent souvent que si l'information est apparue plus tôt dans un chat, le modèle la possède toujours. Cela peut être faux. Un produit peut inclure uniquement les messages récents, les résumés, les souvenirs sélectionnés, les documents récupérés ou aucun contexte antérieur du tout. Le fil de discussion visible n'est pas toujours le contexte exact envoyé au modèle.
Cela compte également car une fenêtre contextuelle plus grande ne garantit pas une meilleure utilisation de chaque détail. L'étude « Lost in the Middle » a trouvé que les modèles de langage évalués et les tâches étaient sensibles à l'endroit où l'information pertinente apparaissait dans les contextes d'entrée longs, avec des performances souvent pires lorsqu'informations pertinentes apparaissaient au milieu [2]. Ce résultat doit être attribué aux systèmes et aux tâches étudiées, et non transformé en affirmation universelle selon laquelle chaque modèle ignore toujours le milieu.
Comment ça marche
Avant la génération, une application assemble une demande. Cette demande peut inclure des instructions au niveau du système, le message utilisateur, l'historique de conversation choisi par le produit, des exemples, des passages récupérés, les sorties d'outils et les règles de formatage. Le modèle traite ensuite les jetons dans ce contexte assemblé et génère de nouveaux jetons en sortie.
Les limites d'entrée et de sortie sont des détails de produit et d'implémentation du modèle. Dans certains systèmes, les jetons d'entrée et la sortie générée partagent une capacité totale. Dans d'autres, la documentation peut indiquer des limites d'entrée et de sortie séparées. Un article conceptuel ne devrait pas présenter une règle d'allocation comme universelle pour tous les produits.
Lorsque le contexte assemblé est trop grand, l'application doit décider quoi faire. Elle peut supprimer les messages plus anciens, les résumer, ne récupérer que des passages sélectionnés, demander à l'utilisateur de raccourcir l'entrée, ou diviser la tâche en demandes plus petites. Chaque choix change les preuves que le modèle peut utiliser.
Exemple complet
Imaginons qu'un étudiant demande à un assistant IA de comparer trois articles. Le premier article est court, le deuxième est long, et le troisième est collé après une longue conversation. Le produit peut inclure la demande de l'utilisateur, certaines instructions système, une partie de l'historique de la conversation et le texte de l'article. Si le total est trop important, il peut supprimer les échanges plus anciens ou utiliser un résumé.
Un bon workflow rend cela visible. L'étudiant peut demander : "Quelles sources avez-vous utilisées ?" et vérifier si la réponse cite effectivement les trois articles. Si un article manque du contexte, la réponse peut encore paraître complète tout en ne reflétant que le matériel que le modèle a reçu.
Mauvaise idée courante
La plus grande erreur est de penser que la fenêtre de contexte signifie la mémoire. La mémoire suggère qu'un produit stocke des informations et peut les récupérer plus tard. Une fenêtre de contexte est la capacité d'une seule demande. Un produit peut stocker des préférences ou des résumés séparément, mais ces informations stockées n'affectent la génération que si le produit les insère dans le contexte actuel.
Une autre idée fausse est que tout ce qui se trouve dans la fenêtre de contexte reçoit une attention égale et une utilisation fiable. Le modèle peut manquer, diluer ou mal appliquer des informations, surtout dans des contextes longs, complexes ou contradictoires. Être présent dans la demande n'est pas la même chose que d'être correctement utilisé.
Risques et limites
Un contexte plus long peut aider avec les grands documents, les tâches à plusieurs étapes et des exemples plus riches, mais il crée aussi des risques. Les utilisateurs peuvent coller plus de données sensibles que nécessaire. Les passages récupérés peuvent inclure du texte obsolète ou hostile. Un long texte d'entrée peut rendre plus difficile pour une personne de vérifier quelle preuve a conduit à la réponse.
Le NIST considère les risques liés à l'IA générative comme des risques liés au cycle de vie, impliquant la conception, l'utilisation, la surveillance et l'évaluation [3]. Pour les fenêtres de contexte, cela signifie que les équipes doivent tester ce que le produit inclut, ce qu'il élimine, comment il gère les entrées longues et si les utilisateurs comprennent les limites.
Vérification pratique
Avant de faire confiance à une réponse issue d'un contexte long, demandez : Quels documents ou messages ont réellement été inclus ? Quelque chose a-t-il été résumé ou omis ? La réponse cite-t-elle exactement la partie qui soutient chaque affirmation importante ? Y a-t-il une donnée sensible présente ? Un message ancien ou un document récupéré pourrait-il contenir des instructions qui contredisent la tâche ?
Utilisez un contexte long pour la lecture, la comparaison, la rédaction à partir de matériaux fournis et pour maintenir la cohérence d'une tâche. Ralentissez lorsque la réponse affecte les décisions politiques, juridiques, médicales, financières, d'emploi, clients ou de sécurité. Une fenêtre de contexte plus large donne au modèle plus de preuves possibles, mais pas de correction automatique.