Une fenêtre de contexte est l’ensemble des informations qu’un modèle peut prendre en compte pendant une génération. Elle comprend les consignes, l’historique de conversation, les documents récupérés, les descriptions d’outils, les résultats d’outils, les images représentées en tokens et l’espace réservé à la réponse. Elle se rapproche davantage d’une mémoire de travail que des connaissances apprises par le modèle.
Cette distinction évite une erreur fréquente. Un modèle peut connaître un concept général grâce à son entraînement, mais ne pas disposer du fait privé nécessaire à votre tâche. L’inverse peut aussi arriver : le fait est présent dans le contexte, mais le modèle ne le remarque pas ou ne l’applique pas lorsque la demande est encombrée de matériau non pertinent.
Chaque token entre en concurrence pour l’attention. Une grande fenêtre permet à une application de soumettre davantage de matériau, mais elle ne garantit pas un rappel ou un raisonnement uniforme sur cet ensemble. Des preuves importantes peuvent devenir difficiles à trouver, des passages répétés peuvent orienter une réponse et de longues sorties d’outils peuvent évincer les consignes qui définissent la réussite.
Établissez le budget à rebours depuis la sortie. Réservez assez de place pour la réponse et pour toute activité de raisonnement ou d’outillage que le modèle pourrait générer. Répartissez ensuite l’espace entre les consignes stables, la question actuelle, l’état récent de la conversation et les preuves d’appui. Ne remplissez pas la capacité restante simplement parce qu’elle existe.
Préférez un contexte à fort signal. Pour une question sur un document, incluez les passages pertinents avec leurs titres, dates et identifiants de source. Pour une tâche de programmation, fournissez les interfaces, les tests, la sortie d’erreur et l’implémentation voisine plutôt que le dépôt entier. Pour un agent, rendez disponibles des références légères qu’il peut consulter au besoin au lieu de charger d’emblée toutes les ressources possibles.
Les longues conversations exigent une stratégie d’état explicite. La compaction résume le travail antérieur dans un artefact plus petit. Des notes structurées préservent les décisions, contraintes, questions ouvertes et étapes terminées hors de la transcription immédiate. La récupération ne ramène que ce dont l’action suivante a besoin. Ces approches échangent l’historique textuel complet contre une cohérence durable.
La compaction peut perdre des détails ; le résumé doit donc distinguer les faits durables des observations temporaires. Consignez les identifiants exacts, chemins, décisions, liens de preuve et risques non résolus. Gardez les artefacts importants — tests, spécifications, données et sorties finales — dans leur forme native plutôt que de compter sur un résumé conversationnel pour les reproduire.
La mise en cache des prompts peut réduire le coût ou la latence de préfixes répétés, mais les tokens mis en cache occupent toujours la fenêtre de contexte. La mise en cache modifie la façon dont une entrée répétée est traitée ou facturée ; elle ne transforme pas la fenêtre en mémoire illimitée.
L’utilisation d’outils ajoute une autre contrainte. Les schémas, résultats, captures d’écran et étapes de raisonnement intermédiaires consomment tous de la capacité. Écartez les résultats d’outils obsolètes lorsque la plateforme le permet, résumez les grandes sorties et conservez des pointeurs vers les preuves brutes. Un agent utile doit pouvoir rouvrir une source plutôt que transporter chaque octet indéfiniment.
Évaluez la conception du contexte avec des entrées longues réalistes. Placez les faits importants à des positions différentes, ajoutez des distracteurs plausibles et testez des questions de suivi après plusieurs appels d’outils. Ne mesurez pas seulement la capacité du modèle à citer un fait, mais aussi sa capacité à appliquer la bonne version et à citer la bonne source.
Le meilleur contexte n’est pas le contexte maximal. C’est le plus petit ensemble de travail courant qui préserve l’objectif, les contraintes, les preuves et la décision suivante. Des fenêtres plus grandes élargissent le possible ; une ingénierie attentive du contexte détermine ce qui reste fiable.
Nous croisons sources primaires, documentation produit et cas d’usage réels pour vous aider à déterminer si un outil convient à votre manière de travailler.