Outils
Budget de contexte
Une fenêtre de contexte se partage entre tout ce que vous envoyez et tout ce que le modèle peut répondre. Renseignez chaque partie, en nombre de tokens ou en collant le texte, et voyez la répartition en barre empilée, ce qui reste pour la réponse, et ce qui déborde. C'est généralement l'historique et les définitions d'outils qui prennent la place, pas la question de l'utilisateur.
Fenêtres telles que publiées le 2026-09-10. Les fournisseurs qui n'en publient pas à côté de leurs prix sont écartés : utilisez « Fenêtre personnalisée » pour ceux-là.
La place laissée pour la réponse. La fenêtre est partagée : chaque token d'entrée ajouté est un token que le modèle ne pourra pas utiliser pour répondre.
Entrée
20 820
tokens
Fenêtre utilisée
12.4 %
24 820 / 200 000
Libre
175 180
tokens restants
Plus grosse part
Historique de conversation
58 % de l'entrée
Composition de l'entrée
175 180 tokens de marge. Gardez en tête que remplir une fenêtre n'est pas gratuit : les longs contextes ralentissent le premier token et coûtent le même prix par token où qu'ils soient.
Stable d'un appel à l'autre, donc la première chose à mettre derrière un point de cache.
Envoyées à chaque appel, que le modèle s'en serve ou non. Vingt outils bavards, et on est à plusieurs milliers de tokens.
Renvoyé en entier à chaque tour puisque l'API est sans état. Le terme qui grossit sans que personne ne le remarque.
Nombre de chunks multiplié par leur taille, ce qui explique que les réglages du découpeur se retrouvent sur la facture.
La question elle-même. Presque toujours la plus petite part, et c'est tout l'intérêt de ce graphique.