Outils
Simulateur de vitesse LLM
Collez un texte, réglez le débit en tokens par seconde, la latence avant le premier token et un peu d'irrégularité : le texte s'affiche comme s'il sortait d'un modèle en streaming. Pratique pour calibrer une animation, éprouver une interface de chat ou montrer l'écart entre deux vitesses. Tout est simulé dans le navigateur, aucun modèle n'est appelé.
Combien de tokens le modèle émet par seconde, une fois lancé. Vers 5 vous lisez plus vite qu'il n'écrit ; au-delà de 60 le texte va plus vite que l'œil. Le curseur s'arrête à 600, le champ accepte davantage.
Le temps mort entre l'envoi de la requête et l'arrivée du premier token. Il couvre la file d'attente, le traitement du prompt et le réseau. C'est lui qui fait paraître une interface lente même quand le flux est rapide.
À quel point les intervalles entre tokens varient. À 0 le flux est un métronome, ce qu'aucun vrai modèle n'est. À 35 chaque intervalle varie jusqu'à un tiers dans les deux sens.
Débit visé
25 tok/s
Mesuré
-
Écoulé
-
Durée totale
≈ 1 min 6 s