Le budget en jetons
ça tourne dans ton navigateur, aucun modèle n'est appelé : la page charge une grille de barèmes et fait le reste elle-même. Ces barèmes sont relevés de la littérature et des documentations de fournisseurs, jamais mesurés ici.
Une page, une image, une seconde de parole, une seconde de vidéo, une « pensée » : la même monnaie. Les barèmes et les prix affichés sont ceux du 5 septembre 2026 — ils bougent au trimestre, et ce sont des conventions de facturation, pas des spécifications de tokenizer.
1. Le calculateur
Choisis la matière, choisis si tu la lis ou si tu la génères, règle la quantité. L'unité de compte est la page : 750 mots = 1 000 jetons — en anglais. Le français en demande ~1,24 fois plus de jetons pour le même texte ; ce rapport porte un nom, la fertilité du tokenizer. Attention, il n'a rien d'universel : mesuré ici sur des pages web réelles avec le clavier de Qwen2.5, il tombe à 1,13. La fertilité dépend du corpus et du tokenizer autant que de la langue.
Le second curseur, « déjà en cache », suppose qu'une part de ce que tu envoies a déjà été lue au tour d'avant : c'est le levier de la section 3, et il ne joue qu'en lecture.
Le résultat
jetons
barème par défaut
en pages de texte
à 1 000 jetons la page
prix le plus bas
des trois fournisseurs
Prix par million de jetons, relevés le 5 septembre 2026, au tarif du jeton de texte : sur l'image, le son et la vidéo, c'est une monnaie de comparaison, pas une facture. publié = écrit tel quel dans la source, dérivé = calculé à partir d'elle, recherche = un article, aucun produit. La remise de cache ne joue que sur la colonne Anthropic, seul cache publié de la grille, et seulement en lecture.
barèmes et grille : tokenisation-budget.json · claude.com/pricing · developers.openai.com · ai.google.dev
2. Ce que le calculateur rend visible
Le sens compte plus que la matière
Une seconde de vidéo 720p coûte ~102 jetons à lire et ~21 600 à générer : ×210. Sur la parole, l'écart est de ×10 selon les conventions d'API, et bien davantage selon les auteurs de Moshi eux-mêmes — les sept codecs, mis à plat. C'est la vraie ligne de partage du domaine, davantage que discret contre continu.
dérivé de ai.google.dev · media-resolution · arxiv 2412.03603 · HunyuanVideo · arxiv 2507.13343 · facteurs de compression · kyutai.org/Moshi.pdf
Une heure, dans les deux sens
Une heure de vidéo lue chez Gemini 3 : ~367 000 jetons, soit ~367 pages. Une heure de parole générée en jetons Mimi : 360 000, soit ~360 pages. Générer une heure de parole coûte, en jetons, autant que lire une heure de vidéo. Mets le curseur sur 3 600 secondes et compare les deux.
dérivé de ai.google.dev · media-resolution et kyutai.org/Moshi.pdf
Le plus gros poste est invisible
OpenAI recommande de réserver 25 000 jetons par requête de raisonnement. Ils n'apparaissent jamais dans la réponse et sont facturés comme des jetons de sortie. Une seule requête coûte donc plus que vingt images 1024² (20 × 1 120 = 22 400) ou quatre minutes de vidéo lue (240 × 102 = 24 480). Optimiser son vocabulaire avant d'avoir regardé ce poste, c'est optimiser la mauvaise chose.
La hiérarchie des coûts n'est pas une propriété de la matière recherche
Une page de texte coûte ~1 000 jetons en BPE. Rendue en image et lue par un modèle de compression optique, elle en coûte 100 — avec 97 % de décodage exact tant qu'on reste sous 10× de compression, et ~60 % à 20×. Aucun laboratoire n'a annoncé de produit là-dessus : c'est de la recherche, pas un barème qu'on peut appeler.
3. Le levier n'est pas la tokenisation
Le cache de contexte, à 10 % du prix d'entrée
Chez Anthropic, relire un préfixe déjà mis en cache coûte 10 % du prix d'entrée ; l'écrire coûte ×1,25. Sur un agent qui renvoie le même préambule à chaque tour, c'est un facteur 10 sur le poste dominant — bien plus que les 27 % de calcul d'inférence économisés par SuperBPE, publié à COLM 2025 et toujours non adopté dix-huit mois après. Le curseur « déjà en cache » le montre en direct.
Piège inverse en session vocale temps réel : l'historique audio est refacturé à chaque tour, donc les jetons d'entrée s'accumulent quadratiquement. Sans cache, une heure de dialogue coûte plusieurs fois le calcul naïf.
Trois réserves à garder en tête
Les prix sont ceux du jeton de texte : convertir une sortie vidéo à ce tarif donne une monnaie de comparaison, pas une facture — Gemini Omni Flash facture 17,50 $ le million en sortie vidéo. Aucun grand fournisseur ne publie son tokenizer audio ou visuel réel. Et le tarif Gemini 3.8 Flash (0,75 / 3,75) est promotionnel jusqu'au 31/12/2026, puis double.