Le budget en jetons

ça tourne dans ton navigateur, aucun modèle n'est appelé : la page charge une grille de barèmes et fait le reste elle-même. Ces barèmes sont relevés de la littérature et des documentations de fournisseurs, jamais mesurés ici.

Une page, une image, une seconde de parole, une seconde de vidéo, une « pensée » : la même monnaie. Les barèmes et les prix affichés sont ceux du 5 septembre 2026 — ils bougent au trimestre, et ce sont des conventions de facturation, pas des spécifications de tokenizer.

1. Le calculateur

Choisis la matière, choisis si tu la lis ou si tu la génères, règle la quantité. L'unité de compte est la page : 750 mots = 1 000 jetons — en anglais. Le français en demande ~1,24 fois plus de jetons pour le même texte ; ce rapport porte un nom, la fertilité du tokenizer. Attention, il n'a rien d'universel : mesuré ici sur des pages web réelles avec le clavier de Qwen2.5, il tombe à 1,13. La fertilité dépend du corpus et du tokenizer autant que de la langue.

Le second curseur, « déjà en cache », suppose qu'une part de ce que tu envoies a déjà été lue au tour d'avant : c'est le levier de la section 3, et il ne joue qu'en lecture.

quantité60
déjà en cache0 %

Le résultat

jetons

0

barème par défaut

en pages de texte

0

à 1 000 jetons la page

prix le plus bas

0

des trois fournisseurs

Prix par million de jetons, relevés le 5 septembre 2026, au tarif du jeton de texte : sur l'image, le son et la vidéo, c'est une monnaie de comparaison, pas une facture. publié = écrit tel quel dans la source, dérivé = calculé à partir d'elle, recherche = un article, aucun produit. La remise de cache ne joue que sur la colonne Anthropic, seul cache publié de la grille, et seulement en lecture.

barèmes et grille : tokenisation-budget.json · claude.com/pricing · developers.openai.com · ai.google.dev

2. Ce que le calculateur rend visible

jetons pour UNE unité — échelle logarithmique 1 10 100 1 000 10 000 100 000 page de texte FR 1 240 1 240 image 1024² 1 120 1 s de parole 32 100 1 s de vidéo 720p 102 21 600 1 s d'action robot 53 1 « pensée » 25 000 lire générer
Chaque décade — chaque ×10 — vaut le même espace. Sans ça, les barres à 32 et 53 jetons seraient des traits invisibles à côté de celle à 25 000. Et l'écart entre lire et générer une seconde de vidéo, ×210, vaut ici deux grands pas de grille.

Le sens compte plus que la matière

Une seconde de vidéo 720p coûte ~102 jetons à lire et ~21 600 à générer : ×210. Sur la parole, l'écart est de ×10 selon les conventions d'API, et bien davantage selon les auteurs de Moshi eux-mêmes — les sept codecs, mis à plat. C'est la vraie ligne de partage du domaine, davantage que discret contre continu.

dérivé de ai.google.dev · media-resolution · arxiv 2412.03603 · HunyuanVideo · arxiv 2507.13343 · facteurs de compression · kyutai.org/Moshi.pdf

Une heure, dans les deux sens

Une heure de vidéo lue chez Gemini 3 : ~367 000 jetons, soit ~367 pages. Une heure de parole générée en jetons Mimi : 360 000, soit ~360 pages. Générer une heure de parole coûte, en jetons, autant que lire une heure de vidéo. Mets le curseur sur 3 600 secondes et compare les deux.

dérivé de ai.google.dev · media-resolution et kyutai.org/Moshi.pdf

Le plus gros poste est invisible

OpenAI recommande de réserver 25 000 jetons par requête de raisonnement. Ils n'apparaissent jamais dans la réponse et sont facturés comme des jetons de sortie. Une seule requête coûte donc plus que vingt images 1024² (20 × 1 120 = 22 400) ou quatre minutes de vidéo lue (240 × 102 = 24 480). Optimiser son vocabulaire avant d'avoir regardé ce poste, c'est optimiser la mauvaise chose.

developers.openai.com · reasoning

La hiérarchie des coûts n'est pas une propriété de la matière recherche

Une page de texte coûte ~1 000 jetons en BPE. Rendue en image et lue par un modèle de compression optique, elle en coûte 100 — avec 97 % de décodage exact tant qu'on reste sous 10× de compression, et ~60 % à 20×. Aucun laboratoire n'a annoncé de produit là-dessus : c'est de la recherche, pas un barème qu'on peut appeler.

arxiv 2510.18234 · DeepSeek-OCR

3. Le levier n'est pas la tokenisation

Le cache de contexte, à 10 % du prix d'entrée

Chez Anthropic, relire un préfixe déjà mis en cache coûte 10 % du prix d'entrée ; l'écrire coûte ×1,25. Sur un agent qui renvoie le même préambule à chaque tour, c'est un facteur 10 sur le poste dominant — bien plus que les 27 % de calcul d'inférence économisés par SuperBPE, publié à COLM 2025 et toujours non adopté dix-huit mois après. Le curseur « déjà en cache » le montre en direct.

claude.com/pricing · arxiv 2503.13423 · SuperBPE

Piège inverse en session vocale temps réel : l'historique audio est refacturé à chaque tour, donc les jetons d'entrée s'accumulent quadratiquement. Sans cache, une heure de dialogue coûte plusieurs fois le calcul naïf.

developers.openai.com · realtime-costs

Trois réserves à garder en tête

Les prix sont ceux du jeton de texte : convertir une sortie vidéo à ce tarif donne une monnaie de comparaison, pas une facture — Gemini Omni Flash facture 17,50 $ le million en sortie vidéo. Aucun grand fournisseur ne publie son tokenizer audio ou visuel réel. Et le tarif Gemini 3.8 Flash (0,75 / 3,75) est promotionnel jusqu'au 31/12/2026, puis double.

ai.google.dev · pricing