Le son et la vidéo
à consulter, pas à lire d'affilée. Un relevé de la littérature, pas une mesure d'ici.
Deux matières sans atome naturel. Pour les lire, personne ne discrétise. Pour les générer, il faut presque toujours un vocabulaire — et la facture change d'ordre de grandeur.
1. Lire du son ne demande aucun vocabulaire
Whisper n'a pas de tokenizer audio
Rééchantillonnage à 16 kHz, puis un spectrogramme mel logarithmique : une image de l'énergie du son, 80 bandes de fréquence, une colonne toutes les 10 ms — 100 colonnes par seconde. Deux convolutions, la seconde d'un pas de 2 : 50 vecteurs par seconde entrent dans le transformeur. Des nombres réels, aucun livre de codes, aucun vocabulaire audio.
Son seul tokenizer est un BPE hérité de GPT-2, appliqué au texte qu'il écrit : Whisper ne produit du discret que parce qu'il génère du texte.
Whisper, OpenAI — arxiv.org/pdf/2212.04356
Le continu ne gagne pas partout. Une comparaison contrôlée conclut que les traits continus dépassent généralement les jetons discrets en compréhension — mais la phrase suivante du résumé ajoute : « discrete tokens perform better on phonetic-level tasks ».
2. Générer : quantifier, puis quantifier l'erreur
Un transformeur autorégressif tire son prochain jeton dans un vocabulaire fini : pour générer du son, il en faut donc un. Mais un livre unique, qui nommerait d'un seul numéro chaque trame de son possible, serait astronomique. La quantification résiduelle contourne l'obstacle en cascade.
Ce que la pile achète
Huit livres de 2 048 entrées — la pile de Mimi — donnent 2 0488 combinaisons pour seulement 8 × 2 048 vecteurs à apprendre. La pile est ordonnée : les premiers niveaux portent la structure grossière, les derniers le grain ; on peut donc la tronquer, et payer en finesse ce qu'on gagne en débit.
Le prix : à cadence égale, huit niveaux font huit fois plus de jetons. Le même obstacle a été contourné autrement côté image — en supprimant le livre de codes au lieu de l'empiler : FSQ et LFQ.
Moshi, Kyutai — kyutai.org/Moshi.pdf
Deux natures de codes cohabitent. Les jetons sémantiques portent le contenu phonétique mais ne se reconstruisent pas en son ; les jetons acoustiques, ceux du codec, reconstruisent mais ne structurent pas la langue. Mimi met les deux en parallèle : un premier quantificateur reçoit la distillation de WavLM, sept niveaux résiduels prennent l'acoustique, et les deux sorties sont sommées.
Moshi, Kyutai — kyutai.org/Moshi.pdf
Presque toujours, pas toujours : Kyutai Pocket TTS (janvier 2026, temps réel sur un processeur) génère des latents continus affinés par flow matching et ne réutilise que le décodeur de Mimi. Le codec discret n'est pas obligatoire.
CALM — arxiv.org/abs/2509.06926
3. Le budget d'une seconde de parole
Six codecs, et Whisper en repère continu. Ce qui les sépare : les trames par seconde et la hauteur de la pile.
| codec | cadence de trame | niveaux × entrées | jetons/s |
|---|---|---|---|
| Whisper — lire | 50 Hz | aucune | 50 vecteurs continus |
| SiTok recherche | 12,5 Hz | 1 | 12,5 |
| SNAC | 12, 23 et 47 Hz | 3 | ≈ 82 |
| Mimi (Moshi) | 12,5 Hz | 8 × 2 048 | 100 |
| U-Codec recherche | 5 Hz | 32 | 160 |
| EnCodec 6 kbps | 75 Hz | 8 × 1 024 | 600 |
| DAC 44,1 kHz | 86 Hz | 9 × 1 024 | 774 |
Pour comparaison : une seconde de parole vaut 3 à 4 jetons de texte, donc Mimi coûte 25 à 33 fois sa transcription — chiffre dérivé. Ce que ça pèse sur une heure, face aux autres matières : le budget en jetons.
Mimi kyutai.org/Moshi.pdf · SNAC github.com/hubertsiuzdak/snac · EnCodec github.com/facebookresearch/encodec · DAC github.com/descriptinc/descript-audio-codec · U-Codec, chiffres cités par NanoCodec arxiv.org/pdf/2508.05835 · SiTok arxiv.org/html/2602.06602v1
Cadence de trame et jetons par seconde ne sont pas la même chose
La cadence, ce sont les pas de génération par seconde : c'est la latence. Les jetons par seconde, c'est cadence × niveaux : c'est la longueur de séquence. U-Codec a la cadence la plus basse du tableau, 5 Hz, et fait pourtant 160 jetons par seconde, plus que Mimi. Baisser la cadence réduit la latence, pas le budget de contexte.
Et le plancher est physique. L'anglais se prononce à dix ou douze phonèmes par seconde ; à 6,25 Hz, une trame enferme deux phonèmes distincts. C'est la raison mécanique du palier à 12,5 Hz.
NanoCodec — arxiv.org/pdf/2508.05835
4. La vidéo : lire et générer, deux ordres de grandeur
Lire, c'est jeter 23 images sur 24
On échantillonne à 1 image par seconde et on paie 70 jetons par image retenue chez Gemini 3 : un forfait, quelles que soient les dimensions. Avec l'audio à 32 jetons par seconde, une seconde lue revient à environ 102 jetons : somme dérivée de deux barèmes de facturation, qui ne disent pas comment le modèle découpe.
Gemini — media-resolution · video-understanding
Générer, c'est reconstruire chaque pixel
Deux compressions en série — 4 dans le temps et 8 × 8 dans l'espace pour l'auto-encodeur, puis 2 × 2 pour le transformeur — font qu'un jeton couvre 4 images et 16 × 16 pixels. En 720p, une image latente est une grille de 80 × 45, soit 3 600 jetons, et il en passe six par seconde : environ 21 600 jetons pour une seule seconde, une vingtaine de pages de texte, sous une attention qui coûte le carré de cette longueur. Chiffres dérivés.
HunyuanVideo arxiv.org/html/2412.03603v1 · facteurs de compression arxiv.org/pdf/2507.13343
5. Pourquoi le mur ne tombe pas
L'attention creuse rend moins que sa formule ne promet
Radial Attention part d'un constat : dans une vidéo, l'attention entre deux instants faiblit vite avec la distance qui les sépare. Son coût ne croît alors plus comme le carré de la longueur, mais presque linéairement. Le gain réel face à l'attention dense : 1,9×. Et contrairement à l'image, l'attention linéaire seule ne suffit pas : « in video generation, existing methods cannot rely on it alone for lossless quality ».
github.com/mit-han-lab/radial-attention · arxiv.org/html/2509.24006v1
Ce qui rapporte vraiment : lire moins
La lecture agentique de Gemini, annoncée le 1er septembre 2026 : le modèle appelle un outil qui charge le seul segment utile, choisit sa cadence, et boucle. Face au découpage statique à 1 image par seconde : jusqu'à −88 % de jetons, −66 % de coût, +7 % de précision. On ne compresse pas mieux, on lit moins.
Élaguer les jetons vidéo rapporte moins que la littérature ne le suggère : sur les bancs en flux, choisir les images par l'attention ne bat le tirage uniforme que de 1 à 2 points. Baisser la cadence ou la résolution donne autant, pour zéro complexité.