Quelle technique, pour quelle matière

le mécanisme. Aucun chiffre de ce projet dans cette page.

Quatre questions, dans cet ordre. La première élimine la moitié des cas, la deuxième l'essentiel du reste. Aucune des quatre ne demande de quel média il s'agit.

Q1 — je la LIS, ou je la GÉNÈRE ? je la LIS → NE DISCRÉTISE PAS patchs continus, log-mel, projection. Whisper : 50 vecteurs/s, aucun codebook. je la GÉNÈRE la tête de sortie décide → Q2 Q2 — de quoi ma tête de sortie a-t-elle besoin ? échantillonner suffit → CONTINU tête de diffusion ou flow matching. le décodage contraint est perdu. Fin. un vocabulaire fini → DISCRET vraisemblance exacte, JSON, grammaire, partage avec le texte. → Q3 Q3 — les atomes existent-ils déjà ? OUI → PRENDS-LES octets, 4 bases, 20 acides aminés, MIDI, échecs. Reste le regroupement. NON pixels, forme d'onde, latents → Q4 Q4 — grille triviale ou dictionnaire ? faible dimension → GRILLE 256 bacs, zéro entraînement, erreur bornée par le pas. piège : le haut débit fait « recopie ». grande dimension → DICTIONNAIRE IMPLICITE : FSQ ou LFQ, jamais un VQ à codebook appris. il faut acheter ×100 à ×300.
Les quatre bandeaux pleine largeur sont les questions. Sous chacune : le cadre bleu est une réponse, on s'y arrête ; le cadre gris renvoie à la question suivante. Une matière ne descend jamais plus bas que la première réponse qu'elle rencontre.

Q1 — lire, ou générer

Pour lire, un vecteur suffit : on découpe l'image en carrés, on aplatit, on projette. Aucun dictionnaire, aucun index, aucun arrondi. Discrétiser une entrée n'ajoute qu'une perte que rien ne rattrape plus loin.

Whisper n'a aucun codebook audio

Il avale 50 vecteurs de mel continus par seconde et ne produit du discret qu'en sortie : ce qu'il génère, c'est du texte. Le spectrogramme, et les codecs qu'il faut au contraire pour générer du son, sont sur la page du son et de la vidéo.

Whisper, OpenAI — arxiv.org/pdf/2212.04356

Ce n'est pas une loi, c'est un défaut

Trois modèles connus discrétisent aussi l'entrée, l'assument, et le paient en performance de lecture. Le chiffre exact et la contrepartie architecturale sont sur la page de l'image.

Q2 — ce que réclame la tête de sortie

Ce n'est pas le média qui décide

Une tête autorégressive finit par un softmax : une probabilité pour chaque entrée d'une liste finie. Cette liste, c'est le vocabulaire. Une tête de diffusion régresse dans le continu et n'a jamais eu besoin de liste. Les deux axes — autorégressif ou diffusion, discret ou continu — sont indépendants, et les quatre cases existent.

Prends le discret s'il te faut chiffrer la probabilité exacte d'une sortie, contraindre le décodage (n'accepter que du JSON valide, suivre une grammaire) ou partager le vocabulaire avec le texte. Sinon le continu t'épargne l'arrondi du quantifieur, que plus rien ne rattrape ensuite.

MAR : la nuance qu'on gomme toujours recherche

Sur un générateur d'images, remplacer ce softmax par une tête de diffusion qui prédit des vecteurs continus fait tomber le FID — la distance aux vraies images, plus bas vaut mieux — de 8,79 à 3,50, à architecture identique. Mais ce gain n'existe que dans la variante masquée et bidirectionnelle : en autorégressif causal, l'écart s'évanouit — 19,58 contre 19,23.

MAR ne montre donc pas que le continu bat le discret, mais qu'il le bat quand on abandonne aussi l'ordre causal.

MAR, NeurIPS 2024, aucun déploiement documenté — arxiv.org/abs/2406.11838

Q3 — les atomes existent-ils déjà

Beaucoup de matières arrivent déjà découpées : octets, bases d'ADN, acides aminés, atomes et liaisons pour SMILES, hauteurs MIDI, coups légaux aux échecs. Ne mets jamais un quantifieur là où il n'y a pas de perte à ajouter.

Il ne reste qu'un curseur : le regroupement

Grouper — par BPE, par k-mers, par patchs — raccourcit la séquence et brouille la résolution locale. Règle : caractère par caractère pour les motifs fins, groupé pour la vue globale. Le banc qui tranche ça tâche par tâche, sur l'ADN, est dans les autres matières.

Q4 — grille triviale, ou dictionnaire

Reste ce qui n'a pas d'atomes : pixels, forme d'onde, ou latents — les vecteurs qu'un encodeur fabrique à la place de la matière brute. Deux cas, et c'est la dimension qui tranche, pas le média.

Faible dimension : 256 bacs suffisent

Une coordonnée, une commande d'articulation, une hauteur de note : zéro entraînement, erreur bornée par le pas. Piège en haute fréquence — deux pas consécutifs tombent dans le même bac, et le modèle apprend « recopie ». Le correctif — décorréler avant de quantifier — est dessiné pas à pas sur la page des gestes de robot.

Grande dimension : FSQ ou LFQ, pas un VQ appris

Une seconde d'audio 24 kHz fait 24 000 échantillons ; une image de 1 024 × 1 024 pixels en trois canaux, 3,1 millions de valeurs (dérivé : 1 024 × 1 024 × 3). Il faut donc acheter un facteur 100 à 300 de compression — Mimi descend à 100 jetons par seconde.

La façon évidente est un VQ : un dictionnaire de vecteurs appris, chaque morceau remplacé par le numéro du plus proche. Elle marche mal, et ses deux remplaçants — FSQ, LFQ — suppriment le dictionnaire au lieu de l'agrandir : le vocabulaire devient le produit d'une grille de niveaux, implicite et entièrement utilisé. Le mur du codebook, les chiffres, et les cinq étapes de cette famille : la page de l'image.

Mimi — kyutai.org/Moshi.pdf

Le curseur qui reste après l'arbre

L'arbre donne une nature, jamais une taille. Le dimensionnement n'est pas une cinquième question : c'est un curseur, et il se lit de trois façons.

le curseurla règlece qui la fonde
part du vocabulairetaille du vocabulaire × largeur du modèle, divisé par le total des paramètres : sous ~20 %Gemma 3 270M met 63 % de ses poids dans sa table (170 M sur 270 M) : assumé pour un modèle à spécialiser. Gemma 3 1B : 30,2 % ; 27B : 5,2 %, même vocabulaire de 262 144
table liée ou nonla table d'entrée et la couche de sortie partagent-elles leurs poids ? au-dessus de ~10 % de part, lie ; sous ~3 %, délieQwen3-0.6B lie, Qwen3-8B délie. Llama 3.2 1B lie, Llama 3.1 8B délie
cadencejetons par seconde = trames par seconde × quantifieurs empilés : l'une est la latence, l'autre la longueur de séquence. Ne confonds pas les deuxsept codecs mis à plat, et le plancher phonémique qui bloque à 12,5 Hz : la page du son

parts et embeddings, config.json publiés — Qwen3-8B · Llama 3.1 8B · rapport Gemma 3 · Gemma 3 270M

Et ce curseur n'est pas symétrique. Le tokenizer est gelé au pré-entraînement : se tromper vers le petit ne coûte que de la longueur de séquence, récupérable ; vers le gros, ce sont des paramètres gelés et de la mémoire d'activation, non récupérables. Dans le doute, vise petit. Les chiffres, et la réserve qu'ils méritent, sont sur la page d'audit.

Le chapitre, matière par matière