La tokenisation
le sommaire du chapitre — neuf pages, deux natures.
Ce chapitre apprend comment une matière — texte, image, son, vidéo, ADN, geste de robot — devient les nombres qu'un modèle peut lire. Il montre que ce n'est jamais la matière qui commande la technique, mais ce qu'on veut en faire : la lire, ou la générer. Et il chiffre ce que chaque choix coûte, en jetons, en poids gelés et en euros.
Le fil, en une phrase
Lire une image et en générer une ne demandent pas du tout le même découpage — et c'est vrai de toutes les matières. Entre lire et générer, l'écart va jusqu'à un facteur 210 ; entre deux matières, il est bien plus petit.
Les quatre questions, en version courte
C'est l'arbre de décision du chapitre. Il se parcourt dans l'ordre, on s'arrête à la première réponse rencontrée, et aucune des quatre questions ne demande de quel média il s'agit.
- Je la lis, ou je la génère ? Si je la lis seulement : ne discrétise pas. Des vecteurs continus suffisent — patchs d'image, spectrogramme — et il n'y a aucun vocabulaire.
- De quoi ma tête de sortie a-t-elle besoin ? Un softmax choisit dans une liste finie, donc il lui faut un vocabulaire ; une tête de diffusion régresse dans le continu et n'en a jamais eu besoin.
- Les atomes existent-ils déjà ? Octets, quatre bases d'ADN, vingt acides aminés, coups d'échecs : prends-les. Il ne reste qu'un curseur, le regroupement.
- Grille triviale, ou dictionnaire ? En faible dimension, 256 bacs et zéro entraînement. En grande dimension, un dictionnaire implicite — jamais un livre de codes appris.
La version dessinée, avec la réserve que mérite chaque branche et le curseur de dimensionnement qui reste après l'arbre : quelle technique, pour quelle matière.
Les neuf pages
Ce qui est mesuré ici
Trois pages dont les chiffres sortent des runs de ce projet — chacun avec sa date, sa machine, son coût et son journal. Ils ne valent que pour ce corpus et ce clavier, et le disent.
Ce qui est relevé de la littérature
Six pages où aucun chiffre n'a été mesuré ici. Chacun porte sa source et son statut : publié tel quel, dérivé d'une formule, ou recherche — un article, aucun produit derrière. Quand un relevé s'écarte d'une mesure d'ici, l'écart est dit.
Cette séparation est la règle du site, pas une précaution de style. Une mesure d'ici se refait : le run, la machine et le journal sont donnés. Un relevé de la littérature ne se refait pas — il se vérifie à la source, et il périme.