La tokenisation

le sommaire du chapitre — neuf pages, deux natures.

Ce chapitre apprend comment une matière — texte, image, son, vidéo, ADN, geste de robot — devient les nombres qu'un modèle peut lire. Il montre que ce n'est jamais la matière qui commande la technique, mais ce qu'on veut en faire : la lire, ou la générer. Et il chiffre ce que chaque choix coûte, en jetons, en poids gelés et en euros.

Le fil, en une phrase

Lire une image et en générer une ne demandent pas du tout le même découpage — et c'est vrai de toutes les matières. Entre lire et générer, l'écart va jusqu'à un facteur 210 ; entre deux matières, il est bien plus petit.

Les quatre questions, en version courte

C'est l'arbre de décision du chapitre. Il se parcourt dans l'ordre, on s'arrête à la première réponse rencontrée, et aucune des quatre questions ne demande de quel média il s'agit.

  1. Je la lis, ou je la génère ? Si je la lis seulement : ne discrétise pas. Des vecteurs continus suffisent — patchs d'image, spectrogramme — et il n'y a aucun vocabulaire.
  2. De quoi ma tête de sortie a-t-elle besoin ? Un softmax choisit dans une liste finie, donc il lui faut un vocabulaire ; une tête de diffusion régresse dans le continu et n'en a jamais eu besoin.
  3. Les atomes existent-ils déjà ? Octets, quatre bases d'ADN, vingt acides aminés, coups d'échecs : prends-les. Il ne reste qu'un curseur, le regroupement.
  4. Grille triviale, ou dictionnaire ? En faible dimension, 256 bacs et zéro entraînement. En grande dimension, un dictionnaire implicite — jamais un livre de codes appris.

La version dessinée, avec la réserve que mérite chaque branche et le curseur de dimensionnement qui reste après l'arbre : quelle technique, pour quelle matière.

Les neuf pages

Ce qui est mesuré ici

Trois pages dont les chiffres sortent des runs de ce projet — chacun avec sa date, sa machine, son coût et son journal. Ils ne valent que pour ce corpus et ce clavier, et le disent.

Le clavier du modèlethéorie — une règle de découpe, une liste de touches, et les fusions BPE dessinées Ce que coûte un caractèrepratique — sept factures mesurées ici : français, anglais, code, JSON, nombres Une phrase, un texte, ou un livre ?démo — le fleuve du pré-entraînement contre l'exemple du fine-tuning

Ce qui est relevé de la littérature

Six pages où aucun chiffre n'a été mesuré ici. Chacun porte sa source et son statut : publié tel quel, dérivé d'une formule, ou recherche — un article, aucun produit derrière. Quand un relevé s'écarte d'une mesure d'ici, l'écart est dit.

Quelle technique, pour quelle matièrethéorie — l'arbre en quatre questions, et le curseur qui reste après L'imageréférence — patchs continus, dictionnaires qui s'évaporent, et ce que le discret fait perdre Le son et la vidéoréférence — la pile de codes, la cadence, et le mur de la génération Toutes les autres matièresréférence — code, tableaux, séries, ADN, protéines, molécules, gestes, graphes, 3D Le budget en jetonsdémo — une monnaie commune, la page de texte, et le prix chez trois fournisseurs Auditer un tokenizer inconnuréférence — quinze tests dans l'ordre, puis ce que la littérature n'a pas tranché

Cette séparation est la règle du site, pas une précaution de style. Une mesure d'ici se refait : le run, la machine et le journal sont donnés. Un relevé de la littérature ne se refait pas — il se vérifie à la source, et il périme.