Toutes les autres matières

à consulter, pas à lire d'affilée. Un relevé de la littérature, pas une mesure d'ici.

Onze matières, une seule question — la troisième de l'arbre : les atomes existent-ils déjà ? Quand oui — code, ADN, acides aminés, atomes d'une molécule — il ne reste qu'à les regrouper. Quand non, il faut les fabriquer, et c'est là que tout se joue.

1. Les gestes de robot : quantifier du continu, en pur

84 84 84 85 85 85 85 86 86 86 1 · un bac par échantillon 256 bacs uniformes par axe, un jeton chacun. À 50 Hz, 700 jetons pour une seconde — et chacun se devine en recopiant le précédent. 2 · la DCT décorrèle d'abord Le signal part dans les premiers coefficients, le reste tombe à zéro. Rien n'est encore jeté. 53 jetons pour la même seconde 3 · BPE sur les coefficients arrondis Les longues suites de zéros fusionnent en une poignée de jetons.
La même seconde à 50 Hz. En haut, un bac par échantillon : les jetons se répètent. En bas, on décorrèle avant de quantifier.

Le bac naïf s'effondre en haute fréquence

La méthode d'origine est la plus simple possible : découper chaque degré de liberté en 256 bacs uniformes et réutiliser 256 jetons du vocabulaire du modèle pour les nommer. Zéro entraînement, aucune modification d'architecture : le robot écrit une action comme il écrirait du texte.

Quand la fréquence de commande monte, deux pas consécutifs deviennent presque identiques : l'information portée par chaque jeton tend vers zéro, et prédire le jeton suivant se résout par la solution triviale, recopier le précédent. À 50 Hz, la méthode échoue.

FAST décorrèle avant de quantifier. Une DCT — la transformation du JPEG, qui range un signal du plus lisse au plus détaillé — pousse presque tout dans les premiers coefficients ; on arrondit, et un BPE de 1 024 avale les longues suites de zéros. Une seconde de trajectoire passe de 700 à 53 jetons à 50 Hz.

OpenVLA — arxiv.org/html/2406.09246v3 · FAST — arxiv.org/html/2501.09747v1

π0.5 ne choisit pas : jetons FAST pour le raisonnement lent, tête de flow matching — des nombres continus, sans vocabulaire — pour la commande fine. Les deux paradigmes dans le même robot.

π0.5 — arxiv.org/html/2504.16054v1

2. Les séries temporelles : le cas où le domaine a tranché

Les bacs ont perdu, chez leur propre auteur

Chronos-1 quantifiait : 4 094 bacs uniformes plus deux jetons spéciaux, soit un vocabulaire de 4 096 — et un jeton par pas de temps. Un modèle de langue ordinaire, une entropie croisée ordinaire, zéro modification d'architecture.

Deux défauts de fond. L'entropie croisée traite deux bacs voisins comme deux étiquettes sans relation, alors que l'écart entre eux a un sens. Et un jeton par pas fait un contexte très court : mille points de mesure, mille jetons.

Le patch continu a gagné : TimesFM et Toto 2.0 projettent 32 pas dans un seul vecteur, sans aucun vocabulaire. Amazon a abandonné ses propres bacs : Chronos-2 bat Chronos-Bolt dans plus de 90 % des comparaisons directes.

Réserve souvent gommée : la sortie par quantiles n'est pas venue avec le patch. TimesFM v1 prédit encore un point unique ; sa tête de quantiles n'arrive qu'à la 2.5, et y reste optionnelle.

Chronos-1 — arxiv.org/html/2403.07815v3 · TimesFM — arxiv.org/html/2310.10688v4 · Toto 2.0 — arxiv.org/html/2605.20119v1 · Chronos-2 — arxiv.org/abs/2510.15821

3. La biologie : la granularité se choisit par la tâche

Le même ADN, deux découpes, deux verdicts opposés

L'ADN fournit ses atomes : quatre bases. Le seul débat est le regroupement — lettre par lettre, par fenêtres de k lettres (les k-mers), ou par BPE — et le premier banc systématique le tranche tâche par tâche, pas matière par matière. Sur la détection des sites d'épissage, où le motif est fin, la lettre bat le BPE de 0,2235 de MCC — le coefficient de Matthews, une note d'exactitude qui va de −1 à +1. Sur une classification globale, où le motif est diffus, c'est le regroupement qui gagne.

Les protéines n'ont même pas ce débat : 20 acides aminés et quelques symboles de service, soit 33 entrées chez ESM-2. Leur structure, elle, n'a pas d'atome : on la quantifie en 4 096 codes appris, dont jusqu'à 70 % ne sortent jamais.

Banc génomique — academic.oup.com/bioinformatics/…/btaf456 · ESM-2 — huggingface.co/facebook/esm2_t33_650M_UR50D · structure — arxiv.org/html/2503.00089v2

4. Les tableaux : le coût pur du format

Le même contenu, presque trois fois le prix

Aucune IA là-dedans, aucun tokenizer spécial : il n'existe pas de « jeton tableau ». On aplatit la grille en texte, et le format décide seul de la facture. La même table à l'échelle 8 K coûte 3,73 k jetons en CSV et 10,5 k en HTML ; markdown 5,40 k, JSON 5,75 k.

La raison tient en une ligne : CSV n'écrit les noms de colonnes qu'une fois, JSON les répète à chaque ligne, HTML ouvre et ferme une balise par cellule.

Sérialisation tabulaire — arxiv.org/html/2411.19504v2

Le plus économe n'est pas forcément le plus exact : seuls les coûts en jetons sont solidement établis, le classement par exactitude ne l'est pas. Et la voie sans texte bute vite : TabPFN projette chaque cellule en un vecteur, donc la facture grandit comme lignes × colonnes.

TabPFN — arxiv.org/html/2502.17361v2

Le tableau de référence

Une ligne par matière ; la deuxième colonne commande tout le reste.

matièreatomes déjà là ?technique dominantediscret / continuvocabulairecoût en jetons
Codeoui — octetsBPE octets, jetons de blancs, remplissage au milieudiscret49 152 (StarCoder2) à ~200 0002,44 à 3,27 caractères/jeton (mesure non reproductible)
Nombresoui — 10 chiffrespré-découpe \p{N} ou \p{N}{1,3}discret10 ou 1 110 jetons numériques1 par chiffre, ou 1 par 3 chiffres
Tableauxnonsérialisation texte ; ou cellule → vecteurmixteaucun en natifune table de 8 K : 3,73 k en CSV, 10,5 k en HTML
Séries temporellesnonpatchs continus + tête à quantilescontinuaucun1 jeton pour 32 pas
ADNoui — 4 basesnucléotide (Evo 2), ou k-mers, ou BPEdiscret4 lettres utiles sur un vocabulaire de 512 (Evo 2) · 4 096 (BPE)1 par base, ou 1 pour 6 en 6-mers
Protéines — séquenceoui — 20 acides aminés1 acide aminé = 1 jetondiscret33 (ESM-2)1 par résidu
Protéines — structurenondictionnaire appris sur les 16 plus proches voisinsdiscret4 096, jusqu'à 70 % inutilisés1 par résidu, en parallèle
Moléculesoui — atomes, liaisonsSMILES coupé par regex atomiquediscret~1001 par atome ou symbole
Actions de robotnonDCT + BPE (FAST), ou flow matchingles deux1 024 (FAST)53/s à 50 Hz, contre 700 en bacs
Graphes recherchenon — aucun ordre canoniqueréseau de graphe projeté en jetonscontinuaucun1 par nœud ou sous-graphe
3D — maillage rechercheoui — triangles1 triangle = 1 jeton, ou latent par sommetles deux—séquence divisée par 9

Chiffres relevés dans la littérature, aucun mesuré ici.

Les deux dernières lignes portent un badge pour une raison : rien n'y est déployé — deux de plus dans la liste des familles très citées sans un seul produit.

maillage — arxiv.org/abs/2603.01515

Le fil commun : quand les atomes existent, le regroupement est un curseur réglé par la tâche ; quand ils n'existent pas, ne quantifiez jamais échantillon par échantillon — décorrélez d'abord. Le coût de chacune de ces lignes, ramené à la page de texte : le budget en jetons.