Les boutons de l'entraînement

la mesure. run-004b → run-039 · 2026-07-22 → 2026-08-03 · Kaggle P100 · 10 runs · 0 €

Ce qu'on tourne entre deux runs. Le récit des campagnes reste dans leur rubrique : ici, le bouton, son effet mesuré, le lien.

run
run-004b → run-039
date
2026-07-22 → 2026-08-03
machine
Kaggle P100 16 Go
durée
3 min à 4 h par run
coût
0 €
journal
EXPERIENCES.md

Quatre mots qui ne sont pas synonymes

Lot, pas, époque, tour

Un lot est un paquet d'exemples traversés ensemble. Un pas est une correction des poids : un lot entre, la perte est calculée, le gradient corrige. Une époque relit tout le panier. Un tour le régénère avec le modèle amélioré.

boutonchez nous
lot6 au 0,5 B ; 4 puis 3 au 1,5 B
pas3 750 au run-015
époque2 en SFT ; 20 à 60 en dessin
tourtour 1 : +10 · tour 2 : +0
lot 6 exemples ensemble — une seule traversée du réseau pas 1 pas = 1 lot corrigé — environ 1 000 pas dans une époque époque 0 10 20 30 40 50 60 2 — la règle du SFT 25 — le plateau du labo tour explorer trier entraîner — 2 époques examen un tour = un panier régénéré par le modèle lui-même
FIG 32 — le régime emboîté. Deux repères mesurés sur l'axe des époques : 2, le plafond du SFT ; 25, le plateau du labo.

La durée : jusqu'où l'époque paie

Sur les dessins : époque 1, 18,5 %. Époque 7, 25,2 %. Époque 10, 25,7 %. Les trois dernières ont pris 30 % du temps GPU pour 0,5 point.

run-004c · 2026-07-22 · P100 · 51 min · 0 € · ameliorations.html

brasépoquesdonnées cibleschats reconnus
run-004h20Sketchy brut~10 / 36
s260Sketchy brut~16 / 36
s530Sketchy épuré~20 / 36
s660Sketchy épuré~15 / 36

Allonger a payé sur données brutes : s2 monte de ~10 à ~16 sur 36. Pas sur données épurées : la perte de s6 plafonne dès l'époque 25 et finit sous s5.

run-004i · 2026-07-22 · ~25 min cumulées — run-004j · 2026-07-23 · 6 min 41 s · P100 · 0 € · labo.html

Côté LLM, le bouton est bloqué à 2 époques dans tous les SFT du projet — le SFT étant le réentraînement sur paires question → réponse. Au-delà, le modèle récite : la perte fond, l'examen stagne.

run-015 · 2026-07-30 · ~2 h — run-027, run-032, run-036 · P100 · 0 € · llm.html

La composition du lot

Absorber un style nouveau efface l'ancien métier : l'oubli catastrophique. La parade testée est le replay, remettre de l'ancien dans chaque lot.

70 / 30 run-004h ~10 / 36 s5, épuré : ~20 / 36 50 / 50 s1 ~10 / 36 deux fois plus de dose, même résultat 0 / 100 s3 ~1 / 36 sans révision, la génération s'écroule ancien, la révision nouveau, le style à apprendre
FIG 33 — trois doses de nouveauté dans le lot, le résultat sous chacune. Planches de 36 chats jugées à l'œil, labo.html.

Aucune dose n'a battu le 70/30. Le seul bond du labo vient d'ailleurs : s5 garde le 70/30 et retire les hachures des dessins cibles, 218 jetons médians tombant à 136. ~20 sur 36, le record. Ici, changer les données a toujours rapporté plus que changer un réglage.

run-004i, bras s1 et s5 · 2026-07-22 · P100 · 0 € · labo.html

Le taux d'apprentissage

Il règle la taille du pas. L'intuition dit qu'un taux minuscule protège l'acquis.

Bras s3 : bain 100 % Sketchy, taux divisé par 5 (1e-5), 15 époques — la retouche minimale. ~1 chat sur 36, pour une perte de 2,96, meilleure que celle du bras gagnant. Un taux minuscule ne remplace pas la révision.

run-004i, bras s3 · 2026-07-22 · P100 · 0 € · labo.html

Ce qu'on gèle

Bras s4 : embeddings et 6 blocs sur 8 figés, seuls les 2 derniers apprennent. ~3 chats sur 36, pour la meilleure perte du labo (2,95). Deux blocs suffisent à faire dérailler l'ensemble.

run-004i, bras s4 · 2026-07-22 · P100 · 0 € · labo.html

Poussé au bout, le bouton marche : LoRA gèle tout et ne réécrit rien — il ajoute un détour de rang 16 sur les matrices q k v o. Entraînables : 0,44 % au 0,5 B (2 M sur 494 M), 0,28 % au 1,5 B (4,4 M).

run-015 · 2026-07-30 · ~2 h — run-027 · 2026-08-01 · ~2 h 30 · P100 · 0 € · llm.html

Sur quoi la perte est calculée

Le masquage de la question

Chaque exemple est moulé dans un gabarit fixe et la perte ne juge que la réponse : les jetons de la question portent l'étiquette -100, qui dit « ignore-moi ».

### Instruction:
{la question}
### Réponse:
{la réponse}   ← seule cette partie compte dans la perte

Sans ce masque, le modèle apprendrait aussi à écrire des questions. Le jeton de fin lui apprend à s'arrêter.

La taille du lot : le seul mur

Lot à 512 sur les dessins : mémoire pleine sur le P100 16 Go, les grilles d'attention croissant en carré. Retour à 256, le run passe — seul contact avec le mur de tout le chapitre.

run-004c · 2026-07-22 · P100 16 Go · 51 min · 0 € · ameliorations.html

Le mur revient au LLM. Run-027 v1 : plantage au premier pas — 6,2 Go de poids fp32 plus les logits (151 936 × 384 × lot de 6), 660 Mo de trop. Correctif : fp16, LoRA en fp32, lot 4.

Deux boutons voisins, chiffrés

L'augmentation de données coûte trois lignes : retourner la moitié des dessins de chaque lot. 98 352 chats deviennent ~200 000 vues.

run-004c · 2026-07-22 · P100 · 51 min · 0 € · ameliorations.html

Grossir quand les données plafonnent : 4,9 M de paramètres puis 10 M, pour 0,4 point (25,3 % → 25,7 %). Le gain visuel venait d'ailleurs : la spécialisation.

run-004b · 66 min — run-004c · 51 min · 2026-07-22 · P100 · 0 € · ameliorations.html

Chaque couche d'entraînement se paie

Le bouton le plus cher n'est pas un nombre : c'est la décision de réentraîner.

couche ajoutéerunexamen
aucune, modèle déjà affinérun-03260 / 100
apprendre à baliser ses calculsrun-03654 / 100
apprendre à déclarer son outilrun-03948 / 100

Environ 6 points par couche, deux fois de suite — le geste appris étant pourtant parfait : 200 décisions d'outil sur 200 au run-039. Choisir est facile ; apprendre à choisir coûte cher.

run-032 · 2026-08-02 · ~2 h 45 — run-036 · ~4 h — run-039 · ~1 h · 2026-08-03 · P100 · 0 € · llm.html

Déclaré non mesuré

Ce projet ne les a pas mesurés : cette page n'en publie aucun chiffre. Les coûts ci-dessous sont estimés d'après les durées voisines, pas mesurés.