Les boutons de l'entraînement
la mesure. run-004b → run-039 · 2026-07-22 → 2026-08-03 · Kaggle P100 · 10 runs · 0 €
Ce qu'on tourne entre deux runs. Le récit des campagnes reste dans leur rubrique : ici, le bouton, son effet mesuré, le lien.
- run
- run-004b → run-039
- date
- 2026-07-22 → 2026-08-03
- machine
- Kaggle P100 16 Go
- durée
- 3 min à 4 h par run
- coût
- 0 €
- journal
- EXPERIENCES.md
Quatre mots qui ne sont pas synonymes
Lot, pas, époque, tour
Un lot est un paquet d'exemples traversés ensemble. Un pas est une correction des poids : un lot entre, la perte est calculée, le gradient corrige. Une époque relit tout le panier. Un tour le régénère avec le modèle amélioré.
| bouton | chez nous |
|---|---|
| lot | 6 au 0,5 B ; 4 puis 3 au 1,5 B |
| pas | 3 750 au run-015 |
| époque | 2 en SFT ; 20 à 60 en dessin |
| tour | tour 1 : +10 · tour 2 : +0 |
La durée : jusqu'où l'époque paie
Sur les dessins : époque 1, 18,5 %. Époque 7, 25,2 %. Époque 10, 25,7 %. Les trois dernières ont pris 30 % du temps GPU pour 0,5 point.
run-004c · 2026-07-22 · P100 · 51 min · 0 € · ameliorations.html
| bras | époques | données cibles | chats reconnus |
|---|---|---|---|
| run-004h | 20 | Sketchy brut | ~10 / 36 |
| s2 | 60 | Sketchy brut | ~16 / 36 |
| s5 | 30 | Sketchy épuré | ~20 / 36 |
| s6 | 60 | Sketchy épuré | ~15 / 36 |
Allonger a payé sur données brutes : s2 monte de ~10 à ~16 sur 36. Pas sur données épurées : la perte de s6 plafonne dès l'époque 25 et finit sous s5.
run-004i · 2026-07-22 · ~25 min cumulées — run-004j · 2026-07-23 · 6 min 41 s · P100 · 0 € · labo.html
Côté LLM, le bouton est bloqué à 2 époques dans tous les SFT du projet — le SFT étant le réentraînement sur paires question → réponse. Au-delà, le modèle récite : la perte fond, l'examen stagne.
run-015 · 2026-07-30 · ~2 h — run-027, run-032, run-036 · P100 · 0 € · llm.html
La composition du lot
Absorber un style nouveau efface l'ancien métier : l'oubli catastrophique. La parade testée est le replay, remettre de l'ancien dans chaque lot.
Aucune dose n'a battu le 70/30. Le seul bond du labo vient d'ailleurs : s5 garde le 70/30 et retire les hachures des dessins cibles, 218 jetons médians tombant à 136. ~20 sur 36, le record. Ici, changer les données a toujours rapporté plus que changer un réglage.
run-004i, bras s1 et s5 · 2026-07-22 · P100 · 0 € · labo.html
Le taux d'apprentissage
Il règle la taille du pas. L'intuition dit qu'un taux minuscule protège l'acquis.
Bras s3 : bain 100 % Sketchy, taux divisé par 5 (1e-5), 15 époques — la retouche minimale. ~1 chat sur 36, pour une perte de 2,96, meilleure que celle du bras gagnant. Un taux minuscule ne remplace pas la révision.
run-004i, bras s3 · 2026-07-22 · P100 · 0 € · labo.html
Ce qu'on gèle
Bras s4 : embeddings et 6 blocs sur 8 figés, seuls les 2 derniers apprennent. ~3 chats sur 36, pour la meilleure perte du labo (2,95). Deux blocs suffisent à faire dérailler l'ensemble.
run-004i, bras s4 · 2026-07-22 · P100 · 0 € · labo.html
Poussé au bout, le bouton marche : LoRA gèle tout et ne réécrit rien — il ajoute un détour de rang 16 sur les matrices q k v o. Entraînables : 0,44 % au 0,5 B (2 M sur 494 M), 0,28 % au 1,5 B (4,4 M).
run-015 · 2026-07-30 · ~2 h — run-027 · 2026-08-01 · ~2 h 30 · P100 · 0 € · llm.html
Sur quoi la perte est calculée
Le masquage de la question
Chaque exemple est moulé dans un gabarit fixe et la perte ne juge que la réponse : les jetons de la question portent l'étiquette -100, qui dit « ignore-moi ».
### Instruction:
{la question}
### Réponse:
{la réponse} ← seule cette partie compte dans la perte
Sans ce masque, le modèle apprendrait aussi à écrire des questions. Le jeton de fin lui apprend à s'arrêter.
La taille du lot : le seul mur
Lot à 512 sur les dessins : mémoire pleine sur le P100 16 Go, les grilles d'attention croissant en carré. Retour à 256, le run passe — seul contact avec le mur de tout le chapitre.
run-004c · 2026-07-22 · P100 16 Go · 51 min · 0 € · ameliorations.html
Le mur revient au LLM. Run-027 v1 : plantage au premier pas — 6,2 Go de poids fp32 plus les logits (151 936 × 384 × lot de 6), 660 Mo de trop. Correctif : fp16, LoRA en fp32, lot 4.
Deux boutons voisins, chiffrés
L'augmentation de données coûte trois lignes : retourner la moitié des dessins de chaque lot. 98 352 chats deviennent ~200 000 vues.
run-004c · 2026-07-22 · P100 · 51 min · 0 € · ameliorations.html
Grossir quand les données plafonnent : 4,9 M de paramètres puis 10 M, pour 0,4 point (25,3 % → 25,7 %). Le gain visuel venait d'ailleurs : la spécialisation.
run-004b · 66 min — run-004c · 51 min · 2026-07-22 · P100 · 0 € · ameliorations.html
Chaque couche d'entraînement se paie
Le bouton le plus cher n'est pas un nombre : c'est la décision de réentraîner.
| couche ajoutée | run | examen |
|---|---|---|
| aucune, modèle déjà affiné | run-032 | 60 / 100 |
| apprendre à baliser ses calculs | run-036 | 54 / 100 |
| apprendre à déclarer son outil | run-039 | 48 / 100 |
Environ 6 points par couche, deux fois de suite — le geste appris étant pourtant parfait : 200 décisions d'outil sur 200 au run-039. Choisir est facile ; apprendre à choisir coûte cher.
run-032 · 2026-08-02 · ~2 h 45 — run-036 · ~4 h — run-039 · ~1 h · 2026-08-03 · P100 · 0 € · llm.html
Déclaré non mesuré
Ce projet ne les a pas mesurés : cette page n'en publie aucun chiffre. Les coûts ci-dessous sont estimés d'après les durées voisines, pas mesurés.
- Rang LoRA balayé — r=4, 16, 64, le reste identique. Trois SFT, ~6 h estimées. Le r=16 du projet est un défaut, pas un gagnant.
- Taux d'apprentissage toutes choses égales — quatre valeurs sur un même bras ; le seul chiffre du projet (s3) change aussi la dose du lot. ~4 h estimées.
- Lot × taux — la grille 3 × 3, les deux boutons interagissant. Neuf runs, ~12 h estimées.
- Échauffement et planning — OneCycle a servi sur les dessins, jamais comparé à un taux constant. Deux runs, ~2 h estimées.