Garder le mouvement de Blender, choisir le style
la mesure. 8 clips de 5 s · 2026-09-27 → 2026-09-28 · Kaggle 2 × T4 · LTX-2.5 + Qwen-Image 2.1 · 0 €
Peut-on garder le mouvement d'une previz Blender — caméra, figurants, mise en page — et choisir le rendu : Disney/Pixar 3D, manga, cartoon ou photo ? Sur la rue v2, LTX-2.5 reçoit la profondeur et le style en toutes lettres, avec ou sans image repeinte.
- run
- styles LTX : 4 images Qwen, 8 clips
- date
- 2026-09-27 → 2026-09-28
- machine
- Kaggle 2 × T4
- durée
- 87,6 min de quota (22,8 Qwen + 64,8 LTX)
- coût
- 0 €
- journal
- releve.json
Le mouvement vient de Blender, le style de l'image. Sur 7 images par clip, prises toutes les 20, l'image générée ressemble le plus, par ses contours, à l'image Blender de même rang 6 ou 7 fois sur 7 : travelling et figurants sont suivis. À la relecture, sans image de départ, les styles dessinés (Disney, manga, cartoon) n'apparaissent pas, seule la photo passe ; avec l'image repeinte par Qwen, le style tient les 121 images.
styles/ltx/suivi.py et suivi_sortie.txt · relecture du réalisateur
La méthode
- Blender rend la rue v2 — 15 figurants, travelling avant de 5 s — et sa profondeur, en 832×448, 121 images.
- Qwen-Image 2.1 repeint l'image 1 du rendu dans chaque style (deux graines, la meilleure retenue, puis recalée sur le cadrage de Blender).
- LTX-2.5 distillé génère 5 s guidé par la profondeur (IC-LoRA Union). Variante a : profondeur et consigne de style. Variante b : la même chose, plus l'image repeinte en image de départ (Wan2GP accepte les deux dans le même appel).
Partout la graine 42, 8 pas, 24 i/s, et une consigne négative appliquée par NAG (5 / 3,5 / 0,5) contre bretelles, jeans, bandanas, fanions et visages déformés.
Les images de départ : la rue v2 (en haut à gauche), puis Disney/Pixar 3D (8/10), anime façon Ghibli pour « manga » (7/10), cartoon (8/10), photo (8,5/10), notées par l'agent qui les a faites. Rendu Blender repeint par Qwen-Image 2.1 ; figurants de Quaternius, 7 modèles CC0, « Witch » et « Worker » en CC BY 3.0 (détail).
Qwen : ≈ 42 s de débruitage par image, 22,8 min de GPU en deux essais (compteur 2,12 → 2,50 h). LTX : 37,5 s par pas, 5,7 min par clip sans image, 6,0 avec ; 8,5 min de mise en route (poids, encodeur Gemma sur la 2e carte) ; en tout, 56,4 min mesurées pour les 8 clips. Pic de mémoire graphique : 11,82 Go.
styles/qwen/sortie_essai2/journal.txt · compteur : personnages/rendu/quota_apres_v2.txt, styles/ltx/quota_avant.txt · styles/ltx/sorties/resume_ltx_styles.json
Les 8 clips
| clip | ce qu'il reçoit | min de GPU | 1re image / image Qwen | note |
|---|---|---|---|---|
| photo b | profondeur + image photo | 5,97 | 29,1 dB | 8 |
| disney b | profondeur + image Disney/Pixar | 6,09 | 30,5 dB | 7 |
| manga b | profondeur + image anime | 5,97 | 28,2 dB | 7 |
| cartoon b | profondeur + image cartoon | 5,96 | 24,8 dB | 7 |
| photo a | profondeur + « photorealistic » en consigne | 5,71 | — | 7 |
| disney a | profondeur + « Disney Pixar » en consigne | 5,70 | — | 4 |
| manga a | profondeur + « anime » en consigne | 5,70 | — | 3,5 |
| cartoon a | profondeur + « cartoon » en consigne | 5,73 | — | 3,5 |
1re image / image Qwen : PSNR avant encodage. Notes du réalisateur sur 10, des jugements ; l'agent qui a tourné les clips donnait 0,5 à 1 point de plus aux clips b et à photo a. Source : resume_ltx_styles.json.
1. Avec l'image de départ, le style tient
Photo documentaire, b (8/10) : tuniques longues à manches, voiles, enduit de chaux ; le passant central reste de dos, comme dans Blender. Généré par LTX-2.5 (previz Blender de ce projet + image Qwen-Image 2.1). Muet.
Cartoon 2D, b (7/10) : le style le plus franc, gros contours noirs et aplats vifs ; en fin de plan, les traits s'affinent. Muet.
Manga, rendu en anime façon Ghibli, b (7/10) : traits d'encre, aplats et ciel peint jusqu'à l'image 121. Muet.
Disney/Pixar 3D, b (7/10) : lumière dorée, mais le passant central se retourne au début (plus bas). Muet.
2. Sans l'image, le style dessiné disparaît
Cartoon demandé, profondeur seule, a (3,5/10) : ni contours noirs ni aplats, la même rue rosée semi-réaliste que les autres clips a. Muet.
L'image 60 de chaque clip. En haut, le rendu Blender et sa profondeur ; puis, par style, l'image Qwen (notée par l'agent qui l'a faite), le clip a, le clip b (notes de relecture). Figurants de Quaternius (licences : détail).
Seule la photo se passe d'image (photo a, 7/10) : photoréaliste de bout en bout, mais monotone — tout en beige, couleurs des costumes perdues, étals redessinés.
3. Ce qui a raté
Pour les styles dessinés, la consigne seule ne sert à rien : LTX-2.5 distillé ignore « Disney Pixar », « anime » ou « cartoon ». disney a, manga a et cartoon a sont presque la même vidéo, mêmes figurants clonés en beige (3,5 à 4/10).
relecture du réalisateur
Avec l'image, LTX recopie aussi ses erreurs : des pseudo-lettres « CA » sur les enseignes (le signe de Tanit de Blender, lu comme des lettres par Qwen), des bras nus et un chapeau conique d'allure asiatique dans la version Disney.
relecture du réalisateur
disney b, images 1, 4, 7, 10 et 13 : Qwen a peint de face un passant qui marche de dos dans Blender. LTX le retourne en une demi-seconde, visage déformé compris : il faut couper les 12 à 15 premières images.
L'image de départ ne dit rien de ce qui entre dans le champ ensuite. Le figurant qui entre au premier plan à gauche (images 90 à 121) sort flou en photo, en traînées en manga, avec des filaments noirs en cartoon.
relecture du réalisateur
Image 121, bord gauche, clips b : photo, manga, cartoon.
Deux premiers essais perdus, comptés dans les 87,6 min. Qwen : arrêté après 8,0 min sans image, une taille incompatible avec l'encodage de position. LTX : 8,4 min sans clip, tué faute de RAM selon le commentaire du noyau (journal de l'essai écrasé) : profondeur en float32 (541 Mo) pendant que Gemma tournait ; corrigé en uint8 (135 Mo), Gemma attendu.
styles/qwen/sortie_essai1/journal.txt · styles/ltx/quota_avant.txt, quota_avant_essai2.txt · styles/ltx/noyau/ltx_styles.py (commentaire)
Ce qu'on retient
- L'image de départ est le seul levier de style qui marche : de a à b, +3 points pour Disney, +3,5 pour manga et cartoon, +1 pour la photo (notes de relecture).
- Elle se vérifie figurant par figurant avant LTX — orientation, manches, coiffe : tout défaut est recopié, ou « corrigé » en morphing.
- Pour la chaîne : photo b en plan d'illustration ; cartoon et manga pour des séquences stylisées ; Disney après correction des costumes.
- À essayer : repeindre aussi la dernière image, en image de fin, pour tenir le style et habiller les entrants ; dépasser 832×448, trop petit pour des visages.