Garder le mouvement de Blender, choisir le style

la mesure. 8 clips de 5 s · 2026-09-27 → 2026-09-28 · Kaggle 2 × T4 · LTX-2.5 + Qwen-Image 2.1 · 0 €

Peut-on garder le mouvement d'une previz Blender — caméra, figurants, mise en page — et choisir le rendu : Disney/Pixar 3D, manga, cartoon ou photo ? Sur la rue v2, LTX-2.5 reçoit la profondeur et le style en toutes lettres, avec ou sans image repeinte.

run
styles LTX : 4 images Qwen, 8 clips
date
2026-09-27 → 2026-09-28
machine
Kaggle 2 × T4
durée
87,6 min de quota (22,8 Qwen + 64,8 LTX)
coût
0 €
journal
releve.json

Le mouvement vient de Blender, le style de l'image. Sur 7 images par clip, prises toutes les 20, l'image générée ressemble le plus, par ses contours, à l'image Blender de même rang 6 ou 7 fois sur 7 : travelling et figurants sont suivis. À la relecture, sans image de départ, les styles dessinés (Disney, manga, cartoon) n'apparaissent pas, seule la photo passe ; avec l'image repeinte par Qwen, le style tient les 121 images.

styles/ltx/suivi.py et suivi_sortie.txt · relecture du réalisateur

La méthode

  1. Blender rend la rue v2 — 15 figurants, travelling avant de 5 s — et sa profondeur, en 832×448, 121 images.
  2. Qwen-Image 2.1 repeint l'image 1 du rendu dans chaque style (deux graines, la meilleure retenue, puis recalée sur le cadrage de Blender).
  3. LTX-2.5 distillé génère 5 s guidé par la profondeur (IC-LoRA Union). Variante a : profondeur et consigne de style. Variante b : la même chose, plus l'image repeinte en image de départ (Wan2GP accepte les deux dans le même appel).

Partout la graine 42, 8 pas, 24 i/s, et une consigne négative appliquée par NAG (5 / 3,5 / 0,5) contre bretelles, jeans, bandanas, fanions et visages déformés.

La rue v2 et ses quatre versions repeintes : 3D, anime, cartoon, photo

Les images de départ : la rue v2 (en haut à gauche), puis Disney/Pixar 3D (8/10), anime façon Ghibli pour « manga » (7/10), cartoon (8/10), photo (8,5/10), notées par l'agent qui les a faites. Rendu Blender repeint par Qwen-Image 2.1 ; figurants de Quaternius, 7 modèles CC0, « Witch » et « Worker » en CC BY 3.0 (détail).

Qwen : ≈ 42 s de débruitage par image, 22,8 min de GPU en deux essais (compteur 2,12 → 2,50 h). LTX : 37,5 s par pas, 5,7 min par clip sans image, 6,0 avec ; 8,5 min de mise en route (poids, encodeur Gemma sur la 2e carte) ; en tout, 56,4 min mesurées pour les 8 clips. Pic de mémoire graphique : 11,82 Go.

styles/qwen/sortie_essai2/journal.txt · compteur : personnages/rendu/quota_apres_v2.txt, styles/ltx/quota_avant.txt · styles/ltx/sorties/resume_ltx_styles.json

Les 8 clips

clipce qu'il reçoitmin de GPU1re image / image Qwennote
photo bprofondeur + image photo5,9729,1 dB8
disney bprofondeur + image Disney/Pixar6,0930,5 dB7
manga bprofondeur + image anime5,9728,2 dB7
cartoon bprofondeur + image cartoon5,9624,8 dB7
photo aprofondeur + « photorealistic » en consigne5,71—7
disney aprofondeur + « Disney Pixar » en consigne5,70—4
manga aprofondeur + « anime » en consigne5,70—3,5
cartoon aprofondeur + « cartoon » en consigne5,73—3,5

1re image / image Qwen : PSNR avant encodage. Notes du réalisateur sur 10, des jugements ; l'agent qui a tourné les clips donnait 0,5 à 1 point de plus aux clips b et à photo a. Source : resume_ltx_styles.json.

1. Avec l'image de départ, le style tient

Photo documentaire, b (8/10) : tuniques longues à manches, voiles, enduit de chaux ; le passant central reste de dos, comme dans Blender. Généré par LTX-2.5 (previz Blender de ce projet + image Qwen-Image 2.1). Muet.

Cartoon 2D, b (7/10) : le style le plus franc, gros contours noirs et aplats vifs ; en fin de plan, les traits s'affinent. Muet.

Manga, rendu en anime façon Ghibli, b (7/10) : traits d'encre, aplats et ciel peint jusqu'à l'image 121. Muet.

Disney/Pixar 3D, b (7/10) : lumière dorée, mais le passant central se retourne au début (plus bas). Muet.

2. Sans l'image, le style dessiné disparaît

Cartoon demandé, profondeur seule, a (3,5/10) : ni contours noirs ni aplats, la même rue rosée semi-réaliste que les autres clips a. Muet.

Grille : en haut le rendu Blender et sa profondeur ; puis, pour chaque style, l'image repeinte, le clip sans image et le clip avec image

L'image 60 de chaque clip. En haut, le rendu Blender et sa profondeur ; puis, par style, l'image Qwen (notée par l'agent qui l'a faite), le clip a, le clip b (notes de relecture). Figurants de Quaternius (licences : détail).

Seule la photo se passe d'image (photo a, 7/10) : photoréaliste de bout en bout, mais monotone — tout en beige, couleurs des costumes perdues, étals redessinés.

3. Ce qui a raté

Pour les styles dessinés, la consigne seule ne sert à rien : LTX-2.5 distillé ignore « Disney Pixar », « anime » ou « cartoon ». disney a, manga a et cartoon a sont presque la même vidéo, mêmes figurants clonés en beige (3,5 à 4/10).

relecture du réalisateur

Avec l'image, LTX recopie aussi ses erreurs : des pseudo-lettres « CA » sur les enseignes (le signe de Tanit de Blender, lu comme des lettres par Qwen), des bras nus et un chapeau conique d'allure asiatique dans la version Disney.

relecture du réalisateur

Cinq vignettes d'un même passant : de face à l'image 1, de dos à l'image 13

disney b, images 1, 4, 7, 10 et 13 : Qwen a peint de face un passant qui marche de dos dans Blender. LTX le retourne en une demi-seconde, visage déformé compris : il faut couper les 12 à 15 premières images.

L'image de départ ne dit rien de ce qui entre dans le champ ensuite. Le figurant qui entre au premier plan à gauche (images 90 à 121) sort flou en photo, en traînées en manga, avec des filaments noirs en cartoon.

relecture du réalisateur

Trois vignettes du bord gauche de l'image 121 : un figurant flou, puis en traînées, puis avec des filaments noirs

Image 121, bord gauche, clips b : photo, manga, cartoon.

Deux premiers essais perdus, comptés dans les 87,6 min. Qwen : arrêté après 8,0 min sans image, une taille incompatible avec l'encodage de position. LTX : 8,4 min sans clip, tué faute de RAM selon le commentaire du noyau (journal de l'essai écrasé) : profondeur en float32 (541 Mo) pendant que Gemma tournait ; corrigé en uint8 (135 Mo), Gemma attendu.

styles/qwen/sortie_essai1/journal.txt · styles/ltx/quota_avant.txt, quota_avant_essai2.txt · styles/ltx/noyau/ltx_styles.py (commentaire)

Ce qu'on retient