Wan 2.2 contre LTX-2.5 sur deux T4

la mesure. 8 clips de 5 s · 2026-09-26 → 2026-09-27 · Kaggle 2 × T4 · 2 modèles · 0 €

Un modèle vidéo ouvert, gratuit sur Kaggle, peut-il habiller une previz Blender comme le fait un service payant ? Deux plans à habiller : la parallaxe du marché, à faire vivre, et la rue 3D avec figurants, à rendre réaliste sans perdre sa caméra.

run
LTX B1 à B4, Wan A1 à A3
date
2026-09-26 → 2026-09-27
machine
Kaggle 2 × T4, 31 Go de RAM
durée
1,82 h de quota (0,46 + 1,36)
coût
0 €
journal
releve.json
clipmodèlece qu'il reçoitmin de GPUnote
B4LTX-2.5 + IC-LoRAla profondeur de la rue, seule5,47
B2LTX-2.5, 704p1re image de la parallaxe7,26
A2Wan 2.2 I2V 14B1re + dernière image de la parallaxe15,36
B1LTX-2.5, 448p1re image de la parallaxe3,85,5
A3Wan 2.1 VACE 1.3Bla parallaxe, avec un masque20,34,5
A1v13Wan 2.1 VACE 1.3Bprofondeur + 1re image de la rue23,83,5
A1Wan 2.2 VACE-Fun 14Bprofondeur + 1re image de la rue27,13
B3LTX-2.5, 448p1re + dernière image de la rue3,43

LTX : 121 images à 24 i/s, 8 pas, son compris. Wan : 81 images à 16 i/s, 4 pas (12 pour le 1.3B), passées à 24 i/s par RIFE. Notes du relecteur, sur 10 : des jugements. Sources : ltx/sorties/resume_ltx.json, wan/sorties/resume_wan_essai1.json et essai2.json.

1. La rue 3D, rhabillée par sa profondeur

Les mêmes 5 s, quatre fois. En haut, le rendu Blender et sa profondeur. En bas, Wan (A1, profondeur + 1re image) reste en 3D ; LTX (B4, profondeur seule) devient photoréaliste. Muet. Figurants de Quaternius : 7 modèles CC0, « Witch » et « Worker » en CC BY 3.0 (détail).

Guidé par la seule profondeur de Blender, LTX suit la mise en page et le travelling à l'image près : la corrélation entre ses contours et la profondeur de la même image vaut 0,16 à 0,26 (0,21 en moyenne). La luminance ne bouge que de 0,2 niveau d'une image à l'autre. 5,4 min de GPU pour 5 s.

ltx/sorties/resume_ltx.json · relecture de contrôle (corrélation contours / profondeur)

Témoins : la même corrélation avec une profondeur décalée dans le temps tombe à 0,00–0,06 ; avec un clip sans rapport (B1), 0,05–0,12.

relecture de contrôle

B4 (7/10) : pierre, tissus, palmier et mer. 832×448. Généré par LTX-2.5 à partir de la profondeur d'une previz Blender de ce projet. Muet.

Neuf images du clip B4 en grille

Neuf images de B4 : le décor tient, mais une robe bleue à fines bretelles s'installe au premier plan et des fanions barrent la rue.

La profondeur ne dit rien des costumes : robe à bretelles, bandanas, fanions de fête, pierre de taille au lieu d'enduit blanc (histoire 4/10, caméra 9/10). Et dès qu'on donne au modèle une image du rendu 3D, il la recopie : A1 garde les figurants 3D du rendu et l'enseigne « CAT » (1re image à 21,6 dB du rendu) ; B3 garde l'aspect jeu vidéo et fond deux figurants en un.

wan/sorties/resume_wan_essai2.json (psnr_img1_vs_rendu3d) · relecture visuelle

Deux bandes d'images : en haut le rendu, en bas deux silhouettes qui se fondent

B3, bord gauche, images 37 à 85 : en haut Blender, en bas LTX. La femme en jaune et l'homme en orange deviennent une seule silhouette qui glisse. Figurants de Quaternius (licences : détail).

Dans B3, la dernière image imposée agit (24,2 dB contre 11,7 face à l'image de départ), mais le trajet entre les deux est faux : au milieu, la caméra a jusqu'à 20 images d'avance sur le plan Blender.

travail/evaluation/calage/B3_*.txt · relecture de contrôle

2. La parallaxe, mise en mouvement

En haut, le plan Blender et Wan A2 (1re + dernière image). En bas, LTX B1 et B2 (1re image seule) : la foule vit, mais la caméra part seule. Muet.

LTX part bien de l'image donnée (29,5 à 32,6 dB), puis s'en va : la ressemblance avec l'image Blender de même rang (SSIM) tombe de 0,97 (image 1) à 0,35 (image 121) pour B1, et de 0,99 à 0,31 pour B2, et l'image s'assombrit (luminance 117 → 107 et 106).

travail/evaluation/ssim_B1_vs_blender_par.txt, ssim_B2r_vs_blender_par.txt, yavg_B1.txt, yavg_B2r.txt

Deux paires d'images : le plan prévu à gauche, la caméra de LTX plus loin et plus haut à droite

Images 97 et 121 : à gauche le plan prévu, à droite B2. La caméra est partie plus loin et plus haut, et la foule a doublé.

B2 en 1280×704 (6/10), réduit en 960 px. LTX génère aussi une piste son avec l'image ; elle est retirée ici tant qu'elle n'a pas été écoutée. Généré par LTX-2.5. Muet.

Wan A2 est le seul clip qui atterrit sur l'image prévue : 33,0 dB à la première, 29,4 à la dernière (sur le MP4), 19 à 21 dB au milieu. Mais ses 6 premières images couvrent le trajet des 21 premières de Blender : un à-coup au départ.

wan/sorties/resume_wan_essai2.json · relecture de contrôle (mesure sur le MP4)

Wan A3 ne régénère que la foule, les toiles et la fumée (59,4 % des pixels) : hors du masque, l'image reste celle de Blender (40,4 à 40,8 dB sur le MP4). Dedans, elle dérive, de 31 dB à l'image 1 à 20,5 dB à l'image 80.

wan/sorties/resume_wan_essai1.json · relecture de contrôle

A3 (4,5/10) : dans le masque, voile laiteux, ânes translucides, visages flous. La méthode est bonne, le modèle 1.3B trop faible. Généré par Wan 2.1 VACE sur un plan Blender de ce projet. Muet.

Une frange grise près d'un marchand, reprise par LTX sur plusieurs images

Défaut hérité : la frange grise d'un bord de calque devient un fantôme que LTX garde aux images 30, 60 et 87 de B1.

3. Ce que coûte un clip

LTX : 3,4 à 7,2 min de GPU par clip de 5 s, après 7,2 min de mise en route (40,2 Go de poids INT8 en 195 s, encodeur Gemma 4 isolé sur la 2e carte). Wan 14B : 15,3 à 27,1 min, sans compter 7 à 9 min de pré-test, et 16 i/s à interpoler. L'encodeur T5 de Wan, passé sur un noyau CPU gratuit, prend 6,4 min au lieu de 7,1 min de GPU.

ltx/sorties/resume_ltx.json, gemma_2e_t4.log · wan/sorties/resume_wan_essai*.json, t5_sortie/journal_t5.log

Premier essai Wan : les trois clips 14B tombent en 0,3 à 0,6 min sur une dépendance manquante (« whisper »), importée seulement au chargement des LoRA : le test CPU préalable, sans LoRA, ne l'avait pas vue. Seuls les secours 1.3B ont tourné. Côté LTX : largeur et hauteur doivent être multiples de 64, d'où 832×448 au lieu de 832×480.

wan/sorties/resume_wan_essai1.json (essai_precedent.erreur) · journal de la session LTX

4. Le verdict

Pour la rue 3D, LTX en vidéo→vidéo sur la profondeur. Pour la parallaxe, Wan en 1re + dernière image quand le cadrage compte, LTX 704p quand la caméra peut être libre. La previz se réduit donc à une maquette sans textures et à sa profondeur : c'est la méthode des tests en cours. Ce que LTX accepte d'autre comme références est relevé à part.