Images et vidéos : modèles ouverts testés
le sommaire de la rubrique — neuf pages, du 24 au 28 septembre 2026.
La question : des modèles ouverts, sur le seul GPU gratuit disponible — Kaggle, deux T4 de 15 Go —, peuvent-ils fournir les images et les plans d'une chaîne de reconstitutions antiques ? Un modèle d'image, deux modèles vidéo, et Blender entre les deux, tous essayés sur le même sujet : une rue de marché de Carthage.
Le fil, en une phrase
Les modèles ouverts savent faire une belle image et un plan crédible, mais ni l'Antiquité juste, ni une caméra tenue. La répartition qui marche : Blender tient la mise en page et la caméra, le modèle vidéo habille, guidé par la profondeur, dans le style d'une image repeinte — et un plan de 10 s se génère d'un seul tenant.
quota GPU utilisé
compteur Kaggle relevé à chaque session, au 28/09 à 9 h (tests publiés)
coût
Kaggle, 30 h gratuites par semaine
meilleur clip
LTX-2.5, profondeur + image repeinte (photo)
Antiquité en génération
le Forum sort en ruines
Le tableau de synthèse
| outil | usage testé | vitesse mesurée | note | GPU | licence |
|---|---|---|---|---|---|
| Qwen-Image 2.1 | générer une image | ≈ 90 s en 1024², 20 pas | texte 9, portrait 9, Antiquité 3 à 4 | 281 min | Qwen Research License |
| Qwen-Image 2.1 | repeindre, styliser une photo | 168 à 188 s par image | polychromie 8, reconstruire 1 à 2, aquarelle 7,5 | ||
| Depth Anything V2, Mask2Former, LaMa | découper une scène en 5 calques | 96,6 s par scène, sur CPU | — | 0 | Apache-2.0 ; « other » ; Apache-2.0 |
| Blender 5.1, Cycles | parallaxe, rue 3D, figurants | 1,97 à 3,41 s par image 1080p et par T4 (moyennes par scène) | 4 à 7 | 30 min | — |
| Qwen-Image 2.1 | repeindre un clip image par image | 41,6 s par image, les 2 T4 ensemble | image 8, clip 3 | 43 min | Qwen Research License |
| LTX-2.5 22B distillé | vidéo de 5 s, 24 i/s, avec son | 3,4 à 7,2 min par clip | 3 à 7 | 28 min | LTX-2.x Community License |
| Wan 2.2 14B, Wan 2.1 1.3B | vidéo de 5 s, 16 i/s | 15,3 à 27,1 min par clip (14B) | 3 à 6 | 82 min | Apache 2.0 |
| Qwen-Image 2.1 puis LTX-2.5 | habiller une previz dans 4 styles | ≈ 42 s par image ; 5,7 à 6,1 min par clip de 5 s | avec image 7 à 8, sans 3,5 à 4 (photo 7) | 87,6 min | Qwen Research License ; LTX-2.x Community License |
| LTX-2.5 22B distillé | 10 s d'un tenant, ou 3 clips enchaînés | 11,0 min en une fenêtre ; 14,6 à 15,6 min en 3 clips | 3 à 7 | 55,8 min | LTX-2.x Community License |
Vitesses et minutes de GPU : mesurées ici, chaque chiffre avec son fichier dans les pages et dans le relevé. Notes sur 10 : jugements de relecture visuelle. Licences relevées sur Qwen-Image-2.1, LTX-2, Wan2.2, et sur la fiche de chaque outil de découpe.
Le chemin suivi
- 24/09 — Déployer. Faire tenir Qwen-Image 2.1 (33 Go) dans deux cartes de 15 Go, en fp16 : trois essais, puis la vitesse et la génération. Qwen-Image 2.1 sur deux T4.
- 25/09 — Retoucher. Repeindre des photos, retoucher sous masque, douze styles. Retoucher et styliser.
- 25/09 — Animer. Une rue de Carthage peinte, animée trois fois : calques, rue 3D, repeint. Trois méthodes.
- 26-27/09 — Peupler. Quinze figurants 3D libres, rhabillés en Carthaginois. Des figurants dans la rue.
- 26-27/09 — Filmer. Wan 2.2 et LTX-2.5, huit clips de 5 s sur les deux plans. Wan contre LTX, et ce que LTX accepte.
- 27-28/09 — Styliser. Quatre styles, huit clips. Garder le mouvement, choisir le style.
- 28/09 — Enchaîner. Trois clips dans une scène, quatre méthodes. Enchaîner sans que ça se voie.
- Depuis le 27/09 — Le film. Scénario et voix off faits, previz Blender en construction. En cours.
Ce qu'on retient
- Le texte latin, les portraits, la vraie transparence : oui. L'Antiquité juste : non, les sites célèbres sortent tels qu'aujourd'hui — sauf à interdire le moderne en toutes lettres dans la consigne (Carthage ≈ 8/10).
- Éditer une image générée avec sa propre graine et sa propre taille rejoue son bruit : le modèle recopie. Changer de graine suffit.
- Repeindre un clip image par image scintille (7,9 fois l'original en aquarelle) : mieux vaut repeindre une image, puis l'animer.
- Une image de départ ne tient pas une caméra ; la profondeur de Blender, si. Et dès qu'on montre au modèle vidéo une image du rendu 3D, il la recopie : la previz se réduit à une maquette sans textures et à sa profondeur.
- Le style passe par l'image, pas par les mots : sans image de départ, LTX ignore les styles dessinés (Disney, manga, cartoon), seule la photo passe ; avec une image repeinte par Qwen, il tient les 5 s (7 à 8/10), défauts de l'image compris.
- Jusqu'à 10 s, une seule fenêtre : aucune jointure, et moins de GPU que trois clips. Au-delà, reprendre 17 images et fondre la jointure ; des clips indépendants coupent net.
- Relire sur le fichier brut : quatre chiffres des premiers rapports ont été corrigés (marge mémoire, durée d'une scène, recadrage des transferts, et un « bug » qui était une graine rejouée).
Ce qui est en cours
Un film de 5 min habillé par LTX : scénario (22 plans, 300 s) et voix off anglaise faits, previz Blender en construction. La page en cours dit où il en est, sans résultat vidéo avant relecture.
Les neuf pages
Crédits : les photos d'entrée viennent de Wikimedia Commons, avec auteur, licence et lien sous chaque image. Les personnages 3D sont de Quaternius : 7 modèles en CC0, « Witch » et « Worker » en CC BY 3.0. Les personnes des portraits sont fictives.