Ce que LTX-2.5 accepte, et le choix des modèles
à consulter, pas à lire d'affilée. Un relevé des dépôts et des classements, pas une mesure d'ici.
Un modèle vidéo ne se juge pas qu'à sa qualité d'image : ce qu'on peut lui imposer — une image, une caméra, un personnage — décide de ce qu'on peut en faire. Tout ce qui suit est lu dans le code ou dans les dépôts ; les essais d'ici sont à la page précédente.
1. Ce qu'on peut imposer à LTX-2.5
LTX-2.5 a tourné ici dans le moteur Wan2GP. Ce que ce moteur lui permet de recevoir, en plus du texte :
| référence | ce qu'elle fixe | essayé ici |
|---|---|---|
| image de départ | la première image | B1, B2 |
| image de fin | la dernière image | B3 |
| images injectées | des images clés, à des rangs choisis | non |
| suite d'une vidéo | fournie, ou la dernière générée | en cours |
| vidéo de profondeur | la mise en page et la caméra | B4 |
| pose, contours Canny | le mouvement humain, les contours | non |
| zone masquée | ce qui change, ce qui reste | non (fait avec Wan, A3) |
| feuille d'« ingrédients » | des sujets et un décor | non |
| SDR → HDR | la dynamique de l'image | non |
Types d'entrée autorisés par le gestionnaire du modèle : texte seul, image de départ, image de fin, suite d'une vidéo fournie, suite de la dernière vidéo générée (« TSEVL »), et un mode « Inject Frames » qui place des images à des indices choisis. Les vidéos de contrôle : pose, profondeur, Canny, format brut d'IC-LoRA, masque à repeindre, feuille de références, SDR vers HDR.
Wan2GP, commit 2345ae1 du 25/09/2026 — models/ltx2/ltx2_handler.py
La fenêtre glissante, pour les plans longs
Au-delà d'une fenêtre, le moteur enchaîne : chaque nouvelle fenêtre repart des dernières images de la précédente. Fenêtre de 5 à 501 images, 241 par défaut, par pas de 4 ; recouvrement de 1 à 97 images, 9 par défaut. À 24 i/s, 501 images font ≈ 21 s (calcul). C'est ce mécanisme que le test de continuité met à l'épreuve.
Wan2GP 2345ae1 — ltx2_handler.py (sliding_window_defaults)
La variante MSR : plusieurs sujets de référence
LTX-2.5 MSR (« Multiple Subject Reference ») prend 1 à 4 sujets ou objets, ou 2 à 5 références avec le décor en premier. Chaque référence est encodée comme 33 images répétées ; le préréglage sort 145 images en 1280×704. C'est la piste pour garder le même personnage d'un plan à l'autre ; elle n'a pas été essayée ici.
Wan2GP 2345ae1 — defaults/ltx2_25_22B_msr.json · models/ltx2/infos.py
L'IC-LoRA de profondeur utilisée pour B4 (« union control ») a été publiée pour LTX-2.3, comme le dit son nom de fichier. Appliquée à LTX-2.5, elle s'est chargée sans erreur et a guidé le clip.
huggingface.co · DeepBeepMeep/LTX-2 · ltx-2.3-22b-ic-lora-union-control-ref0.5 (miroir utilisé par Wan2GP, révision f9ce199)
2. Pourquoi ces deux modèles
Le 26/09, une quinzaine de modèles vidéo ont été relevés. Il en fallait un aux poids ouverts, qui ait une chance de tourner sur deux T4 de 15 Go.
| modèle | poids ouverts | licence | arène, texte → vidéo | arène, image → vidéo |
|---|---|---|---|---|
| LTX-2.5 22B distillé (arène : « LTX-2.5 Fast ») | oui | LTX-2.x Community License | 1 218 | 1 035 |
| Wan 2.2 A14B | oui | Apache 2.0 | 1 116 | — |
| Wan 2.1 VACE 1.3B | oui | Apache 2.0 | — | — |
| Wan 2.5 à 3.0 | non, API seule | — | — | — |
| HunyuanVideo 1.5 | oui | Tencent Hunyuan Community License (hors UE, Royaume-Uni, Corée du Sud) | — | — |
| MiniMax H3 | oui | licence MiniMax H3 (hors UE, Royaume-Uni, Corée du Sud, États-Unis) | — | 1 181 |
| Seedance 2.0, 720p | non, API seule | — | 1 259 | 1 176 |
Arène vidéo d'Artificial Analysis relevée le 26/09/2026 : texte → vidéo sans son, image → vidéo avec son ; « — » = pas relevé. Pour LTX-2.5, les scores sont ceux de l'entrée « LTX-2.5 Fast » (Pro : 1 209 et 1 006) ; qu'elle corresponde au modèle distillé ouvert n'est pas vérifié. Encodeur de texte de LTX-2.5 : Gemma 4, Apache 2.0 ; IC-LoRA Union : LTX-2 Community License. Sources : artificialanalysis.ai, github.com/Lightricks/LTX-2, github.com/Wan-Video/Wan2.2, huggingface.co/Wan-AI, tencent/HunyuanVideo-1.5, MiniMaxAI/MiniMax-H3, google/gemma-4-12B-it.
Ce qui était annoncé avant d'essayer
Le code officiel de Wan 2.2 A14B demande au moins 80 Go de mémoire sur une seule carte. Un notebook communautaire annonce ≈ 13 min pour 81 images en 480p sur une T4, en GGUF Q4_K_M, sans journal d'exécution. Un notebook public de LTX-2.5 annonce 3 à 5 min en 480p et 6 à 8 min en 704p, sur une seule T4.
Wan2.2 · README · Isi-dev/Google-Colab_Notebooks (wan22_Lightx2v.ipynb) · kaggle.com · unlockbulk
Aucun de ces temps n'était une mesure : des libellés de menu et des annonces. Il fallait mesurer ; c'est fait ici, avec les deux cartes.