Retoucher et styliser avec Qwen-Image 2.1
la mesure. édition + styles · 2026-09-25 · Kaggle 2 × T4 · 22 éditions, 12 styles (33 images) · 0 €
Le même modèle, cette fois avec une image en entrée : une photo à repeindre, un masque, un style à imposer. Ce qu'on cherchait : rendre à une ruine son état d'origine, et trouver un style tenable pour une chaîne.
- run
- édition (3 essais) + styles
- date
- 2026-09-25
- machine
- Kaggle 2 × T4 (15 Go)
- durée
- 133 min de GPU
- coût
- 0 €
- journal
- releve.json
1. Ce que coûte une édition
À 768 (896×672 ou 928×640) : 2,2 s par pas, ≈ 92 s pour 40 pas, plus 28 s d'encodeur par image de référence. En comptant tout, 168 à 188 s par image, et ≈ 6,5 min de frais fixes par session. Les 22 éditions (plus 1 portrait généré) ont pris 67 min en 3 essais.
edition/sorties/essai-1 à 3/mesures.json et journal.txt · quota_avant.txt
2. Repeindre : oui. Reconstruire : non.
Sans masque, les colonnes retrouvent leur polychromie ; gravures, lumière et cadrage conservés (8/10). 928×640, 40 pas, ≈ 93 s. Photo d'origine : © Vyacheslav Argenberg, CC BY 4.0, Wikimedia Commons ; modifiée par Qwen-Image 2.1.
Gravure de Piranèse (vers 1775) passée en couleur : composition fidèle, numéros gravés effacés (7/10). Numérisation du Metropolitan Museum of Art, CC0,
« Reconstruis le Forum antique », sur une photo de ruines, en 4 variantes de consigne et de taille : 1 à 2/10. Le modèle nettoie le site — touristes enlevés, lumière réchauffée — et ne reconstruit rien. Sur le decumanus de Volubilis, l'arc redevient entier et des passants en toge apparaissent (6/10), mais le portique s'allonge en aqueduc, avec balcons, stores et vitres.
rapport/donnees.json (éditions 01, 01b, 01c, 03) · relecture visuelle
Ruines, églises et Vittoriano restent en place (2/10). Photo d'origine : Alex Liivet, CC0 1.0,
Volubilis, 6/10. Photo d'origine : Christian Rosenbaum, CC BY-SA 3.0, Wikimedia Commons ; modifiée par Qwen-Image 2.1 et diffusée sous la même licence CC BY-SA 3.0.
3. Retoucher une zone
Le pipeline n'a pas de paramètre de masque. On le passe donc en deuxième image.
La photo, le masque, le résultat : seules les deux colonnes du masque sont peintes (8/10). Photo d'origine : © Vyacheslav Argenberg, CC BY 4.0, Wikimedia Commons ; modifiée par Qwen-Image 2.1.
Avec « image entièrement opaque » dans la consigne, l'écart moyen reste de 11,7/255 hors du masque contre 21,4 dedans. Sans cette phrase, tout le hors-masque devient transparent : alpha moyen 17,1 dehors, 253,8 dedans. Des cadres rouges peints sur l'image, à la place du masque séparé, débordent : 16,0 hors zone contre 11,7, et 17,7 à 18,8 sur les colonnes du fond contre 10 à 11,5.
edition/sorties/essai-1 et essai-2/mesures.json (02, 02c, 02d) · relecture (colonnes du fond)
Notes de relecture : sans la phrase, 2/10 ; avec les cadres rouges, 6/10.
Le texte tient bien : une enseigne bilingue arabe / français ajoutée sur une photo de rue sort sans faute (8,5/10). Mais un court texte français en minuscules sort avec la même faute 3 fois sur 3, sur deux graines ; en capitales, il est exact. Un logo et une photo combinés en affiche : 7,5/10, traits du logo affinés d'environ 20 %.
4. Le piège de la graine rejouée
À gauche, portrait fictif généré (672×896, graine 42). Au centre, édition « blazer, salle de réunion » à la même taille et la même graine : copie sursaturée, consigne ignorée (1/10). À droite, la même édition à 640 : 8/10. Images générées et modifiées par Qwen-Image 2.1.
Même graine, même taille, même bruit
Éditer une image générée avec la graine et la taille qui l'ont produite rejoue le bruit initial de la génération : le modèle recopie au lieu d'obéir. Le ticket diffusers a été clos sans correctif, « nothing to fix ». Il suffit de changer de graine ou de taille.
Même piège à 1024, consigne « ajoute une foule et des marchands » : aucune foule, et la saturation moyenne passe de 0,152 à 0,345, avec des halos HDR.
rapport/donnees.json (09_edit_foule, remesure de relecture ; le premier relevé donnait 0,154 → 0,346)
Cette édition a été notée 2/10. Le premier rapport parlait d'un « bug à 1024 ». La relecture a corrigé : aucune vraie photo n'avait été éditée à 1024, et le défaut suit la graine, pas la taille.
5. Douze styles, deux modes
Chaque style a été demandé en génération sur deux sujets (1024², 20 pas, ≈ 86 s), puis, pour quatre d'entre eux, en transfert sur une photo existante. Notes de relecture :
| style | ingénieure | légionnaire | transfert |
|---|---|---|---|
| aquarelle | 8,5 | 8,5 | 7,5 et 7,5 |
| 3D type Pixar/Disney | 9 | 8,5 | 3,5 et 2 |
| peinture à l'huile | 8,5 | 8 | — |
| cartoon 2D | 7 | 8 | 7 et 7 |
| anime | 8,5 | 7 | 5 |
| affiche années 1950 | 6 | 9 | — |
| pixel art | 6,5 | 8 | — |
| argile | 8 | 6,5 | — |
| photoréaliste | 7 | 7 | — |
| manga | 6,5 | 5 | — |
| ligne claire | 4,5 | 5,5 | — |
| vectoriel plat | 3 | 5 | — |
« Légionnaire devant le Colisée au coucher du soleil », graine 42. Le manga sort en gravure, la ligne claire en coloriage, le vectoriel plat sans visage ni armure. Images générées par Qwen-Image 2.1.
Deuxième sujet, une ingénieure de chantier à Casablanca : la ville n'est reconnaissable qu'en anime et en 3D. Personne fictive, images générées par Qwen-Image 2.1.
Transferts à 768, 40 pas, graine 1234. Photo du Forum : Alex Liivet, CC0 1.0,
Un transfert coûte ≈ 130 s à 768 (100 s de débruitage, 27,5 s d'encodeur, 2,6 s de décodage) et ≈ 269 s à 1024 — pour un résultat moins stylisé : écart moyen à la source 38,0 contre 48,5. À 768, la photo du Forum est recadrée sans qu'on le demande : ×1,12 en anime et en 3D, ×1,05 en aquarelle ; le cartoon et les portraits gardent leur cadrage, à 2,5 % près. La série entière a pris 66 min.
styles/sorties/essai-1/mesures.json et resume_styles.json · relecture (corrélation de contours)
Le transfert « 3D type Pixar » est ignoré sur la photo du Forum (3,5/10) et, sur le portrait, il retouche le visage : aminci et rajeuni (2/10). L'anime ne fait que repeindre la photo (5/10). Seule l'aquarelle tient dans les deux modes.
rapport/donnees.json (styles_classement) · relecture visuelle
Le rapport annonçait un recadrage d'environ 5 % partout ; la relecture, par corrélation des contours, mesure ×1,12 sur la photo du Forum, et au plus 2,5 % sur le cartoon et les portraits. C'est la mesure qui est publiée.