Retoucher et styliser avec Qwen-Image 2.1

la mesure. édition + styles · 2026-09-25 · Kaggle 2 × T4 · 22 éditions, 12 styles (33 images) · 0 €

Le même modèle, cette fois avec une image en entrée : une photo à repeindre, un masque, un style à imposer. Ce qu'on cherchait : rendre à une ruine son état d'origine, et trouver un style tenable pour une chaîne.

run
édition (3 essais) + styles
date
2026-09-25
machine
Kaggle 2 × T4 (15 Go)
durée
133 min de GPU
coût
0 €
journal
releve.json

1. Ce que coûte une édition

À 768 (896×672 ou 928×640) : 2,2 s par pas, ≈ 92 s pour 40 pas, plus 28 s d'encodeur par image de référence. En comptant tout, 168 à 188 s par image, et ≈ 6,5 min de frais fixes par session. Les 22 éditions (plus 1 portrait généré) ont pris 67 min en 3 essais.

edition/sorties/essai-1 à 3/mesures.json et journal.txt · quota_avant.txt

2. Repeindre : oui. Reconstruire : non.

Avant et après : colonnes de Karnak grises puis polychromes

Sans masque, les colonnes retrouvent leur polychromie ; gravures, lumière et cadrage conservés (8/10). 928×640, 40 pas, ≈ 93 s. Photo d'origine : © Vyacheslav Argenberg, CC BY 4.0, Wikimedia Commons ; modifiée par Qwen-Image 2.1.

Gravure du Campo Vaccino et sa version en couleur

Gravure de Piranèse (vers 1775) passée en couleur : composition fidèle, numéros gravés effacés (7/10). Numérisation du Metropolitan Museum of Art, CC0, Wikimedia Commons ; modifiée par Qwen-Image 2.1.

« Reconstruis le Forum antique », sur une photo de ruines, en 4 variantes de consigne et de taille : 1 à 2/10. Le modèle nettoie le site — touristes enlevés, lumière réchauffée — et ne reconstruit rien. Sur le decumanus de Volubilis, l'arc redevient entier et des passants en toge apparaissent (6/10), mais le portique s'allonge en aqueduc, avec balcons, stores et vitres.

rapport/donnees.json (éditions 01, 01b, 01c, 03) · relecture visuelle

Avant et après : le Forum romain en ruines, sans touristes après

Ruines, églises et Vittoriano restent en place (2/10). Photo d'origine : Alex Liivet, CC0 1.0, Wikimedia Commons ; modifiée par Qwen-Image 2.1.

Avant et après : le decumanus de Volubilis rendu comme une rue animée

Volubilis, 6/10. Photo d'origine : Christian Rosenbaum, CC BY-SA 3.0, Wikimedia Commons ; modifiée par Qwen-Image 2.1 et diffusée sous la même licence CC BY-SA 3.0.

3. Retoucher une zone

Le pipeline n'a pas de paramètre de masque. On le passe donc en deuxième image.

La photo, le masque en noir et blanc, puis deux colonnes repeintes

La photo, le masque, le résultat : seules les deux colonnes du masque sont peintes (8/10). Photo d'origine : © Vyacheslav Argenberg, CC BY 4.0, Wikimedia Commons ; modifiée par Qwen-Image 2.1.

Avec « image entièrement opaque » dans la consigne, l'écart moyen reste de 11,7/255 hors du masque contre 21,4 dedans. Sans cette phrase, tout le hors-masque devient transparent : alpha moyen 17,1 dehors, 253,8 dedans. Des cadres rouges peints sur l'image, à la place du masque séparé, débordent : 16,0 hors zone contre 11,7, et 17,7 à 18,8 sur les colonnes du fond contre 10 à 11,5.

edition/sorties/essai-1 et essai-2/mesures.json (02, 02c, 02d) · relecture (colonnes du fond)

Notes de relecture : sans la phrase, 2/10 ; avec les cadres rouges, 6/10.

Le texte tient bien : une enseigne bilingue arabe / français ajoutée sur une photo de rue sort sans faute (8,5/10). Mais un court texte français en minuscules sort avec la même faute 3 fois sur 3, sur deux graines ; en capitales, il est exact. Un logo et une photo combinés en affiche : 7,5/10, traits du logo affinés d'environ 20 %.

4. Le piège de la graine rejouée

Trois portraits d'une personne fictive : l'original, une copie sursaturée, puis la version en blazer

À gauche, portrait fictif généré (672×896, graine 42). Au centre, édition « blazer, salle de réunion » à la même taille et la même graine : copie sursaturée, consigne ignorée (1/10). À droite, la même édition à 640 : 8/10. Images générées et modifiées par Qwen-Image 2.1.

Même graine, même taille, même bruit

Éditer une image générée avec la graine et la taille qui l'ont produite rejoue le bruit initial de la génération : le modèle recopie au lieu d'obéir. Le ticket diffusers a été clos sans correctif, « nothing to fix ». Il suffit de changer de graine ou de taille.

diffusers #14824

Même piège à 1024, consigne « ajoute une foule et des marchands » : aucune foule, et la saturation moyenne passe de 0,152 à 0,345, avec des halos HDR.

rapport/donnees.json (09_edit_foule, remesure de relecture ; le premier relevé donnait 0,154 → 0,346)

Cette édition a été notée 2/10. Le premier rapport parlait d'un « bug à 1024 ». La relecture a corrigé : aucune vraie photo n'avait été éditée à 1024, et le défaut suit la graine, pas la taille.

5. Douze styles, deux modes

Chaque style a été demandé en génération sur deux sujets (1024², 20 pas, ≈ 86 s), puis, pour quatre d'entre eux, en transfert sur une photo existante. Notes de relecture :

styleingénieurelégionnairetransfert
aquarelle8,58,57,5 et 7,5
3D type Pixar/Disney98,53,5 et 2
peinture à l'huile8,58—
cartoon 2D787 et 7
anime8,575
affiche années 195069—
pixel art6,58—
argile86,5—
photoréaliste77—
manga6,55—
ligne claire4,55,5—
vectoriel plat35—
Douze vignettes d'un légionnaire devant le Colisée, une par style

« Légionnaire devant le Colisée au coucher du soleil », graine 42. Le manga sort en gravure, la ligne claire en coloriage, le vectoriel plat sans visage ni armure. Images générées par Qwen-Image 2.1.

Douze vignettes d'une ingénieure de chantier, une par style

Deuxième sujet, une ingénieure de chantier à Casablanca : la ville n'est reconnaissable qu'en anime et en 3D. Personne fictive, images générées par Qwen-Image 2.1.

Une photo du Forum et un portrait fictif, chacun en anime, cartoon, 3D et aquarelle

Transferts à 768, 40 pas, graine 1234. Photo du Forum : Alex Liivet, CC0 1.0, Wikimedia Commons ; portrait fictif généré ; transferts par Qwen-Image 2.1.

Un transfert coûte ≈ 130 s à 768 (100 s de débruitage, 27,5 s d'encodeur, 2,6 s de décodage) et ≈ 269 s à 1024 — pour un résultat moins stylisé : écart moyen à la source 38,0 contre 48,5. À 768, la photo du Forum est recadrée sans qu'on le demande : ×1,12 en anime et en 3D, ×1,05 en aquarelle ; le cartoon et les portraits gardent leur cadrage, à 2,5 % près. La série entière a pris 66 min.

styles/sorties/essai-1/mesures.json et resume_styles.json · relecture (corrélation de contours)

Le transfert « 3D type Pixar » est ignoré sur la photo du Forum (3,5/10) et, sur le portrait, il retouche le visage : aminci et rajeuni (2/10). L'anime ne fait que repeindre la photo (5/10). Seule l'aquarelle tient dans les deux modes.

rapport/donnees.json (styles_classement) · relecture visuelle

Le rapport annonçait un recadrage d'environ 5 % partout ; la relecture, par corrélation des contours, mesure ×1,12 sur la photo du Forum, et au plus 2,5 % sur le cartoon et les portraits. C'est la mesure qui est publiée.