La famille Qwen d'Alibaba a publié Qwen Image 2.1 en open source le 20 septembre 2026 — la vidéo 'Finally! New best local AI image editor is here' le présente comme l'éditeur local le plus capable à ce jour. Son coeur visuel compte seulement 7 milliards de paramètres sur 32 couches DiT single-stream, associé à un encodeur texte Qwen3-VL 8B et à un VAE RGBA 64 canaux. Un seul checkpoint gère à la fois la génération texte-image et l'édition conditionnée par image, fini de jongler entre outils séparés. Imaginez un seul atelier qui dessine et découpe sur le même établi.
L'architecture vise l'efficacité : attention à granularité mixte et réutilisation du cache KV de préfixe équilibrent qualité et coût de calcul. La fiche Hugging Face et le billet Alibaba Cloud soulignent que ce bloc compact de 7B délivre des sorties natives en 2K nettes tout en réduisant la pression mémoire. 7B paraît petit, mais l'argument porte sur la qualité par watt plutôt que sur la taille brute — comme obtenir un gros couple avec un petit moteur grâce à une meilleure boîte de vitesses.
Côté texte-image, le modèle excelle sur photos photoréalistes, anatomie correcte et forte fidélité au prompt. La vidéo montre en un seul prompt des diagrammes et infographies complexes multi-éléments, ainsi que des designs d'interface rendus de façon cohérente. Les vagues ouvertes précédentes étaient limitées au texte-image et ne permettaient pas d'éditer une photo existante en langage naturel comme la lignée fermée Nano Banana ; cette version comble l'écart. Concrètement, 'transforme cette brochure en infographie' garde des dizaines d'éléments alignés dans une seule image.
L'ajout phare est la transparence native. S'appuyant sur l'effort dédié Qwen-Image-Layered de décembre 2025, Qwen Image 2.1 intègre cette capacité dans un modèle unifié et laisse le prompt décider d'émettre une image normale ou une image RGBA avec canal alpha. Les exemples incluent stickers et découpes produit générés avec fond transparent en une passe, et même l'édition de la couche transparente elle-même. Pour les designers, cela supprime l'étape séparée de segmentation ou de détourage, comme poser un logo sur un t-shirt sans d'abord effacer le fond à la main.
L'édition franchit un cap avec le conditionnement par références : jusqu'à dix images de référence à la fois. La vidéo montre le changement de texte sur un asset transparent via prompt, l'extraction de branches au premier plan vers une couche transparente, et surtout l'assemblage d'éléments issus de nombreuses photos. Une démo demande la femme de la photo un avec la veste rose de la photo deux plus chaussures, sac et chapeau de trois autres photos, fusionnés en un seul plan cohérent avec préservation du visage. Des photos de meubles sont pareillement compositées en une seule pièce.
L'édition locale est tout aussi flexible : entourez une zone, peignez une annotation ou fournissez un masque séparé pour dire exactement où intervenir. La vidéo gribouille sur des objets pour les supprimer ou dessine sur une zone vide pour ajouter un élément, et le modèle respecte le masque sans toucher le reste. Les modèles ouverts antérieurs offraient un contrôle pixel-précis limité ; ici le contrôle reste chez l'utilisateur et l'édition est confinée à la zone marquée, comme surligner une épreuve pour un éditeur.
La fidélité des personnes et produits est un autre axe : une tenue complexe conserve coutures, texture et couleur transférée sur un mannequin, un selfie est étendu en panorama explorable en 3D, et des tâches plus larges comme infographies et storyboards sont couvertes. La limite de dix images compte pour le travail multi-sujets — la fiche montre six portraits individuels fusionnés en une photo de groupe. C'est comme répéter toute une collection en une seule frame au lieu de découper chaque produit isolément.
Pour l'installation, la vidéo recommande ComfyUI — la plateforme offline la plus populaire pour la génération ouverte d'images et vidéos, gratuite et hautement personnalisable. Elle met d'abord à jour ComfyUI via 'update ComfyUI.bat', puis ouvre Templates dans la barre latérale, cherche Qwen Image 2.1 et révèle trois workflows prêts : texte-image, édition d'image et suppression d'arrière-plan. Si les modèles manquent, les JSON de workflow se téléchargent en bas de page et se glissent dans ComfyUI. Comme préparer l'établi avant d'étaler les fiches recettes.
Les fichiers modèles vivent dans trois dossiers et leurs tailles dictent la VRAM. Pour la diffusion, BF16 complet 14,2 Go ou INT8 Conrot plus petit 7,2 Go, ce dernier tenant sur 8 Go de VRAM et moins. Les encodeurs texte vont de BF16 17,5 Go à W4A8 seulement 6,3 Go — la recommandation basse VRAM. Le VAE est minuscule à 676 Mo. Les fichiers vont dans ComfyUI/models/diffusion_models, text_encoders et vae, puis R rafraîchit la liste et l'on choisit Unit, Clip et VAE dans les menus.
Les contrôles d'exécution sont familiers mais puissants : ratio, mégapixels pour la résolution, prompts positif/négatif, CFG pour la fidélité au prompt (les prompts négatifs exigent CFG au-dessus de 1), steps (plus de steps, meilleure qualité mais plus long), sampler et seed (même seed plus mêmes réglages égale même image ; changer le seed pour varier). Sur le portable du créateur avec RTX 5000 Ada (16 Go), texte-image 29 secondes, édition voiture single-référence avec 'route forestière sinueuse avec flou de mouvement' 81 secondes — noté un peu plus lent que Flux Klein — et suppression d'arrière-plan 116 secondes.
Le support LoRA est encore précoce : un LoRA est une petite surcouche fine-tunée au-dessus du modèle de base, comme un filtre photo qui renforce un style, personnage ou texture précis. Un jour après la sortie, un seul exemple public — Qwen 2.1 anime consistency pour la cohérence de personnages anime. Pour le charger, insérez un noeud Load LoRA entre le chargeur diffusion et le suivant, réglez la force autour de 0,8 et chaînez plusieurs LoRAs. La vidéo le teste en 16:9, 2 mégapixels avec 'planche de référence personnage — face, dos et profil' et obtient un résultat en 128 secondes aux traits cohérents.
Pour 4 Go et moins, les checkpoints compressés GGUF sont la bouée. La communauté, notamment le dépôt Abiray, propose un éventail : Q8_0 7,59 Go (12 Go+ quasi sans perte), Q6_K 5,88 Go (10-12 Go), Q5_K_M 5,01 Go (8-10 Go équilibré), Q4_K_M 4,19 Go et Q4_K_S 4,06 Go (6-8 Go grand public), Q3_K_M 3,19 Go (4-6 Go budget extrême). Q6 et Q8 ne sont pas beaucoup plus petits que INT8 Conrot, donc avec 6-8 Go essayez Conrot d'abord ; avec 4 Go prenez Q3 ou Q4. Il faut ComfyUI-GGUF de city96 via ComfyUI Manager, puis remplacer le chargeur diffusion par le noeud UNet Loader (GGUF), bypasser l'original avec Ctrl+B et pointer clip et VAE comme avant. Même le Q3 le plus quantifié reste proche du modèle complet.
Commentaire de l’IA
"Mon avis est clair : Qwen Image 2.1 comble un manque attendu pour la création locale — transparence native et composition à dix références dans un seul checkpoint changent vraiment les flux design et e-commerce. Je ne l'intégrerais pas directement en production sans tester mon propre jeu de prompts et clarifier la licence commerciale par écrit. La vitesse et la flexibilité enthousiasment, le cadre légal reste en recherche."
Évaluation de l’IA
Donnons sa meilleure forme à la thèse adverse : les modèles fermés peuvent encore paraître plus polis sur le texte, la lumière et la composition, et les courbes vendeur du Qwen-Image-Bench pour Qwen n'ont pas été reproduites indépendamment. Les premiers retours communautaires sont partagés — certains testeurs louent typographie et fidélité d'identité, tandis qu'une revue Reddit pointe texture synthétique, dominante jaunâtre et grain ou artefacts sur certains prompts. Ouvert, local et polyvalent ne signifie pas automatiquement meilleur sur votre brief ; sans A/B à l'aveugle sur vos propres prompts, l'étiquette 'meilleur' est prématurée.
Les limites méthodologiques sont claires : les durées de la vidéo sont des mesures uniques sur une seule machine — 29/81/116 secondes sur un laptop RTX 5000 Ada 16 Go — non généralisables, avec 40 steps supposés et une pile différente derrière les 18,7s génération / 21,7s édition et 22,7 Gio pic rapportés par SGLang sur RTX 4090. L'affirmation que Q3 reste 'proche' du modèle complet est visuelle, sans métrique numérique type FID ou CLIPScore. Et les prompts difficiles — lettrage dense, lumière studio subtile ou longs passages texte — peuvent encore casser la typographie ; la vidéo ne pousse pas ces coins.
Sur incitations et vérification, le noeud est la licence : la fiche modèle sous Qwen Research License indique 'usage non commercial seulement' et renvoie l'usage commercial à Hangzhou Tongyi Lab pour une licence séparée, tandis qu'un post de suivi clarifie que les sorties ne sont pas du matériel sous licence et appartiennent à l'utilisateur. Cela apaise partiellement, mais pour une ligne de production il faut une permission écrite. Vérifiez avec trois contrôles : 1) lancez Nano Banana et Qwen sur le même brief avec vos prompts produit, 2) inspectez les assets transparents pour un vrai canal alpha dans Photoshop ou GIMP, 3) validez la netteté Q3/Q4 à 100 pour cent pour l'impression 2K. Sans cela, tout calcul coût ou licence est incomplet.
En pratique : pour designers, équipes commerce et labos recherche qui veulent contrôle local, confidentialité et personnalisation, Qwen Image 2.1 convient bien — surtout avec carte 8 Go ou passage 4 Go via GGUF. Pour les équipes devant livrer commercialement demain, attendre du support et vouloir une facture hébergée prévisible, les options hébergées comme Nano Banana ou Luma sont plus sûres. Mon plan : installer Qwen dans ComfyUI pour recherche et prototypage interne, surveiller les LoRAs, produire les jobs 2K et transparents là ; livrer le client-facing sur modèle hébergé jusqu'à signature commerciale.
Sources
7 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — AI Search : Editeur local Qwen Image 2.1
- @huggingface.co https://huggingface.co/Qwen/Qwen-Image-2.1
- @alibabacloud.com https://www.alibabacloud.com/blog/qwen-image-2-1-compact-efficient-and-unified-image-creation_603586
- @technode.com https://technode.com/2026/09/21/alibabas-qwen-open-sources-qwen-image-2-1-for-unified-image-generation-and-editing/
- @kombitz.com https://www.kombitz.com/2026/09/20/how-to-use-qwen-image-2-1-gguf-in-comfyui/
- @huggingface.co https://huggingface.co/Abiray/Qwen-Image-2.1-GGUF
- @huggingface.co https://huggingface.co/Comfy-Org/Qwen-Image-2.1
qwen image · alibaba · ia · génération d'image · comfyui · gguf · lora