Gündeme dön

Qwen Image 2.1 Geldi: Tek Modelde Üretim, Şeffaflık ve 10 Referansla Düzenleme

Alibaba'nın 20 Eylül'de açık kaynak yayımladığı Qwen Image 2.1, 7 milyar parametreli görsel bileşeniyle metinden görsel üretmeyi, şeffaf RGBA çıktıyı ve doğal dille düzenlemeyi tek checkpointe topluyor. Video, ComfyUI'de 8 GB ve 4 GB VRAM'de bile çalışan kurulumu, 29 saniyelik üretim hızını ve eklenen GGUF/LoRA seçeneklerini adım adım gösteriyor — ama lisansın ticari yasağı hâlâ en kritik soru.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — BaE6UBfNdQk
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Alibaba'nın Qwen ailesi 20 Eylül 2026'da Qwen Image 2.1'i açık kaynak yayımladı — video başlığı 'Finally! New best local AI image editor is here' bunu en iyi yerel düzenleyici olarak selamlıyor. Modelin görsel üretim bileşeni yalnızca 7 milyar parametre ve 32 Single-Stream DiT katmanından oluşuyor, buna Qwen3-VL 8B metin kodlayıcısı ve 64 kanallı RGBA VAE eşlik ediyor. Tek bir checkpoint hem metinden görsel üretimi hem de görselle düzenlemeyi üstleniyor, yani ayrı araçlar arasında zıplamaya gerek kalmıyor. Tıpkı tek bir atölyede hem çizim hem kesim yapılabilmesi gibi, her şey aynı tezgahta bitiyor.

Mimari özellikle verimlilik için tasarlandı: karışık taneli dikkat (mixed-granularity attention) ve önek KV önbelleğinin yeniden kullanımı, güçlü kaliteyi düşük hesaplama maliyetiyle dengeliyor. Hugging Face model kartı ve Alibaba Cloud blogu, hafif yapının native 2K çıktıya kadar net sonuç verdiğini ve çıkarım optimizasyonları sayesinde bellek baskısını azalttığını vurguluyor. 7B küçük sayılabilir ama testler ışığında kalite/fiyat dengesi iddialı. Bu, küçük motorla büyük çekiş almak gibi — hacim değil mimari işi çözüyor.

Metinden görsele tarafında model gerçekçi fotoğraflar, doğru anatomi ve güçlü prompt takibi ile öne çıkıyor. Video, tek prompt ile diyagram ve infografik gibi çok öğeli karmaşık kompozisyonların, hatta arayüz tasarımlarının tek seferde üretildiğini gösteriyor. Önceki dalgadaki bazı araçlar yalnızca metinden görsele odaklanıp mevcut görseli doğal dille düzenletemezken, burada eksik parça kapanıyor. Pratikte şu demek: 'şu broşürü infografiğe çevir' dediğinde model parçaları tek karede tutarlı yerleştiriyor.

En çarpıcı yenilik doğal şeffaflık. Qwen Image 2.1, Aralık 2025'teki ayrı Qwen-Image-Layered deneyimini birleşik modele taşıdı ve prompt ile normal görüntü mü yoksa alfa kanallı RGBA mı üretileceğini seçebiliyorsunuz. Örneklerde sticker, ürün kesimi ve arka planı şeffaf görseller tek üretimde çıkıyor, üstelik şeffaf katmanın kendisi de düzenlenebiliyor. Tasarımcı için bu, ayırma-matlama adımı olmadan doğrudan saydam varlık üretmek demek — yani arka planı sonradan silmekle uğraşmadan logoyu tişörte koymak kadar pratik.

Düzenleme tarafında en büyük sıçrama referanslı çalışma: 10'a kadar referans görseli aynı anda verebiliyorsunuz. Video, şeffaf bir görselin üzerindeki metni prompt ile değiştirmeyi, bir fotoğraftaki dalları ön plandan ayırıp şeffaf katmana çekmeyi ve farklı fotoğraflardaki öğeleri birleştirmeyi gösteriyor. Örneğin birinci fotoğraftaki kadın, ikinci karedeki pembe ceket, üçüncü karedeki ayakkabı, çanta ve son karedeki şapka tek karede dikişsiz birleşiyor. Yüz ve karakter tutarlılığı da vurgulanıyor; benzer şekilde mobilya fotoğrafları tek odada toplanabiliyor.

Yerel (local) düzenleme de esnek: doğrudan fotoğraf üzerine daire çizerek, fırça ile boyayarak veya ayrı maske vererek 'burayı değiştir' diyebiliyorsunuz. Video, istemediğiniz nesneyi karalayarak kaldırmayı veya aynı bölgeye yeni bir öğe eklemeyi canlı gösteriyor. Önceki açık modellerde bu tür piksel-precise kontrol sınırlıydı; burada kontrol kullanıcıda kalıyor ve model yalnızca işaretli bölgeye odaklanıyor. Tıpkı kağıt üzerinde ilgili alanı işaretleyip editöre vermek gibi sezgisel.

Kimlik ve ürün sadakati bir diğer odak: karmaşık desenli bir kıyafeti modele giydirdiğinizde dikiş, doku ve renk korunuyor; selfie'den panorama üretip sahneyi 3D'de gezebiliyorsunuz. Model infografik ve storyboard gibi geniş görevleri de aynı çatıda kapsıyor. 10 referans sınırı, grup portresi veya koleksiyon çekimi gibi çok özneli işlerde kritik — altı ayrı portreden tek grup fotoğrafı üretimi Hugging Face kartında örneklenmiş. Bu, tek tek ürün kesmek yerine tüm seti bir karede prova etmek gibi.

Kurulum için video ComfyUI'yi öneriyor — açık kaynak görsel/video üretiminde en yaygın offline platform, ücretsiz ve özelleştirilebilir. Önce ComfyUI'yi 'update ComfyUI.bat' ile son sürüme güncelliyor, ardından sol kenardaki Templates'te Qwen Image 2.1 araması ile üç hazır iş akışı açılıyor: text-to-image, image edit ve remove background. Şablonlar görünmüyorsa sayfanın altından workflow JSON'larını indirip sürükle-bırakla içeri almak yeterli. Bu, mutfak tezgahını kurmak gibi: önce tezgah güncel, sonra tarif kartları hazır.

Model dosyaları üç klasöre yerleşiyor ve boyutlar VRAM planlaması için kritik. Diffusion modeli için tam BF16 14.2 GB veya daha küçük INT8 Conrot 7.2 GB seçeneği var; Conrot 8 GB VRAM ve altına sığabilecek şekilde optimize edilmiş. Metin kodlayıcılarda BF16 17.5 GB'a karşılık W4A8 6.3 GB en küçük seçenek — düşük VRAM'de önerilen bu. VAE ise yalnızca 676 MB. Dosyalar sırasıyla ComfyUI/models/diffusion_models, text_encoders ve vae altına konup R ile liste yenileniyor; ardından Unit, Clip ve VAE açılırlarından doğru dosyalar seçiliyor.

Çalıştırma ayarları tanıdık ama etkili: en-boy oranı, megapiksel ile çözünürlük, pozitif/negatif prompt, CFG (prompt'a ne kadar sadık kalınacağı; 1'de negatif prompt çalışmaz, biraz yükseltmek gerek), adım sayısı (adım arttıkça kalite artar ama süre uzar), sampler ve seed (aynı seed + aynı ayar = aynı görüntü, varyasyon için seed değiştir). Video sahibinin RTX 5000 Ada (16 GB, dizüstü) testinde text-to-image 29 saniye, tek referanslı araba düzenleme (orman yolunda motion blur) 81 saniye ve arka plan silme 116 saniye ölçülmüş. Yazar, bunun önceki en iyi edit modeli Flux Klein'den biraz daha yavaş olduğunu not ediyor.

LoRA desteği henüz çok erken: LoRA, ana model üstüne eklenen küçük ince ayar katmanıdır — tıpkı fotoğraf filtresinin belirli bir stil, karakter veya dokuyu güçlendirmesi gibi. Qwen Image 2.1 bir günlük olduğu için ekosistemde şimdilik tek örnek var: anime tutarlılığını artıran Qwen 2.1 anime consistency. Kurulumda Load LoRA düğümü diffusion modeli ile sonrasındaki düğüm arasına ekleniyor, gücü %80 civarı ayarlanıp zincirlenebiliyor. Video 16:9, 2 megapiksel ve 'karakter referans sayfası: önden/arkadan/yandan' promptu ile 128 saniyede sonuç alıyor; karakterin çizgileri korunuyor. Zamanla LoRA sayısı artacak, şimdilik alan deneme aşamasında.

4 GB ve altı için can simidi GGUF sıkıştırılmış modeller: topluluk, özellikle Abiray deposu üzerinden çok sayıda nicemleme sunuyor. Tablo net: Q8_0 7.59 GB (12 GB+ VRAM, kayba yakın), Q6_K 5.88 GB (10-12 GB), Q5_K_M 5.01 GB (8-10 GB dengeli), Q4_K_M 4.19 GB / Q4_K_S 4.06 GB (6-8 GB tüketici tabanı), Q3_K_M 3.19 GB (4-6 GB bütçe). Q6/Q8, INT8 Conrot'tan çok küçük değil — 6-8 GB varsa Conrot önerilir; 4 GB ise Q3/Q4 mantıklı. ComfyUI-GGUF eklentisi (city96) ComfyUI Manager'dan kurulup UNet Loader (GGUF) düğümü ile normal diffusion loader değiştiriliyor, eski düğüm Ctrl+B ile bypass ediliyor. Videoda Q3 ile üretim kalitesi tam modele çok yakın çıkıyor, yani düşük kartta da kullanılabilir kalite korunuyor.

Görsel: nodesdaily AI

AI yorumu

"Benim okumam net: Qwen Image 2.1, yerel üretimde uzun süredir beklenen boşluğu kapatıyor — tek modelde şeffaf çıktı ve 10 referansla kompozisyon, tasarım ve e-ticaret iş akışlarında gerçek fark yaratır. Yine de ben bunu doğrudan ürün hattına almaz, önce kendi prompt setimle dener ve ticari lisansı yazılı netleştiririm; hız ve esneklik heyecan verici, hukuki çerçeve ise hâlâ araştırma sınırında."

AI değerlendirmesi

Karşıt görüşü en güçlü haliyle kuralım: kapalı modeller metin, ışık ve kompozisyonda hâlâ daha cilalı görünebilir ve vendor benchmark'ları Qwen-Image-Bench'teki Qwen eğrisi bağımsız tekrarlanmadı. Erken topluluk notları da ikiye bölünmüş — bazı testçiler tipografi ve kimlik korumayı överken, Reddit tabanlı bir inceleme sentetik doku, sarımsı ton ve bazı prompt'larda gren/artefakt eleştirisi getiriyor. Yani Qwen'in açık, yerel ve çok yönlü olması kalite farkını otomatik kapatmaz; kendi setinizde kör A/B yapmadan 'en iyi' etiketi erken kalır.

Metodoloji sınırları da net: video hızları tek donanım (RTX 5000 Ada 16 GB laptop) ve tek ölçüm — 29/81/116 saniye genellenemez, adım sayısı 40 varsayılan ve SGLang'in RTX 4090'da 18.7 saniye üretim / 21.7 saniye düzenleme + 22.7 GiB zirve bellek raporu farklı yazılım yığınına ait. GGUF tarafında Q3'ün 'kalite yakın' gözlemi görsel, sayısal metrik (FID/CLIPScore) yok. Ayrıca ND filtreli stüdyo ışığı, el yazısı kalabalık sahne veya uzun Türkçe metin gibi zor prompt'larda tipografi hâlâ kırılabilir — video bu köşeleri test etmiyor.

Çıkar ve doğrulanabilirlikte düğüm lisans: model kartı Qwen Research License ile 'ticari amaç dışı' diyor, ayrı ticari lisans için Hangzhou Tongyi Lab'e başvurmak gerekiyor; çıktıların lisanslı materyal sayılmadığı ve haklarının kullanıcıda kaldığı açıklaması topluluk sorularını kısmen yatıştırsa da üretim hattı için yazılı izin hâlâ şart. Doğrulanabilirlik için şu üçü şart: 1) kendi ürün/katalog prompt'larınızla Nano Banana ve Qwen'i aynı brief ile karşılaştırın, 2) şeffaf varlıkları Photoshop/GIMP'te alfa kanalı ile doğrulayın, 3) 2K baskı kesiminde Q3/Q4 keskinliğini 100% crop ile kontrol edin. Bu testler olmadan fiyat/lisans hesabı eksik kalır.

Pratik çıkarım: yerel kontrol, gizlilik ve özelleştirme isteyen tasarımcı, e-ticaret ekibi ve araştırma labı için Qwen Image 2.1 biçilmiş kaftan — özellikle 8 GB kartı olan veya 4 GB'de GGUF ile çalışmak zorunda kalanlar için. Hemen ticariye çıkacak, destek talebi yüksek veya barındırılan API'nin öngörülebilir faturasını isteyen ekip için ise Nano Banana/Luma gibi barındırılan seçenekler daha güvenli. Benim hamlem şu olurdu: araştırma ve iç prototip için Qwen'i ComfyUI'de kur, LoRA'ları izle, 2K ve şeffaf işleri orada üret; müşteri önüne çıkacak işi ise lisans netleşene kadar barındırılan modelle teslim et.

Kaynaklar

7 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

qwen image · alibaba · yapay zeka · görsel üretim · comfyui · gguf · lora

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…

Qwen Image 2.1 Geldi: Tek Modelde Üretim, Şeffaflık ve 10…