Volver al inicio

Qwen Image 2.1 ya está aquí: generación unificada, transparencia nativa y edición con 10 referencias en un solo modelo

Publicado en abierto por Alibaba el 20 de septiembre, Qwen Image 2.1 reúne generación texto-imagen, transparencia RGBA nativa y edición en lenguaje natural en un único checkpoint visual de 7.000 millones de parámetros. El tutorial muestra su ejecución en ComfyUI con 8 GB e incluso 4 GB de VRAM, 29 segundos por imagen en una RTX 5000 Ada y sus primeras opciones LoRA y GGUF — pero su licencia solo investigación sigue siendo el bloqueo clave para producción.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — BaE6UBfNdQk
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

La familia Qwen de Alibaba publicó Qwen Image 2.1 en abierto el 20 de septiembre de 2026 — el vídeo 'Finally! New best local AI image editor is here' lo presenta como el editor local más capaz hasta la fecha. Su núcleo visual son solo 7.000 millones de parámetros en 32 capas DiT single-stream, junto a un codificador de texto Qwen3-VL 8B y un VAE RGBA de 64 canales. Un solo checkpoint gestiona tanto generación texto-imagen como edición condicionada por imagen, sin alternar herramientas separadas. Como un único taller que dibuja y recorta en el mismo banco.

La arquitectura busca eficiencia: atención de granularidad mixta y reutilización de caché KV de prefijo equilibran calidad y cómputo. La ficha de Hugging Face y el blog de Alibaba Cloud subrayan que ese bloque compacto de 7B entrega salidas nativas nítidas en 2K mientras reduce la presión de memoria. 7B suena pequeño, pero la apuesta es calidad por vatio en lugar de tamaño bruto — como lograr mucho par con un motor pequeño gracias a una caja de cambios más inteligente.

En texto-imagen el modelo brilla en fotos fotorrealistas, anatomía correcta y fuerte seguimiento del prompt. El vídeo muestra en un solo prompt diagramas e infografías complejas multi-elemento, además de diseños de interfaz renderizados con coherencia. Las olas abiertas anteriores eran solo texto-imagen y no permitían editar una foto existente con lenguaje natural como la línea cerrada Nano Banana; esta entrega cierra esa brecha. En la práctica, 'convierte este folleto en infografía' mantiene decenas de elementos alineados en un solo cuadro.

La novedad estrella es la transparencia nativa. Basándose en el esfuerzo dedicado Qwen-Image-Layered de diciembre de 2025, Qwen Image 2.1 integra esa capacidad en un modelo unificado y deja que el prompt decida si emitir una imagen normal o una imagen RGBA con canal alfa. Los ejemplos incluyen pegatinas y recortes de producto generados con fondo transparente en una pasada, e incluso la edición de la propia capa transparente. Para diseñadores esto elimina el paso separado de segmentación o mateado, como colocar un logo en una camiseta sin borrar antes el fondo a mano.

La edición da un salto con el condicionamiento por referencias: hasta diez imágenes de referencia a la vez. El vídeo muestra el cambio de texto en un asset transparente vía prompt, la extracción de ramas en primer plano a una capa transparente y, sobre todo, el ensamblaje de elementos de muchas fotos. Una demo pide la mujer de la foto uno con la chaqueta rosa de la foto dos más zapatos, bolso y sombrero de otras tres fotos, fusionados en una sola toma coherente con preservación de rostro. Fotos de muebles se componen de forma similar en una sola habitación.

La edición local es igual de flexible: rodea un área, pinta una anotación o aporta una máscara separada para decir exactamente dónde actuar. El vídeo garabatea sobre objetos para eliminarlos o dibuja sobre una región vacía para añadir algo nuevo, y el modelo respeta la máscara sin tocar el resto. Los modelos abiertos anteriores ofrecían control píxel-preciso limitado; aquí el control queda en el usuario y la edición se confina a la zona marcada, como resaltar una prueba para un editor.

La fidelidad de personas y productos es otro foco: un atuendo complejo conserva costuras, textura y color al transferirse a una modelo, un selfie se expande a panorama explorable en 3D y tareas más amplias como infografías y storyboards quedan cubiertas. El límite de diez imágenes importa para trabajo multi-sujeto — la ficha muestra seis retratos individuales fusionados en una foto grupal. Es como ensayar toda una colección en un solo cuadro en lugar de recortar cada producto aislado.

Para la instalación el vídeo recomienda ComfyUI — la plataforma offline más popular para generación abierta de imagen y vídeo, gratuita y muy personalizable. Primero actualiza ComfyUI vía 'update ComfyUI.bat', luego abre Templates en la barra lateral, busca Qwen Image 2.1 y revela tres flujos listos: texto-imagen, edición de imagen y eliminación de fondo. Si las plantillas no aparecen, los JSON de flujo se descargan al pie de página y se arrastran a ComfyUI. Como preparar el banco antes de extender las tarjetas de receta.

Los archivos del modelo viven en tres carpetas y sus tamaños dictan la VRAM. Para difusión, BF16 completo 14,2 GB o INT8 Conrot más pequeño 7,2 GB, este último cabiendo en 8 GB de VRAM y menos. Los codificadores de texto van de BF16 17,5 GB a W4A8 solo 6,3 GB — la recomendación de baja VRAM. El VAE es diminuto con 676 MB. Los archivos van a ComfyUI/models/diffusion_models, text_encoders y vae, luego R refresca la lista y se elige Unit, Clip y VAE en los desplegables.

Los controles de ejecución son familiares pero potentes: relación de aspecto, megapíxeles para resolución, prompts positivo/negativo, CFG para fidelidad al prompt (los prompts negativos requieren CFG por encima de 1), pasos (más pasos, mayor calidad pero más tiempo), sampler y seed (misma seed más mismos ajustes igual a misma imagen; cambia la seed para variar). En el portátil del creador con RTX 5000 Ada (16 GB), texto-imagen 29 segundos, edición de coche con una referencia y prompt 'conducir por carretera forestal sinuosa con desenfoque de movimiento' 81 segundos — señalado un poco más lento que Flux Klein — y eliminación de fondo 116 segundos.

El soporte LoRA aún es temprano: un LoRA es una pequeña capa fine-tuneada sobre el modelo base, como un filtro fotográfico que refuerza un estilo, personaje o textura concreta. Solo un día después del lanzamiento hay un único ejemplo público — Qwen 2.1 anime consistency para mejor coherencia de personaje anime. Para cargarlo se inserta un nodo Load LoRA entre el cargador de difusión y el siguiente, se ajusta fuerza alrededor de 0,8 y se pueden encadenar varios LoRAs. El vídeo lo prueba en 16:9, 2 megapíxeles con 'hoja de referencia de personaje — frente, espalda y perfil' y obtiene resultado en 128 segundos con líneas consistentes.

Para 4 GB y menos, los checkpoints comprimidos GGUF son el salvavidas. La comunidad, notablemente el repositorio Abiray, ofrece un abanico: Q8_0 7,59 GB (12 GB+ casi sin pérdida), Q6_K 5,88 GB (10-12 GB), Q5_K_M 5,01 GB (8-10 GB equilibrado), Q4_K_M 4,19 GB y Q4_K_S 4,06 GB (6-8 GB base consumo), Q3_K_M 3,19 GB (4-6 GB presupuesto extremo). Q6 y Q8 no son mucho más pequeños que INT8 Conrot, así que con 6-8 GB prueba Conrot primero; con 4 GB toma Q3 o Q4. Necesitas ComfyUI-GGUF de city96 vía ComfyUI Manager, luego reemplaza el cargador de difusión por el nodo UNet Loader (GGUF), haz bypass al original con Ctrl+B y apunta clip y VAE como antes. Incluso el Q3 más cuantizado se mantiene cerca del modelo completo.

Visualization: nodesdaily AI

Comentario de la IA

"Mi lectura es clara: Qwen Image 2.1 cierra un hueco muy esperado en la creación local — transparencia nativa y composición con diez referencias en un único checkpoint cambian de verdad los flujos de diseño y comercio. No lo conectaría directo a producción sin probarlo con mis propios prompts y aclarar la licencia comercial por escrito. La velocidad y la flexibilidad ilusionan, el marco legal sigue atado a investigación."

Evaluación de la IA

Refuerza al máximo la tesis contraria: los modelos cerrados aún pueden verse más pulidos en texto, luz y composición, y las curvas de vendedor del Qwen-Image-Bench para Qwen no han sido reproducidas de forma independiente. Las primeras notas comunitarias están divididas — algunos probadores elogian tipografía y preservación de identidad, mientras una reseña en Reddit señala textura sintética, tono amarillento y grano o artefactos en ciertos prompts. Abierto, local y versátil no significa automáticamente mejor para tu encargo; sin un A/B ciego con tus propios prompts la etiqueta 'mejor' es prematura.

Los límites metodológicos son claros: los tiempos del vídeo son mediciones únicas en un solo equipo — 29/81/116 segundos en un portátil RTX 5000 Ada 16 GB — no generalizables, con 40 pasos asumidos y una pila distinta detrás de los 18,7s generación / 21,7s edición y 22,7 GiB pico reportados por SGLang en RTX 4090. La afirmación de que Q3 se mantiene 'cerca' del modelo completo es visual, sin métrica numérica tipo FID o CLIPScore. Y los prompts difíciles — rotulación densa, luz de estudio sutil o pasajes largos de texto — aún pueden romper la tipografía; el vídeo no fuerza esas esquinas.

En incentivos y verificación el nudo es la licencia: la ficha del modelo bajo Qwen Research License indica 'solo uso no comercial' y remite el uso comercial a Hangzhou Tongyi Lab para una licencia separada, mientras un post posterior aclara que las salidas no son material bajo licencia y pertenecen al usuario. Eso tranquiliza en parte, pero para una línea de producción aún necesitas permiso escrito. Verifica con tres controles: 1) ejecuta Nano Banana y Qwen con el mismo brief y tus prompts de producto, 2) inspecciona los assets transparentes en busca de un canal alfa real en Photoshop o GIMP, 3) valida la nitidez Q3/Q4 al 100 por cien para impresión 2K. Sin eso, cualquier cálculo de coste o licencia queda incompleto.

En la práctica: para diseñadores, equipos de comercio y labs de investigación que quieren control local, privacidad y personalización, Qwen Image 2.1 encaja bien — sobre todo con tarjeta de 8 GB o paso a 4 GB vía GGUF. Para equipos que deben entregar comercialmente mañana, esperar soporte y querer una factura alojada predecible, las opciones alojadas como Nano Banana o Luma son más seguras. Mi plan: instalar Qwen en ComfyUI para investigación y prototipado interno, vigilar los LoRAs, producir trabajos 2K y transparentes allí; entregar lo de cara al cliente en modelo alojado hasta la firma comercial.

Fuentes

7 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

qwen image · alibaba · ia · generación de imagen · comfyui · gguf · lora

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…