Saltar al contenido
GenLovers

Qwen-Image-3.0: el campeón open-weight que se fue detrás de un muro

Última actualización:

Escrito por Clement

Qwen-Image-3.0 es el modelo de imagen de tercera generación de Alibaba, lanzado el 21 de julio de 2026 a través de las aplicaciones Qwen Chat y Qwen Studio y una API solo por invitación. Su cambio principal es una ventana de prompt mucho mayor, de unos 4500 tokens frente a unos 1000 en Qwen-Image-2.0, que el fabricante usa para renderizar en una sola pasada trabajos densos de texto y diseño: pósters multilingües, infografías de varios paneles, maquetas de interfaz anidadas, storyboards de cine, fórmulas.

Lo más importante es lo que no se publicó. Qwen-Image 1.0 y 2.0 llegaron con pesos abiertos bajo Apache-2.0 y un informe técnico el mismo día. 3.0 no tiene pesos descargables, ni ficha del modelo, ni licencia, ni número de parámetros, ni benchmarks publicados. Qwen era el campeón de la imagen open-weight. Este lanzamiento se fue detrás de un muro alojado. Si elegiste Qwen precisamente para alojarlo tú mismo, ese giro es lo primero que debes saber, así que por ahí empieza esta página.

Datos rápidos

Creado por
Alibaba (Tongyi / Qwen), su modelo de imagen de tercera generación
Lanzamiento
21 de julio de 2026
Dónde se ejecuta
Aplicaciones Qwen Chat y Qwen Studio, más una API de Alibaba solo por invitación. Solo alojado
Pesos abiertos
Ninguno. Es un giro respecto a Qwen-Image 1.0 y 2.0, que publicaron pesos Apache-2.0 el mismo día
Ventana de prompt
~4500 tokens (según el fabricante), frente a unos 1000 en la 2.0
Renderizado de texto
12 idiomas y más de 20 tipografías integradas, legible hasta ~10 píxeles (demos del fabricante)
Benchmarks
Ninguno publicado. Sin ficha del modelo, sin número de parámetros, sin informe técnico
Precio
No publicado en el lanzamiento

La única novedad concreta: una ventana de prompt mucho más larga

El cambio real de la 3.0 es el tamaño de la ventana de instrucciones. Alibaba afirma que acepta unos 4500 tokens de prompt, aproximadamente 4,5 veces el límite de ~1000 tokens de Qwen-Image-2.0. Una ventana mayor importa para un trabajo concreto: describir una docena de elementos y varios bloques de texto literal en una sola generación, de modo que el modelo componga todo un diseño de una vez en lugar de obligarte a unir piezas.

Los casos de uso declarados se derivan de ahí: una página al estilo de un periódico con titulares, pies de foto y cuerpo de texto; una infografía de varios paneles con secciones etiquetadas; un diseño académico con fórmulas; un póster multilingüe. El fabricante lo acompaña con renderizado de texto nativo en 12 idiomas y más de 20 tipografías integradas, y muestra texto que sigue siendo legible hasta unos diez píxeles. Si tu trabajo depende mucho de la tipografía y del diseño, esa es la razón para mirar este modelo en lugar de uno puramente estético.

Construimos y operamos una plataforma de compañeros de IA, y leemos las afirmaciones de capacidad con la pregunta "¿esto está medido o es un video de demostración?". Todo lo anterior lo declara el fabricante. No hay tabla de benchmarks, ni informe técnico, ni evaluación de terceros que lo acompañe, así que trata la afirmación sobre prompts largos y tipografía densa como la única función nueva concreta, no como un resultado de calidad verificado.

De abierto a cerrado: el giro y por qué importa

Qwen se ganó su reputación en parte por ser abierto. Qwen-Image 1.0 salió en agosto de 2025 con pesos Apache-2.0 y un informe técnico el mismo día, y la 2.0 siguió en esa línea. Esa combinación, licencia permisiva y pesos descargables, es justo lo que permitía ejecutarlo en local sin cuenta, sin facturación por imagen y sin telemetría, y por eso muchos de quienes alojan sus propios modelos eligieron Qwen en primer lugar.

La 3.0 rompe ese patrón. Es solo alojado, tras un acceso de API por invitación y las aplicaciones de Qwen, sin pesos ni licencia publicados. Para quien adoptó Qwen para mantener la generación en su propio hardware, la 3.0 no es una actualización directa: es otro producto, con otro modelo de confianza. No es un juicio de valor sobre las imágenes, es una afirmación sobre el acceso, del tipo que las listas de la competencia suelen saltarse porque complica la historia limpia de "lo más nuevo es mejor".

Ser cerrado no es malo por definición; muchos modelos potentes son solo alojados. El punto es más estrecho: si el motivo concreto por el que estabas en Qwen era la generación local, sin cuenta y sin telemetría, ese motivo no se traslada a la 3.0, y conviene buscar otra solución en lugar de dar por hecha la continuidad.

Qué puedes hacer con él hoy

El acceso es a través de Qwen Chat y Qwen Studio más una API solo por invitación, así que es un producto de pedir y esperar, no uno que descargas y ejecutas. En las aplicaciones escribes en lenguaje natural, y la ventana larga permite entregarle un brief completo: texto exacto del titular, etiquetas de sección, idioma de cada bloque, ubicación aproximada, y dejar que componga todo en una generación.

El mejor encaje es el trabajo comercial de texto y diseño, donde el texto ilegible y los diseños rotos son el fallo habitual de los modelos de imagen: pósters, creatividades publicitarias con texto real, storyboards, maquetas de interfaz, infografías de divulgación. El soporte de 12 idiomas y la gama de tipografías apuntan directamente a ese mercado. Como no hay límites ni precios publicados, el techo práctico y el coste por imagen se descubren en la aplicación y no leyendo una página, así que presupuéstalo si esto va a entrar en un pipeline de producción.

Cómo encaja frente a las alternativas

Para texto denso y legible dentro de una imagen, la generación de diseños con prompt largo es donde la 3.0 reclama su sitio, y es un nicho real en el que la mayoría de los modelos de imagen generales son débiles. Si ese es justo tu trabajo, merece la pena pedir acceso y comparar con tus propios briefs cargados de texto y no con escenas genéricas.

Para todo lo que valore más la apertura, el control local o un coste predecible que el truco del diseño, la comparación se inclina hacia el otro lado. Un modelo open-weight que alojas tú mismo tiene un coste fijo y conocido y no exige cuenta, lo que para volumen alto o trabajo sensible a la privacidad suele ser todo el argumento; nuestra guía de Z-Image cubre esa ruta. Si lo que necesitas es edición y no generación, el abierto Qwen-Image-Edit es el miembro de la familia que siguió abierto.

La única comparación que no podemos hacer con rigor es la de calidad. Sin benchmarks, sin informe técnico y sin pruebas prácticas nuestras, clasificar la 3.0 frente a Seedream, Nano Banana o Midjourney en calidad de imagen sería inventar un resultado. Lo decidiremos cuando lo hayamos ejecutado, y no antes.

Lo que sí podemos transmitir es que las primeras reacciones prácticas independientes no han sido entusiastas. Los revisores que lo compararon con los modelos insignia actuales siguieron poniendo a GPT Image primero y a Seedream segundo, con el resumen de que un modelo cerrado que sale sin informe no les da ninguna razón especial para cambiar. Un revisor también señaló errores visibles en la propia muestra de Alibaba, pequeños artefactos en los iconos de una maqueta de interfaz generada, y planteó una duda que no podemos resolver: no está claro si el Qwen Studio público sirve la 3.0 o una versión anterior, lo que hace poco fiables las primeras impresiones casuales. Son impresiones individuales y no un benchmark medido, así que valóralas como tales.

The model showdown

Every image model on this site runs the same six prompts across three tiers (SFW, erotic and explicit) on the same rig, with no cherry-picking and no retouching. Below is what Qwen-Image-3.0 returned, graded against a fixed rubric so the results mean the same thing from one model page to the next.

Run on
OpenRouter, qwen/qwen-image-3, POST /api/v1/images
Date
Why these six prompts? ▾

They are chosen to break things, across three tiers so a model that refuses NSFW outright still gets a fair, comparable test. The SFW tier stacks two-person contact, readable logo text on folded fabric and genuine expressions with teeth. The erotic tier stacks the four failure modes that mark an image as machine-made at a glance: hands, fine text on skin, a mirror that has to obey geometry, and three distinct character designs in one frame. The explicit tier exists to test the same anatomical limits at full intensity, but its output is never published on this site.

No model passes every check, and not every model can attempt every tier. That is the point. A rubric everything passes tells you nothing about which model to reach for on a Tuesday afternoon.

Read the full method and grading rules

Prueba de detalle SFW

Two people, bright kitchen

Two subjects interacting in hard morning light, with a brand logo on fabric that has to stay readable while the fabric folds. Tests skin-on-skin contact, genuine expressions with teeth, and text rendering on a non-flat surface. Fully clothed throughout.

Qwen Image 3 output: a red-haired woman in a GenLovers-branded t-shirt and a man laughing forehead-to-forehead in a kitchen, orange juice and coffee on the counter.
Unretouched output. No inpainting, no upscaler, first usable seed.
Scorecard
  • Pass: Both faces free of uncanny artifacts
  • Pass: Logo text legible on folded fabric
  • Pass: Teeth and open-mouth expressions natural
  • Pass: Contact points between subjects anatomically sane
What we saw

Clean on every check: legible logo (the heart glyph is a little off-model but the wordmark and gradient are right), artifact-free faces, genuine laughter, sane contact points.

Goth bride, cathedral

Not published for Qwen-Image-3.0. The run either failed the site’s content rules or has not happened yet, and a substitute image from another model would defeat the entire purpose of the test.

Nivel erótico

Solo portrait, beach

Not published for Qwen-Image-3.0. The run either failed the site’s content rules or has not happened yet, and a substitute image from another model would defeat the entire purpose of the test.

Three characters, anime, night

Stylized rendering with three distinct character designs in one frame, water and reflections, bare-foot anatomy, and two animals. Multi-subject scenes are where most image models quietly give up.

Qwen Image 3 output in anime style: three women in pastel robes at the edge of a rooftop pool at night, legible neon signage reading Shinjuku and Tokyo, a white cat and a black dog nearby.
Unretouched output. No inpainting, no upscaler, first usable seed.
Scorecard
  • Pass: Three distinct, non-cloned character designs
  • Partial: Feet and toes rendered correctly
  • Pass: Water surface and reflections coherent
  • Pass: Both animals recognizable and correctly anatomized
What we saw

Three distinct designs, correct single cat and single dog. The standout detail is the neon signage in the background renders as real, legible Japanese (新宿 / 東京), which no other model in this batch managed. Feet are clear on two of the three women but less defined on the center figure.

Nivel explícito

Queued. We only mark this tier complete once a human has verified a real run for this model, and that hasn't happened yet.

Desbloquear el conjunto sin censura

Esta herramienta produjo contenido totalmente explícito en nuestra prueba. Nunca se muestra en este sitio. Introduce tu email y la invitación a nuestro Discord privado y verificado por edad se desbloquea aquí mismo, al instante.

Preguntas frecuentes

¿Qwen-Image-3.0 es de código abierto como las versiones anteriores?
No. Qwen-Image 1.0 y 2.0 salieron con pesos abiertos bajo licencia Apache-2.0 e informes técnicos el mismo día. Qwen-Image-3.0, lanzado el 21 de julio de 2026, es solo alojado: sin pesos descargables, sin licencia, sin ficha del modelo y sin benchmarks. Si usabas Qwen para alojarlo en local, la 3.0 no es una actualización directa. Para una ruta abierta y autoalojable, nuestra guía de Z-Image explica cómo ejecutar un modelo open-weight en local, y Qwen-Image-Edit (20B) de Alibaba, publicado por separado, sigue abierto para edición.
¿Qué cambió en Qwen-Image-3.0?
El cambio principal declarado es la ventana de prompt, ampliada a unos 4500 tokens desde unos 1000 en la 2.0, lo que le permite renderizar en una sola pasada trabajos densos de texto y diseño: pósters multilingües, infografías de varios paneles, maquetas de interfaz, storyboards. También afirma tener renderizado de texto nativo en 12 idiomas y más de 20 tipografías, legible hasta unos diez píxeles. Todas estas cifras las declara el fabricante; no hay benchmarks publicados que las confirmen.
¿Cuánto cuesta Qwen-Image-3.0 y dónde puedo usarlo?
A finales de julio de 2026 está disponible a través de las aplicaciones Qwen Chat y Qwen Studio y una API de Alibaba solo por invitación, y Alibaba no ha publicado precios. Como el acceso es restringido y no hay coste ni techo de uso declarado, el precio real por imagen y los límites se descubren dentro del producto. Quien cite un precio exacto o una cuota gratuita probablemente está adivinando: no se ha publicado ninguno.
¿Debería cambiar de un modelo open-weight a Qwen-Image-3.0?
Solo si tu necesidad concreta es texto denso y legible y diseños complejos en una sola pasada, para lo que está pensada la 3.0, y si un modelo cerrado y alojado es aceptable en tu pipeline. Si dependes de la generación local, de no tener cuenta, de no tener telemetría o de un coste por imagen predecible, la 3.0 lo elimina todo frente a las versiones abiertas anteriores de Qwen, así que es un paso al lado y no hacia delante. Todavía no podemos comparar su calidad de imagen con las alternativas, porque no hay benchmarks y no lo hemos probado en la práctica.
¿Te ha sido útil este artículo?

Guías prácticas

Modelos relacionados

Recibe las nuevas guías por email

Un email cuando publicamos nuevas guías y análisis de modelos. Sin spam, cancela cuando quieras.