Cómo usar Wan 2.7 Image (texto a imagen, edición y conjuntos de imágenes)
Escrito por Clement
Wan 2.7 Image es un modelo de imagen fija que hace más que generar una imagen a partir de texto. El mismo modelo gestiona el texto a imagen, la edición de una imagen existente con un prompt, la edición de una sola región de una imagen, la fusión de varias imágenes de referencia en una escena nueva, y la producción de un conjunto entero de imágenes coherentes a partir de una sola petición. Se ofrecen dos versiones: wan2.7-image-pro, que admite salida 4K en texto a imagen y edita mejor, y wan2.7-image, más rápido pero con un tope más bajo.
Esta guía cubre los cinco usos que la gente construye de verdad con él (generación simple, edición, retoque de región, referencia multiimagen y conjuntos de imágenes) más los ajustes y hábitos de prompt que separan un resultado limpio de un render desperdiciado. Si has usado antes un modelo de imagen a vídeo como Wan 2.2, los instintos de prompt se transfieren: sé específico, describe lo que quieres en lugar de lo que no quieres, e itera sobre una variable a la vez.
El panel de arriba es una ilustración del flujo, no una herramienta en vivo.
¿Quieres crear uno de verdad? Consigue el archivo de prompt gratuito. Convierte a ChatGPT, Claude o Gemini en un especialista.
Obtener el archivo de prompt gratis →Las cinco cosas que Wan 2.7 Image puede hacer
Texto a imagen. Sin imagen de entrada, solo un prompt. Es el único modo que admite 4K en el modelo Pro, y el único donde aplica el modo de razonamiento (una pasada de razonamiento extra antes de generar).
Edición de imagen. Le das una imagen y un prompt que describe el cambio (cambiar un fondo, cambiar una prenda, rehacer la iluminación) y edita la imagen en lugar de empezar de cero.
Edición interactiva (por región). Igual que la edición, pero además pasas un cuadro delimitador para que el modelo solo toque esa parte de la imagen y deje el resto intacto. Útil cuando una edición global sigue cambiando cosas que no pediste.
Referencia multiimagen. Le das hasta nueve imágenes y un prompt que describe cómo combinarlas: una persona de una, una prenda de otra, un fondo de una tercera. El modelo las compone en una sola imagen nueva.
Generación de conjuntos de imágenes. Una petición, varias imágenes que comparten un sujeto o estilo coherente: un conjunto del mismo personaje en las cuatro estaciones, o una pequeña serie de productos. Fijas un número máximo y el modelo decide cuántas necesita realmente.
Paso a paso
El flujo tiene la misma forma sea cual sea de los cinco modos que uses. Solo cambian las entradas y un par de parámetros.
- 1
Elige el modo que realmente necesitas
Generación simple para una imagen nueva a partir de texto. Edición para cambiar una imagen existente. Edición interactiva cuando solo quieres tocar una zona. Referencia multiimagen cuando el resultado debe combinar elementos de más de una imagen de origen. Conjuntos de imágenes cuando necesitas varias imágenes coherentes de una sola petición, no una.
- 2
Prepara tus imágenes de entrada, si las hay
JPEG, PNG (sin canal alfa), BMP o WEBP, de 240 a 8.000 píxeles por lado, menos de 20 MB, relación de aspecto entre 1:8 y 8:1. Para la referencia multiimagen, el orden en que listas las imágenes es el orden en que el modelo las trata: pon tu sujeto principal primero.
- 3
Escribe el prompt
Describe la imagen terminada, no el historial de transformación. Para ediciones, nombra el cambio concreto ("reemplazar el fondo con una calle de ciudad lluviosa de noche") en lugar de una instrucción vaga. Para la referencia multiimagen, refiérete a cada imagen con sencillez ("el coche de la primera imagen", "el estilo grafiti de la segunda").
- 4
Ajusta la resolución y el número
Elige 1K, 2K, o (Pro, solo texto a imagen) 4K, o especifica dimensiones exactas en píxeles si necesitas una relación de aspecto no estándar. Ajusta n al número de imágenes que quieres (1-4 normalmente, hasta 12 para un conjunto). Recuerda que cada imagen generada con éxito se factura, así que no pongas n más alto de lo que vas a usar.
- 5
Para un retoque de región, añade el cuadro delimitador
Pasa el cuadro como coordenadas de píxel de la esquina superior izquierda e inferior derecha sobre la imagen original. Si una imagen de entrada no necesita edición, pásale un cuadro vacío en lugar de omitirla: la lista de cuadros tiene que alinearse con la lista de imágenes.
- 6
Genera, luego descarga sin demora
Los resultados solo se alojan 24 horas. Guarda de inmediato las imágenes que vayas a conservar. No cuentes con poder volver a recuperar una URL de resultado más tarde.
Prompts para ediciones y composiciones multiimagen
Para una edición de una sola imagen, di qué cambia y, si importa, qué se queda igual: "mantén la persona y la pose, reemplaza solo el fondo por una playa soleada." El modelo tiende a preservar todo lo que no mencionas, así que un cambio no deseado suele significar que el prompt fue vago sobre esa parte de la imagen, no que el modelo te ignorara.
Para la referencia multiimagen, trata el prompt como un conjunto de instrucciones para un compositor: nombra qué imagen aporta qué elemento, en el orden en que las listaste. "Pon la prenda de la imagen 2 en la persona de la imagen 1, en el entorno de la imagen 3" es mucho más fiable que una sola frase que describe el resultado final sin referencia a las fuentes.
Para un conjunto de imágenes, describe el hilo conductor que debe permanecer constante (normalmente un personaje o un estilo) y luego la única cosa que cambia por imagen. El ejemplo de la documentación es un gato naranja callejero cuyos "rasgos deben ser coherentes en todas las imágenes", con una estación distinta en cada toma. Nombra el constante explícitamente; de lo contrario el modelo trata cada imagen como una nueva tirada de dados.
Recibe los nuevos archivos de prompts primero
Un email cuando publicamos un nuevo archivo de prompts probado o una guía de modelo. Prompts probados en producción, no teoría. Sin spam, cancela cuando quieras.
Ajustes recomendados (base)
Empieza aquí, luego ajusta una variable a la vez. Los límites de resolución difieren según el modo y el modelo, así que comprueba qué fila aplica antes de fijar el tamaño.
| Modelo | wan2.7-image-pro para 4K y edición más fuerte; wan2.7-image para pasadas más rápidas y baratas |
|---|---|
| Resolución: texto a imagen | 1K, 2K o 4K (solo Pro); salida cuadrada cuando no se introduce imagen |
| Resolución: edición, retoque de región, multiimagen, conjuntos | solo 1K o 2K, incluso en Pro; la relación de aspecto de salida sigue la imagen de entrada |
| Imágenes de referencia | 0-9 imágenes; el orden importa, lista tu sujeto principal primero |
| n (número de imágenes) | 1-4 para una generación única; hasta 12 para un conjunto de imágenes. Ajústalo a lo que vas a usar, no al máximo |
| Modo de razonamiento | Activado por defecto para el texto a imagen simple; añade tiempo por calidad extra, desactivado para iteración rápida |
| Marca de agua | Desactivada por defecto; actívala si necesitas la etiqueta "AI Generated" para un soporte concreto |
| Seed | Fija mientras comparas cambios de prompt; aleatoria una vez que exploras variaciones |
Problemas comunes y soluciones
Una edición cambió partes de la imagen que no pediste: el prompt no dijo qué debía quedarse igual. Añade una cláusula explícita "mantén X sin cambios", o cambia a la edición interactiva con un cuadro delimitador para que solo pueda moverse la región prevista.
Una composición multiimagen mezcla los elementos equivocados: el prompt no ató una instrucción a una imagen concreta. Refiérete a cada imagen de origen explícitamente por su posición ("imagen 1", "imagen 2") en lugar de describir el resultado en abstracto.
Un conjunto de imágenes no se mantiene coherente: el constante (personaje, estilo) no se planteó como requisito firme. Di directamente que los rasgos del sujeto deben coincidir en cada imagen, y mantén el elemento variable en un solo eje claro, como la estación o el ángulo.
Una petición 4K falló o se ignoró: la 4K solo está disponible en wan2.7-image-pro, y solo para texto a imagen sin imagen de entrada. Cualquier petición de edición, retoque de región, multiimagen o conjunto tiene su tope en 2K sea cual sea el modelo.
Cómo se compara en velocidad y calidad
Lo comparamos lado a lado con Z-Image con el mismo prompt para ver dónde está de verdad: Wan 2.7 Image fue notablemente más lento en generar, y la calidad de salida quedó como mucho igual, en algunos casos peor. Si la velocidad importa y no buscas específicamente uno de sus cinco modos (edición, retoque de región, multiimagen o conjuntos), Z-Image es el que usaríamos primero.
Seguir leyendo
How to use Z-Image for AI image generation
A practical guide to Z-Image (z-image-turbo): a fast, lightweight text-to-image model with clean English and Chinese text rendering. Covers the resolutions that work best, how to write a prompt it renders faithfully, and the settings that decide speed versus quality.
How to use Dola-Seedream-5.0-lite for AI image generation
A practical guide to Dola-Seedream-5.0-lite (model ID seedream-5-0-260128): a text- and image-input model with web-connected retrieval, strong reference consistency, and accurate instruction following. Covers how to prompt it, combine reference images, and pick the right pricing tier.
How to use Seedream 4.5 for AI image generation
A practical guide to ByteDance Seedream 4.5: how its text-to-image and image-to-image (multi-image fusion) modes work, how to reference input images in a prompt, the resolution and batch settings that matter, and how to get consistent, high-detail results.
How to generate videos with Wan 2.7
A practical guide to Wan 2.7 image-to-video: clips up to about fifteen seconds, built-in prompt optimization, and refined native audio. What the model adds over 2.5, how to prompt sound, and how to script a longer clip so it holds together.
Recibe los nuevos archivos de prompts primero
Un email cuando publicamos un nuevo archivo de prompts probado o una guía de modelo. Prompts probados en producción, no teoría. Sin spam, cancela cuando quieras.
