Wan AI: los modelos de video de Alibaba, de los pesos abiertos a Wan 2.7
Escrito por Clement
Wan es la familia de modelos de generación de video de Alibaba, y cumple un papel que nadie más en la gama alta cumple: el del modelo abierto. Las versiones open-weight de Wan (la línea 2.1/2.2) se pueden descargar y ejecutar en tu propia GPU (gratis, ilimitado, privado), mientras que sus versiones alojadas más recientes (2.5 y 2.7) compiten con los modelos comerciales de referencia, con audio nativo y clips de hasta unos quince segundos.
Esa doble naturaleza es el sentido de esta página: Wan es a la vez la mejor opción autoalojada para quienes les gusta trastear y un motor alojado serio para producción. Lo usamos mucho y mantenemos guías detalladas versión por versión; esta página es el mapa de la familia y te ayuda a elegir tu punto de entrada.
Datos rápidos
- Creado por
- Alibaba (laboratorio Tongyi)
- Qué hace
- Text-to-video e image-to-video; las versiones nuevas añaden audio nativo y un modelo de imagen sólido (Wan 2.7 Image)
- El lado abierto
- Pesos abiertos Wan 2.1/2.2: ejecución local en ComfyUI con una GPU de consumo, gratis e ilimitada
- El lado alojado
- Wan 2.5 (nivel de calidad) y Wan 2.7 (audio + clips de hasta ~15 s), mediante API y plataformas alojadas
- Precio
- En local: gratis (tu hardware). Alojado: API de pago por segundo, más barata que los modelos de referencia occidentales
- Ideal para
- Quienes se autoalojan, la generación en volumen con poco presupuesto y los clips con audio sin precios de modelo de referencia
Lo que Wan hace mejor
Los lanzamientos open-weight cambiaron quién puede generar video. Wan 2.2 en una GPU de consumo produce buen image-to-video: coherencia del sujeto, movimiento real, cero coste por clip, sin cola, sin filtro de contenido y control total del pipeline en ComfyUI. Nada comercial iguala esa combinación para quienes trastean y para los flujos en volumen.
La línea alojada es discretamente competitiva: Wan 2.5 subió el nivel de detalle y la estabilidad del movimiento, y Wan 2.7 añadió audio nativo y clips mucho más largos (las dos funciones que, si no, te empujan a Veo o Sora) con precios de API agresivos.
Como la familia va del local gratuito al alojado premium, puedes crear prototipos en local y llevar el mismo estilo de prompt a los niveles alojados cuando un proyecto necesite audio, duración o la máxima calidad. Nuestras guías de Wan 2.2, 2.5 y 2.7 cubren cada peldaño en profundidad.
El ajuste que marcó la diferencia para nosotros en generación alojada: renderizar a una resolución base más baja y luego aplicar un upscale 2x con un modelo (usamos RealESRGAN, no un simple cambio de tamaño) en lugar de generar a resolución completa desde el principio. En una GPU de pago por segundo, eso redujo nuestro tiempo de generación aproximadamente a la mitad para una resolución final comparable, porque los pasos de difusión trabajan mucho menos por fotograma y la pasada de upscale es barata en comparación.
Limitaciones que conviene conocer antes de comprometerte
Wan en local tiene un precio de entrada en hardware. Una GPU moderna con bastante VRAM y ganas de configurar ComfyUI. Lo más barato por clip. Lo más caro en esfuerzo de instalación.
Las herramientas alrededor del modelo están menos pulidas que las de los modelos de referencia occidentales. Las aplicaciones para el gran público y las herramientas de edición que rodean a Veo o Runway no existen de la misma forma; Wan es un modelo al que se accede mediante plataformas y API más que una suite creativa empaquetada.
El techo de fotorrealismo y de fidelidad al prompt en lo más alto sigue siendo de Veo 3 y de los modelos cerrados más recientes; el argumento de Wan es el 90 % del resultado por una fracción del coste, no el liderazgo absoluto.
Cómo acceder
Vía local: descarga los pesos abiertos de Wan y ejecútalos en ComfyUI. Calcula una tarde para la instalación; después, cada generación es gratis. Nuestra guía de Wan 2.2 es el paso a paso.
Vía alojada: la API de modelos de Alibaba expone toda la línea, incluidas la 2.5 y la 2.7, con precio por segundo, y un número creciente de plataformas de generación de terceros ofrecen modelos Wan con sistemas de créditos. A menudo es la forma más fácil de probar el audio de la 2.7 sin una cuenta de API.
Cómo se compara Wan
Frente a Veo 3: Veo gana en fidelidad máxima, herramientas alrededor del modelo y pulido del audio; Wan 2.7 responde con audio nativo y clips más largos a un precio mucho menor, y suma la salida abierta que ningún producto de Google ofrece.
Frente a Kling y Hailuo: esos tienen aplicaciones más amigables para el gran público y créditos diarios gratuitos; Wan contrarresta con pesos abiertos y mejor economía a volumen de API. Para un creador que quiere ser dueño de su pipeline, Wan es la elección por defecto.
Wan-Streamer: la rama en tiempo real que vale la pena seguir
En julio de 2026 el equipo de Wan publicó Wan-Streamer, que es algo de otra naturaleza que los generadores de clips anteriores. Es una conversación de video en directo: un solo modelo que gestiona a la vez la comprensión y la generación de texto, audio y video. Hablas con un personaje generado y responde en tiempo real, viéndote a través de tu cámara mientras lo hace. En la demo describe por iniciativa propia a la persona que está mirando, hasta el color de su camisa y la pared de detrás, y mantiene una conversación normal. No está atado a un avatar fijo: el personaje puede ser una persona, una mascota o un personaje de anime descrito con palabras.
Las cifras son la parte interesante. La v0.2 funciona a 640x368 y 25fps, frente a 192x336 antes, con unos 200 ms de latencia del lado del modelo y unos 550 ms de extremo a extremo. Lo consigue repartiendo el trabajo: un "Thinker" ligero se ocupa de percepción, lenguaje y estado con baja latencia, mientras que un "Performer" multi-GPU más pesado genera los latentes de video.
La versión 0.3 llegó el 16 de julio de 2026 y mantuvo esas cifras idénticas, lo que indica adónde fue el trabajo. En lugar de perseguir la resolución, redefine qué es un video: un "mundo" persistente (la apariencia del personaje, la habitación, el estilo visual) más un "flujo de eventos" de lo que cambia (habla, movimiento corporal, movimiento de cámara). Durante una sesión en directo, tu propia cámara, tu micrófono y el texto que escribes se suman a ese flujo de eventos. El resultado práctico es que el personaje deja de ser una cabeza parlante. Las versiones anteriores solo hacían retratos de alguien sentado hablando; en la v0.3 diriges el cuerpo con la voz en plena conversación. Pídele que haga el signo de la paz, que se ponga las manos en la cintura, que se arregle el pelo o que mire al suelo, y lo hace, sin perder el hilo de la conversación.
Construimos productos de compañía en tiempo real, así que esta es nuestra lectura de esas cifras. Unos 550 ms de ida y vuelta es conversacional; está cerca de la pausa que una persona deja antes de responder, y es mucho mejor que el retraso de varios segundos que hace que un chat de video se sienta roto. La resolución es lo que todavía no está. 640x368 es una ventana pequeña, válida para una cabeza parlante del tamaño de un móvil pero por debajo del encuadre de plano medio al que apunta la demo. El control del cuerpo por voz es la mejora más significativa, porque un compañero que siempre está quieto parece una videollamada con una grabación.
El punto que decide si puedes usar algo de esto: solo hay un artículo técnico, y eso ya se cumple tres veces seguidas. La v0.1, la v0.2 y la v0.3 llegaron en unas seis semanas sin pesos, sin producto y sin API entre ellas. Los modelos de clips del equipo de Wan sí se abrieron, y los autores han dicho que esperan hacer lo mismo aquí, pero un ritmo de investigación tan rápido sin lanzamiento se lee como un programa de investigación, no como un camino de producto. Tómalo como la imagen más clara disponible de hacia dónde van los compañeros de IA en tiempo real, no como algo sobre lo que construir este trimestre.
MobileWan: generación de video Wan en un móvil
La otra dirección que tomó Wan en julio de 2026 fue hacia abajo. Qualcomm AI Research publicó MobileWan, que ejecuta la arquitectura Wan 2.2 de 5 mil millones de parámetros por completo en hardware móvil Snapdragon comercial. Genera 81 fotogramas, cinco segundos a 16fps, a 480x832, en unos 20 segundos de extremo a extremo en el propio dispositivo. La descarga completa ronda los 9,9 GB. Fíjate en la atribución, porque mucha cobertura se equivocó: es ingeniería de Qualcomm construida sobre los pesos abiertos de Alibaba, no un lanzamiento de Alibaba.
El trabajo de compresión es lo que lo hace posible. MobileWan genera por bloques en lugar de procesar todos los fotogramas juntos, poda las cabezas de atención que menos contribuyen, usa un decodificador eficiente en memoria y reduce la difusión de los 20 a 30 pasos habituales a tres. Esa última cifra es la que carga con el grueso de la mejora de latencia.
La calidad no es competitiva frente a Wan a escala de servidor, y no pretende serlo. Lo que cambia es el suelo. Generar en tu propio móvil significa sin cuenta, sin subida, sin cola y sin filtro de contenido alojado entre tú y el resultado: la combinación que quienes se autoalojan llevan años queriendo y para la que antes hacía falta una GPU de escritorio. También rompe el modelo de costes sobre el que se apoya nuestra guía de costes de video: cuando la generación ocurre en hardware que ya tienes, el coste marginal de un clip es la batería en lugar de créditos de API.
Preguntas frecuentes
- ¿Qué es Wan-Streamer y puedo usarlo?
- Wan-Streamer es la rama en tiempo real del equipo de Wan: un único modelo que unifica texto, audio y video para mantener una conversación de video en directo con un personaje generado que te ve a través de tu cámara. La versión 0.3 (16 de julio de 2026) funciona a 640x368 y 25fps con unos 200 ms de latencia del lado del modelo y unos 550 ms de extremo a extremo, y añade control del cuerpo por voz, de modo que el personaje puede hacer un gesto, arreglarse el pelo o mirar a su alrededor bajo orden en lugar de limitarse a estar sentado hablando. Todavía no puedes usarlo. Las tres versiones (0.1, 0.2 y 0.3) se han publicado solo como artículos técnicos, a lo largo de unas seis semanas: sin pesos, sin API, sin producto. Los modelos de clips de la familia Wan son abiertos, pero Wan-Streamer no está publicado a julio de 2026.
- ¿Puedo ejecutar la generación de video de Wan en un móvil?
- Sí, desde julio de 2026. MobileWan, de Qualcomm AI Research, ejecuta la arquitectura Wan 2.2 de 5B en hardware móvil Snapdragon y genera un clip de 5 segundos a 480x832 y 16fps en unos 20 segundos en el propio dispositivo, a partir de una descarga de unos 9,9 GB. La calidad queda muy por debajo de Wan a escala de servidor, pero todo ocurre en local: sin cuenta, sin subida, sin filtro de contenido y sin coste por clip.
- ¿Wan es gratis?
- Las versiones open-weight (Wan 2.1/2.2) son gratuitas: descarga los pesos y ejecútalos en local en ComfyUI con tu propia GPU, sin coste por clip. Las versiones alojadas más recientes (2.5, 2.7) se pagan por segundo mediante la API o a través de los sistemas de créditos de las plataformas alojadas.
- ¿Cuál es la diferencia entre Wan 2.2, 2.5 y 2.7?
- La 2.2 es el caballo de batalla ligero, rápido y abierto (mudo, clips de ~5 s). La 2.5 es la mejora de calidad alojada: movimiento más estable, más detalle fino. La 2.7 es el nivel premium: audio nativo y clips de hasta unos quince segundos en una sola pasada. Nuestras guías por versión cubren cada una en detalle.
- ¿Qué necesito para ejecutar Wan en local?
- Una GPU moderna con bastante VRAM, ComfyUI y el checkpoint abierto de Wan para tu flujo de trabajo (text-to-video o image-to-video). La instalación lleva una tarde; después, la generación es gratuita e ilimitada.
Guías prácticas
Los mejores
Modelos relacionados
Recibe las nuevas guías por email
Un email cuando publicamos nuevas guías y análisis de modelos. Sin spam, cancela cuando quieras.
