Cómo convertir una imagen en video con IA
Escrito por Clement

El image-to-video (a menudo abreviado I2V) es el flujo de trabajo en el que entregas a un modelo de video con IA una sola imagen y una descripción del movimiento, para generar un video que parte de ese fotograma. Es la forma más fiable de conseguir un video con IA controlable, porque el modelo no inventa toda una escena: anima una que ya has creado.
Esta guía es deliberadamente independiente de la herramienta, para que puedas aplicar estos conocimientos a cualquier modelo.
¿Quieres crear uno? Consigue el archivo de prompt gratuito. Convierte a ChatGPT, Claude o Gemini en un especialista.
Obtener el archivo de prompt gratis →Hazlo tú mismo en Qwen Chat (gratis, basta con registrarte para probar)
Este es el procedimiento exacto del video de arriba. Síguelo: no cuesta nada y lleva unos veinte segundos de clics más la espera del renderizado.
- 1
Abre Qwen Chat y suelta tu imagen en el cuadro de mensaje
Arrastra tu imagen a cualquier parte del cuadro de mensaje. Usa una imagen de buena calidad. Lo que haya en este encuadre se convierte en el primer fotograma de tu video.
Abrir chat.qwen.ai - 2
Escribe tu prompt describiendo el movimiento que esperas
Escribe la acción que quieres, en el orden en que debe ocurrir. En el ejemplo usé "Make the woman blow a kiss toward the camera then smile" (la mujer lanza un beso hacia la cámara y luego sonríe). No describas el escenario, la ropa ni la iluminación si no quieres cambiarlos. Menciona solo lo que debe moverse o cambiar.
- 3
Haz clic en + y activa Create Video
Abre el menú + a la izquierda de la barra de entrada y elige Create Video. No hace falta seleccionar una relación de aspecto: se ajusta automáticamente a tu imagen.
- 4
Envíalo y deja que se renderice
Pulsa la flecha azul. Tu imagen y tu prompt se publican como un mensaje normal y debajo aparece una tarjeta provisional con una barra de progreso desde el 0 %. La generación tarda entre 1 y 2 minutos según la cola.
- 5
Revisa el resultado y descárgalo
Obtienes un clip de cinco segundos en la conversación. Haz clic para reproducirlo a pantalla completa y comprueba que el movimiento coincide con lo que pediste. Download guarda el MP4. Si el movimiento se acerca pero no es el correcto, vuelve a enviar la misma imagen y reformula un poco el prompt con un movimiento más común: este modelo no maneja bien los movimientos complejos.
En qué se diferencia el image-to-video del text-to-video
Con el text-to-video lo describes todo y el modelo inventa la escena, el sujeto y el movimiento en cada generación. No hay estabilidad del personaje, así que es difícil hacer un video con IA más largo. Además, generar video lleva más tiempo y dinero, de modo que cada renderizado fallido te cuesta más que generar y retocar un primer fotograma.
El image-to-video fija la escena. Tú aportas el primer fotograma, así que el aspecto del sujeto y la composición quedan bloqueados. El único trabajo del modelo es añadir un movimiento creíble. Esa restricción es justo la razón por la que el I2V es el flujo de trabajo al que recurrir cuando quieres un personaje o una escena concretos.
Cómo elegir una imagen de origen que se anime bien
La calidad es el factor más importante de tu imagen de entrada. El movimiento amplifica lo que ya hay en el encuadre, así que una imagen de baja calidad o pixelada da un video de mala calidad.
Para conseguir un mejor resultado con facilidad al empezar, usa un solo personaje centrado y de aspecto humano. Así el modelo entiende cuál es tu foco principal y cómo animar el cuerpo.
Asegúrate de que el movimiento que pides sea humanamente posible y quepa en la duración de tu video. Mi ejemplo pide dos tiempos cortos, un beso lanzado y luego una sonrisa, que caben con holgura en 5 segundos; añadir una tercera acción, como sacar la fruta de la cesta, habría sido demasiado. Si quieres que alguien camine o se gire, no lo encuadres pegado a los bordes: el modelo necesita espacio hacia donde moverlo, o el movimiento se ve encogido y estirado.
Recibe los nuevos archivos de prompts primero
Un email cuando publicamos un nuevo archivo de prompts probado o una guía de modelo. Prompts probados en producción, no teoría. Sin spam, cancela cuando quieras.
Paso a paso
El proceso es corto e igual en todos los modelos. La calidad se juega en los pasos 1 y 3.
- 6
Prepara la imagen de origen
Genera o elige una imagen de alta calidad con un sujeto claro y recórtala a la relación de aspecto que quieres para el video final (vertical para móviles y redes sociales, horizontal para pantallas anchas como el ordenador). Intenta usar una proporción exacta como 9:16 o 4:3, para asegurarte de que el modelo pueda procesar el formato.
- 7
Configura la resolución de salida
Si tu modelo lo permite, usa una resolución que admita oficialmente para tu relación de aspecto. Introducir un tamaño arbitrario es la causa más habitual de resultados estirados o fallidos, porque la mayoría de los modelos de video esperan dimensiones que sean múltiplos de un tamaño de bloque fijo.
- 8
Describe solo el movimiento
Escribe el prompt describiendo el movimiento esperado con la mayor precisión posible, usando verbos en presente progresivo: "ella se está girando hacia la cámara, el pelo flotando con el viento". No vuelvas a describir los elementos de la imagen si no tienen que moverse. La imagen ya es la escena.
- 9
Ajusta la duración del clip y la guidance
Mantén el primer clip corto, de unos cinco segundos, y usa un valor de guidance moderado (casi siempre es el valor predeterminado de tu herramienta). Empieza con un clip corto de 5 s a baja resolución, para reducir el coste y el tiempo de generación y obtener un resultado directo sobre la calidad de tu prompt y tu configuración.
- 10
Genera y vuelve a tirar de la seed
Ejecútalo. Si el movimiento está casi bien, cambia solo la seed y vuelve a intentarlo antes de tocar nada más. Estos modelos son aleatorios, y una seed nueva suele convertir un casi en un resultado aprovechable. Probé la misma imagen de origen con cinco variaciones de seed: cuatro salieron limpias y una deformó una mano gravemente, sin ninguna causa visible en el prompt ni en los ajustes. Pero ojo: los fallos totales suelen deberse a un mal prompt (un movimiento imposible, o demasiados movimientos a la vez en una duración corta).
Los ajustes que importan (cualquier modelo)
Los ajustes disponibles varían entre herramientas, pero estas cinco palancas existen casi en todas partes y deciden el resultado.
- Imagen de origen
- Alta calidad, un solo sujeto, recortada a la relación de aspecto objetivo
- Resolución
- Un tamaño que el modelo admita oficialmente; no improvises las dimensiones, lee la documentación de tu modelo
- Duración del clip
- ~5 segundos para empezar, para evaluar la calidad de tu configuración
- Prompt de movimiento
- Presente progresivo, describe solo el movimiento, físicamente plausible
- Fuerza de guidance
- Moderada (demasiado alta quema el resultado, demasiado baja ignora tu prompt)
Problemas habituales y soluciones
El sujeto se deforma o se derrite: el movimiento pedido es demasiado grande o la guidance es demasiado alta. Pide un movimiento más pequeño y creíble y baja la guidance.
Casi no hay movimiento: el prompt es demasiado vago (o el movimiento no existe para este modelo sin un LoRA) o la guidance es demasiado baja. Usa un verbo de acción concreto y sube un poco la guidance.
Forma estirada o incorrecta: tus dimensiones no son un tamaño admitido para esa relación de aspecto. Corrige la resolución.
Parpadeo y grano: normalmente una imagen de origen de mala calidad. Parte de una imagen de alta calidad. El movimiento no oculta el ruido de entrada, lo multiplica.
Siguientes pasos
Cuando puedas animar una sola imagen de forma fiable, los pasos naturales siguientes son escribir prompts de movimiento más sólidos y unir clips en secuencias más largas. Tratamos ambos en guías específicas.
Seguir leyendo

How to use reference-to-video AI (combine images into one clip)
A model-agnostic guide to reference-to-video AI: how to combine several reference images (a person, an outfit, a prop, a location) into one coherent clip, how some engines also take audio and video as references, and the mistakes that decide whether the shot fuses or falls apart.

How to write prompts for AI video generation
The prompt structure that works for AI video: why motion prompts are different from image prompts, the present-progressive rule, and the specific phrasing that gets you believable movement instead of a warped photo.

How to fix flickering AI video: 4 causes and fixes
AI video that flickers, shimmers, or morphs between frames has 4 usual causes. Here's how to diagnose and fix each one: source-image noise, too-few steps, over-long clips, and unstable prompts. Step by step.

How to make longer AI videos: 4 methods that work
AI video models cap out at a few seconds. Here are the 4 methods that extend them: chaining clips, last-frame continuation, and keeping motion consistent across every join. Step by step, free.
Cómo generar vídeos con Wan 2.2
Una guía práctica y probada para convertir una sola imagen en vídeo IA fluido con Wan 2.2 (imagen a vídeo): los ajustes que importan, la estructura de prompt que funciona y los errores que arruinan tus renders.

How to use HappyHorse image-to-video (first-frame AI video)
A practical guide to HappyHorse image-to-video: how to turn a single first-frame image and a prompt into smooth AI video, the resolution and duration settings that matter, and the mistakes that waste a render.
Modelos relacionados
Recibe los nuevos archivos de prompts primero
Un email cuando publicamos un nuevo archivo de prompts probado o una guía de modelo. Prompts probados en producción, no teoría. Sin spam, cancela cuando quieras.
