Saltar al contenido
GenLovers

Cómo convertir una imagen en video con IA

Última actualización: 8 min de lecturaDificultad: Apto para principiantes

Escrito por Clement

Una tarjeta para la guía de imagen a video, que muestra una sola imagen convirtiéndose en un fotograma de video.

El image-to-video (a menudo abreviado I2V) es el flujo de trabajo en el que entregas a un modelo de video con IA una sola imagen y una descripción del movimiento, para generar un video que parte de ese fotograma. Es la forma más fiable de conseguir un video con IA controlable, porque el modelo no inventa toda una escena: anima una que ya has creado.

Esta guía es deliberadamente independiente de la herramienta, para que puedas aplicar estos conocimientos a cualquier modelo.

Un ejemplo en Qwen Chat: suelta la imagen, describe la acción esperada, selecciona Create Video y genera.

¿Quieres crear uno? Consigue el archivo de prompt gratuito. Convierte a ChatGPT, Claude o Gemini en un especialista.

Obtener el archivo de prompt gratis →

Hazlo tú mismo en Qwen Chat (gratis, basta con registrarte para probar)

Este es el procedimiento exacto del video de arriba. Síguelo: no cuesta nada y lleva unos veinte segundos de clics más la espera del renderizado.

  1. 1

    Abre Qwen Chat y suelta tu imagen en el cuadro de mensaje

    Arrastra tu imagen a cualquier parte del cuadro de mensaje. Usa una imagen de buena calidad. Lo que haya en este encuadre se convierte en el primer fotograma de tu video.

    Abrir chat.qwen.ai
  2. 2

    Escribe tu prompt describiendo el movimiento que esperas

    Escribe la acción que quieres, en el orden en que debe ocurrir. En el ejemplo usé "Make the woman blow a kiss toward the camera then smile" (la mujer lanza un beso hacia la cámara y luego sonríe). No describas el escenario, la ropa ni la iluminación si no quieres cambiarlos. Menciona solo lo que debe moverse o cambiar.

  3. 3

    Haz clic en + y activa Create Video

    Abre el menú + a la izquierda de la barra de entrada y elige Create Video. No hace falta seleccionar una relación de aspecto: se ajusta automáticamente a tu imagen.

  4. 4

    Envíalo y deja que se renderice

    Pulsa la flecha azul. Tu imagen y tu prompt se publican como un mensaje normal y debajo aparece una tarjeta provisional con una barra de progreso desde el 0 %. La generación tarda entre 1 y 2 minutos según la cola.

  5. 5

    Revisa el resultado y descárgalo

    Obtienes un clip de cinco segundos en la conversación. Haz clic para reproducirlo a pantalla completa y comprueba que el movimiento coincide con lo que pediste. Download guarda el MP4. Si el movimiento se acerca pero no es el correcto, vuelve a enviar la misma imagen y reformula un poco el prompt con un movimiento más común: este modelo no maneja bien los movimientos complejos.

Los cinco segundos generados en ese ejemplo. La cara, el vestido, el sombrero y el campo de rosas se mantienen fieles a la imagen de origen; lo único que cambia es la mano que se levanta para lanzar el beso y la sonrisa que viene después.

En qué se diferencia el image-to-video del text-to-video

Con el text-to-video lo describes todo y el modelo inventa la escena, el sujeto y el movimiento en cada generación. No hay estabilidad del personaje, así que es difícil hacer un video con IA más largo. Además, generar video lleva más tiempo y dinero, de modo que cada renderizado fallido te cuesta más que generar y retocar un primer fotograma.

El image-to-video fija la escena. Tú aportas el primer fotograma, así que el aspecto del sujeto y la composición quedan bloqueados. El único trabajo del modelo es añadir un movimiento creíble. Esa restricción es justo la razón por la que el I2V es el flujo de trabajo al que recurrir cuando quieres un personaje o una escena concretos.

Cómo elegir una imagen de origen que se anime bien

La calidad es el factor más importante de tu imagen de entrada. El movimiento amplifica lo que ya hay en el encuadre, así que una imagen de baja calidad o pixelada da un video de mala calidad.

Para conseguir un mejor resultado con facilidad al empezar, usa un solo personaje centrado y de aspecto humano. Así el modelo entiende cuál es tu foco principal y cómo animar el cuerpo.

Asegúrate de que el movimiento que pides sea humanamente posible y quepa en la duración de tu video. Mi ejemplo pide dos tiempos cortos, un beso lanzado y luego una sonrisa, que caben con holgura en 5 segundos; añadir una tercera acción, como sacar la fruta de la cesta, habría sido demasiado. Si quieres que alguien camine o se gire, no lo encuadres pegado a los bordes: el modelo necesita espacio hacia donde moverlo, o el movimiento se ve encogido y estirado.

Recibe los nuevos archivos de prompts primero

Un email cuando publicamos un nuevo archivo de prompts probado o una guía de modelo. Prompts probados en producción, no teoría. Sin spam, cancela cuando quieras.

Paso a paso

El proceso es corto e igual en todos los modelos. La calidad se juega en los pasos 1 y 3.

  1. 6

    Prepara la imagen de origen

    Genera o elige una imagen de alta calidad con un sujeto claro y recórtala a la relación de aspecto que quieres para el video final (vertical para móviles y redes sociales, horizontal para pantallas anchas como el ordenador). Intenta usar una proporción exacta como 9:16 o 4:3, para asegurarte de que el modelo pueda procesar el formato.

  2. 7

    Configura la resolución de salida

    Si tu modelo lo permite, usa una resolución que admita oficialmente para tu relación de aspecto. Introducir un tamaño arbitrario es la causa más habitual de resultados estirados o fallidos, porque la mayoría de los modelos de video esperan dimensiones que sean múltiplos de un tamaño de bloque fijo.

  3. 8

    Describe solo el movimiento

    Escribe el prompt describiendo el movimiento esperado con la mayor precisión posible, usando verbos en presente progresivo: "ella se está girando hacia la cámara, el pelo flotando con el viento". No vuelvas a describir los elementos de la imagen si no tienen que moverse. La imagen ya es la escena.

  4. 9

    Ajusta la duración del clip y la guidance

    Mantén el primer clip corto, de unos cinco segundos, y usa un valor de guidance moderado (casi siempre es el valor predeterminado de tu herramienta). Empieza con un clip corto de 5 s a baja resolución, para reducir el coste y el tiempo de generación y obtener un resultado directo sobre la calidad de tu prompt y tu configuración.

  5. 10

    Genera y vuelve a tirar de la seed

    Ejecútalo. Si el movimiento está casi bien, cambia solo la seed y vuelve a intentarlo antes de tocar nada más. Estos modelos son aleatorios, y una seed nueva suele convertir un casi en un resultado aprovechable. Probé la misma imagen de origen con cinco variaciones de seed: cuatro salieron limpias y una deformó una mano gravemente, sin ninguna causa visible en el prompt ni en los ajustes. Pero ojo: los fallos totales suelen deberse a un mal prompt (un movimiento imposible, o demasiados movimientos a la vez en una duración corta).

Los ajustes que importan (cualquier modelo)

Los ajustes disponibles varían entre herramientas, pero estas cinco palancas existen casi en todas partes y deciden el resultado.

Imagen de origen
Alta calidad, un solo sujeto, recortada a la relación de aspecto objetivo
Resolución
Un tamaño que el modelo admita oficialmente; no improvises las dimensiones, lee la documentación de tu modelo
Duración del clip
~5 segundos para empezar, para evaluar la calidad de tu configuración
Prompt de movimiento
Presente progresivo, describe solo el movimiento, físicamente plausible
Fuerza de guidance
Moderada (demasiado alta quema el resultado, demasiado baja ignora tu prompt)

Problemas habituales y soluciones

El sujeto se deforma o se derrite: el movimiento pedido es demasiado grande o la guidance es demasiado alta. Pide un movimiento más pequeño y creíble y baja la guidance.

Casi no hay movimiento: el prompt es demasiado vago (o el movimiento no existe para este modelo sin un LoRA) o la guidance es demasiado baja. Usa un verbo de acción concreto y sube un poco la guidance.

Forma estirada o incorrecta: tus dimensiones no son un tamaño admitido para esa relación de aspecto. Corrige la resolución.

Parpadeo y grano: normalmente una imagen de origen de mala calidad. Parte de una imagen de alta calidad. El movimiento no oculta el ruido de entrada, lo multiplica.

Siguientes pasos

Cuando puedas animar una sola imagen de forma fiable, los pasos naturales siguientes son escribir prompts de movimiento más sólidos y unir clips en secuencias más largas. Tratamos ambos en guías específicas.

Seguir leyendo

Modelos relacionados

Recibe los nuevos archivos de prompts primero

Un email cuando publicamos un nuevo archivo de prompts probado o una guía de modelo. Prompts probados en producción, no teoría. Sin spam, cancela cuando quieras.

Añadir GenLovers como fuente preferida en Google