Aller au contenu
GenLovers

Comment transformer une image en vidéo avec l'IA

Dernière mise à jour: 8 min de lectureDifficulté: Accessible aux débutants

Écrit par Clement

Une carte pour le guide image vers vidéo, montrant une image unique qui devient une image de vidéo.

L'image vers vidéo (souvent abrégée I2V) est le workflow où vous donnez à un modèle de vidéo IA une seule image et une description du mouvement, pour générer une vidéo qui part de cette image. C'est la façon la plus fiable d'obtenir une vidéo IA contrôlable, parce que le modèle n'invente pas toute une scène : il anime une scène que vous avez déjà créée.

Ce guide est volontairement indépendant de l'outil, pour que vous puissiez appliquer ces connaissances à tous les modèles.

Un exemple dans Qwen Chat : déposez l'image, décrivez l'action attendue, sélectionnez Create Video, générez.

Envie d'en créer un ? Récupérez le fichier de prompt gratuit. Il transforme ChatGPT, Claude ou Gemini en spécialiste.

Obtenir le fichier de prompt gratuit →

Faites-le vous-même dans Qwen Chat (gratuit, une simple inscription pour essayer)

C'est la procédure exacte de la vidéo ci-dessus. Suivez-la, elle ne coûte rien et demande une vingtaine de secondes de clics, plus l'attente du rendu.

  1. 1

    Ouvrez Qwen Chat et déposez votre image sur la zone de saisie

    Faites glisser votre image n'importe où sur la zone de message. Utilisez une image de bonne qualité. Ce qui se trouve dans ce cadre devient la première image de votre vidéo.

    Ouvrir chat.qwen.ai
  2. 2

    Écrivez votre prompt en décrivant le mouvement attendu

    Saisissez l'action voulue, dans l'ordre où elle doit se produire. Dans l'exemple, j'ai utilisé "Make the woman blow a kiss toward the camera then smile" (la femme envoie un baiser vers la caméra puis sourit). Ne décrivez pas le décor, la tenue ni l'éclairage si vous ne voulez pas les changer. Mentionnez uniquement ce qui doit bouger ou changer.

  3. 3

    Cliquez sur + et activez Create Video

    Ouvrez le menu + à gauche de la barre de saisie et choisissez Create Video. Inutile de sélectionner un format d'image : il s'aligne automatiquement sur votre image.

  4. 4

    Envoyez et laissez le rendu se faire

    Cliquez sur la flèche bleue. Votre image et votre prompt s'affichent comme un message normal, et une carte provisoire apparaît dessous avec une barre de progression à partir de 0 %. La génération prend environ 1 à 2 minutes selon la file d'attente.

  5. 5

    Vérifiez le résultat, puis téléchargez-le

    Vous obtenez un clip de cinq secondes dans la conversation. Cliquez pour le lire en plein écran et vérifiez que le mouvement correspond à votre demande. Download enregistre le MP4. Si le mouvement est proche sans être juste, renvoyez la même image et retravaillez un peu votre prompt avec un mouvement plus courant : ce modèle gère mal les mouvements complexes.

Les cinq secondes générées pour cet exemple. Le visage, la robe, le chapeau et le champ de roses restent fidèles à l'image source ; la seule chose qui change, c'est la main qui se lève pour envoyer le baiser, puis le sourire qui suit.

En quoi l'image vers vidéo diffère du texte vers vidéo

Avec le texte vers vidéo, vous décrivez tout et le modèle invente la scène, le sujet et le mouvement à chaque génération. Aucune stabilité du personnage, ce qui rend difficile de réaliser une vidéo IA plus longue. La génération vidéo demande aussi plus de temps et d'argent : chaque rendu raté vous coûte donc plus cher que de générer puis retoucher une première image.

L'image vers vidéo fige la scène. Vous fournissez la première image, donc l'apparence du sujet et la composition sont verrouillées. Le seul travail du modèle est d'ajouter un mouvement crédible. Cette contrainte est précisément la raison pour laquelle l'I2V est le workflow à choisir quand vous voulez un personnage ou une scène précis.

Choisir une image source qui s'anime bien

La qualité est le facteur le plus important de votre image d'entrée. Le mouvement amplifie tout ce qui est déjà dans le cadre : une image de mauvaise qualité ou pixellisée donne une vidéo de mauvaise qualité.

Pour obtenir facilement un meilleur résultat au début, utilisez un seul personnage centré, de forme humaine. Le modèle comprend ainsi ce sur quoi se concentrer et comment animer le corps.

Assurez-vous que le mouvement demandé est humainement possible et tient dans la durée de votre vidéo. Mon exemple demande deux courts temps, un baiser envoyé puis un sourire, ce qui tient sans problème en 5 secondes ; ajouter une troisième action comme sortir les fruits du panier aurait été trop. Si vous voulez qu'une personne marche ou se retourne, ne la cadrez pas serrée contre les bords : le modèle a besoin d'espace pour la déplacer, sinon le mouvement paraît à l'étroit et étiré.

Recevez les nouveaux fichiers de prompts en premier

Un email quand un nouveau fichier de prompts testé ou un guide de modèle est publié. Des prompts éprouvés en production, pas de théorie. Pas de spam, désinscription à tout moment.

Étape par étape

Le déroulé est court et identique d'un modèle à l'autre. La qualité se joue aux étapes 1 et 3.

  1. 6

    Préparez l'image source

    Générez ou choisissez une image de haute qualité avec un sujet clair, et recadrez-la au format voulu pour la vidéo finale (portrait pour les téléphones et le social, paysage pour les écrans larges comme l'ordinateur). Essayez d'utiliser un ratio exact comme 9:16 ou 4:3, pour que le modèle puisse traiter le format.

  2. 7

    Réglez la résolution de sortie

    Si votre modèle le permet, utilisez une résolution qu'il prend officiellement en charge pour votre format. Saisir une taille arbitraire est la cause la plus fréquente de sorties étirées ou ratées, car la plupart des modèles vidéo attendent des dimensions multiples d'une taille de bloc fixe.

  3. 8

    Décrivez uniquement le mouvement

    Écrivez le prompt en décrivant le mouvement attendu aussi précisément que possible, avec des verbes au présent progressif : "elle se tourne vers la caméra, ses cheveux flottent dans le vent". Ne redécrivez pas les éléments de l'image s'ils n'ont pas à bouger. L'image est déjà la scène.

  4. 9

    Réglez la durée du clip et la guidance

    Gardez le premier clip court, autour de cinq secondes, et utilisez une valeur de guidance modérée (le plus souvent, la valeur par défaut de votre outil). Commencez par un clip court de 5 s en basse résolution, pour réduire le coût et le temps de génération et obtenir un retour direct sur la qualité de votre prompt et de votre réglage.

  5. 10

    Générez, puis relancez avec une autre seed

    Lancez-le. Si le mouvement est presque bon, changez uniquement la seed et réessayez avant de toucher à autre chose. Ces modèles sont aléatoires, et une nouvelle seed transforme souvent un quasi-succès en résultat à garder. J'ai testé la même image source avec cinq variations de seed : quatre sont sorties propres, une a déformé une main de façon grave, sans cause visible dans le prompt ni les réglages. Mais attention, les échecs complets viennent généralement d'un mauvais prompt (un mouvement impossible, ou trop de mouvements à la fois dans une durée courte).

Les réglages qui comptent (tout modèle)

Les réglages disponibles varient d'un outil à l'autre, mais ces cinq leviers existent presque partout et décident du résultat.

Image source
Haute qualité, un seul sujet, recadrée au format cible
Résolution
Une taille que le modèle prend officiellement en charge ; n'improvisez pas les dimensions, lisez la documentation de votre modèle
Durée du clip
~5 secondes pour commencer, afin d'évaluer la qualité de votre réglage
Prompt de mouvement
Présent progressif, décrit uniquement le mouvement, physiquement plausible
Force de guidance
Modérée (trop élevée, le rendu est sur-cuit ; trop basse, le prompt est ignoré)

Problèmes courants et solutions

Le sujet se déforme ou fond : le mouvement demandé est trop ample ou la guidance est trop élevée. Demandez un mouvement plus petit et crédible, et baissez la guidance.

Presque aucun mouvement : le prompt est trop vague (ou le mouvement n'existe pas pour ce modèle sans LoRA) ou la guidance est trop basse. Utilisez un verbe d'action concret et remontez un peu la guidance.

Forme étirée ou incorrecte : vos dimensions ne sont pas une taille prise en charge pour ce format. Corrigez la résolution.

Scintillement et grain : le plus souvent une image source de mauvaise qualité. Partez d'une image de haute qualité. Le mouvement ne masque pas le bruit d'entrée, il le multiplie.

Pour aller plus loin

Une fois que vous animez une image de façon fiable, les étapes suivantes naturelles sont d'écrire de meilleurs prompts de mouvement et d'assembler des clips en séquences plus longues. Nous traitons les deux dans des guides dédiés.

Continuer la lecture

Modèles liés

Recevez les nouveaux fichiers de prompts en premier

Un email quand un nouveau fichier de prompts testé ou un guide de modèle est publié. Des prompts éprouvés en production, pas de théorie. Pas de spam, désinscription à tout moment.

Ajouter GenLovers comme source préférée sur Google