Wan AI : les modèles vidéo d'Alibaba, des poids ouverts à Wan 2.7
Écrit par Clement
Wan est la famille de modèles de génération vidéo d'Alibaba, et elle joue un rôle qu'aucun autre acteur du haut du classement ne joue : celui du modèle ouvert. Les versions open-weight de Wan (la lignée 2.1/2.2) se téléchargent et tournent sur votre propre GPU (gratuit, illimité, privé), tandis que ses versions hébergées plus récentes (2.5 et 2.7) rivalisent avec les modèles phares commerciaux, avec l'audio natif et des clips allant jusqu'à une quinzaine de secondes.
Cette double nature est tout l'intérêt de cette page : Wan est à la fois la meilleure option auto-hébergée pour les bricoleurs et un vrai moteur hébergé pour la production. Nous l'utilisons beaucoup et tenons des guides détaillés version par version ; cette page est la carte de la famille et vous aide à choisir votre point d'entrée.
Fiche rapide
- Créé par
- Alibaba (laboratoire Tongyi)
- Ce qu'il fait
- Texte vers vidéo et image vers vidéo ; les versions récentes ajoutent l'audio natif et un modèle d'image solide (Wan 2.7 Image)
- Côté ouvert
- Poids ouverts Wan 2.1/2.2 : exécution locale dans ComfyUI sur un GPU grand public, gratuite et illimitée
- Côté hébergé
- Wan 2.5 (niveau qualité) et Wan 2.7 (audio + clips jusqu'à ~15 s), via API et plateformes hébergées
- Tarifs
- En local : gratuit (votre matériel). Hébergé : API facturée à la seconde, moins chère que les modèles phares occidentaux
- Idéal pour
- Les auto-hébergeurs, la génération en volume à petit budget, et les clips avec audio sans prix de modèle phare
Ce que Wan fait de mieux
Les versions open-weight ont changé qui peut générer de la vidéo. Wan 2.2 sur un GPU grand public produit du bon image vers vidéo : cohérence du sujet, vrai mouvement, zéro coût par clip, pas de file d'attente, pas de filtre de contenu, contrôle total du pipeline dans ComfyUI. Rien de commercial n'égale cette combinaison pour les bricoleurs et les workflows en volume.
La gamme hébergée est discrètement compétitive : Wan 2.5 a relevé le niveau de détail et la stabilité du mouvement, et Wan 2.7 a ajouté l'audio natif et des clips bien plus longs (les deux fonctions qui, sinon, vous poussent vers Veo ou Sora) à des tarifs d'API agressifs.
Comme la famille va du local gratuit à l'hébergé premium, vous pouvez prototyper en local et reporter le même style de prompt vers les offres hébergées quand un projet exige de l'audio, de la durée ou la qualité maximale. Nos guides Wan 2.2, 2.5 et 2.7 détaillent chaque échelon.
Le réglage qui a fait la différence pour nous en génération hébergée : rendre à une résolution de base plus basse, puis passer un upscale 2x par modèle (nous utilisons RealESRGAN, pas un simple redimensionnement) au lieu de générer en pleine résolution dès le départ. Sur un GPU facturé à la seconde, cela a réduit notre temps de génération d'environ la moitié pour une résolution finale comparable, puisque les étapes de diffusion travaillent bien moins par image et que la passe d'upscale coûte peu en comparaison.
Les limites à connaître avant de vous engager
Wan en local a un ticket d'entrée matériel. Un GPU récent avec beaucoup de VRAM, et l'envie de configurer ComfyUI. Le moins cher par clip. Le plus coûteux en effort d'installation.
Les outils autour du modèle sont moins aboutis que ceux des modèles phares occidentaux. Les applications grand public et les outils d'édition qui entourent Veo ou Runway n'existent pas sous la même forme ; Wan est un modèle auquel on accède par des plateformes et des API plus qu'une suite créative clé en main.
Le plafond du photoréalisme et du respect du prompt tout en haut appartient encore à Veo 3 et aux modèles fermés les plus récents ; l'argument de Wan, c'est 90 % du résultat pour une fraction du coût, pas la première place.
Comment y accéder
Voie locale : téléchargez les poids ouverts de Wan et faites-les tourner dans ComfyUI. Prévoyez un après-midi d'installation ; ensuite, chaque génération est gratuite. Notre guide Wan 2.2 est le pas-à-pas.
Voie hébergée : l'API de modèles d'Alibaba expose toute la gamme, 2.5 et 2.7 comprises, avec une tarification à la seconde, et un nombre croissant de plateformes de génération tierces proposent des modèles Wan avec des systèmes de crédits. C'est souvent le moyen le plus simple d'essayer l'audio de la 2.7 sans compte API.
Comment Wan se compare
Face à Veo 3 : Veo l'emporte sur la fidélité maximale, les outils autour du modèle et le polissage de l'audio ; Wan 2.7 répond avec l'audio natif et des clips plus longs à un prix bien plus bas, plus la porte de sortie ouverte qu'aucun produit Google n'offre.
Face à Kling et Hailuo : ceux-ci ont des applications grand public plus conviviales et des crédits quotidiens gratuits ; Wan réplique avec des poids ouverts et une meilleure économie au volume d'API. Pour un créateur qui veut posséder son pipeline, Wan est le choix par défaut.
Wan-Streamer : la branche temps réel à surveiller
En juillet 2026, l'équipe Wan a publié Wan-Streamer, qui n'a rien à voir avec les générateurs de clips ci-dessus. C'est une conversation vidéo en direct : un seul modèle qui gère ensemble la compréhension et la génération de texte, d'audio et de vidéo. Vous parlez à un personnage généré et il répond en temps réel, en vous voyant par votre caméra pendant ce temps. Dans la démo, il décrit de lui-même la personne qu'il regarde, jusqu'à la couleur de sa chemise et le mur derrière elle, et tient une conversation normale. Il n'est pas lié à un avatar fixe : le personnage peut être une personne, un animal ou un personnage d'anime décrit avec des mots.
Les chiffres sont la partie intéressante. La v0.2 tourne en 640x368 à 25fps, contre 192x336 auparavant, avec environ 200 ms de latence côté modèle et environ 550 ms de bout en bout. Elle y parvient en répartissant le travail : un « Thinker » léger gère la perception, le langage et l'état avec une faible latence, tandis qu'un « Performer » multi-GPU plus lourd génère les latents vidéo.
La version 0.3 a suivi le 16 juillet 2026 en gardant exactement les mêmes chiffres, ce qui indique où est passé le travail. Au lieu de courir après la résolution, elle redéfinit ce qu'est une vidéo : un « monde » persistant (l'apparence du personnage, la pièce, le style visuel) plus un « flux d'événements » de ce qui change (parole, mouvement du corps, mouvement de caméra). Pendant une session en direct, votre propre caméra, votre micro et votre texte saisi rejoignent ce flux d'événements. Résultat concret : le personnage cesse d'être une tête parlante. Les versions précédentes ne savaient faire que des portraits d'une personne assise qui parle ; en v0.3, vous dirigez le corps à la voix en pleine conversation. Demandez-lui de faire un signe de paix, de poser les mains sur les hanches, de remettre ses cheveux ou de regarder le sol, et il le fait, sans lâcher la conversation.
Nous construisons des produits de compagnons en temps réel : voici donc notre lecture de ces chiffres. Environ 550 ms d'aller-retour, c'est conversationnel ; on est près de la pause qu'une personne laisse avant de répondre, et bien mieux que le décalage de plusieurs secondes qui rend un chat vidéo bancal. La résolution, elle, n'y est pas encore. 640x368 est une petite fenêtre, correcte pour une tête parlante au format téléphone, mais en deçà du cadrage en plan moyen que la démo vise. Le contrôle du corps à la voix est l'amélioration la plus significative, car un compagnon qui reste toujours immobile fait l'effet d'un appel vidéo avec un enregistrement.
Le point qui décide si vous pouvez utiliser tout cela : il n'existe qu'un article technique, et c'est désormais vrai trois fois de suite. Les v0.1, v0.2 et v0.3 sont arrivées en environ six semaines sans poids, sans produit et sans API entre elles. Les modèles de clips de l'équipe Wan sont bien devenus ouverts, et les auteurs ont dit espérer faire de même ici, mais un rythme de recherche aussi rapide sans publication se lit comme un programme de recherche, pas comme une voie produit. Considérez-le comme l'image la plus claire disponible de la direction que prennent les compagnons IA en temps réel, pas comme quelque chose sur lequel vous pouvez construire ce trimestre.
MobileWan : la génération vidéo Wan sur un téléphone
L'autre direction prise par Wan en juillet 2026 allait vers le bas. Qualcomm AI Research a publié MobileWan, qui fait tourner l'architecture Wan 2.2 de 5 milliards de paramètres entièrement sur du matériel mobile Snapdragon du commerce. Il génère 81 images, soit cinq secondes à 16fps, en 480x832, en environ 20 secondes de bout en bout sur l'appareil lui-même. Le téléchargement complet fait environ 9,9 Go. Notez l'attribution, car beaucoup d'articles se sont trompés : c'est l'ingénierie de Qualcomm construite sur les poids ouverts d'Alibaba, pas une publication d'Alibaba.
Le travail de compression est ce qui le rend possible. MobileWan génère par blocs au lieu de traiter toutes les images ensemble, élague les têtes d'attention qui contribuent le moins, utilise un décodeur économe en mémoire, et ramène la diffusion des 20 à 30 étapes habituelles à trois. Ce dernier chiffre est celui qui fait presque tout le gain de latence.
La qualité n'est pas compétitive face à Wan à l'échelle d'un serveur, et ce n'est pas son but. Ce qu'il change, c'est le plancher. Générer sur son propre téléphone, c'est pas de compte, pas d'envoi, pas de file d'attente, et pas de filtre de contenu hébergé entre vous et le résultat : la combinaison que les auto-hébergeurs veulent depuis des années et qui exigeait jusqu'ici un GPU de bureau. Cela casse aussi le modèle de coût sur lequel repose notre guide des coûts vidéo : quand la génération se fait sur un matériel que vous possédez déjà, le coût marginal d'un clip, c'est la batterie plutôt que des crédits d'API.
Questions fréquentes
- Qu'est-ce que Wan-Streamer, et puis-je l'utiliser ?
- Wan-Streamer est la branche temps réel de l'équipe Wan : un seul modèle qui unifie texte, audio et vidéo pour tenir une conversation vidéo en direct avec un personnage généré qui vous voit par votre caméra. La version 0.3 (16 juillet 2026) tourne en 640x368 à 25fps avec environ 200 ms de latence côté modèle et environ 550 ms de bout en bout, et ajoute le contrôle du corps à la voix : le personnage peut faire un geste, remettre ses cheveux ou regarder autour de lui sur commande, au lieu de rester assis à parler. Vous ne pouvez pas encore l'utiliser. Les trois versions (0.1, 0.2 et 0.3) ont été publiées sous forme d'articles techniques seulement, en environ six semaines : pas de poids, pas d'API, pas de produit. Les modèles de clips de la famille Wan sont ouverts, mais Wan-Streamer n'est pas publié en juillet 2026.
- Puis-je faire tourner la génération vidéo Wan sur un téléphone ?
- Oui, depuis juillet 2026. MobileWan, de Qualcomm AI Research, fait tourner l'architecture Wan 2.2 de 5B sur du matériel mobile Snapdragon et génère un clip de 5 secondes en 480x832 à 16fps en environ 20 secondes sur l'appareil, à partir d'un téléchargement d'environ 9,9 Go. La qualité est bien inférieure à Wan à l'échelle d'un serveur, mais tout se passe en local : pas de compte, pas d'envoi, pas de filtre de contenu et pas de coût par clip.
- Wan est-il gratuit ?
- Les versions open-weight (Wan 2.1/2.2) sont gratuites : téléchargez les poids et faites-les tourner en local dans ComfyUI sur votre propre GPU, sans coût par clip. Les versions hébergées plus récentes (2.5, 2.7) sont payantes à la seconde via l'API ou via les systèmes de crédits des plateformes hébergées.
- Quelle est la différence entre Wan 2.2, 2.5 et 2.7 ?
- La 2.2 est le cheval de trait léger, rapide et ouvert (muet, clips de ~5 s). La 2.5 est la montée en qualité hébergée : mouvement plus stable, plus de finesse. La 2.7 est le niveau premium : audio natif et clips jusqu'à une quinzaine de secondes en une seule passe. Nos guides par version détaillent chacune.
- De quoi ai-je besoin pour faire tourner Wan en local ?
- Un GPU récent avec beaucoup de VRAM, ComfyUI, et le checkpoint Wan ouvert adapté à votre workflow (texte vers vidéo ou image vers vidéo). L'installation prend un après-midi ; ensuite la génération est gratuite et illimitée.
Guides pratiques
Les meilleurs choix
Modèles liés
Recevez les nouveaux guides par email
Un email quand nous publions de nouveaux guides et analyses de modèles. Pas de spam, désinscription à tout moment.
