Comment faire tourner MiniMax H3 en local dans ComfyUI
Écrit par Clement

MiniMax H3 est la version à poids ouverts du modèle vidéo de troisième génération de MiniMax (la même lignée que Hailuo). MiniMax l'a publié en open source le 3 août 2026 sous sa propre licence communautaire, et ComfyUI a livré un support natif dès le premier jour : quatre nouveaux nodes et six templates officiels, fusionnés directement dans Comfy-Org/ComfyUI. En interne, c'est un transformeur omni dense de 33,1 milliards de paramètres piloté par un encodeur de texte Qwen3-VL-32B, qui génère jusqu'à 15 secondes de vidéo en 24 ips avec un audio stéréo natif de 32 kHz en une seule passe. Du texte, une image, ou tout un jeu d'images, de vidéos et d'audios de référence entrent comme contexte ; la vidéo et le son sortent ensemble.
C'est l'installation que nous avons nous-mêmes testée : des versions élaguées FP8/INT8 pour tenir sur un GPU grand public, et les trois workflows officiels (texte vers vidéo, image vers vidéo, référence vers vidéo). Avant de télécharger quoi que ce soit, lisez l'encadré juste en dessous. La licence de MiniMax impose une vraie restriction sur les lieux où vous avez le droit de faire tourner ces poids, et elle est facile à manquer si vous êtes habitué à des poids ouverts entièrement permissifs.
Ce que vous installez
La spécification qui compte pour une installation locale : d'après les chiffres de MiniMax, H3 en pleine précision pèse 123,6 Go. Élaguer les poids de modulation (environ 40 % des paramètres) dans une table de correspondance et quantifier le reste ramène les plus petites variantes à environ 42,5 Go, soit 66 % de moins, ce qui rend une carte de classe RTX 3060 envisageable (avec le déchargement dynamique de la VRAM activé). Les versions FP8 et INT8 utilisées dans ce guide se situent dans cette plage réduite.
Il existe deux modèles de diffusion, et il vous en faut une seule paire, pas les deux : fl2va gère texte vers vidéo et image vers vidéo, ref2va gère référence vers vidéo. Les deux existent en variantes élaguées FP8 et INT8-convrot. Il vous faut ComfyUI 0.30.0 ou plus récent, première version avec un support natif des nodes H3.
Une réserve de résolution facile à manquer : ce que vous installez ici plafonne à 768p (petit côté, jusqu'à 768x1344). Le chiffre « jusqu'à 2K » du marketing de MiniMax vient de H3-Regenerate-2K, une passe distincte qui prend un clip 768p terminé et le rend à nouveau en 2K à partir du contexte d'origine. Ce module ne fait pas partie de la version à poids ouverts ; il ne fonctionne que via l'API hébergée de MiniMax. Rien dans ce guide ne vous donne du 2K en local.
Mettez à jour ComfyUI et récupérez les templates
- 1
Mettez à jour ComfyUI
Ouvrez le dossier d'installation de ComfyUI, entrez dans le dossier update et lancez update_comfyui.bat. Il faut au moins ComfyUI 0.30.0 pour que les nodes natifs MiniMax H3 apparaissent.
- 2
Chargez les templates
Lancez ComfyUI, ouvrez la barre latérale Templates à gauche et cherchez "MiniMax H3". Six templates de workflow officiels sont livrés dans ce lot ; si la recherche ne donne rien, téléchargez-les directement depuis la page Comfy-Org/MiniMax-H3 sur Hugging Face et déposez-les dans votre dossier de templates.
Les fichiers de modèle à télécharger, et où les placer
Chaque workflow a besoin de l'encodeur de texte et des deux VAE. Le modèle de diffusion à ajouter dépend du workflow que vous visez.
- Diffusion (texte/image vers vidéo)
- minimax_h3_fl2va_pruned_fp8_scaled.safetensors, ou _int8_convrot → models/diffusion_models/
- Diffusion (référence vers vidéo)
- minimax_h3_ref2va_pruned_fp8_scaled.safetensors, ou _int8_convrot → models/diffusion_models/
- Encodeur de texte
- qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors → models/text_encoders/ (remplacez par _int8_convrot sur une carte de 24 Go, _int4_convrot sur 16 Go)
- VAE vidéo
- minimax_h3_video_vae_fp16.safetensors → models/vae/
- VAE audio
- minimax_h3_audio_vae_fp32.safetensors → models/vae/ (obligatoire même si le son ne vous intéresse pas ; H3 le génère toujours)
Workflow 1 : texte vers vidéo
Ni image ni référence ici : le modèle construit toute la scène à partir de votre prompt.
- 3
Chargez le template
Dans Templates, cherchez "MiniMax H3: Text to Video" et ouvrez-le.
- 4
Faites pointer les nodes de modèle vers vos fichiers
Load Diffusion Model → le fichier fl2va FP8 ou INT8 que vous avez téléchargé. Load CLIP → l'encodeur de texte Qwen3VL. Load VAE → associez les deux nodes VAE, audio et vidéo ; l'audio et la vidéo de H3 se génèrent toujours ensemble, les deux sont donc obligatoires, même sur un workflow que vous croyez silencieux.
- 5
Réglez la résolution et la durée
Resolution Selector : choisissez votre format d'image et une cible en mégapixels. Le canevas natif du modèle a un petit côté de 768 px (max 768x1344), et le node arrondit automatiquement au multiple de 32 pixels le plus proche. La durée s'aligne sur la grille de blocs de 17 images de H3 à 24 ips ; le template est livré avec une taille d'aperçu rapide, et la pleine qualité coûte environ 1,0 mégapixel en 16:9.
- 6
Écrivez votre prompt et lancez
Décrivez la scène complète, le sujet et le mouvement dans la zone de prompt (il n'y a pas d'image sur laquelle s'appuyer ici, soyez donc précis), puis Queue Prompt. Le clip terminé, audio compris, arrive dans output/video/.
Workflow 2 : image vers vidéo
Les mêmes modèles que pour texte vers vidéo, mais la scène vient de votre image plutôt que de vos mots.
- 7
Chargez le template
Cherchez "MiniMax H3: Image to Video" dans Templates, et prenez bien la version sans étiquette "API" ; cette variante appelle le point d'accès hébergé de MiniMax au lieu de votre installation locale.
- 8
Faites correspondre vos modèles
Les mêmes trois nodes de modèle que pour texte vers vidéo : modèle de diffusion fl2va, CLIP Qwen3VL, les deux VAE.
- 9
Importez votre image et mettez-la à l'échelle
Load Image → votre image source. Utilisez Image Size → elle la met à l'échelle proportionnellement à votre cible en mégapixels et à votre format, pour ne pas donner au modèle une résolution hors spécification. Ce template accepte aussi une image-clé finale optionnelle si vous voulez que le modèle interpole vers un point d'arrivée précis plutôt que de simplement extrapoler le mouvement.
- 10
Écrivez le prompt de mouvement et lancez
Décrivez ce qui doit bouger (pas la scène ; l'image l'a déjà), puis Queue Prompt.
Recevez les nouveaux guides par email
Un email quand nous publions de nouveaux guides et analyses de modèles. Pas de spam, désinscription à tout moment.
Workflow 3 : référence vers vidéo
Le workflow multi-entrées : jusqu'à 9 images de référence, 3 vidéos de référence et 3 clips audio autonomes en une génération. C'est celui qui demande un modèle de diffusion différent.
- 11
Chargez le template
Cherchez "MiniMax H3: Reference to Video" et ouvrez-le.
- 12
Chargez le bon modèle de diffusion
C'est l'étape que l'on saute : référence vers vidéo demande ref2va, pas fl2va. Faites pointer Load Diffusion Model vers minimax_h3_ref2va_pruned_fp8_scaled.safetensors (ou son équivalent int8_convrot). Les nodes d'encodeur de texte et de VAE restent les mêmes que pour les deux autres workflows.
- 13
Ajoutez vos références
Nodes Load Image et Load Video (Upload) pour vos ressources source, jusqu'à 9 images et 3 vidéos. Une seule image au lieu de deux ? Sélectionnez le node d'image inutilisé et appuyez sur Ctrl+B pour le contourner plutôt que le supprimer. Load Audio (Upload) est optionnel, jusqu'à 3 clips, si vous voulez que le mouvement de la vidéo soit synchronisé avec de la musique ou de la voix.
- 14
Balisez vos références dans le prompt
Référencez chaque entrée dans votre prompt avec des balises dans l'ordre exact où vous les avez connectées : <Picture 1>, <Picture 2>, <Video 1>, <Audio 1>. Le modèle résout la balise selon l'ordre de connexion, pas selon le nom de fichier : revérifiez donc le graphe de nodes si une balise tire la mauvaise ressource.
- 15
Lancez
Queue Prompt pour synthétiser le clip guidé par les références avec son audio intégré.

Ce que notre premier essai a confirmé
La capture et le clip ci-dessus sont notre première vraie génération référence vers vidéo, pas une maquette. Elle confirme quelques points que la fiche technique seule ne donne pas : le modèle de diffusion ref2va INT8-convrot tourne de bout en bout avec l'encodeur de texte Qwen3VL INT8-convrot, deux images de référence passées par des nodes Charger Image, et Ctrl+B contourne l'emplacement de troisième image inutilisé exactement comme décrit plus haut. La sortie est arrivée en 800x1056 pour une demande de portrait 3:4 (un multiple de 32 pixels, le même comportement d'arrondi que le node Resolution Selector est censé avoir, mais pas exactement le chiffre de 768 px que MiniMax cite pour le 16:9). Elle a duré 10,1 secondes, dans la fenêtre de 4 à 15 s, et la piste audio est revenue en vrai stéréo AAC de 32 kHz, ni silencieuse ni à une fréquence inférieure : l'affirmation d'audio natif tient donc sur notre propre matériel.
Sur les chiffres que l'on nous demande le plus : nous l'avons fait tourner sur un A40 (48 Go de VRAM, 50 Go de RAM système), et un clip de 10 secondes en 720p (agrandi avec la passe d'amélioration, pas natif) a utilisé environ 38 Go de cette VRAM et pris environ 5 minutes. Et oui, l'int8 battait nettement le fp8 à cette résolution à nos yeux, ce qui concorde avec ce que rapporte la communauté.
Dépasser la limite de durée d'un clip
L'installation ci-dessus vous donne un clip dans la plage que H3 génère nativement. La durée est le mur suivant, et le contournement qui a le plus attiré l'attention cet été est un sampler communautaire qui rend en continu au lieu d'une seule passe de durée fixe, avec l'affirmation qu'il tient en 1080p sur une carte de 16 Go.
Cette affirmation mérite d'être comprise précisément, car c'est un mécanisme différent du chaînage d'images décrit dans notre guide pour réaliser des vidéos IA plus longues. Le chaînage rend un clip, prend sa dernière image et démarre un nouveau clip à partir d'elle, ce qui explique la dérive de qualité : chaque image de relais porte les défauts de la précédente. Un sampler continu évite ce relais, donc en principe il évite aussi la dérive cumulative.
En principe. Nos propres essais de chaînage ont atteint un plafond pratique vers quarante secondes avant que la dérive des couleurs devienne visible, et ce chiffre vient d'un essai réel, pas d'une lecture. Nous avons aussi fait tourner nous-mêmes le sampler sans fin, mais pas sur la carte de 16 Go visée par l'affirmation : sur une RTX 4090 de 24 Go, la qualité est restée stable bien au-delà du point où le chaînage commence à dériver, sans le décalage de couleur d'un segment à l'autre que montre le chaînage. Cela ne s'est toutefois pas passé sans accroc. Nous avons subi des arrêts pour mémoire insuffisante plus d'une fois, sur une carte avec 8 Go de marge de plus que la cible de l'affirmation : considérez donc le chiffre de 16 Go comme optimiste tant que vous n'avez pas confirmé qu'il tient sur votre propre matériel.
Questions fréquentes
- MiniMax H3 peut-il rendre des vidéos de n'importe quelle durée ?
- Pas en une seule passe native, mais un sampler sans fin de la communauté s'en approche. Il rend en continu au lieu d'une seule passe de durée fixe et, contrairement au chaînage d'images, il ne redémarre pas chaque segment depuis une image terminée : il évite donc la dérive de couleur cumulative du chaînage. Nous l'avons fait tourner nous-mêmes et la qualité a tenu bien au-delà des quarante secondes environ où notre propre chaînage commence à dériver. L'affirmation largement partagée est qu'il tourne avec 16 Go de VRAM ; nous avons testé sur une carte de 24 Go et subi quand même des arrêts occasionnels pour mémoire insuffisante : considérez les 16 Go comme optimistes tant que vous ne l'avez pas confirmé sur votre matériel.
- MiniMax H3 est-il gratuit pour un usage commercial ?
- Oui, jusqu'à 20 M$ de revenu annuel issu de produits ou services commerciaux qui l'utilisent, sans frais. Au-delà de ce seuil, il faut une autorisation écrite préalable de MiniMax, et tout produit commercial utilisant H3 doit afficher « MiniMax H3 » dans son interface dans les deux cas.
- Puis-je faire tourner MiniMax H3 en local aux États-Unis, dans l'UE, au Royaume-Uni ou en Corée du Sud ?
- Pas selon la licence communautaire telle qu'écrite : ces quatre territoires sont explicitement exclus de son « Applicable Territory », et le déploiement local hors de ce territoire n'est pas autorisé. MiniMax invite les personnes de ces régions à les contacter (api@minimax.io) pour un accord distinct. Son API hébergée, en revanche, est disponible dans le monde entier quelle que soit cette restriction.
- De combien de VRAM MiniMax H3 a-t-il besoin ?
- Les versions élaguées et quantifiées utilisées dans ce guide ramènent le modèle complet de 123,6 Go à environ 42,5 Go au plus petit niveau, et MiniMax cite une carte du genre RTX 3060 comme envisageable avec le déchargement dynamique de la VRAM activé. Adaptez le fichier d'encodeur de texte à votre carte : nvfp4 pour le moins de VRAM, int8_convrot autour des cartes de 24 Go, int4_convrot autour de 16 Go.
- Dois-je utiliser le modèle de diffusion FP8 ou INT8 ?
- INT8-convrot est le choix par défaut le plus sûr si votre GPU a la place. Les premiers tests de la communauté le montrent mieux tenir le mouvement et la forme des objets pendant les panoramiques rapides que la voie nvfp4, plus fortement quantifiée, au prix d'un fichier plus gros. FP8 est la solution de repli quand l'encombrement de l'INT8 ne passe pas.
- Cette installation locale peut-elle générer de la vidéo 2K ?
- Non. Le modèle à poids ouverts plafonne à 768p en local. Le vrai 2K vient de H3-Regenerate-2K, une passe réservée à l'API hébergée de MiniMax qui rend à nouveau un clip 768p terminé à une résolution supérieure ; elle ne fait pas partie des nodes ComfyUI ni des fichiers de ce guide. Si vous avez besoin du 2K, il faut passer par l'API hébergée, pas par une installation locale.
- Est-ce moins cher d'utiliser simplement l'API hébergée de MiniMax plutôt que de le faire tourner en local ?
- Pour un usage occasionnel, souvent oui : l'API de MiniMax tarife H3 à environ 0,08 $/seconde en 768p et 0,13 $/seconde en 2K (environ 1,20 $ et 1,95 $ pour un clip de 15 secondes), sans GPU ni installation. Le faire tourner en local devient plus logique quand vous générez assez de volume pour que l'électricité et l'amortissement de votre GPU fassent mieux que la facturation à la seconde de l'API, ou quand vous avez précisément besoin des conditions d'usage local de la licence plutôt que de celles de l'API.
Continuer la lecture

How to generate videos with Wan 2.5
What changed in Wan 2.5 versus 2.2, including native audio, and how to get the most out of it for image-to-video: the new settings worth touching, when the upgrade helps, and when it doesn't.

How to generate videos with Wan 2.7
A practical guide to Wan 2.7 image-to-video: clips up to about fifteen seconds, built-in prompt optimization, and refined native audio. What the model adds over 2.5, how to prompt sound, and how to script a longer clip so it holds together.

How to write prompts for AI video generation
The prompt structure that works for AI video: why motion prompts are different from image prompts, the present-progressive rule, and the specific phrasing that gets you believable movement instead of a warped photo.

How to make longer AI videos: 4 methods that work
AI video models cap out at a few seconds. Here are the 4 methods that extend them: chaining clips, last-frame continuation, and keeping motion consistent across every join. Step by step, free.

How much does AI video generation cost?
A clear breakdown of what AI video costs: per-second pricing, why resolution and audio change the bill, how to estimate a clip before you generate it, the free local alternative, and where the hidden costs like upscaling hide.

How to fix flickering AI video: 4 causes and fixes
AI video that flickers, shimmers, or morphs between frames has 4 usual causes. Here's how to diagnose and fix each one: source-image noise, too-few steps, over-long clips, and unstable prompts. Step by step.
Modèles liés
Recevez les nouveaux guides par email
Un email quand nous publions de nouveaux guides et analyses de modèles. Pas de spam, désinscription à tout moment.
