Aller au contenu
GenLovers

Comment faire tourner MiniMax H3 en local dans ComfyUI

Dernière mise à jour: 13 min de lectureDifficulté: Intermédiaire

Écrit par Clement

Une carte pour le guide d'installation locale de MiniMax H3, montrant trois types de fichiers étiquetés : modèle, encodeur et VAE.

MiniMax H3 est la version à poids ouverts du modèle vidéo de troisième génération de MiniMax (la même lignée que Hailuo). MiniMax l'a publié en open source le 3 août 2026 sous sa propre licence communautaire, et ComfyUI a livré un support natif dès le premier jour : quatre nouveaux nodes et six templates officiels, fusionnés directement dans Comfy-Org/ComfyUI. En interne, c'est un transformeur omni dense de 33,1 milliards de paramètres piloté par un encodeur de texte Qwen3-VL-32B, qui génère jusqu'à 15 secondes de vidéo en 24 ips avec un audio stéréo natif de 32 kHz en une seule passe. Du texte, une image, ou tout un jeu d'images, de vidéos et d'audios de référence entrent comme contexte ; la vidéo et le son sortent ensemble.

C'est l'installation que nous avons nous-mêmes testée : des versions élaguées FP8/INT8 pour tenir sur un GPU grand public, et les trois workflows officiels (texte vers vidéo, image vers vidéo, référence vers vidéo). Avant de télécharger quoi que ce soit, lisez l'encadré juste en dessous. La licence de MiniMax impose une vraie restriction sur les lieux où vous avez le droit de faire tourner ces poids, et elle est facile à manquer si vous êtes habitué à des poids ouverts entièrement permissifs.

MiniMax H3's Image-to-Video workflow: one source frame, a motion-and-sound prompt, and one pass that returns video with native audio already in it.

Ce que vous installez

La spécification qui compte pour une installation locale : d'après les chiffres de MiniMax, H3 en pleine précision pèse 123,6 Go. Élaguer les poids de modulation (environ 40 % des paramètres) dans une table de correspondance et quantifier le reste ramène les plus petites variantes à environ 42,5 Go, soit 66 % de moins, ce qui rend une carte de classe RTX 3060 envisageable (avec le déchargement dynamique de la VRAM activé). Les versions FP8 et INT8 utilisées dans ce guide se situent dans cette plage réduite.

Il existe deux modèles de diffusion, et il vous en faut une seule paire, pas les deux : fl2va gère texte vers vidéo et image vers vidéo, ref2va gère référence vers vidéo. Les deux existent en variantes élaguées FP8 et INT8-convrot. Il vous faut ComfyUI 0.30.0 ou plus récent, première version avec un support natif des nodes H3.

Une réserve de résolution facile à manquer : ce que vous installez ici plafonne à 768p (petit côté, jusqu'à 768x1344). Le chiffre « jusqu'à 2K » du marketing de MiniMax vient de H3-Regenerate-2K, une passe distincte qui prend un clip 768p terminé et le rend à nouveau en 2K à partir du contexte d'origine. Ce module ne fait pas partie de la version à poids ouverts ; il ne fonctionne que via l'API hébergée de MiniMax. Rien dans ce guide ne vous donne du 2K en local.

Mettez à jour ComfyUI et récupérez les templates

  1. 1

    Mettez à jour ComfyUI

    Ouvrez le dossier d'installation de ComfyUI, entrez dans le dossier update et lancez update_comfyui.bat. Il faut au moins ComfyUI 0.30.0 pour que les nodes natifs MiniMax H3 apparaissent.

  2. 2

    Chargez les templates

    Lancez ComfyUI, ouvrez la barre latérale Templates à gauche et cherchez "MiniMax H3". Six templates de workflow officiels sont livrés dans ce lot ; si la recherche ne donne rien, téléchargez-les directement depuis la page Comfy-Org/MiniMax-H3 sur Hugging Face et déposez-les dans votre dossier de templates.

Les fichiers de modèle à télécharger, et où les placer

Chaque workflow a besoin de l'encodeur de texte et des deux VAE. Le modèle de diffusion à ajouter dépend du workflow que vous visez.

Diffusion (texte/image vers vidéo)
minimax_h3_fl2va_pruned_fp8_scaled.safetensors, ou _int8_convrot → models/diffusion_models/
Diffusion (référence vers vidéo)
minimax_h3_ref2va_pruned_fp8_scaled.safetensors, ou _int8_convrot → models/diffusion_models/
Encodeur de texte
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors → models/text_encoders/ (remplacez par _int8_convrot sur une carte de 24 Go, _int4_convrot sur 16 Go)
VAE vidéo
minimax_h3_video_vae_fp16.safetensors → models/vae/
VAE audio
minimax_h3_audio_vae_fp32.safetensors → models/vae/ (obligatoire même si le son ne vous intéresse pas ; H3 le génère toujours)
Schéma de dossiers montrant le modèle de diffusion, l'encodeur de texte et les fichiers VAE de MiniMax H3 répartis dans les dossiers models/diffusion_models, models/text_encoders et models/vae de ComfyUI.
Quatre fichiers, trois dossiers. Si le VAE audio manque, le workflow échoue même pour un texte vers vidéo qui semble silencieux.

Workflow 1 : texte vers vidéo

Ni image ni référence ici : le modèle construit toute la scène à partir de votre prompt.

  1. 3

    Chargez le template

    Dans Templates, cherchez "MiniMax H3: Text to Video" et ouvrez-le.

  2. 4

    Faites pointer les nodes de modèle vers vos fichiers

    Load Diffusion Model → le fichier fl2va FP8 ou INT8 que vous avez téléchargé. Load CLIP → l'encodeur de texte Qwen3VL. Load VAE → associez les deux nodes VAE, audio et vidéo ; l'audio et la vidéo de H3 se génèrent toujours ensemble, les deux sont donc obligatoires, même sur un workflow que vous croyez silencieux.

  3. 5

    Réglez la résolution et la durée

    Resolution Selector : choisissez votre format d'image et une cible en mégapixels. Le canevas natif du modèle a un petit côté de 768 px (max 768x1344), et le node arrondit automatiquement au multiple de 32 pixels le plus proche. La durée s'aligne sur la grille de blocs de 17 images de H3 à 24 ips ; le template est livré avec une taille d'aperçu rapide, et la pleine qualité coûte environ 1,0 mégapixel en 16:9.

  4. 6

    Écrivez votre prompt et lancez

    Décrivez la scène complète, le sujet et le mouvement dans la zone de prompt (il n'y a pas d'image sur laquelle s'appuyer ici, soyez donc précis), puis Queue Prompt. Le clip terminé, audio compris, arrive dans output/video/.

Workflow 2 : image vers vidéo

Les mêmes modèles que pour texte vers vidéo, mais la scène vient de votre image plutôt que de vos mots.

  1. 7

    Chargez le template

    Cherchez "MiniMax H3: Image to Video" dans Templates, et prenez bien la version sans étiquette "API" ; cette variante appelle le point d'accès hébergé de MiniMax au lieu de votre installation locale.

  2. 8

    Faites correspondre vos modèles

    Les mêmes trois nodes de modèle que pour texte vers vidéo : modèle de diffusion fl2va, CLIP Qwen3VL, les deux VAE.

  3. 9

    Importez votre image et mettez-la à l'échelle

    Load Image → votre image source. Utilisez Image Size → elle la met à l'échelle proportionnellement à votre cible en mégapixels et à votre format, pour ne pas donner au modèle une résolution hors spécification. Ce template accepte aussi une image-clé finale optionnelle si vous voulez que le modèle interpole vers un point d'arrivée précis plutôt que de simplement extrapoler le mouvement.

  4. 10

    Écrivez le prompt de mouvement et lancez

    Décrivez ce qui doit bouger (pas la scène ; l'image l'a déjà), puis Queue Prompt.

Recevez les nouveaux guides par email

Un email quand nous publions de nouveaux guides et analyses de modèles. Pas de spam, désinscription à tout moment.

Workflow 3 : référence vers vidéo

Le workflow multi-entrées : jusqu'à 9 images de référence, 3 vidéos de référence et 3 clips audio autonomes en une génération. C'est celui qui demande un modèle de diffusion différent.

  1. 11

    Chargez le template

    Cherchez "MiniMax H3: Reference to Video" et ouvrez-le.

  2. 12

    Chargez le bon modèle de diffusion

    C'est l'étape que l'on saute : référence vers vidéo demande ref2va, pas fl2va. Faites pointer Load Diffusion Model vers minimax_h3_ref2va_pruned_fp8_scaled.safetensors (ou son équivalent int8_convrot). Les nodes d'encodeur de texte et de VAE restent les mêmes que pour les deux autres workflows.

  3. 13

    Ajoutez vos références

    Nodes Load Image et Load Video (Upload) pour vos ressources source, jusqu'à 9 images et 3 vidéos. Une seule image au lieu de deux ? Sélectionnez le node d'image inutilisé et appuyez sur Ctrl+B pour le contourner plutôt que le supprimer. Load Audio (Upload) est optionnel, jusqu'à 3 clips, si vous voulez que le mouvement de la vidéo soit synchronisé avec de la musique ou de la voix.

  4. 14

    Balisez vos références dans le prompt

    Référencez chaque entrée dans votre prompt avec des balises dans l'ordre exact où vous les avez connectées : <Picture 1>, <Picture 2>, <Video 1>, <Audio 1>. Le modèle résout la balise selon l'ordre de connexion, pas selon le nom de fichier : revérifiez donc le graphe de nodes si une balise tire la mauvaise ressource.

  5. 15

    Lancez

    Queue Prompt pour synthétiser le clip guidé par les références avec son audio intégré.

Capture de notre vrai graphe référence vers vidéo dans ComfyUI : le node MiniMax H3 Reference to Video relié à deux nodes d'image de référence Charger Image (un couple dans une cuisine, une femme en robe sombre), au modèle de diffusion ref2va INT8-convrot et à l'encodeur de texte Qwen3VL INT8-convrot, aux nodes VAE Decode et Créer une vidéo, et l'aperçu du résultat montrant un couple qui s'embrasse dans une cuisine lumineuse.
Notre propre graphe R2V, pas une maquette : deux images de référence en entrée, le modèle ref2va INT8, et le vrai résultat rendu à droite.
Le clip produit par ce graphe : 10,1 secondes, 800x1056, avec un vrai audio stéréo de 32 kHz intégré à la même génération. Le premier que nous avons lancé, réussi du premier coup.
Tableau comparatif des trois workflows ComfyUI de MiniMax H3 : texte vers vidéo et image vers vidéo utilisent le modèle de diffusion fl2va, référence vers vidéo utilise ref2va et accepte jusqu'à 9 images, 3 vidéos et 3 clips audio balisés dans le prompt. Les trois plafonnent à 768p en local ; le 2K demande la passe hébergée Regenerate-2K de MiniMax.
Les trois templates partagent un encodeur de texte et des VAE. La seule chose qui change entre eux, c'est le modèle de diffusion et la quantité de contenu que vous pouvez fournir.

Ce que notre premier essai a confirmé

La capture et le clip ci-dessus sont notre première vraie génération référence vers vidéo, pas une maquette. Elle confirme quelques points que la fiche technique seule ne donne pas : le modèle de diffusion ref2va INT8-convrot tourne de bout en bout avec l'encodeur de texte Qwen3VL INT8-convrot, deux images de référence passées par des nodes Charger Image, et Ctrl+B contourne l'emplacement de troisième image inutilisé exactement comme décrit plus haut. La sortie est arrivée en 800x1056 pour une demande de portrait 3:4 (un multiple de 32 pixels, le même comportement d'arrondi que le node Resolution Selector est censé avoir, mais pas exactement le chiffre de 768 px que MiniMax cite pour le 16:9). Elle a duré 10,1 secondes, dans la fenêtre de 4 à 15 s, et la piste audio est revenue en vrai stéréo AAC de 32 kHz, ni silencieuse ni à une fréquence inférieure : l'affirmation d'audio natif tient donc sur notre propre matériel.

Sur les chiffres que l'on nous demande le plus : nous l'avons fait tourner sur un A40 (48 Go de VRAM, 50 Go de RAM système), et un clip de 10 secondes en 720p (agrandi avec la passe d'amélioration, pas natif) a utilisé environ 38 Go de cette VRAM et pris environ 5 minutes. Et oui, l'int8 battait nettement le fp8 à cette résolution à nos yeux, ce qui concorde avec ce que rapporte la communauté.

Dépasser la limite de durée d'un clip

L'installation ci-dessus vous donne un clip dans la plage que H3 génère nativement. La durée est le mur suivant, et le contournement qui a le plus attiré l'attention cet été est un sampler communautaire qui rend en continu au lieu d'une seule passe de durée fixe, avec l'affirmation qu'il tient en 1080p sur une carte de 16 Go.

Cette affirmation mérite d'être comprise précisément, car c'est un mécanisme différent du chaînage d'images décrit dans notre guide pour réaliser des vidéos IA plus longues. Le chaînage rend un clip, prend sa dernière image et démarre un nouveau clip à partir d'elle, ce qui explique la dérive de qualité : chaque image de relais porte les défauts de la précédente. Un sampler continu évite ce relais, donc en principe il évite aussi la dérive cumulative.

En principe. Nos propres essais de chaînage ont atteint un plafond pratique vers quarante secondes avant que la dérive des couleurs devienne visible, et ce chiffre vient d'un essai réel, pas d'une lecture. Nous avons aussi fait tourner nous-mêmes le sampler sans fin, mais pas sur la carte de 16 Go visée par l'affirmation : sur une RTX 4090 de 24 Go, la qualité est restée stable bien au-delà du point où le chaînage commence à dériver, sans le décalage de couleur d'un segment à l'autre que montre le chaînage. Cela ne s'est toutefois pas passé sans accroc. Nous avons subi des arrêts pour mémoire insuffisante plus d'une fois, sur une carte avec 8 Go de marge de plus que la cible de l'affirmation : considérez donc le chiffre de 16 Go comme optimiste tant que vous n'avez pas confirmé qu'il tient sur votre propre matériel.

Questions fréquentes

MiniMax H3 peut-il rendre des vidéos de n'importe quelle durée ?
Pas en une seule passe native, mais un sampler sans fin de la communauté s'en approche. Il rend en continu au lieu d'une seule passe de durée fixe et, contrairement au chaînage d'images, il ne redémarre pas chaque segment depuis une image terminée : il évite donc la dérive de couleur cumulative du chaînage. Nous l'avons fait tourner nous-mêmes et la qualité a tenu bien au-delà des quarante secondes environ où notre propre chaînage commence à dériver. L'affirmation largement partagée est qu'il tourne avec 16 Go de VRAM ; nous avons testé sur une carte de 24 Go et subi quand même des arrêts occasionnels pour mémoire insuffisante : considérez les 16 Go comme optimistes tant que vous ne l'avez pas confirmé sur votre matériel.
MiniMax H3 est-il gratuit pour un usage commercial ?
Oui, jusqu'à 20 M$ de revenu annuel issu de produits ou services commerciaux qui l'utilisent, sans frais. Au-delà de ce seuil, il faut une autorisation écrite préalable de MiniMax, et tout produit commercial utilisant H3 doit afficher « MiniMax H3 » dans son interface dans les deux cas.
Puis-je faire tourner MiniMax H3 en local aux États-Unis, dans l'UE, au Royaume-Uni ou en Corée du Sud ?
Pas selon la licence communautaire telle qu'écrite : ces quatre territoires sont explicitement exclus de son « Applicable Territory », et le déploiement local hors de ce territoire n'est pas autorisé. MiniMax invite les personnes de ces régions à les contacter (api@minimax.io) pour un accord distinct. Son API hébergée, en revanche, est disponible dans le monde entier quelle que soit cette restriction.
De combien de VRAM MiniMax H3 a-t-il besoin ?
Les versions élaguées et quantifiées utilisées dans ce guide ramènent le modèle complet de 123,6 Go à environ 42,5 Go au plus petit niveau, et MiniMax cite une carte du genre RTX 3060 comme envisageable avec le déchargement dynamique de la VRAM activé. Adaptez le fichier d'encodeur de texte à votre carte : nvfp4 pour le moins de VRAM, int8_convrot autour des cartes de 24 Go, int4_convrot autour de 16 Go.
Dois-je utiliser le modèle de diffusion FP8 ou INT8 ?
INT8-convrot est le choix par défaut le plus sûr si votre GPU a la place. Les premiers tests de la communauté le montrent mieux tenir le mouvement et la forme des objets pendant les panoramiques rapides que la voie nvfp4, plus fortement quantifiée, au prix d'un fichier plus gros. FP8 est la solution de repli quand l'encombrement de l'INT8 ne passe pas.
Cette installation locale peut-elle générer de la vidéo 2K ?
Non. Le modèle à poids ouverts plafonne à 768p en local. Le vrai 2K vient de H3-Regenerate-2K, une passe réservée à l'API hébergée de MiniMax qui rend à nouveau un clip 768p terminé à une résolution supérieure ; elle ne fait pas partie des nodes ComfyUI ni des fichiers de ce guide. Si vous avez besoin du 2K, il faut passer par l'API hébergée, pas par une installation locale.
Est-ce moins cher d'utiliser simplement l'API hébergée de MiniMax plutôt que de le faire tourner en local ?
Pour un usage occasionnel, souvent oui : l'API de MiniMax tarife H3 à environ 0,08 $/seconde en 768p et 0,13 $/seconde en 2K (environ 1,20 $ et 1,95 $ pour un clip de 15 secondes), sans GPU ni installation. Le faire tourner en local devient plus logique quand vous générez assez de volume pour que l'électricité et l'amortissement de votre GPU fassent mieux que la facturation à la seconde de l'API, ou quand vous avez précisément besoin des conditions d'usage local de la licence plutôt que de celles de l'API.

Continuer la lecture

Modèles liés

Recevez les nouveaux guides par email

Un email quand nous publions de nouveaux guides et analyses de modèles. Pas de spam, désinscription à tout moment.

Ajouter GenLovers comme source préférée sur Google