Saltar al contenido
GenLovers

Cómo ejecutar MiniMax H3 en local con ComfyUI

Última actualización: 13 min de lecturaDificultad: Intermedio

Escrito por Clement

Una tarjeta para la guía de instalación local de MiniMax H3, que muestra tres tipos de archivo etiquetados: modelo, codificador y VAE.

MiniMax H3 es la versión de pesos abiertos del modelo de video de tercera generación de MiniMax (el mismo linaje que Hailuo). MiniMax lo publicó en código abierto el 3 de agosto de 2026 bajo su propia licencia comunitaria, y ComfyUI lanzó soporte nativo desde el primer día: cuatro nodes nuevos y seis plantillas oficiales, integrados directamente en Comfy-Org/ComfyUI. Por dentro es un transformer omni denso de 33,1 mil millones de parámetros, guiado por un codificador de texto Qwen3-VL-32B, que genera hasta 15 segundos de video a 24 fps con audio estéreo nativo de 32 kHz en una sola pasada. Entran como contexto texto, una imagen o un conjunto completo de imágenes, videos y audios de referencia; salen el video y el sonido juntos.

Esta es la instalación que probamos nosotros mismos: versiones recortadas FP8/INT8 para que quepa en una GPU de consumo y los tres workflows oficiales (text-to-video, image-to-video y reference-to-video). Antes de descargar nada, lee el recuadro de justo debajo. La licencia de MiniMax impone una restricción real sobre dónde puedes ejecutar estos pesos, y es fácil pasarla por alto si estás acostumbrado a pesos abiertos totalmente permisivos.

MiniMax H3's Image-to-Video workflow: one source frame, a motion-and-sound prompt, and one pass that returns video with native audio already in it.

Qué estás instalando

La especificación que importa para una instalación local: según las cifras de MiniMax, H3 a precisión completa pesa 123,6 GB. Recortar los pesos de modulación (alrededor del 40 % de los parámetros) a una tabla de consulta y cuantizar el resto reduce las variantes más pequeñas a unos 42,5 GB, un 66 % menos, que es lo que hace viable una tarjeta de clase RTX 3060 (con la descarga dinámica de VRAM activada). Las versiones FP8 e INT8 que usa esta guía están dentro de ese rango reducido.

Existen dos modelos de difusión y solo necesitas un par, no los dos: fl2va gestiona text-to-video e image-to-video, y ref2va gestiona reference-to-video. Ambos vienen en variantes recortadas FP8 e INT8-convrot. Necesitarás ComfyUI 0.30.0 o más reciente, la primera versión con soporte nativo de nodes de H3.

Una salvedad de resolución fácil de pasar por alto: lo que instalas aquí llega como máximo a 768p (lado corto, hasta 768x1344). La cifra de "hasta 2K" del marketing de MiniMax viene de H3-Regenerate-2K, una pasada aparte que toma un clip de 768p terminado y lo vuelve a renderizar en 2K usando el contexto original. Ese módulo no forma parte de la versión de pesos abiertos; solo funciona a través de la API alojada de MiniMax. Nada de esta guía te da 2K en local.

Actualiza ComfyUI y consigue las plantillas

  1. 1

    Actualiza ComfyUI

    Abre la carpeta de instalación de ComfyUI, entra en la carpeta update y ejecuta update_comfyui.bat. Necesitas al menos ComfyUI 0.30.0 para que aparezcan los nodes nativos de MiniMax H3.

  2. 2

    Carga las plantillas

    Abre ComfyUI, despliega la barra lateral Templates a la izquierda y busca "MiniMax H3". En este lote se incluyen seis plantillas de workflow oficiales; si la búsqueda no devuelve nada, descárgalas directamente de la página Comfy-Org/MiniMax-H3 en Hugging Face y colócalas en tu carpeta de plantillas.

Archivos de modelo que descargar y dónde van

Todos los workflows necesitan el codificador de texto y los dos VAE. El modelo de difusión que añadas depende del workflow que quieras montar.

Difusión (texto/imagen a video)
minimax_h3_fl2va_pruned_fp8_scaled.safetensors, o _int8_convrot → models/diffusion_models/
Difusión (referencia a video)
minimax_h3_ref2va_pruned_fp8_scaled.safetensors, o _int8_convrot → models/diffusion_models/
Codificador de texto
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors → models/text_encoders/ (cámbialo por _int8_convrot en una tarjeta de 24 GB, _int4_convrot en una de 16 GB)
VAE de video
minimax_h3_video_vae_fp16.safetensors → models/vae/
VAE de audio
minimax_h3_audio_vae_fp32.safetensors → models/vae/ (obligatorio aunque no te importe el sonido; H3 siempre lo genera)
Diagrama de carpetas que muestra el modelo de difusión, el codificador de texto y los archivos VAE de MiniMax H3 repartidos en las carpetas models/diffusion_models, models/text_encoders y models/vae de ComfyUI.
Cuatro archivos, tres carpetas. Si falta el VAE de audio, el workflow falla incluso en un text-to-video que parezca silencioso.

Workflow 1: text-to-video

Aquí no hace falta imagen ni referencia: el modelo construye toda la escena a partir de tu prompt.

  1. 3

    Carga la plantilla

    En Templates, busca "MiniMax H3: Text to Video" y ábrela.

  2. 4

    Apunta los nodes de modelo a tus archivos

    Load Diffusion Model → el archivo fl2va FP8 o INT8 que descargaste. Load CLIP → el codificador de texto Qwen3VL. Load VAE → asigna los dos nodes VAE, el de audio y el de video; el audio y el video de H3 siempre se renderizan juntos, así que los dos son obligatorios incluso en un workflow que creas silencioso.

  3. 5

    Configura la resolución y la duración

    Resolution Selector: elige tu relación de aspecto y un objetivo en megapíxeles. El lienzo nativo del modelo tiene un lado corto de 768 px (máx. 768x1344), y el node redondea automáticamente al múltiplo de 32 píxeles más cercano. La duración se ajusta a la cuadrícula de bloques de 17 fotogramas de H3 a 24 fps; la plantilla viene con un tamaño de vista previa rápido, y la calidad completa cuesta aproximadamente 1,0 megapíxel en 16:9.

  4. 6

    Escribe tu prompt y ejecuta

    Describe la escena completa, el sujeto y el movimiento en el cuadro de prompt (aquí no hay imagen en la que apoyarse, así que sé específico) y pulsa Queue Prompt. El clip terminado, con audio incluido, aparece en output/video/.

Workflow 2: image-to-video

Los mismos modelos que en text-to-video, pero la escena viene de tu imagen en lugar de tus palabras.

  1. 7

    Carga la plantilla

    Busca "MiniMax H3: Image to Video" en Templates y asegúrate de elegir la versión sin etiqueta "API"; esa variante llama al endpoint alojado de MiniMax en lugar de a tu instalación local.

  2. 8

    Haz coincidir tus modelos

    Los mismos tres nodes de modelo que en text-to-video: modelo de difusión fl2va, CLIP Qwen3VL y los dos VAE.

  3. 9

    Sube tu imagen y escálala

    Load Image → tu fotograma de origen. Usa Image Size → la escala proporcionalmente a tu objetivo en megapíxeles y a tu relación de aspecto, para no darle al modelo una resolución fuera de especificación. Esta plantilla también acepta un fotograma clave final opcional si quieres que el modelo interpole hacia un punto de llegada concreto en lugar de limitarse a extrapolar el movimiento.

  4. 10

    Escribe el prompt de movimiento y ejecuta

    Describe lo que debe moverse (no la escena; la imagen ya la tiene) y pulsa Queue Prompt.

Recibe las nuevas guías por email

Un email cuando publicamos nuevas guías y análisis de modelos. Sin spam, cancela cuando quieras.

Workflow 3: reference-to-video

El workflow de múltiples entradas: hasta 9 imágenes de referencia, 3 videos de referencia y 3 clips de audio independientes en una sola generación. Es el que necesita un modelo de difusión distinto.

  1. 11

    Carga la plantilla

    Busca "MiniMax H3: Reference to Video" y ábrela.

  2. 12

    Carga el modelo de difusión correcto

    Este es el paso que la gente se salta: reference-to-video necesita ref2va, no fl2va. Apunta Load Diffusion Model a minimax_h3_ref2va_pruned_fp8_scaled.safetensors (o su equivalente int8_convrot). Los nodes del codificador de texto y de los VAE siguen siendo los mismos que en los otros dos workflows.

  3. 13

    Añade tus referencias

    Nodes Load Image y Load Video (Upload) para tus recursos de origen, hasta 9 imágenes y 3 videos. ¿Solo necesitas una imagen en lugar de dos? Selecciona el node de imagen sin usar y pulsa Ctrl+B para omitirlo en lugar de borrarlo. Load Audio (Upload) es opcional, hasta 3 clips, si quieres que el movimiento del video se sincronice con música o voz.

  4. 14

    Etiqueta tus referencias en el prompt

    Referencia cada entrada en tu prompt con etiquetas en el orden exacto en que las conectaste: <Picture 1>, <Picture 2>, <Video 1>, <Audio 1>. El modelo resuelve la etiqueta por el orden de conexión, no por el nombre del archivo, así que revisa el grafo de nodes si una etiqueta trae el recurso equivocado.

  5. 15

    Ejecuta

    Queue Prompt para sintetizar el clip guiado por las referencias con su audio integrado.

Captura de nuestro grafo real de reference-to-video en ComfyUI: el node MiniMax H3 Reference to Video conectado a dos nodes de imagen de referencia Charger Image (una pareja en una cocina, una mujer con vestido oscuro), al modelo de difusión ref2va INT8-convrot y al codificador de texto Qwen3VL INT8-convrot, a los nodes VAE Decode y Créer une vidéo, y la vista previa del resultado con una pareja besándose en una cocina luminosa.
Nuestro propio grafo R2V, no una maqueta: dos imágenes de referencia de entrada, el modelo ref2va INT8 y el resultado real renderizado a la derecha.
El clip que produjo ese grafo: 10,1 segundos, 800x1056, con audio estéreo real de 32 kHz integrado en la misma generación. El primero que ejecutamos, a la primera.
Tabla comparativa de los tres workflows de ComfyUI de MiniMax H3: text-to-video e image-to-video usan el modelo de difusión fl2va, reference-to-video usa ref2va y acepta hasta 9 imágenes, 3 videos y 3 clips de audio etiquetados en el prompt. Los tres llegan como máximo a 768p en local; el 2K necesita la pasada alojada Regenerate-2K de MiniMax.
Las tres plantillas comparten codificador de texto y VAE. Lo único que cambia entre ellas es el modelo de difusión y cuánto contenido puedes aportar.

Lo que confirmó nuestra primera prueba

La captura y el clip de arriba son nuestra primera generación real de reference-to-video, no una maqueta. Confirma varias cosas que la hoja de especificaciones por sí sola no dice: el modelo de difusión ref2va INT8-convrot funciona de principio a fin con el codificador de texto Qwen3VL INT8-convrot, dos imágenes de referencia pasadas por nodes Charger Image, y Ctrl+B omitiendo la ranura de la tercera imagen sin usar exactamente como se describe arriba. El resultado salió a 800x1056 para una petición de retrato 3:4 (un múltiplo de 32 píxeles, el mismo comportamiento de redondeo que se supone que hace el node Resolution Selector, aunque no exactamente la cifra de 768 px que cita MiniMax para 16:9). Duró 10,1 segundos, dentro de la ventana de 4 a 15 s, y la pista de audio volvió como estéreo AAC genuino de 32 kHz, ni silenciosa ni a una frecuencia menor, así que la afirmación de audio nativo se sostiene en nuestro propio hardware.

Sobre los números que la gente pregunta de verdad: lo ejecutamos en una A40 (48 GB de VRAM, 50 GB de RAM del sistema), y un clip de 10 segundos a 720p (ampliado con la pasada de mejora, no nativo) usó unos 38 GB de esa VRAM y tardó aproximadamente 5 minutos. Y sí, int8 superó claramente a fp8 a esa resolución a simple vista, en línea con lo que viene informando la comunidad.

Renderizar más allá del límite del clip

La instalación de arriba te da un clip dentro del rango que H3 genera de forma nativa. La duración es el siguiente muro con el que se topa la gente, y la solución que más atención recibió este verano es un sampler comunitario que renderiza de forma continua en lugar de en una sola pasada de duración fija, con la afirmación de que aguanta a 1080p en una tarjeta de 16 GB.

Esa afirmación conviene entenderla con precisión, porque es un mecanismo distinto del encadenado de fotogramas que describimos en nuestra guía sobre cómo hacer videos con IA más largos. El encadenado renderiza un clip, toma su último fotograma y empieza un clip nuevo a partir de él, por eso la calidad se desvía: cada fotograma de relevo arrastra los defectos del anterior. Un sampler continuo evita ese relevo, así que en principio también evita la desviación acumulada.

En principio. Nuestros propios experimentos de encadenado chocaron con un techo práctico en torno a los cuarenta segundos antes de que la desviación de color se hiciera visible, y esa cifra salió de ejecutarlo, no de leer sobre ello. También ejecutamos nosotros mismos el sampler sin fin, aunque no en la tarjeta de 16 GB para la que se hace la afirmación: en una RTX 4090 de 24 GB, la calidad se mantuvo estable mucho más allá del punto en que el encadenado empieza a desviarse, sin el cambio de color de un segmento a otro que muestra el encadenado. Pero no fue todo sobre ruedas. Sufrimos cierres por falta de memoria más de una vez, en una tarjeta con 8 GB más de margen que el objetivo de la afirmación, así que considera la cifra de 16 GB como optimista hasta que confirmes que se sostiene en tu propio hardware.

Preguntas frecuentes

¿Puede MiniMax H3 renderizar videos de cualquier duración?
No en una sola pasada nativa, pero un sampler sin fin de la comunidad se acerca. Renderiza de forma continua en lugar de en una sola pasada de duración fija y, a diferencia del encadenado de fotogramas, no reinicia cada segmento desde un fotograma terminado, así que evita la desviación de color acumulada del encadenado. Lo ejecutamos nosotros mismos y la calidad se mantuvo bastante más allá de los cuarenta segundos aproximados en los que nuestro propio encadenado empieza a desviarse. La afirmación muy compartida es que funciona con 16 GB de VRAM; probamos en una tarjeta de 24 GB y aun así sufrimos cierres ocasionales por falta de memoria, así que considera los 16 GB como optimistas hasta que lo confirmes en tu propio hardware.
¿Se puede usar MiniMax H3 gratis de forma comercial?
Sí, hasta 20 M$ al año de ingresos de productos o servicios comerciales que lo usen, sin ninguna tarifa. Por encima de ese umbral necesitas autorización previa por escrito de MiniMax, y cualquier producto comercial que use H3 debe mostrar "MiniMax H3" en su interfaz en ambos casos.
¿Puedo ejecutar MiniMax H3 en local en Estados Unidos, la UE, el Reino Unido o Corea del Sur?
No bajo la licencia comunitaria tal como está escrita: esos cuatro territorios están excluidos expresamente de su "Applicable Territory", y el despliegue local fuera de ese territorio no está licenciado. MiniMax invita a las personas de esas regiones a contactarlos (api@minimax.io) para un acuerdo aparte. En cambio, su API alojada está disponible en todo el mundo sin importar esta restricción.
¿Cuánta VRAM necesita MiniMax H3?
Las versiones recortadas y cuantizadas que usa esta guía reducen el modelo completo de 123,6 GB a unos 42,5 GB en el nivel más pequeño, y MiniMax cita algo como una RTX 3060 como viable con la descarga dinámica de VRAM activada. Ajusta el archivo del codificador de texto a tu tarjeta: nvfp4 para la menor VRAM, int8_convrot en torno a las tarjetas de 24 GB, int4_convrot en torno a las de 16 GB.
¿Debería usar el modelo de difusión FP8 o INT8?
INT8-convrot es la opción por defecto más segura si tu GPU tiene espacio. Las primeras pruebas de la comunidad indican que mantiene mejor el movimiento y la forma de los objetos en los barridos rápidos que la vía nvfp4, más agresivamente cuantizada, a costa de un archivo más grande. FP8 es el recurso cuando no cabe lo que ocupa INT8.
¿Puede esta instalación local generar video en 2K?
No. El modelo de pesos abiertos llega como máximo a 768p en local. El 2K completo viene de H3-Regenerate-2K, una pasada solo alojada en la API de MiniMax que vuelve a renderizar un clip de 768p terminado a mayor resolución; no forma parte de los nodes de ComfyUI ni de los archivos de esta guía. Si necesitas 2K, eso significa la API alojada, no una instalación local.
¿Sale más barato usar la API alojada de MiniMax que ejecutarlo en local?
Para un uso ocasional, a menudo sí: la propia API de MiniMax cobra H3 a unos 0,08 $/segundo en 768p y 0,13 $/segundo en 2K (alrededor de 1,20 $ y 1,95 $ por un clip de 15 segundos), sin GPU ni instalación. Ejecutarlo en local tiene más sentido cuando generas volumen suficiente para que la electricidad y la amortización de tu GPU queden por debajo de la facturación por segundo de la API, o cuando necesitas específicamente las condiciones de uso local de la licencia y no las de la API.

Seguir leyendo

Modelos relacionados

Recibe las nuevas guías por email

Un email cuando publicamos nuevas guías y análisis de modelos. Sin spam, cancela cuando quieras.

Añadir GenLovers como fuente preferida en Google