Cómo ejecutar MiniMax H3 en local con ComfyUI
Escrito por Clement

MiniMax H3 es la versión de pesos abiertos del modelo de video de tercera generación de MiniMax (el mismo linaje que Hailuo). MiniMax lo publicó en código abierto el 3 de agosto de 2026 bajo su propia licencia comunitaria, y ComfyUI lanzó soporte nativo desde el primer día: cuatro nodes nuevos y seis plantillas oficiales, integrados directamente en Comfy-Org/ComfyUI. Por dentro es un transformer omni denso de 33,1 mil millones de parámetros, guiado por un codificador de texto Qwen3-VL-32B, que genera hasta 15 segundos de video a 24 fps con audio estéreo nativo de 32 kHz en una sola pasada. Entran como contexto texto, una imagen o un conjunto completo de imágenes, videos y audios de referencia; salen el video y el sonido juntos.
Esta es la instalación que probamos nosotros mismos: versiones recortadas FP8/INT8 para que quepa en una GPU de consumo y los tres workflows oficiales (text-to-video, image-to-video y reference-to-video). Antes de descargar nada, lee el recuadro de justo debajo. La licencia de MiniMax impone una restricción real sobre dónde puedes ejecutar estos pesos, y es fácil pasarla por alto si estás acostumbrado a pesos abiertos totalmente permisivos.
Qué estás instalando
La especificación que importa para una instalación local: según las cifras de MiniMax, H3 a precisión completa pesa 123,6 GB. Recortar los pesos de modulación (alrededor del 40 % de los parámetros) a una tabla de consulta y cuantizar el resto reduce las variantes más pequeñas a unos 42,5 GB, un 66 % menos, que es lo que hace viable una tarjeta de clase RTX 3060 (con la descarga dinámica de VRAM activada). Las versiones FP8 e INT8 que usa esta guía están dentro de ese rango reducido.
Existen dos modelos de difusión y solo necesitas un par, no los dos: fl2va gestiona text-to-video e image-to-video, y ref2va gestiona reference-to-video. Ambos vienen en variantes recortadas FP8 e INT8-convrot. Necesitarás ComfyUI 0.30.0 o más reciente, la primera versión con soporte nativo de nodes de H3.
Una salvedad de resolución fácil de pasar por alto: lo que instalas aquí llega como máximo a 768p (lado corto, hasta 768x1344). La cifra de "hasta 2K" del marketing de MiniMax viene de H3-Regenerate-2K, una pasada aparte que toma un clip de 768p terminado y lo vuelve a renderizar en 2K usando el contexto original. Ese módulo no forma parte de la versión de pesos abiertos; solo funciona a través de la API alojada de MiniMax. Nada de esta guía te da 2K en local.
Actualiza ComfyUI y consigue las plantillas
- 1
Actualiza ComfyUI
Abre la carpeta de instalación de ComfyUI, entra en la carpeta update y ejecuta update_comfyui.bat. Necesitas al menos ComfyUI 0.30.0 para que aparezcan los nodes nativos de MiniMax H3.
- 2
Carga las plantillas
Abre ComfyUI, despliega la barra lateral Templates a la izquierda y busca "MiniMax H3". En este lote se incluyen seis plantillas de workflow oficiales; si la búsqueda no devuelve nada, descárgalas directamente de la página Comfy-Org/MiniMax-H3 en Hugging Face y colócalas en tu carpeta de plantillas.
Archivos de modelo que descargar y dónde van
Todos los workflows necesitan el codificador de texto y los dos VAE. El modelo de difusión que añadas depende del workflow que quieras montar.
- Difusión (texto/imagen a video)
- minimax_h3_fl2va_pruned_fp8_scaled.safetensors, o _int8_convrot → models/diffusion_models/
- Difusión (referencia a video)
- minimax_h3_ref2va_pruned_fp8_scaled.safetensors, o _int8_convrot → models/diffusion_models/
- Codificador de texto
- qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors → models/text_encoders/ (cámbialo por _int8_convrot en una tarjeta de 24 GB, _int4_convrot en una de 16 GB)
- VAE de video
- minimax_h3_video_vae_fp16.safetensors → models/vae/
- VAE de audio
- minimax_h3_audio_vae_fp32.safetensors → models/vae/ (obligatorio aunque no te importe el sonido; H3 siempre lo genera)
Workflow 1: text-to-video
Aquí no hace falta imagen ni referencia: el modelo construye toda la escena a partir de tu prompt.
- 3
Carga la plantilla
En Templates, busca "MiniMax H3: Text to Video" y ábrela.
- 4
Apunta los nodes de modelo a tus archivos
Load Diffusion Model → el archivo fl2va FP8 o INT8 que descargaste. Load CLIP → el codificador de texto Qwen3VL. Load VAE → asigna los dos nodes VAE, el de audio y el de video; el audio y el video de H3 siempre se renderizan juntos, así que los dos son obligatorios incluso en un workflow que creas silencioso.
- 5
Configura la resolución y la duración
Resolution Selector: elige tu relación de aspecto y un objetivo en megapíxeles. El lienzo nativo del modelo tiene un lado corto de 768 px (máx. 768x1344), y el node redondea automáticamente al múltiplo de 32 píxeles más cercano. La duración se ajusta a la cuadrícula de bloques de 17 fotogramas de H3 a 24 fps; la plantilla viene con un tamaño de vista previa rápido, y la calidad completa cuesta aproximadamente 1,0 megapíxel en 16:9.
- 6
Escribe tu prompt y ejecuta
Describe la escena completa, el sujeto y el movimiento en el cuadro de prompt (aquí no hay imagen en la que apoyarse, así que sé específico) y pulsa Queue Prompt. El clip terminado, con audio incluido, aparece en output/video/.
Workflow 2: image-to-video
Los mismos modelos que en text-to-video, pero la escena viene de tu imagen en lugar de tus palabras.
- 7
Carga la plantilla
Busca "MiniMax H3: Image to Video" en Templates y asegúrate de elegir la versión sin etiqueta "API"; esa variante llama al endpoint alojado de MiniMax en lugar de a tu instalación local.
- 8
Haz coincidir tus modelos
Los mismos tres nodes de modelo que en text-to-video: modelo de difusión fl2va, CLIP Qwen3VL y los dos VAE.
- 9
Sube tu imagen y escálala
Load Image → tu fotograma de origen. Usa Image Size → la escala proporcionalmente a tu objetivo en megapíxeles y a tu relación de aspecto, para no darle al modelo una resolución fuera de especificación. Esta plantilla también acepta un fotograma clave final opcional si quieres que el modelo interpole hacia un punto de llegada concreto en lugar de limitarse a extrapolar el movimiento.
- 10
Escribe el prompt de movimiento y ejecuta
Describe lo que debe moverse (no la escena; la imagen ya la tiene) y pulsa Queue Prompt.
Recibe las nuevas guías por email
Un email cuando publicamos nuevas guías y análisis de modelos. Sin spam, cancela cuando quieras.
Workflow 3: reference-to-video
El workflow de múltiples entradas: hasta 9 imágenes de referencia, 3 videos de referencia y 3 clips de audio independientes en una sola generación. Es el que necesita un modelo de difusión distinto.
- 11
Carga la plantilla
Busca "MiniMax H3: Reference to Video" y ábrela.
- 12
Carga el modelo de difusión correcto
Este es el paso que la gente se salta: reference-to-video necesita ref2va, no fl2va. Apunta Load Diffusion Model a minimax_h3_ref2va_pruned_fp8_scaled.safetensors (o su equivalente int8_convrot). Los nodes del codificador de texto y de los VAE siguen siendo los mismos que en los otros dos workflows.
- 13
Añade tus referencias
Nodes Load Image y Load Video (Upload) para tus recursos de origen, hasta 9 imágenes y 3 videos. ¿Solo necesitas una imagen en lugar de dos? Selecciona el node de imagen sin usar y pulsa Ctrl+B para omitirlo en lugar de borrarlo. Load Audio (Upload) es opcional, hasta 3 clips, si quieres que el movimiento del video se sincronice con música o voz.
- 14
Etiqueta tus referencias en el prompt
Referencia cada entrada en tu prompt con etiquetas en el orden exacto en que las conectaste: <Picture 1>, <Picture 2>, <Video 1>, <Audio 1>. El modelo resuelve la etiqueta por el orden de conexión, no por el nombre del archivo, así que revisa el grafo de nodes si una etiqueta trae el recurso equivocado.
- 15
Ejecuta
Queue Prompt para sintetizar el clip guiado por las referencias con su audio integrado.

Lo que confirmó nuestra primera prueba
La captura y el clip de arriba son nuestra primera generación real de reference-to-video, no una maqueta. Confirma varias cosas que la hoja de especificaciones por sí sola no dice: el modelo de difusión ref2va INT8-convrot funciona de principio a fin con el codificador de texto Qwen3VL INT8-convrot, dos imágenes de referencia pasadas por nodes Charger Image, y Ctrl+B omitiendo la ranura de la tercera imagen sin usar exactamente como se describe arriba. El resultado salió a 800x1056 para una petición de retrato 3:4 (un múltiplo de 32 píxeles, el mismo comportamiento de redondeo que se supone que hace el node Resolution Selector, aunque no exactamente la cifra de 768 px que cita MiniMax para 16:9). Duró 10,1 segundos, dentro de la ventana de 4 a 15 s, y la pista de audio volvió como estéreo AAC genuino de 32 kHz, ni silenciosa ni a una frecuencia menor, así que la afirmación de audio nativo se sostiene en nuestro propio hardware.
Sobre los números que la gente pregunta de verdad: lo ejecutamos en una A40 (48 GB de VRAM, 50 GB de RAM del sistema), y un clip de 10 segundos a 720p (ampliado con la pasada de mejora, no nativo) usó unos 38 GB de esa VRAM y tardó aproximadamente 5 minutos. Y sí, int8 superó claramente a fp8 a esa resolución a simple vista, en línea con lo que viene informando la comunidad.
Renderizar más allá del límite del clip
La instalación de arriba te da un clip dentro del rango que H3 genera de forma nativa. La duración es el siguiente muro con el que se topa la gente, y la solución que más atención recibió este verano es un sampler comunitario que renderiza de forma continua en lugar de en una sola pasada de duración fija, con la afirmación de que aguanta a 1080p en una tarjeta de 16 GB.
Esa afirmación conviene entenderla con precisión, porque es un mecanismo distinto del encadenado de fotogramas que describimos en nuestra guía sobre cómo hacer videos con IA más largos. El encadenado renderiza un clip, toma su último fotograma y empieza un clip nuevo a partir de él, por eso la calidad se desvía: cada fotograma de relevo arrastra los defectos del anterior. Un sampler continuo evita ese relevo, así que en principio también evita la desviación acumulada.
En principio. Nuestros propios experimentos de encadenado chocaron con un techo práctico en torno a los cuarenta segundos antes de que la desviación de color se hiciera visible, y esa cifra salió de ejecutarlo, no de leer sobre ello. También ejecutamos nosotros mismos el sampler sin fin, aunque no en la tarjeta de 16 GB para la que se hace la afirmación: en una RTX 4090 de 24 GB, la calidad se mantuvo estable mucho más allá del punto en que el encadenado empieza a desviarse, sin el cambio de color de un segmento a otro que muestra el encadenado. Pero no fue todo sobre ruedas. Sufrimos cierres por falta de memoria más de una vez, en una tarjeta con 8 GB más de margen que el objetivo de la afirmación, así que considera la cifra de 16 GB como optimista hasta que confirmes que se sostiene en tu propio hardware.
Preguntas frecuentes
- ¿Puede MiniMax H3 renderizar videos de cualquier duración?
- No en una sola pasada nativa, pero un sampler sin fin de la comunidad se acerca. Renderiza de forma continua en lugar de en una sola pasada de duración fija y, a diferencia del encadenado de fotogramas, no reinicia cada segmento desde un fotograma terminado, así que evita la desviación de color acumulada del encadenado. Lo ejecutamos nosotros mismos y la calidad se mantuvo bastante más allá de los cuarenta segundos aproximados en los que nuestro propio encadenado empieza a desviarse. La afirmación muy compartida es que funciona con 16 GB de VRAM; probamos en una tarjeta de 24 GB y aun así sufrimos cierres ocasionales por falta de memoria, así que considera los 16 GB como optimistas hasta que lo confirmes en tu propio hardware.
- ¿Se puede usar MiniMax H3 gratis de forma comercial?
- Sí, hasta 20 M$ al año de ingresos de productos o servicios comerciales que lo usen, sin ninguna tarifa. Por encima de ese umbral necesitas autorización previa por escrito de MiniMax, y cualquier producto comercial que use H3 debe mostrar "MiniMax H3" en su interfaz en ambos casos.
- ¿Puedo ejecutar MiniMax H3 en local en Estados Unidos, la UE, el Reino Unido o Corea del Sur?
- No bajo la licencia comunitaria tal como está escrita: esos cuatro territorios están excluidos expresamente de su "Applicable Territory", y el despliegue local fuera de ese territorio no está licenciado. MiniMax invita a las personas de esas regiones a contactarlos (api@minimax.io) para un acuerdo aparte. En cambio, su API alojada está disponible en todo el mundo sin importar esta restricción.
- ¿Cuánta VRAM necesita MiniMax H3?
- Las versiones recortadas y cuantizadas que usa esta guía reducen el modelo completo de 123,6 GB a unos 42,5 GB en el nivel más pequeño, y MiniMax cita algo como una RTX 3060 como viable con la descarga dinámica de VRAM activada. Ajusta el archivo del codificador de texto a tu tarjeta: nvfp4 para la menor VRAM, int8_convrot en torno a las tarjetas de 24 GB, int4_convrot en torno a las de 16 GB.
- ¿Debería usar el modelo de difusión FP8 o INT8?
- INT8-convrot es la opción por defecto más segura si tu GPU tiene espacio. Las primeras pruebas de la comunidad indican que mantiene mejor el movimiento y la forma de los objetos en los barridos rápidos que la vía nvfp4, más agresivamente cuantizada, a costa de un archivo más grande. FP8 es el recurso cuando no cabe lo que ocupa INT8.
- ¿Puede esta instalación local generar video en 2K?
- No. El modelo de pesos abiertos llega como máximo a 768p en local. El 2K completo viene de H3-Regenerate-2K, una pasada solo alojada en la API de MiniMax que vuelve a renderizar un clip de 768p terminado a mayor resolución; no forma parte de los nodes de ComfyUI ni de los archivos de esta guía. Si necesitas 2K, eso significa la API alojada, no una instalación local.
- ¿Sale más barato usar la API alojada de MiniMax que ejecutarlo en local?
- Para un uso ocasional, a menudo sí: la propia API de MiniMax cobra H3 a unos 0,08 $/segundo en 768p y 0,13 $/segundo en 2K (alrededor de 1,20 $ y 1,95 $ por un clip de 15 segundos), sin GPU ni instalación. Ejecutarlo en local tiene más sentido cuando generas volumen suficiente para que la electricidad y la amortización de tu GPU queden por debajo de la facturación por segundo de la API, o cuando necesitas específicamente las condiciones de uso local de la licencia y no las de la API.
Seguir leyendo

How to generate videos with Wan 2.5
What changed in Wan 2.5 versus 2.2, including native audio, and how to get the most out of it for image-to-video: the new settings worth touching, when the upgrade helps, and when it doesn't.

How to generate videos with Wan 2.7
A practical guide to Wan 2.7 image-to-video: clips up to about fifteen seconds, built-in prompt optimization, and refined native audio. What the model adds over 2.5, how to prompt sound, and how to script a longer clip so it holds together.

How to write prompts for AI video generation
The prompt structure that works for AI video: why motion prompts are different from image prompts, the present-progressive rule, and the specific phrasing that gets you believable movement instead of a warped photo.

How to make longer AI videos: 4 methods that work
AI video models cap out at a few seconds. Here are the 4 methods that extend them: chaining clips, last-frame continuation, and keeping motion consistent across every join. Step by step, free.

How much does AI video generation cost?
A clear breakdown of what AI video costs: per-second pricing, why resolution and audio change the bill, how to estimate a clip before you generate it, the free local alternative, and where the hidden costs like upscaling hide.

How to fix flickering AI video: 4 causes and fixes
AI video that flickers, shimmers, or morphs between frames has 4 usual causes. Here's how to diagnose and fix each one: source-image noise, too-few steps, over-long clips, and unstable prompts. Step by step.
Modelos relacionados
Recibe las nuevas guías por email
Un email cuando publicamos nuevas guías y análisis de modelos. Sin spam, cancela cuando quieras.
