Free credits for new users
Modelo
0/7000
4s
Saldo:0
100%
MiniMax H3

Ejemplos

Configura los parámetros y haz clic en Generar

Cinematic Motion

A cinematic shot with smooth camera movement and realistic lighting.

Dynamic Product Scene

A product-focused video with polished motion and detailed textures.

Creative Story Beat

A short visual story with expressive motion and atmospheric composition.

Pro Narrative Shot

A refined cinematic sequence with stable framing and rich scene detail.

Audio-Ready Scene

A polished video scene designed for expressive motion and audio support.

Studio Composition

A controlled scene with deliberate movement and professional lighting.

MiniMax H3: el modelo de vídeo multimodal, explicado

MiniMax H3 es un modelo universal y multimodal de generación de vídeo de MiniMax, lanzado el 31 de julio de 2026 a través de la API de MiniMax y de la app Hailuo, donde también se le llama Hailuo 3.0. Acepta texto, imágenes, clips de vídeo y audio como entrada y produce vídeo con audio estéreo nativo: hasta 2K de resolución, 24 fps y entre 4 y 15 segundos por clip.

Todo lo que necesitas saber sobre MiniMax H3, en un solo lugar.

MiniMax H3 en ComfyUI

La generación de texto a vídeo con MiniMax H3 ya está disponible en el generador de arriba: escribe un prompt, elige 768P o 2K, una duración de 4 a 15 segundos y una de las seis relaciones de aspecto. La generación de imagen a vídeo y la de referencia multimodal R2V todavía no están en Studio; la pestaña de imagen a vídeo funciona por ahora con Hailuo 02.

Qué es MiniMax H3

¿Qué es MiniMax H3?

MiniMax H3 es un modelo universal y multimodal de generación de vídeo desarrollado por MiniMax. A diferencia de los modelos que solo aceptan un prompt o una única imagen, MiniMax H3 unifica la entrada de texto, imagen, vídeo y audio dentro de un mismo modelo, y devuelve un clip terminado que ya incluye su propia banda sonora estéreo. La app Hailuo, orientada al consumidor, ofrece el mismo modelo con los nombres Hailuo 3.0, Hailuo H3 y Hailuo 03: todos se refieren a MiniMax H3.

Entrada multimodal unificada

Texto, imágenes, clips de vídeo y audio entran al mismo modelo. Esa es la diferencia esencial frente a las herramientas que solo convierten imagen en vídeo: una única generación puede condicionarse a la vez con un prompt escrito, imágenes de referencia, metraje de referencia y audio de referencia.

Audio estéreo nativo

MiniMax H3 genera vídeo con audio estéreo producido por el propio modelo, sin necesidad de una fase de sonido posterior. Admite doblaje en 11 idiomas.

2K, 24 fps, de 4 a 15 segundos

La salida llega hasta 2K de resolución a 24 fps, con una duración configurable en segundos enteros de 4 a 15. El modelo tiene aproximadamente 33B de parámetros.

Evolución del modelo

De Hailuo 2.3 a MiniMax H3

MiniMax H3 es la generación actual de la línea de modelos de vídeo de MiniMax, sucesora de Hailuo 2.3. El salto entre ambos no es solo de calidad: H3 cambia lo que el modelo acepta como entrada y lo que produce como salida.

Hailuo 2.3

Versión anterior

La generación previa de la línea de modelos de vídeo Hailuo. Permitía generar vídeo a partir de texto y de imágenes, y sigue siendo la versión de referencia en la mayoría de tutoriales y flujos de trabajo de Hailuo publicados antes de mediados de 2026.

MiniMax H3

Versión actual

La versión actual, lanzada el 31 de julio de 2026 en la API de MiniMax y en la app Hailuo. H3 unifica la entrada de texto, imagen, vídeo y audio en un solo modelo, genera audio estéreo nativo y alcanza 2K a 24 fps con clips de 4 a 15 segundos. Los pesos abiertos de H3-Base llegaron el 3 de agosto de 2026.

Modos de generación

Los tres modos de generación de MiniMax H3

MiniMax H3 ofrece tres formas distintas de dirigir una generación. La tercera, R2V, es donde el diseño multimodal se hace realmente visible: es el modo que no tiene equivalente directo en los modelos de vídeo de entrada única.

T2V

Texto a vídeo

Describe el plano con palabras y MiniMax H3 genera el clip: sujeto, movimiento de cámara y escena, junto con la pista de audio estéreo nativa. No hace falta imagen de partida.

Generar con MiniMax H3
I2V

Imagen a vídeo y primer–último fotograma

Parte de una sola imagen y anímala, o aporta el primer y el último fotograma para que MiniMax H3 genere la transición entre ambos. Útil cuando necesitas que el clip termine en un fotograma concreto.

Próximamente en Studio
R2V — Referencia multimodal

Referencia a vídeo

Condiciona una misma generación con hasta 9 imágenes de referencia, hasta 3 clips de vídeo de referencia (de 2 a 15 segundos cada uno, con un total máximo de 15 segundos) y hasta 3 clips de audio de referencia. Así es como MiniMax H3 traslada un personaje, un estilo, un patrón de movimiento o una voz de tu propio material a un plano nuevo.

Próximamente en Studio
Precios

Precios de MiniMax H3 en Wowovid

Wowovid funciona con un único saldo de créditos válido para todos los modelos de vídeo e imagen de la plataforma: no hay que contratar una suscripción aparte de MiniMax ni gestionar planes por modelo. Un clip de texto a vídeo MiniMax H3 de 4 segundos cuesta 93 créditos en 768P o 151 en 2K, y el total exacto se muestra antes de generar. Los planes anuales cuestan desde 10 $ al mes con facturación anual; los packs de pago único empiezan en 39 $.

Comparativas

MiniMax H3 frente a otros modelos de vídeo

Las dos comparativas que más se buscan a la hora de evaluar MiniMax H3.

MiniMax H3 vs. Kling AI

Kling AI es la opción más contrastada para texto a vídeo e imagen a vídeo con acabado cuidado y movimiento coherente con la física. Los puntos diferenciales de MiniMax H3 son su entrada multimodal unificada —imágenes, vídeo y audio de referencia en una misma generación— y el audio estéreo nativo del resultado.

MiniMax H3 vs. Seedance 2.5

Ambos son modelos de vídeo de la generación actual que los creadores comparan en paralelo. Lo que distingue a MiniMax H3 es el condicionamiento multimodal por referencia (R2V), el audio estéreo nativo y un modelo base con pesos abiertos; Seedance 2.5 es un modelo alojado con otro conjunto de funciones.

Preguntas frecuentes

MiniMax H3: preguntas frecuentes

Dudas habituales sobre MiniMax H3, sus capacidades, su situación de código abierto y su comparación con otros modelos de vídeo.

MiniMax H3 es un modelo universal y multimodal de generación de vídeo de MiniMax. Acepta de forma unificada entradas de texto, imagen, vídeo y audio, y produce vídeo con audio estéreo nativo, con hasta 2K de resolución y 24 fps, y duraciones de 4 a 15 segundos en pasos de un segundo. Admite doblaje en 11 idiomas y tiene aproximadamente 33B de parámetros.

Sí. «MiniMax H3» es el nombre oficial del modelo. La app Hailuo, orientada al consumidor, y buena parte de la comunidad se refieren al mismo modelo como Hailuo 3.0, Hailuo H3 o Hailuo 03. Se trata del mismo modelo, lanzado el 31 de julio de 2026 en la API de MiniMax y en la app Hailuo.

En parte, y la distinción importa. MiniMax publicó los pesos abiertos de H3-Base el 3 de agosto de 2026, incluidos los checkpoints FL2VA y Ref2VA, bajo la MiniMax H3 Community License. Sin embargo, dos componentes quedan fuera de esa publicación: H3-Context-IR, el sistema de preprocesado y mejora de prompts, y H3-Regenerate-2K, el módulo de escalado a 2K. Ambos siguen siendo exclusivos del servicio alojado, así que un despliegue local de los pesos abiertos no reproduce el pipeline completo. Consulta nuestra página de MiniMax H3 en ComfyUI para ver el panorama técnico completo.

T2V (texto a vídeo) genera solo a partir de un prompt escrito. I2V (imagen a vídeo) anima una única imagen o, si aportas el primer y el último fotograma, genera la transición entre ambos. R2V (referencia a vídeo) es el modo multimodal: admite hasta 9 imágenes de referencia, hasta 3 clips de vídeo de referencia de 2 a 15 segundos cada uno sin superar los 15 segundos en total, y hasta 3 clips de audio de referencia en una misma generación.

Sí. La generación de texto a vídeo con MiniMax H3 ya está activa en el generador de Wowovid Studio: escribe un prompt, elige 768P o 2K, fija una duración de entre 4 y 15 segundos y selecciona una de las seis relaciones de aspecto, de 21:9 a 9:16. La generación de imagen a vídeo y la de referencia multimodal R2V aún no están disponibles en Studio: la pestaña de imagen a vídeo funciona por ahora con el modelo anterior, Hailuo 02.

Kling AI es una opción consolidada para el movimiento realista y la conversión de imagen a vídeo coherente con la física, y es el modelo por el que Wowovid enruta hoy la mayoría de generaciones de vídeo. MiniMax H3 destaca cuando necesitas condicionamiento multimodal por referencia —llevar un personaje, un estilo, un movimiento o una voz de tus propias imágenes, clips y audio a un plano nuevo— y cuando quieres que el resultado llegue ya con audio estéreo en lugar de añadirlo después.

Ambos pertenecen a la generación actual de modelos de vídeo con IA. Lo que separa a MiniMax H3 es su modo de referencia multimodal R2V, su salida de audio estéreo nativo con doblaje en 11 idiomas y el hecho de que los pesos de su modelo base se publicaran de forma abierta. Seedance 2.5 es un modelo alojado con su propio conjunto de funciones y sin publicación de pesos abiertos.

En Wowovid no. Como existen pesos abiertos, MiniMax H3 puede ejecutarse en local, pero eso implica una GPU potente, decenas de gigabytes de descargas y un entorno de ComfyUI funcionando. Wowovid es una plataforma alojada: la generación se ejecuta en nuestra infraestructura y a ti solo te hace falta un navegador. Si lo que estás investigando es el despliegue local, nuestra página de MiniMax H3 en ComfyUI cubre los requisitos de hardware y las versiones cuantizadas.

Wowovid usa un único saldo de créditos compartido por todos los modelos, así que no hay una suscripción aparte para MiniMax H3. Un clip de 4 segundos cuesta 93 créditos en 768P o 151 en 2K, y el generador muestra el total exacto antes del envío. Los planes anuales empiezan en 10 $/mes, los mensuales en 29 $/mes y los packs de pago único en 39 $.

Las vistas previas gratuitas pueden incluir marca de agua. Los vídeos exportados con un plan de créditos de pago salen en HD y sin marca de agua, de modo que puedes usarlos directamente en trabajos para clientes, anuncios o contenido para redes.

Plataforma independiente

«MiniMax H3», «MiniMax» y «Hailuo» son marcas de MiniMax y se utilizan aquí únicamente con fines descriptivos. Wowovid es una plataforma independiente que ofrece decenas de modelos de generación de imagen y vídeo, y no está afiliada, respaldada ni patrocinada por MiniMax.

Genera vídeo en Wowovid

La generación de texto a vídeo con MiniMax H3 ya está disponible: escribe un prompt y empieza a generar desde el navegador, sin GPU, sin instalaciones y sin descargar modelos. Exportación en HD y sin marca de agua en los planes de pago.

Ver precios