Free credits for new users
Modèle
0/7000
4s
Solde:0
100%
MiniMax H3

Exemples

Configurez les paramètres puis cliquez sur Générer

Cinematic Motion

A cinematic shot with smooth camera movement and realistic lighting.

Dynamic Product Scene

A product-focused video with polished motion and detailed textures.

Creative Story Beat

A short visual story with expressive motion and atmospheric composition.

Pro Narrative Shot

A refined cinematic sequence with stable framing and rich scene detail.

Audio-Ready Scene

A polished video scene designed for expressive motion and audio support.

Studio Composition

A controlled scene with deliberate movement and professional lighting.

MiniMax H3 — le modèle vidéo multimodal, expliqué

MiniMax H3 est un modèle universel et multimodal de génération vidéo signé MiniMax, lancé le 31 juillet 2026 via l'API MiniMax et l'application Hailuo, où il porte aussi le nom de Hailuo 3.0. Il accepte du texte, des images, des clips vidéo et de l'audio en entrée, et produit une vidéo avec audio stéréo natif : jusqu'à 2K de résolution, 24 ips et de 4 à 15 secondes par clip.

Tout ce qu'il faut savoir sur MiniMax H3, au même endroit.

MiniMax H3 dans ComfyUI

La génération texte vers vidéo avec MiniMax H3 est désormais disponible dans le générateur ci-dessus : rédigez une consigne, choisissez 768P ou 2K, une durée de 4 à 15 secondes et l’un des six formats d’image. La génération image vers vidéo et la référence multimodale R2V ne sont pas encore dans Studio ; l’onglet image vers vidéo fonctionne pour l’instant avec Hailuo 02.

Qu'est-ce que MiniMax H3

Qu'est-ce que MiniMax H3 ?

MiniMax H3 est un modèle universel et multimodal de génération vidéo développé par MiniMax. Contrairement aux modèles qui n'acceptent qu'une consigne écrite ou qu'une seule image, MiniMax H3 unifie les entrées texte, image, vidéo et audio au sein d'un même modèle, et renvoie un clip finalisé qui embarque déjà sa propre bande-son stéréo. L'application grand public Hailuo propose le même modèle sous les noms Hailuo 3.0, Hailuo H3 et Hailuo 03 : tous désignent MiniMax H3.

Entrée multimodale unifiée

Texte, images, clips vidéo et audio passent tous par le même modèle. C'est la différence de fond avec les outils limités à l'image vers vidéo : une même génération peut être conditionnée simultanément par une consigne écrite, des images de référence, des séquences de référence et de l'audio de référence.

Audio stéréo natif en sortie

MiniMax H3 génère de la vidéo avec un audio stéréo produit par le modèle lui-même, sans passer par une étape sonore séparée ensuite. Le doublage est pris en charge dans 11 langues.

2K, 24 ips, 4 à 15 secondes

La sortie monte jusqu'à 2K de résolution en 24 ips, avec une durée réglable en secondes entières, de 4 à 15 secondes. Le modèle compte environ 33 milliards de paramètres.

Lignée du modèle

De Hailuo 2.3 à MiniMax H3

MiniMax H3 est la génération actuelle de la gamme de modèles vidéo de MiniMax, après Hailuo 2.3. L'écart entre les deux ne tient pas qu'à la qualité : H3 change ce que le modèle accepte en entrée et ce qu'il produit en sortie.

Hailuo 2.3

Version précédente

La génération précédente de la gamme de modèles vidéo Hailuo. Elle gérait la génération texte vers vidéo et image vers vidéo, et reste la version de référence dans la plupart des tutoriels et workflows Hailuo publiés avant mi-2026.

MiniMax H3

Version actuelle

La version actuelle, lancée le 31 juillet 2026 sur l'API MiniMax et l'application Hailuo. H3 unifie les entrées texte, image, vidéo et audio dans un seul modèle, produit un audio stéréo natif et atteint 2K en 24 ips avec des clips de 4 à 15 secondes. Les poids ouverts de H3-Base ont suivi le 3 août 2026.

Modes de génération

Les trois modes de génération de MiniMax H3

MiniMax H3 propose trois façons distinctes de piloter une génération. La troisième, R2V, est celle où la conception multimodale devient vraiment visible : c'est le mode qui n'a pas d'équivalent direct dans les modèles vidéo à entrée unique.

T2V

Texte vers vidéo

Décrivez le plan avec des mots et MiniMax H3 génère le clip : sujet, mouvement de caméra et décor, ainsi que la piste audio stéréo native. Aucune image de départ n'est nécessaire.

Générer avec MiniMax H3
I2V

Image vers vidéo et première–dernière image

Partez d'une seule image pour l'animer, ou fournissez à la fois une première et une dernière image pour que MiniMax H3 génère la transition entre les deux. Pratique lorsque le clip doit se terminer sur une image précise.

Bientôt dans Studio
R2V — Référence multimodale

Référence vers vidéo

Conditionnez une même génération avec jusqu'à 9 images de référence, jusqu'à 3 clips vidéo de référence (de 2 à 15 secondes chacun, pour un total de 15 secondes maximum) et jusqu'à 3 clips audio de référence. C'est ainsi que MiniMax H3 transpose un personnage, un style, un mouvement ou une voix issus de vos propres éléments dans un nouveau plan.

Bientôt dans Studio
Tarifs

Tarifs de MiniMax H3 sur Wowovid

Wowovid fonctionne avec un solde de crédits unique, valable sur tous les modèles vidéo et image de la plateforme : aucun abonnement MiniMax distinct à souscrire, aucun forfait par modèle à gérer. Un clip MiniMax H3 texte vers vidéo de 4 secondes coûte 93 crédits en 768P ou 151 en 2K, et le total exact s'affiche avant la génération. Les formules annuelles démarrent à 10 $ par mois ; les packs ponctuels à 39 $.

Comparatifs

MiniMax H3 face aux autres modèles vidéo

Les deux comparaisons les plus recherchées au moment d'évaluer MiniMax H3.

MiniMax H3 vs Kling AI

Kling AI reste la valeur sûre pour une génération texte vers vidéo et image vers vidéo aboutie, avec un mouvement cohérent sur le plan physique. Les atouts propres à MiniMax H3 sont son entrée multimodale unifiée — images, vidéos et audio de référence dans une même génération — et l'audio stéréo natif présent dans le résultat.

MiniMax H3 vs Seedance 2.5

Les deux sont des modèles vidéo de génération actuelle que les créateurs comparent côte à côte. Ce qui distingue MiniMax H3, c'est le conditionnement multimodal par référence (R2V), l'audio stéréo natif et un modèle de base à poids ouverts ; Seedance 2.5 est un modèle hébergé, avec un autre ensemble de fonctionnalités.

FAQ

MiniMax H3 — questions fréquentes

Les questions courantes sur MiniMax H3, ses capacités, son statut open source et sa comparaison avec les autres modèles vidéo.

MiniMax H3 est un modèle universel et multimodal de génération vidéo développé par MiniMax. Il accepte de façon unifiée des entrées texte, image, vidéo et audio, et produit une vidéo avec audio stéréo natif, jusqu'à 2K de résolution et 24 ips, avec des durées de 4 à 15 secondes par pas d'une seconde. Il gère le doublage dans 11 langues et compte environ 33 milliards de paramètres.

Oui. « MiniMax H3 » est le nom officiel du modèle. L'application grand public Hailuo et une grande partie de la communauté désignent le même modèle par Hailuo 3.0, Hailuo H3 ou Hailuo 03. Il s'agit du même modèle, lancé le 31 juillet 2026 sur l'API MiniMax et l'application Hailuo.

En partie, et la nuance est importante. MiniMax a publié les poids ouverts de H3-Base le 3 août 2026, y compris les checkpoints FL2VA et Ref2VA, sous la MiniMax H3 Community License. Deux composants restent toutefois en dehors de cette publication : H3-Context-IR, le système de prétraitement et d'enrichissement des consignes, et H3-Regenerate-2K, le module d'agrandissement en 2K. Tous deux demeurent réservés au service hébergé : un déploiement local des poids ouverts ne reproduit donc pas l'intégralité du pipeline. Voir notre page MiniMax H3 dans ComfyUI pour le détail technique.

T2V (texte vers vidéo) génère à partir d'une simple consigne écrite. I2V (image vers vidéo) anime une image unique, ou génère une transition lorsque vous fournissez à la fois une première et une dernière image. R2V (référence vers vidéo) est le mode multimodal : il accepte jusqu'à 9 images de référence, jusqu'à 3 clips vidéo de référence de 2 à 15 secondes chacun sans dépasser 15 secondes au total, et jusqu'à 3 clips audio de référence au sein d'une même génération.

Oui. La génération texte vers vidéo avec MiniMax H3 est active dans le générateur de Wowovid Studio : rédigez une consigne, choisissez 768P ou 2K, réglez une durée comprise entre 4 et 15 secondes et sélectionnez l’un des six formats d’image, du 21:9 au 9:16. La génération image vers vidéo et la référence multimodale R2V ne sont pas encore disponibles dans Studio : l’onglet image vers vidéo s’appuie pour l’instant sur le modèle précédent, Hailuo 02.

Kling AI est un choix bien établi pour le mouvement réaliste et l'image vers vidéo cohérente physiquement ; c'est le modèle vers lequel Wowovid oriente aujourd'hui la majorité des générations vidéo. MiniMax H3 se distingue lorsque vous avez besoin d'un conditionnement multimodal par référence — transposer un personnage, un style, un mouvement ou une voix depuis vos propres images, clips et fichiers audio vers un nouveau plan — et lorsque vous voulez un résultat livré avec son audio stéréo plutôt qu'ajouté après coup.

Les deux appartiennent à la génération actuelle des modèles vidéo par IA. Ce qui distingue MiniMax H3 : son mode de référence multimodale R2V, sa sortie audio stéréo native avec doublage dans 11 langues, et le fait que les poids de son modèle de base aient été publiés ouvertement. Seedance 2.5 est un modèle hébergé, doté de ses propres fonctionnalités et sans publication de poids ouverts.

Pas sur Wowovid. Comme les poids ouverts existent, MiniMax H3 peut tourner en local, mais cela suppose un GPU performant, des dizaines de gigaoctets de téléchargements et un environnement ComfyUI fonctionnel. Wowovid est une plateforme hébergée : la génération s'exécute sur notre infrastructure et il vous suffit d'un navigateur. Si vous vous renseignez précisément sur le déploiement local, notre page MiniMax H3 dans ComfyUI couvre les besoins matériels et les versions quantifiées.

Wowovid utilise un solde de crédits unique partagé par tous les modèles, sans abonnement MiniMax H3 séparé. Un clip de 4 secondes coûte 93 crédits en 768P ou 151 en 2K, et le générateur affiche le total exact avant l'envoi. Les forfaits annuels débutent à 10 $/mois, les mensuels à 29 $/mois et les packs ponctuels à 39 $.

Les aperçus gratuits peuvent comporter un filigrane. Les vidéos exportées avec une formule de crédits payante sortent en HD et sans filigrane : vous pouvez les utiliser directement pour des travaux clients, des publicités ou du contenu social.

Plateforme indépendante

« MiniMax H3 », « MiniMax » et « Hailuo » sont des marques de MiniMax, utilisées ici à des fins purement descriptives. Wowovid est une plateforme indépendante proposant des dizaines de modèles de génération d'images et de vidéos ; elle n'est ni affiliée à MiniMax, ni approuvée ou sponsorisée par MiniMax.

Générez des vidéos sur Wowovid

La génération texte vers vidéo avec MiniMax H3 est disponible : rédigez une consigne et lancez la génération depuis votre navigateur, sans GPU, sans installation et sans téléchargement de modèles. Export HD sans filigrane sur les formules payantes.

Voir les tarifs