Accès à la démo 100 % gratuit
Ouvrez le Space de référence intégré et testez le workflow MiniMax H3 disponible sans payer Free Video AI, acheter de crédits ou souscrire un abonnement ici.

Utilisez MiniMax H3 entièrement gratuitement dans la démo intégrée, puis explorez des exemples officiels et un parcours de déploiement open source pour H3-Base. Créez des vidéos multimodales à partir de contextes texte, image, vidéo et audio, avec son stéréo natif et une sortie jusqu'à 2K dans le workflow H3 complet.
Essayez ci-dessous l'interface de référence MiniMax H3 hébergée par la communauté. Free Video AI ne facture ni crédits, ni abonnement, ni frais d'accès pour cette expérience intégrée.
Cette démo est hébergée et exploitée comme un Hugging Face Space externe. Les prompts et références téléversées sont traités par ce service, et non localement par Free Video AI. La disponibilité, les files d'attente, les limites, la modération et le traitement des données sont contrôlés par le fournisseur du Space.
Ouvrir la démo dans un nouvel ongletH3 réunit la compréhension multimodale, la génération et le montage vidéo ainsi que l'audio synchronisé dans un système polyvalent, au lieu de séparer chaque tâche créative dans un modèle différent.
Ouvrez le Space de référence intégré et testez le workflow MiniMax H3 disponible sans payer Free Video AI, acheter de crédits ou souscrire un abonnement ici.
Décrivez les relations entre le texte, les images, les vidéos de référence, l'audio et la cible. H3 est conçu pour interpréter l'ensemble de ces relations plutôt que chaque entrée séparément.
Générez simultanément l'image et le son, notamment les dialogues, les effets d'ambiance et la musique, avec une sortie stéréo native de 32 kHz dans le système H3 documenté.
Les caractéristiques officielles couvrent des vidéos de 4–15 secondes, 24 FPS et les formats paysage, carré, portrait et cinématographique courants.
Le pipeline H3 complet peut régénérer en 2K un résultat de base en 768p tout en réutilisant le contexte multimodal d'origine afin de restituer plus fidèlement les détails fins.
Les développeurs peuvent télécharger les checkpoints FL2VA et Ref2VA de H3-Base, examiner l'implémentation et créer un workflow de génération 768p auto-hébergé.
Passez de l’expérimentation gratuite à une production reproductible grâce à trois endpoints Flaq AI spécialisés dans la génération vidéo à partir de texte, d’images et de références multimodales.
Vous cherchez une alternative à Seedance 2.0 ? MiniMax H3 réunit contrôle multimodal, audio natif, poids ouverts H3-Base et options d’API pour la production dans un seul workflow flexible.
Animez une image source avec des mouvements guidés par prompt, un audio synchronisé et un workflow d’API géré, adapté aux visuels de produits, portraits, publicités et concepts graphiques.
Générez des clips audiovisuels directement à partir de prompts détaillés via un endpoint stable, conçu pour une automatisation créative reproductible et une production vidéo évolutive.
Utilisez des références multimodales pour guider l’identité, le style visuel, le mouvement, la voix et le son lorsqu’une production exige plus de contrôle qu’une génération fondée uniquement sur un prompt.
La disponibilité de l’API, les tarifs, les limites de requêtes et le comportement du modèle sont définis par Flaq AI et peuvent évoluer. Consultez la documentation et les tarifs en vigueur avant toute utilisation en production.
Ces sorties 768p reproductibles proviennent du dépôt GitHub officiel de MiniMax H3 et illustrent trois modes de génération essentiels.
Transformez la description écrite d'une scène en séquence vidéo avec son généré conjointement grâce à la famille de checkpoints FL2VA.
Voir la source officielle sur GitHubGuidez le mouvement et la composition avec zéro, une ou deux images pour générer une vidéo à partir de texte, de la première image, de la dernière image ou des deux images limites.
Voir la source officielle sur GitHubUtilisez ensemble des images de référence, des clips vidéo et de l'audio pris en charge pour contrôler l'identité, le mouvement, le style visuel, la voix et le son.
Voir la source officielle sur GitHubLes vidéos d'exemple sont fournies par MiniMax-AI dans le dépôt MiniMax-H3. Les résultats varient selon le prompt, les références, le checkpoint, les paramètres d'inférence, le matériel et le workflow.
Le système H3 documenté sépare l'interprétation approfondie du contexte, la génération audiovisuelle de base et la régénération haute résolution, tout en conservant le contexte créatif original pendant l'ensemble du workflow.

Le langage sert de pont entre les prompts et les médias mixtes en décrivant les relations entre les sujets, les plans, le mouvement, le son et la sortie visée.
Un système de prétraitement hébergé interprète les instructions multimodales libres et les convertit en une représentation structurée destinée à la génération.
Le modèle de base ouvert prédit conjointement les représentations latentes visuelles et audio à l'aide d'un H3-Omni Transformer polyvalent et produit une sortie audiovisuelle 768p.
Le module final réutilise à la fois le résultat de base et le contexte original pour régénérer les détails en haute résolution, au lieu d'appliquer uniquement une super-résolution classique.
Utilisez un workflow multimodal unique pour explorer des concepts commerciaux, des scènes narratives, le design de marque, des références de mouvement et des idées audiovisuelles synchronisées.
Prototypez des publicités produit, concepts de campagne, visuels de lancement, packshots et annonces sociales avec un meilleur respect des instructions et un meilleur rendu du texte.
Transformez avant la production des descriptions de scènes, images de personnages, références de mouvement et indications sonores en courtes études cinématographiques.
Explorez des identités animées, des concepts de sites produit, des génériques, des affiches animées et des systèmes visuels de marque.
Transférez un mouvement, préservez un sujet, reprenez un style visuel ou utilisez un contexte audio et vidéo pour décrire une transformation ciblée.
Développez des moments de personnages, intros de jeux, courts métrages 3D stylisés, affiches animées et expérimentations visuelles dans diverses directions artistiques.
Testez de courts concepts audiovisuels avec une prise en charge stable et documentée des dialogues dans 11 langues, et d'autres langues à des niveaux de qualité variables.
Commencez par la démo intégrée, explicitez la relation créative entre chaque référence et examinez le résultat audiovisuel complet.
Ouvrez le Space intégré et sélectionnez le workflow disponible basé sur le texte, la première/dernière image ou des références multimodales.
Rédigez un prompt précis et ajoutez les références compatibles. Expliquez quelle image, vidéo, voix, quel mouvement, son ou style doit influencer la cible.
Envoyez la tâche, attendez dans la file hébergée, puis vérifiez le mouvement, l'identité, le texte, les dialogues, les effets sonores, la musique et le respect global des instructions.
Le dépôt officiel fournit des checkpoints FL2VA et Ref2VA ainsi que des guides pour SGLang, vLLM, diffusers et ComfyUI. Commencez par le workflow H3-Base local en 768p et ne passez à l'échelle qu'après avoir validé votre matériel et votre cas d'usage.
hf download MiniMaxAI/MiniMax-H3 \
--include "model_index.json" "FL2VA/*" \
--local-dir MiniMax-H3
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 --ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 --port 30010 \
--model-variant fl2va
Lisez la Community License, les recommandations du dépôt, la taille des checkpoints et les exigences GPU propres à chaque framework avant de télécharger les poids du modèle.
Utilisez FL2VA pour générer à partir de texte et de la première/dernière image, ou Ref2VA si le workflow nécessite des références mixtes d'image, vidéo et audio.
Limitez le téléchargement Hugging Face à une famille de tâches ou laissez diffusers récupérer les composants nécessaires afin de réduire le stockage et le temps de configuration.
Démarrez le framework choisi, reproduisez un cas officiel, comparez la sortie audiovisuelle, puis décidez s'il faut intégrer le workflow 2K hébergé.
Important : les poids ouverts ne rendent pas le calcul GPU gratuit. Consultez la MiniMax H3 Community License avant le déploiement. La version ouverte actuelle inclut H3-Base, tandis que H3-Context-IR et H3-Regenerate-2K sont des composants hébergés utilisés par le workflow 2K officiel complet.
Après avoir généré un clip H3, augmentez localement sa résolution de travail, corrigez son orientation ou découpez-en un moment fort plus court avec le reste des outils.
Générer
Testez la démo multimodale H3 hébergée, regardez les exemples officiels et suivez le parcours de déploiement ouvert de H3-Base.
Ouvrir un outil gratuitAméliorer
Augmentez la résolution vidéo de 2× ou 4× avec un traitement local privé et une amélioration neuronale WebGPU en option.
Ouvrir un outil gratuitMiroir
Retournez une vidéo horizontalement, verticalement ou dans les deux sens avec un aperçu privé et une exportation depuis un navigateur local.
Ouvrir un outil gratuitCouper
Choisissez une heure de début et de fin exacte, prévisualisez la source et exportez un clip ciblé sans le télécharger.
Ouvrir un outil gratuitPoursuivez avec les sources primaires consacrées au lancement, à l'implémentation ouverte, aux checkpoints, aux workflows et à la licence du modèle.
Lisez l'explication de MiniMax sur le contexte multimodal, le son stéréo natif, H3-VAE, l'Omni Transformer et la régénération 2K en contexte.
Ouvrir la ressourceRessource officielleConsultez la structure des checkpoints, les modes d'entrée compatibles, les commandes de déploiement, les cas reproductibles, les techniques de prompt et les limites actuelles de l'open source.
Ouvrir la ressourceRessource officielleAvant le déploiement, vérifiez la version officielle sur Hugging Face, les fichiers du modèle, la Community License et les instructions de chargement propres à chaque framework.
Ouvrir la ressource