

Modèle nouvelle génération MiniMax : sortie et aperçu de l'API
MiniMax Hailuo 2.3 crée des clips cinématographiques de 6-10s depuis texte ou image. Flux API soumettre-vérifier-télécharger et tarifs USD/seconde sur APIMart.
Si vous voulez tester MiniMax Hailuo 2.3 dès aujourd'hui, voici la réponse courte : il prend en charge le texte-vers-vidéo et l'image-vers-vidéo sur le modèle Standard, image-vers-vidéo uniquement sur Fast, et il produit des clips de 6 ou 10 secondes en 768p ou 1080p. Les tarifs démarrent à environ $0.28 par clip de 6 secondes sur Standard et $0.19 sur Fast, avec un flux API simple soumettre → vérifier → télécharger.
Si je résume l'essentiel, ce lancement se résume à quatre points :
- Ce que vous pouvez faire dès maintenant : texte-vers-vidéo et image-vers-vidéo
- Ce que cela coûte : environ $0.0248 à $0.072 par seconde sur APIMart, selon le modèle et la résolution
- Comment s'y connecter :
POST /video_generation, puis vérifiez le statut avecGET /query/video_generation - Pour qui c'est le plus adapté : les équipes qui créent des publicités courtes, des clips produits, des vidéos explicatives et des variantes de test
Il existe aussi des limites claires. Fast ne prend pas en charge le texte-vers-vidéo. Les images d'entrée doivent faire moins de 20 MB, avoir un côté court supérieur à 300 px, et rester dans la plage de ratio d'aspect autorisée. La sortie Standard prend généralement environ 30 à 90 secondes par clip, ce qui convient donc mieux aux tâches vidéo courtes qu'au montage long format.

Tutoriel API Minimax Hailuo : clonage de voix, génération de vidéo IA et de musique + automatisation Make.com
Comparaison rapide
| Modèle | Type d'entrée | Durée de sortie | Résolution | Coût de départ | Idéal pour |
|---|---|---|---|---|---|
| MiniMax-Hailuo-2.3 | Texte ou image | 6s ou 10s | 768p, 1080p | $0.28 par clip de 6s | Clips finaux, publicités, vidéos produits |
| MiniMax-Hailuo-2.3-Fast | Image uniquement | 6s ou 10s | 768p, 1080p | $0.19 par clip de 6s | Brouillons, essais, production par lots |
Ce qui m'a le plus marqué, c'est ceci : le modèle est simple à essayer, les tarifs sont faciles à estimer, et l'API est simple d'utilisation. Donc si vous vous demandez si Hailuo 2.3 convient à votre flux de travail, la question principale n'est pas « Puis-je y accéder ? » mais « Est-ce que je veux une meilleure qualité de sortie ou un coût par clip plus bas ? »
2. Ce que MiniMax Hailuo 2.3 propose au lancement
MiniMax Hailuo 2.3 est le modèle vidéo courte durée de MiniMax pour des clips cinématographiques. Il est conçu pour des mouvements fluides, des personnages expressifs, et des prompts qui restent fidèles à ce que vous avez demandé.
2.1 Capacités principales et flux de travail pris en charge
Au niveau du modèle, le choix principal se situe entre Standard et Fast.
Standard Hailuo 2.3 prend en charge à la fois le texte-vers-vidéo et l'image-vers-vidéo. Il offre une meilleure cohérence des mouvements, un rendu plus réaliste, et un contrôle de style plus précis. Il faut aussi généralement 30 à 90 secondes par clip.[2][5][7]
Fast est réservé à l'image-vers-vidéo. Il mise sur la vitesse et un coût plus bas, mais vous perdez un peu en qualité d'image en contrepartie.[3]
La lecture se situe autour de 24 fps cinématographiques, mais il faut voir cela comme un objectif général plutôt qu'une spécification figée.[3][7][8]
En pratique, ce choix a un impact immédiat sur trois éléments :
- combien de temps chaque clip peut prendre
- à quel point le rendu final est soigné
- à quelle vitesse une équipe peut passer du prompt à une ébauche terminée
2.2 Améliorations du mouvement, des personnages et du style
La plus grande avancée par rapport à Hailuo 02 se situe dans le mouvement des personnages et l'émotion.
Hailuo 2.3 utilise une simulation des muscles faciaux pour gérer les petites expressions comme le mouvement des sourcils, les changements de focalisation du regard, et les subtiles inclinaisons de la tête. Il utilise aussi Global Identity VAE pour garder les visages, les cheveux et les vêtements plus stables d'une image à l'autre.[1][4][9]
Le mouvement de caméra est aussi plus marqué. Vous pouvez utiliser des commandes entre crochets comme [Pan left], [Zoom in], et [Tracking shot], et le modèle prend en charge jusqu'à trois de ces commandes dans un même prompt. En plus de cela, Hailuo 2.3 ajoute un contrôle de style supplémentaire avec des options de rendu pour les esthétiques anime, peinture à l'encre, et jeu vidéo en CG.[1][4][6][9]
Cela signifie que les équipes peuvent être plus intentionnelles sur le ressenti d'un clip. Un gros plan sur un personnage, un lent zoom avant, ou un plan produit stylisé relève moins du hasard et davantage d'un travail de rédaction de prompt.
2.3 Où Hailuo 2.3 est le plus pertinent
Hailuo 2.3 est surtout adapté aux clips courts et percutants. Si vous avez besoin d'une pièce plus longue, il est plus judicieux de générer les plans ici et de les assembler dans un logiciel de montage standard.
| Type de flux de travail | Points forts | Limites | Cas d'usage idéal |
|---|---|---|---|
| Texte-vers-vidéo | Forte fidélité au prompt, rendu stylisé | Modèle Standard uniquement | Clips pour réseaux sociaux, bandes-annonces stylisées |
| Image-vers-vidéo | Cohérence des personnages, détails stables de l'image source | Nécessite une image source de haute qualité | Rotations produit, publicités e-commerce |
| Fast (I2V uniquement) | Délai plus rapide, coût plus bas | Pas de prise en charge du texte-vers-vidéo ; fidélité réduite | Brouillons par lots, tests A/B |
Utilisez Standard Hailuo 2.3 lorsque la qualité de sortie, la direction artistique, et le détail du prompt comptent le plus, comme pour des publicités phares, des bandes-annonces, ou des moments centrés sur les personnages. Passez à Fast lorsque la vitesse et le volume comptent davantage, en particulier pour les tests de variantes ou la production sociale par lots.
Ces différences au niveau du lancement se répercutent directement sur la configuration de l'API, les contraintes de sortie, et les décisions d'intégration dans la section suivante.
3. Aperçu de l'API : points de terminaison, entrées, sorties et accès
3.1 Structure des requêtes et des réponses
Hailuo 2.3 suit un flux simple soumettre → vérifier → télécharger. Vous envoyez une requête POST /video_generation, vous recevez en retour un task_id, et vous attendez pendant que la vidéo est traitée. Ensuite, vous vérifiez le statut. Une fois la tâche terminée, l'API renvoie un lien de téléchargement. Ces champs correspondent aux deux parcours de lancement : texte-vers-vidéo et image-vers-vidéo.
Pour le texte-vers-vidéo, la requête nécessite un champ prompt. Ce prompt peut aller jusqu'à 2,000 caractères. Pour l'image-vers-vidéo, vous envoyez aussi first_frame_image comme image de référence. L'image peut être transmise sous forme d'URL publique ou de chaîne Base64. Les fichiers doivent rester sous 20 MB, le côté court doit dépasser 300 px, et le ratio d'aspect doit se situer entre 2:5 et 5:2.
Les principaux paramètres sont :
durationpour la durée du clip, avec des valeurs courantes de 6 ou 10 secondesresolutiondéfinie sur"768P"ou"1080P"prompt_optimizeren tant qu'indicateur optionnel
| Paramètre | Type | Requis | Remarques |
|---|---|---|---|
model | string | Oui | MiniMax-Hailuo-2.3 ou MiniMax-Hailuo-2.3-Fast |
prompt | string | Oui | Max 2,000 caractères ; prend en charge les tags caméra [bracketed] |
first_frame_image | string | I2V uniquement | URL publique ou Base64 ; moins de 20 MB |
duration | integer | Non | Valeurs courantes : 6 ou 10 secondes |
resolution | string | Non | "768P" ou "1080P" |
prompt_optimizer | boolean | Non | Indicateur optionnel de raffinement du prompt |
callback_url | string | Non | Webhook pour les notifications asynchrones de fin de tâche |
Après soumission, GET /query/video_generation renvoie un statut comme "processing", "success", ou "failed". Si la tâche réussit, la réponse inclut l'URL de la vidéo ou une référence de fichier. Si elle échoue, vous obtenez un error_code et un error_message.
Vérifier le statut toutes les 15 à 30 secondes est un rythme raisonnable. Le faire trop souvent ne fait que créer du bruit. Autre point : les liens de sortie sur APIMart restent actifs pendant 72 heures, donc il est judicieux de déplacer les fichiers finis vers votre propre stockage peu après la génération.
3.2 Accès direct et accès unifié à l'API APIMart

Les équipes peuvent appeler directement les points de terminaison natifs de MiniMax avec un jeton Bearer dans l'en-tête :
Authorization: Bearer YOUR_API_KEY
Cette voie vous permet de rester au plus proche de la documentation officielle de MiniMax et de son calendrier de sortie.
APIMart propose une autre voie pour les équipes qui veulent un seul endroit pour gérer un travail multimodal. Son API unifiée vous donne une seule clé API et un seul solde en USD pour les appels texte, image, et vidéo. Elle utilise aussi un style de requête compatible OpenAI, ce qui peut simplifier la configuration si votre stack parle déjà ce format. Si vous connectez plusieurs types de modèles dans un seul pipeline, ce genre de configuration peut faire gagner du temps côté client.
3.3 Tarification et facturation en dollars américains
La tarification est facturée par seconde générée en dollars américains. APIMart affiche des tarifs avec environ 20% de réduction par rapport aux tarifs officiels de MiniMax.
| Variante du modèle | Résolution | Prix APIMart (USD/s) | Prix officiel (USD/s) |
|---|---|---|---|
| MiniMax-Hailuo-2.3 | 768P | ~$0.0488 | ~$0.061 |
| MiniMax-Hailuo-2.3 | 1080P | ~$0.072 | ~$0.090 |
| MiniMax-Hailuo-2.3-Fast | 768P | ~$0.0248 | ~$0.031 |
| MiniMax-Hailuo-2.3-Fast | 1080P | ~$0.0424 | ~$0.053 |
Une façon pratique de gérer les coûts est de tester en 768P et de réserver le 1080P pour les rendus finaux. Cela garde les premières itérations moins coûteuses tout en laissant de la place pour une sortie de meilleure qualité plus tard.
4. Modèles d'intégration pour les flux de travail multimodaux
4.1 Modèles d'implémentation SDK Python et REST
Une fois le format de vos requêtes et réponses défini, l'étape suivante consiste à intégrer Hailuo 2.3 dans un pipeline que vous pouvez exécuter encore et encore. La façon la plus simple d'y penser : Hailuo 2.3 est la couche de rendu au sein d'un système plus large. Gardez votre clé API dans une variable d'environnement, utilisez l'authentification Bearer sur chaque requête, et utilisez requests pour les appels de génération vidéo tout en vous appuyant sur des SDK pour l'orchestration des prompts.
import os
import time
import requests
API_KEY = os.environ["APIMART_API_KEY"]
BASE_URL = "https://api.apimart.ai/v1"
headers = {
"Authorization": f"Bearer {API_KEY}",
"Content-Type": "application/json",
}
payload = {
"model": "MiniMax-Hailuo-2.3",
"prompt": "[Slow zoom in] A ceramic coffee mug on a sunlit kitchen counter, steam rising, photorealistic",
"duration": 6,
"resolution": "768P",
"prompt_optimizer": True,
}
response = requests.post(f"{BASE_URL}/video_generation", json=payload, headers=headers)
task_id = response.json()["task_id"]
while True:
status_resp = requests.get(
f"{BASE_URL}/query/video_generation",
params={"task_id": task_id},
headers=headers,
)
result = status_resp.json()
if result["status"] == "success":
file_id = result.get("file_id")
video_url = result.get("video_url")
break
if result["status"] == "failed":
raise Exception(result.get("error_message", "Video generation failed"))
time.sleep(20)
Si le polling vous semble contraignant, ajoutez un callback_url et laissez le système vous notifier quand le rendu est terminé. Ensuite, transmettez le file_id renvoyé ou l'URL de téléchargement à votre étape de stockage ou de publication.
Une fois le flux API en place, la tâche suivante consiste à définir des réglages par défaut qui gardent les dépenses et la qualité de sortie sous contrôle.
4.2 Conceptions de pipeline pour les équipes contenu et produit
La plupart des équipes contenu et produit peuvent se contenter de trois modèles de pipeline. Ils correspondent aux principaux cas d'usage de l'article : texte-vers-vidéo, image-vers-vidéo, et assemblage audio post-rendu.[13][10][12][20][21]
Pour un flux de travail de clip publicitaire (texte → vidéo), un LLM construit un prompt structuré avec un décor, un sujet, une description du mouvement, et une direction de caméra entre crochets. Par exemple :
[Pan left] A pair of running shoes on a track, golden hour lighting, cinematic
Ce prompt est ensuite envoyé dans une requête texte-vers-vidéo de Hailuo 2.3. Cette configuration fonctionne bien pour des clips courts de 6 secondes.[16]
Pour un flux de travail de démo produit (image → vidéo), téléversez une photo produit nette et transmettez-la en tant que first_frame_image à Hailuo 2.3. Cela garde le produit visuellement fidèle tout en ajoutant un mouvement qu'une image statique ne peut pas montrer.[13][10][12]
Pour un flux de travail de synchronisation de narration (vidéo + audio), générez d'abord la vidéo. Ajoutez ensuite la voix off ou la musique en post-production à l'aide d'un modèle de parole ou de musique, et assemblez le tout dans votre pipeline de publication.
Si vous avez besoin de séquences de plus de 10 secondes, enchaînez les clips. Prenez la dernière image d'une génération et transmettez-la à la requête suivante en tant que first_frame_image. C'est une transmission simple, mais elle aide à garder l'apparence des personnages et la continuité de la scène stables entre les segments.[10][12]
4.3 Paramètres à standardiser avant le déploiement
Il est utile de traiter cela comme une politique de déploiement. Fixer une courte liste de réglages par défaut avant de passer à l'échelle garde la sortie stable, le coût plus facile à planifier, et l'usage de l'équipe aligné.[16][17][18][19]
Une courte checklist suffit généralement :
- Modèle de prompt - Utilisez une structure commune : décor, sujet, mouvement, direction de caméra, et tag de style comme
"cinematic","product demo", ou"user-generated feel". Gardez une bibliothèque de prompts qui ont déjà fonctionné pour que les équipes les réutilisent au lieu de repartir de zéro.[11][14][15] - Durée - Adaptez la longueur du clip à la tâche. Utilisez des clips de 6 secondes pour les aperçus et le contenu social. Réservez les clips de 10 secondes aux campagnes qui ont besoin de ce temps supplémentaire.
- Résolution - Définissez
768Pcomme réglage par défaut pour les brouillons et les itérations. Utilisez1080Puniquement pour les rendus finaux. - Règles pour l'image de première image - Précisez où se trouvent les images source approuvées, assurez-vous que les fichiers restent sous 20 MB avec un côté court supérieur à 300 px, et définissez ce qui constitue une image de référence solide pour le travail image-vers-vidéo.[10][17][18][15]
- Sélection du modèle - Utilisez
MiniMax-Hailuo-2.3-Fastpour les exécutions par lots à fort volume. RéservezMiniMax-Hailuo-2.3(Standard) pour une sortie finale à plus haute fidélité.[19]
Ces réglages par défaut façonnent le profil de coût et le choix du modèle abordés ensuite.
5. Coût, sélection du modèle et points clés à retenir
5.1 Estimation des coûts pour des scénarios de production courants aux États-Unis
Une fois votre configuration de lancement et votre flux API en place, la prochaine chose à définir précisément est le coût de production.
Un clip 768p de 6 secondes sur Hailuo 2.3 coûte environ $0.29, et un clip de 10 secondes coûte environ $0.49. Sur Hailuo 2.3 Fast, ces mêmes clips reviennent à environ $0.15 et $0.25.
Pour une marque e-commerce américaine qui produit 80 clips produits Standard de 10 secondes par mois en 768p, le coût total de génération est d'environ $39.00.
Une façon simple d'y penser :
- Utilisez Hailuo 2.3 Fast pour les brouillons, les variantes A/B, et les tests par lots
- Utilisez Hailuo 2.3 pour les pages produits en ligne, les publicités sociales payantes, et les aperçus sur les app stores
Le prix compte, bien sûr. Mais cela ne devrait pas être le seul facteur qui guide le choix. Ce que vous avez besoin que la sortie fasse compte davantage.
5.2 Choisir MiniMax Hailuo 2.3 dans le catalogue d'APIMart
Le choix se résume à trois éléments : la qualité de sortie finale, la vitesse des brouillons, ou le volume par lots.
| Modèle | Points forts principaux | Profil de sortie pris en charge | Prix APIMart (USD/s) | Meilleurs cas d'usage aux États-Unis |
|---|---|---|---|---|
| MiniMax Hailuo 2.3 | Qualité de mouvement, fidélité des personnages, contrôle du style | 768p : jusqu'à 10 secondes ; 1080p : jusqu'à 6 secondes | $0.0488 (768p) / $0.072 (1080p) | Clips de marque, démos produits, publicité sociale payante |
| MiniMax Hailuo 2.3 Fast | Vitesse, efficacité de coût par lots | 768p : jusqu'à 10 secondes ; 1080p : jusqu'à 6 secondes | $0.0248 (768p) / $0.0424 (1080p) | Brouillons, variantes créatives, génération en masse |
Le point positif, c'est qu'une seule intégration couvre les deux niveaux. Donc si votre équipe veut passer du mode brouillon au mode sortie finale, vous pouvez le faire sans changer la logique de requête.
5.3 Points clés à retenir
Si vous choisissez entre les deux niveaux, la règle est assez simple : Hailuo 2.3 est conçu pour la vidéo courte durée, en particulier les clips brefs où la cohérence du mouvement et l'adéquation à la marque comptent le plus.
Avant de passer à l'échelle, menez un pilote rigoureux. Générez un lot contrôlé de clips à 6 secondes et 10 secondes. Passez ensuite en revue la qualité du mouvement et l'adéquation à la marque avec votre équipe créative, assurez-vous que le délai fonctionne pour votre flux de production, et confirmez que la vue de facturation d'APIMart correspond aux secondes utilisées et au coût total en USD.
FAQ
Par quel modèle devrais-je commencer ?
Pour la plupart des utilisateurs, Hailuo 03 est le meilleur point de départ. C'est le modèle le plus récent, et il fonctionne le mieux pour des flux de travail multimodaux complexes comme le texte-vers-vidéo, l'image-vers-vidéo, l'audio synchronisé, et des contrôles de caméra précis.
Si vous avez besoin d'un rendu artistique stylisé, de mouvement humain, ou de micro-expressions, Hailuo 2.3 est un bon choix. Si votre travail s'appuie davantage sur un mouvement à forte composante physique et des déplacements très réalistes, Hailuo 02 est aussi un choix solide.
Vous pouvez accéder à tous ces modèles via l'API unifiée APIMart en définissant le paramètre model.
Comment puis-je créer des clips de plus de 10 secondes ?
Pour des vidéos de plus de 5 secondes, utilisez une résolution plus basse comme 768p ou 512p. 1080p ne prend en charge que des clips allant jusqu'à 5 secondes, ce qui ne fonctionnera donc pas pour des sorties plus longues.
Besoin de dépasser la limite de clip de 10 secondes de l'API ? Générez quelques clips et assemblez-les dans votre backend. Il est préférable de gérer cela de manière asynchrone, soit en vérifiant régulièrement le statut de la tâche, soit en utilisant une URL de callback pour recevoir une notification de fin.
Qu'est-ce qui cause généralement l'échec d'une requête de génération ?
Une requête de génération peut échouer pour plusieurs raisons courantes :
- Paramètres invalides
- Clés API invalides
- Solde du compte insuffisant
- Limites de débit (429)
- Erreurs internes du serveur (5xx)
Les requêtes basées sur des images peuvent aussi échouer lorsque les fichiers d'entrée dépassent 20 MB ou que le ratio d'aspect sort de la plage 2:5 à 5:2.
Si le statut d'une tâche passe à failed, consultez le champ error_message pour connaître la raison exacte.
Choisissez le modèle qui vous convient dans le marketplace
Essayez les modèles de chat, image et vidéo sur le marketplace APIMart, puis découvrez rapidement leurs capacités avec une API unifiée.
