APIMart
APIMart

Modelo de nueva generación de MiniMax: lanzamiento y vista previa de la API

MiniMax Hailuo 2.3 genera clips cinematográficos de 6-10s desde texto o imágenes. Conoce funciones, el flujo de API y el precio en USD por segundo en APIMart.

Tutorial

Si quieres probar MiniMax Hailuo 2.3 hoy mismo, aquí tienes la respuesta corta: admite texto a video e imagen a video en el modelo Standard, solo imagen a video en Fast, y genera clips de 6 o 10 segundos en 768p o 1080p. Los precios parten de aproximadamente $0.28 por clip de 6 segundos en Standard y $0.19 en Fast, con un flujo de API simple de enviar → consultar → descargar.

Si lo reduzco a lo más importante, este lanzamiento se trata de cuatro cosas:

  • Qué puedes hacer ahora: texto a video e imagen a video
  • Cuánto cuesta: entre $0.0248 y $0.072 por segundo en APIMart, según el modelo y la resolución
  • Cómo conectarlo: POST /video_generation, y luego verifica el estado con GET /query/video_generation
  • Para quién es ideal: equipos que crean anuncios cortos, clips de producto, explicativos y variantes de prueba

También hay algunos límites claros. Fast no admite texto a video. Las imágenes de entrada deben pesar menos de 20 MB, tener el lado corto por encima de 300 px y mantenerse dentro del rango de relación de aspecto permitido. El modelo Standard suele tardar entre 30 y 90 segundos por clip, por lo que es mejor para trabajos de video cortos que para edición de formato largo.

APIMart
MiniMax Hailuo 2.3 frente a Fast: precios, funciones y casos de uso

Tutorial de la API de Minimax Hailuo: clonación de voz, generación de video y música con IA + automatización con Make.com

Comparación rápida

ModeloTipo de entradaDuración de salidaResoluciónCosto inicialIdeal para
MiniMax-Hailuo-2.3Texto o imagen6s o 10s768p, 1080p$0.28 por clip de 6sClips finales, anuncios, videos de producto
MiniMax-Hailuo-2.3-FastSolo imagen6s o 10s768p, 1080p$0.19 por clip de 6sBorradores, pruebas, producción por lotes

Lo que más me llamó la atención es esto: el modelo es fácil de probar, el precio es fácil de estimar y la API es sencilla. Así que si estás evaluando si Hailuo 2.3 encaja en tu flujo de trabajo, la pregunta principal no es "¿Puedo acceder a él?" sino "¿Quiero mejor calidad de salida o menor costo por clip?"

2. Qué ofrece MiniMax Hailuo 2.3 en su lanzamiento

MiniMax Hailuo 2.3 es el modelo de video de formato corto de MiniMax para clips cinematográficos. Está diseñado para movimiento fluido, personajes expresivos y prompts que se ajustan de cerca a lo que pediste.

2.1 Capacidades principales y flujos de trabajo admitidos

A nivel de modelo, la principal elección es Standard frente a Fast.

Standard Hailuo 2.3 admite tanto texto a video como imagen a video. Ofrece mejor consistencia de movimiento, resultados más realistas y un control de estilo más preciso. También suele tardar entre 30 y 90 segundos por clip.[2][5][7]

Fast es solo imagen a video. Se enfoca en la velocidad y el menor costo, pero a cambio se pierde algo de calidad de imagen.[3]

La reproducción se sitúa alrededor de un cinematográfico 24 fps, pero esto debe tratarse como un objetivo general, no como una especificación fija.[3][7][8]

En la práctica, esta elección afecta de inmediato tres cosas:

  • cuánto puede tardar cada clip
  • qué tan pulido se ve el resultado
  • qué tan rápido puede pasar un equipo del prompt al borrador terminado

2.2 Mejoras en movimiento, personajes y estilo

El mayor salto respecto a Hailuo 02 se nota en el movimiento y la emoción de los personajes.

Hailuo 2.3 utiliza simulación de músculos faciales para manejar expresiones pequeñas como el movimiento de las cejas, los cambios en el enfoque de la mirada y las sutiles inclinaciones de cabeza. También usa Global Identity VAE para mantener los rostros, el cabello y la ropa más estables entre fotogramas.[1][4][9]

El movimiento de cámara también es más sólido. Puedes usar comandos entre corchetes como [Pan left], [Zoom in] y [Tracking shot], y el modelo admite hasta tres de estos comandos en un mismo prompt. Además, Hailuo 2.3 suma más control de estilo con opciones de renderizado para estéticas de anime, pintura a tinta y CG de videojuego.[1][4][6][9]

Esto significa que los equipos pueden ser más deliberados sobre cómo se siente un clip. Un primer plano de personaje, un acercamiento lento o una toma de producto estilizada es menos un juego de adivinanzas y más una tarea de redacción de prompts.

2.3 Dónde encaja mejor Hailuo 2.3

Hailuo 2.3 funciona mejor para clips cortos y con impacto. Si necesitas una pieza más larga, tiene más sentido generar las tomas aquí y unirlas en un editor estándar.

Tipo de flujo de trabajoFortalezasLímitesCaso de uso ideal
Texto a videoFuerte adherencia al prompt, resultado estilizadoSolo modelo StandardClips para redes sociales, trailers estilizados
Imagen a videoConsistencia de personajes, detalles estables de la imagen de origenRequiere una imagen de origen de alta calidadGiros de producto, anuncios de e-commerce
Fast (solo I2V)Entrega más rápida, menor costoSin soporte para texto a video; fidelidad reducidaBorradores por lotes, pruebas A/B

Usa Standard Hailuo 2.3 cuando la calidad de salida, la dirección de estilo y el detalle del prompt sean lo más importante, como en anuncios principales, trailers o momentos centrados en personajes. Cambia a Fast cuando la velocidad y el volumen importen más, especialmente para pruebas de variación o producción por lotes en redes sociales.

Esas diferencias a nivel de lanzamiento se trasladan directamente a la configuración de la API, las restricciones de salida y las decisiones de integración en la siguiente sección.

3. Vista previa de la API: endpoints, entradas, salidas y acceso

3.1 Estructura de solicitud y respuesta

Hailuo 2.3 sigue un flujo simple de enviar → consultar → descargar. Envías una solicitud POST /video_generation, recibes un task_id y esperas mientras se procesa el video. Después, consultas el estado. Cuando el trabajo termina, la API devuelve un enlace de descarga. Estos campos se alinean con las dos rutas de lanzamiento: texto a video e imagen a video.

Para texto a video, la solicitud necesita un campo prompt. Ese prompt puede tener hasta 2,000 caracteres. Para imagen a video, también envías first_frame_image como imagen de referencia. La imagen puede pasarse como una URL pública o como una cadena en Base64. Los archivos deben pesar menos de 20 MB, el lado corto debe superar los 300 px, y la relación de aspecto debe estar entre 2:5 y 5:2.

Los controles principales son:

  • duration para la duración del clip, con valores comunes de 6 o 10 segundos
  • resolution configurado como "768P" o "1080P"
  • prompt_optimizer como una bandera opcional
ParámetroTipoObligatorioNotas
modelstringMiniMax-Hailuo-2.3 o MiniMax-Hailuo-2.3-Fast
promptstringMáximo 2,000 caracteres; admite etiquetas de cámara [entre corchetes]
first_frame_imagestringSolo I2VURL pública o Base64; menos de 20 MB
durationintegerNoValores comunes: 6 o 10 segundos
resolutionstringNo"768P" o "1080P"
prompt_optimizerbooleanNoBandera opcional de refinamiento de prompt
callback_urlstringNoWebhook para notificaciones asíncronas de finalización

Después del envío, GET /query/video_generation devuelve un estado como "processing", "success" o "failed". Si el trabajo tiene éxito, la respuesta incluye la URL del video o la referencia del archivo. Si falla, obtienes un error_code y un error_message.

Consultar cada 15 a 30 segundos es un ritmo razonable. Hacerlo con demasiada frecuencia solo genera ruido. Una cosa más: los enlaces de salida en APIMart permanecen activos durante 72 horas, así que tiene sentido mover los archivos terminados a tu propio almacenamiento poco después de la generación.

3.2 Acceso directo y acceso unificado a la API de APIMart

APIMart

Los equipos pueden llamar directamente a los endpoints nativos de MiniMax con un token Bearer en el encabezado:

Authorization: Bearer YOUR_API_KEY

Esta ruta te mantiene más cerca de la documentación propia de MiniMax y del calendario de lanzamientos.

APIMart ofrece otra ruta para los equipos que quieren un solo lugar para gestionar trabajo multimodal. Su API unificada te da una sola clave de API y un solo saldo en USD para llamadas de texto, imagen y video. También usa un estilo de solicitud compatible con OpenAI, lo que puede facilitar la configuración si tu stack ya habla ese formato. Si estás conectando varios tipos de modelos en un solo pipeline, ese tipo de configuración puede ahorrar tiempo del lado del cliente.

3.3 Precios y facturación en dólares estadounidenses

El precio se cobra por segundo generado en dólares estadounidenses. APIMart lista tarifas con un descuento de aproximadamente 20% frente al precio oficial de MiniMax.

Variante del modeloResoluciónPrecio en APIMart (USD/seg)Precio oficial (USD/seg)
MiniMax-Hailuo-2.3768P~$0.0488~$0.061
MiniMax-Hailuo-2.31080P~$0.072~$0.090
MiniMax-Hailuo-2.3-Fast768P~$0.0248~$0.031
MiniMax-Hailuo-2.3-Fast1080P~$0.0424~$0.053

Una forma práctica de gestionar el costo es probar en 768P y reservar 1080P para los renders finales. Eso mantiene más barata la iteración inicial sin dejar de dejar espacio para una entrega de mayor calidad más adelante.

4. Patrones de integración para flujos de trabajo multimodales

4.1 Patrones de implementación con SDK de Python y REST

Una vez que el formato de solicitud y respuesta está definido, el siguiente paso es conectar Hailuo 2.3 a un pipeline que puedas ejecutar una y otra vez. La forma más simple de verlo: Hailuo 2.3 es la capa de renderizado dentro de un sistema más grande. Mantén tu clave de API en una variable de entorno, usa autenticación Bearer en cada solicitud, y usa requests para las llamadas de generación de video mientras te apoyas en SDKs para la orquestación de prompts.

import os
import time
import requests

API_KEY = os.environ["APIMART_API_KEY"]
BASE_URL = "https://api.apimart.ai/v1"

headers = {
    "Authorization": f"Bearer {API_KEY}",
    "Content-Type": "application/json",
}

payload = {
    "model": "MiniMax-Hailuo-2.3",
    "prompt": "[Slow zoom in] A ceramic coffee mug on a sunlit kitchen counter, steam rising, photorealistic",
    "duration": 6,
    "resolution": "768P",
    "prompt_optimizer": True,
}

response = requests.post(f"{BASE_URL}/video_generation", json=payload, headers=headers)
task_id = response.json()["task_id"]

while True:
    status_resp = requests.get(
        f"{BASE_URL}/query/video_generation",
        params={"task_id": task_id},
        headers=headers,
    )
    result = status_resp.json()

    if result["status"] == "success":
        file_id = result.get("file_id")
        video_url = result.get("video_url")
        break
    if result["status"] == "failed":
        raise Exception(result.get("error_message", "Video generation failed"))

    time.sleep(20)

Si consultar el estado te resulta engorroso, añade un callback_url y deja que el sistema te notifique cuando el render esté listo. Después, pasa el file_id devuelto o la URL de descarga a tu paso de almacenamiento o publicación.

Una vez que el flujo de la API está implementado, el siguiente trabajo es establecer valores predeterminados que mantengan el gasto y la calidad de salida bajo control.

4.2 Diseños de pipeline para equipos de contenido y producto

La mayoría de los equipos de contenido y producto pueden arreglárselas con tres patrones de pipeline. Se alinean con los principales casos de uso del artículo: texto a video, imagen a video y ensamblaje de audio posterior al render.[13][10][12][20][21]

Para un flujo de trabajo de clip publicitario (texto → video), un LLM construye un prompt estructurado con un entorno, un sujeto, una descripción de movimiento y una dirección de cámara entre corchetes. Por ejemplo:

[Pan left] A pair of running shoes on a track, golden hour lighting, cinematic

Ese prompt se envía luego a una solicitud de texto a video de Hailuo 2.3. Esta configuración funciona bien para clips cortos de 6 segundos.[16]

Para un flujo de trabajo de demo de producto (imagen → video), sube una foto de producto limpia y pásala como first_frame_image a Hailuo 2.3. Eso mantiene la precisión visual del producto mientras añade movimiento que una imagen estática no puede mostrar.[13][10][12]

Para un flujo de trabajo de sincronización de narración (video + audio), renderiza primero el video. Luego añade voz en off o música en la posproducción usando un modelo de voz o música, y combina todo en tu pipeline de publicación.

Si necesitas secuencias de más de 10 segundos, encadena clips entre sí. Toma el último fotograma de una generación y pásalo a la siguiente solicitud como first_frame_image. Es un traspaso simple, pero ayuda a mantener estable la apariencia del personaje y la continuidad de la escena entre segmentos.[10][12]

4.3 Parámetros para estandarizar antes del lanzamiento

Ayuda tratar esto como una política de implementación. Fijar una lista corta de valores predeterminados antes de escalar mantiene la salida estable, facilita la planificación de costos y alinea el uso del equipo.[16][17][18][19]

Una lista de verificación corta suele ser suficiente:

  • Plantilla de prompt - Usa una estructura compartida: entorno, sujeto, movimiento, dirección de cámara y una etiqueta de estilo como "cinematic", "product demo" o "user-generated feel". Mantén una biblioteca de prompts que ya hayan funcionado para que los equipos los reutilicen en lugar de empezar de cero.[11][14][15]
  • Duración - Ajusta la duración del clip al trabajo. Usa clips de 6 segundos para vistas previas y contenido social. Reserva los clips de 10 segundos para campañas que necesiten el tiempo extra.
  • Resolución - Establece 768P como valor predeterminado para borradores e iteración. Usa 1080P solo para los renders finales.
  • Reglas de imagen de primer fotograma - Define dónde viven las imágenes de origen aprobadas, asegúrate de que los archivos pesen menos de 20 MB con el lado corto por encima de 300 px, y define qué cuenta como un buen fotograma de referencia para el trabajo de imagen a video.[10][17][18][15]
  • Selección de modelo - Usa MiniMax-Hailuo-2.3-Fast para ejecuciones por lotes de gran volumen. Reserva MiniMax-Hailuo-2.3 (Standard) para la salida final de mayor fidelidad.[19]

Esos valores predeterminados definen el perfil de costo y la elección de modelo que se discute a continuación.

5. Costo, selección de modelo y conclusiones finales

5.1 Estimación de costos para escenarios de producción comunes en EE. UU.

Una vez que tu configuración de lanzamiento y el flujo de la API están listos, lo siguiente que hay que definir es el costo de producción.

Un clip de 6 segundos en 768p en Hailuo 2.3 cuesta aproximadamente $0.29, y un clip de 10 segundos cuesta aproximadamente $0.49. En Hailuo 2.3 Fast, esos mismos clips salen en aproximadamente $0.15 y $0.25.

Para una marca de e-commerce de EE. UU. que hace 80 clips de producto Standard de 10 segundos al mes en 768p, el costo total de generación es de aproximadamente $39.00.

Una forma simple de verlo:

  • Usa Hailuo 2.3 Fast para borradores, variantes A/B y pruebas por lotes
  • Usa Hailuo 2.3 para páginas de producto en vivo, redes sociales pagadas y vistas previas de app store

El precio importa, por supuesto. Pero no debería ser lo único que guíe la elección. Lo que necesitas que haga el resultado importa más.

5.2 Elegir MiniMax Hailuo 2.3 dentro del catálogo de APIMart

La elección se reduce a tres cosas: calidad de salida final, velocidad de borrador o volumen por lotes.

ModeloFortalezas principalesPerfil de salida admitidoPrecio en APIMart (USD/seg)Mejores casos de uso en EE. UU.
MiniMax Hailuo 2.3Calidad de movimiento, fidelidad de personajes, control de estilo768p: hasta 10 segundos; 1080p: hasta 6 segundos$0.0488 (768p) / $0.072 (1080p)Clips de marca, demos de producto, redes sociales pagadas
MiniMax Hailuo 2.3 FastVelocidad, eficiencia de costo por lotes768p: hasta 10 segundos; 1080p: hasta 6 segundos$0.0248 (768p) / $0.0424 (1080p)Borradores, variantes creativas, generación masiva

Lo bueno es que una sola integración cubre ambos niveles. Así que si tu equipo quiere pasar del modo borrador al modo de salida final, puedes hacerlo sin cambiar la lógica de la solicitud.

5.3 Puntos clave para llevar contigo

Si estás eligiendo entre los dos niveles, la regla es bastante simple: Hailuo 2.3 está construido para video de formato corto, especialmente clips breves donde la consistencia de movimiento y el ajuste de marca importan más.

Antes de escalar, ejecuta un piloto controlado. Genera un lote controlado de clips de 6 segundos y 10 segundos. Luego revisa la calidad de movimiento y el ajuste de marca con tu equipo creativo, asegúrate de que el tiempo de entrega funcione para tu flujo de producción, y confirma que la vista de facturación de APIMart coincida con los segundos usados y el costo total en USD.

Preguntas frecuentes

¿Con qué modelo debería empezar?

Para la mayoría de los usuarios, Hailuo 03 es el mejor punto de partida. Es el modelo más nuevo, y funciona mejor para flujos de trabajo multimodales complejos como texto a video, imagen a video, audio sincronizado y controles precisos de cámara.

Si necesitas arte estilizado, movimiento humano o microexpresiones, Hailuo 2.3 es una buena opción. Si tu trabajo se inclina más hacia el movimiento con mucha física y un movimiento altamente realista, Hailuo 02 también es una opción sólida.

Puedes acceder a todos ellos a través de la API unificada de APIMart configurando el parámetro model.

¿Cómo puedo hacer clips de más de 10 segundos?

Para videos de más de 5 segundos, usa una resolución más baja como 768p o 512p. 1080p solo admite clips de hasta 5 segundos, así que no funcionará para salidas más largas.

¿Necesitas más del límite de clip de 10 segundos de la API? Genera varios clips y únelos en tu backend. Es mejor manejar esto de forma asíncrona, ya sea consultando el estado del trabajo o usando una URL de callback para recibir una notificación de finalización.

¿Qué suele causar que falle una solicitud de generación?

Una solicitud de generación puede fallar por algunas razones comunes:

  • Parámetros no válidos
  • Claves de API no válidas
  • Saldo de cuenta insuficiente
  • Límites de tasa (429)
  • Errores internos del servidor (5xx)

Las solicitudes basadas en imágenes también pueden fallar cuando los archivos de entrada pesan más de 20 MB o la relación de aspecto está fuera de 2:5 a 5:2.

Si el estado de una tarea cambia a failed, revisa el campo error_message para conocer el motivo exacto.

¿Listo para probar?

Elige el modelo que quieres en el marketplace

Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.

Modelos de chatModelos de imagenModelos de video
Explorar marketplace