APIMart
APIMart

Modelo de Próxima Geração MiniMax: Lançamento e Prévia da API

O MiniMax Hailuo 2.3 cria clipes cinematográficos de 6-10s a partir de texto ou imagem. Veja recursos, fluxo de API e preços por segundo em USD na APIMart.

Tutorial

Se você quer testar o MiniMax Hailuo 2.3 hoje, aqui está a resposta rápida: ele suporta texto para vídeo e imagem para vídeo no modelo Standard, apenas imagem para vídeo no Fast, e gera clipes de 6 ou 10 segundos em 768p ou 1080p. Os preços começam em cerca de $0.28 por clipe de 6 segundos no Standard e $0.19 no Fast, com um fluxo de API simples de enviar → consultar → baixar.

Se eu resumir ao que mais importa, este lançamento gira em torno de quatro coisas:

  • O que você pode fazer agora: texto para vídeo e imagem para vídeo
  • Quanto custa: cerca de $0.0248 a $0.072 por segundo na APIMart, dependendo do modelo e da resolução
  • Como conectar: POST /video_generation, depois verifique o status com GET /query/video_generation
  • Para quem é ideal: equipes que criam anúncios curtos, clipes de produto, vídeos explicativos e variantes de teste

Também existem limites claros. O Fast não suporta texto para vídeo. As imagens de entrada devem ter menos de 20 MB, lado menor acima de 300 px, e permanecer dentro da faixa de proporção permitida. O Standard geralmente leva cerca de 30 a 90 segundos por clipe, então isso é melhor para trabalhos de vídeo curtos do que para edições mais longas.

APIMart
MiniMax Hailuo 2.3 vs Fast: Preços, Recursos e Casos de Uso

Tutorial da API Minimax Hailuo: Clonagem de Voz, Geração de Vídeo e Música com IA + Automação com Make.com

Comparação Rápida

ModeloTipo de EntradaDuração da SaídaResoluçãoCusto InicialMelhor Para
MiniMax-Hailuo-2.3Texto ou imagem6s ou 10s768p, 1080p$0.28 por clipe de 6sClipes finais, anúncios, vídeos de produto
MiniMax-Hailuo-2.3-FastApenas imagem6s ou 10s768p, 1080p$0.19 por clipe de 6sRascunhos, testes, saída em lote

O que mais chamou minha atenção foi isto: o modelo é simples de testar, os preços são fáceis de estimar e a API é direta. Então, se você está avaliando se o Hailuo 2.3 se encaixa no seu fluxo de trabalho, a pergunta principal não é "Posso acessá-lo?", mas sim "Eu quero melhor qualidade de saída ou menor custo por clipe?"

2. O Que o MiniMax Hailuo 2.3 Entrega no Lançamento

O MiniMax Hailuo 2.3 é o modelo de vídeo de formato curto da MiniMax para clipes cinematográficos. Ele foi criado para movimento fluido, personagens expressivos e prompts que seguem de perto o que você pediu.

2.1 Capacidades principais e fluxos de trabalho suportados

No nível do modelo, a principal escolha é entre Standard e Fast.

O Standard Hailuo 2.3 suporta tanto texto para vídeo quanto imagem para vídeo. Ele oferece melhor consistência de movimento, resultado mais realista e controle de estilo mais preciso. Também costuma levar 30 a 90 segundos por clipe.[2][5][7]

O Fast é apenas imagem para vídeo. Ele prioriza velocidade e custo menor, mas você abre mão de um pouco de qualidade de imagem em troca.[3]

A reprodução fica em torno de 24 fps cinematográficos, mas isso deve ser tratado como uma meta geral, não uma especificação fixa.[3][7][8]

Na prática, essa escolha afeta três coisas imediatamente:

  • quanto tempo cada clipe pode levar
  • quão polido o resultado parece
  • quão rápido uma equipe consegue ir do prompt ao rascunho finalizado

2.2 Melhorias de movimento, personagem e estilo

O maior avanço em relação ao Hailuo 02 aparece no movimento e na emoção dos personagens.

O Hailuo 2.3 usa simulação de músculos faciais para lidar com pequenas expressões, como movimento das sobrancelhas, mudanças no foco dos olhos e inclinações sutis da cabeça. Ele também usa Global Identity VAE para manter rostos, cabelo e roupas mais estáveis de quadro a quadro.[1][4][9]

O movimento de câmera também está mais forte. Você pode usar comandos entre colchetes como [Pan left], [Zoom in] e [Tracking shot], e o modelo suporta até três desses comandos em um único prompt. Além disso, o Hailuo 2.3 adiciona mais controle de estilo com opções de renderização para estéticas de anime, pintura a nanquim e game-CG.[1][4][6][9]

Isso significa que as equipes podem ser mais deliberadas sobre a sensação de um clipe. Um close-up de personagem, um push-in lento ou uma cena de produto estilizada deixam de ser um jogo de adivinhação e passam a ser uma tarefa de escrita de prompt.

2.3 Onde o Hailuo 2.3 se encaixa melhor

O Hailuo 2.3 funciona melhor para clipes curtos e impactantes. Se você precisar de uma peça mais longa, faz mais sentido gerar as cenas aqui e uni-las em um editor padrão.

Tipo de Fluxo de TrabalhoPontos FortesLimitesCaso de Uso Ideal
Texto para VídeoForte adesão ao prompt, resultado estilizadoApenas modelo StandardClipes para redes sociais, trailers estilizados
Imagem para VídeoConsistência de personagem, detalhes estáveis da imagem de origemRequer uma imagem de origem de alta qualidadeGiros de produto, anúncios de e-commerce
Fast (apenas I2V)Entrega mais rápida, custo menorSem suporte a texto para vídeo; fidelidade reduzidaRascunhos em lote, testes A/B

Use o Standard Hailuo 2.3 quando a qualidade do resultado, a direção de estilo e o detalhe do prompt forem mais importantes, como em anúncios principais, trailers ou momentos centrados em personagens. Mude para o Fast quando velocidade e volume importarem mais, especialmente para testes de variação ou produção em lote para redes sociais.

Essas diferenças de lançamento se refletem diretamente na configuração da API, nas restrições de saída e nas decisões de integração da próxima seção.

3. Prévia da API: Endpoints, Entradas, Saídas e Acesso

3.1 Estrutura de requisição e resposta

O Hailuo 2.3 segue um fluxo simples de enviar → consultar → baixar. Você envia uma requisição POST /video_generation, recebe de volta um task_id e aguarda enquanto o vídeo é processado. Depois disso, você consulta o status. Quando o trabalho termina, a API retorna um link de download. Esses campos se alinham com os dois caminhos de lançamento: texto para vídeo e imagem para vídeo.

Para texto para vídeo, a requisição precisa de um campo prompt. Esse prompt pode ter até 2.000 caracteres. Para imagem para vídeo, você também envia first_frame_image como a imagem de referência. A imagem pode ser passada como uma URL pública ou uma string Base64. Os arquivos devem ter menos de 20 MB, o lado menor deve ser superior a 300 px, e a proporção deve estar entre 2:5 e 5:2.

Os principais controles são:

  • duration para a duração do clipe, com valores comuns de 6 ou 10 segundos
  • resolution definido como "768P" ou "1080P"
  • prompt_optimizer como uma flag opcional
ParâmetroTipoObrigatórioObservações
modelstringSimMiniMax-Hailuo-2.3 ou MiniMax-Hailuo-2.3-Fast
promptstringSimMáximo de 2.000 caracteres; suporta tags de câmera [entre colchetes]
first_frame_imagestringApenas I2VURL pública ou Base64; menos de 20 MB
durationintegerNãoValores comuns: 6 ou 10 segundos
resolutionstringNão"768P" ou "1080P"
prompt_optimizerbooleanNãoFlag opcional de refinamento de prompt
callback_urlstringNãoWebhook para notificações assíncronas de conclusão

Após o envio, GET /query/video_generation retorna um status como "processing", "success" ou "failed". Se o trabalho for bem-sucedido, a resposta inclui a URL do vídeo ou a referência do arquivo. Se falhar, você recebe um error_code e uma error_message.

Consultar a cada 15 a 30 segundos é um ritmo razoável. Consultar com muita frequência só cria ruído. Mais uma coisa: os links de saída na APIMart ficam ativos por 72 horas, então faz sentido mover os arquivos finalizados para seu próprio armazenamento logo após a geração.

3.2 Acesso direto e acesso unificado à API da APIMart

APIMart

As equipes podem chamar os endpoints nativos da MiniMax diretamente com um token Bearer no cabeçalho:

Authorization: Bearer YOUR_API_KEY

Esse caminho mantém você mais próximo da documentação e do cronograma de lançamento da própria MiniMax.

A APIMart oferece outro caminho para equipes que querem um único lugar para gerenciar o trabalho multimodal. Sua API unificada oferece uma única chave de API e um único saldo em USD para chamadas de texto, imagem e vídeo. Ela também usa um estilo de requisição compatível com OpenAI, o que pode facilitar a configuração se sua stack já fala esse formato. Se você está conectando vários tipos de modelo em um único pipeline, esse tipo de configuração pode economizar tempo do lado do cliente.

3.3 Preços e faturamento em dólares americanos

Os preços são cobrados por segundo gerado em dólares americanos. A APIMart lista taxas com cerca de 20% de desconto em relação ao preço oficial da MiniMax.

Variante do ModeloResoluçãoPreço APIMart (USD/seg)Preço Oficial (USD/seg)
MiniMax-Hailuo-2.3768P~$0.0488~$0.061
MiniMax-Hailuo-2.31080P~$0.072~$0.090
MiniMax-Hailuo-2.3-Fast768P~$0.0248~$0.031
MiniMax-Hailuo-2.3-Fast1080P~$0.0424~$0.053

Uma forma prática de controlar o custo é testar em 768P e reservar o 1080P para as renderizações finais. Isso mantém a iteração inicial mais barata, deixando espaço para uma entrega de maior qualidade depois.

4. Padrões de Integração para Fluxos de Trabalho Multimodais

4.1 Padrões de Implementação com SDK Python e REST

Depois que o formato de requisição e resposta estiver definido, o próximo passo é integrar o Hailuo 2.3 em um pipeline que você possa executar repetidamente. A forma mais simples de pensar nisso: o Hailuo 2.3 é a camada de renderização dentro de um sistema maior. Mantenha sua chave de API em uma variável de ambiente, use autenticação Bearer em todas as requisições e use requests para as chamadas de geração de vídeo, contando com SDKs para a orquestração de prompts.

import os
import time
import requests

API_KEY = os.environ["APIMART_API_KEY"]
BASE_URL = "https://api.apimart.ai/v1"

headers = {
    "Authorization": f"Bearer {API_KEY}",
    "Content-Type": "application/json",
}

payload = {
    "model": "MiniMax-Hailuo-2.3",
    "prompt": "[Slow zoom in] A ceramic coffee mug on a sunlit kitchen counter, steam rising, photorealistic",
    "duration": 6,
    "resolution": "768P",
    "prompt_optimizer": True,
}

response = requests.post(f"{BASE_URL}/video_generation", json=payload, headers=headers)
task_id = response.json()["task_id"]

while True:
    status_resp = requests.get(
        f"{BASE_URL}/query/video_generation",
        params={"task_id": task_id},
        headers=headers,
    )
    result = status_resp.json()

    if result["status"] == "success":
        file_id = result.get("file_id")
        video_url = result.get("video_url")
        break
    if result["status"] == "failed":
        raise Exception(result.get("error_message", "Video generation failed"))

    time.sleep(20)

Se o polling parecer trabalhoso, adicione um callback_url e deixe o sistema notificá-lo quando a renderização terminar. Depois disso, passe o file_id retornado ou a URL de download para sua etapa de armazenamento ou publicação.

Depois que o fluxo da API estiver em funcionamento, o próximo passo é definir padrões que mantenham o gasto e a qualidade de saída sob controle.

4.2 Modelos de Pipeline para Equipes de Conteúdo e Produto

A maioria das equipes de conteúdo e produto consegue se virar com três padrões de pipeline. Eles se alinham com os principais casos de uso do artigo: texto para vídeo, imagem para vídeo e montagem de áudio pós-renderização.[13][10][12][20][21]

Para um fluxo de trabalho de clipe publicitário (texto → vídeo), um LLM constrói um prompt estruturado com cenário, assunto, descrição de movimento e direção de câmera entre colchetes. Por exemplo:

[Pan left] A pair of running shoes on a track, golden hour lighting, cinematic

Esse prompt é então enviado em uma requisição de texto para vídeo do Hailuo 2.3. Essa configuração funciona bem para clipes curtos de 6 segundos.[16]

Para um fluxo de trabalho de demonstração de produto (imagem → vídeo), envie uma imagem estática limpa do produto e passe-a como first_frame_image para o Hailuo 2.3. Isso mantém o produto visualmente preciso enquanto adiciona um movimento que uma imagem estática não consegue mostrar.[13][10][12]

Para um fluxo de trabalho de sincronização de narração (vídeo + áudio), renderize o vídeo primeiro. Depois adicione narração ou música em pós-produção usando um modelo de fala ou música, e combine tudo no seu pipeline de publicação.

Se você precisar de sequências com mais de 10 segundos, encadeie clipes. Pegue o último quadro de uma geração e passe-o para a próxima requisição como first_frame_image. É uma transição simples, mas ajuda a manter a aparência do personagem e a continuidade da cena estáveis entre os segmentos.[10][12]

4.3 Parâmetros para Padronizar Antes do Lançamento

Ajuda tratar isso como uma política de lançamento. Fixar uma lista curta de padrões antes de escalar mantém o resultado estável, o custo mais fácil de planejar e o uso da equipe alinhado.[16][17][18][19]

Uma checklist curta geralmente resolve:

  • Modelo de prompt - Use uma estrutura compartilhada: cenário, assunto, movimento, direção de câmera e uma tag de estilo como "cinematic", "product demo" ou "user-generated feel". Mantenha uma biblioteca de prompts que já funcionaram para que as equipes os reutilizem em vez de começar do zero.[11][14][15]
  • Duração - Ajuste a duração do clipe ao trabalho. Use clipes de 6 segundos para prévias e conteúdo de redes sociais. Reserve os clipes de 10 segundos para campanhas que precisam do tempo extra.
  • Resolução - Defina 768P como padrão para rascunhos e iteração. Use 1080P apenas para renderizações finais.
  • Regras para a imagem do primeiro quadro - Defina claramente onde ficam as imagens de origem aprovadas, garanta que os arquivos fiquem abaixo de 20 MB com o lado menor acima de 300 px, e defina o que conta como um quadro de referência forte para o trabalho de imagem para vídeo.[10][17][18][15]
  • Seleção de modelo - Use MiniMax-Hailuo-2.3-Fast para execuções em lote de alto volume. Reserve MiniMax-Hailuo-2.3 (Standard) para resultados finais de maior fidelidade.[19]

Esses padrões moldam o perfil de custo e a escolha de modelo discutidos a seguir.

5. Custo, Seleção de Modelo e Considerações Finais

5.1 Estimando o Custo para Cenários Comuns de Produção nos EUA

Depois que a configuração de lançamento e o fluxo da API estiverem prontos, a próxima coisa a definir é o custo de produção.

Um clipe de 6 segundos em 768p no Hailuo 2.3 custa cerca de $0.29, e um clipe de 10 segundos custa cerca de $0.49. No Hailuo 2.3 Fast, esses mesmos clipes ficam em cerca de $0.15 e $0.25.

Para uma marca de e-commerce dos EUA que produz 80 clipes de produto padrão de 10 segundos por mês em 768p, o custo total de geração é de cerca de $39.00.

Uma forma simples de pensar nisso:

  • Use o Hailuo 2.3 Fast para rascunhos, variantes A/B e testes em lote
  • Use o Hailuo 2.3 para páginas de produto ativas, mídia paga e prévias em lojas de aplicativos

O preço importa, claro. Mas não deveria ser o único fator na escolha. O que você precisa que o resultado faça importa mais.

5.2 Escolhendo o MiniMax Hailuo 2.3 no Catálogo da APIMart

A escolha se resume a três coisas: qualidade final do resultado, velocidade de rascunho ou volume em lote.

ModeloPontos Fortes PrincipaisPerfil de Saída SuportadoPreço APIMart (USD/seg)Melhores Casos de Uso nos EUA
MiniMax Hailuo 2.3Qualidade de movimento, fidelidade de personagem, controle de estilo768p: até 10 segundos; 1080p: até 6 segundos$0.0488 (768p) / $0.072 (1080p)Clipes de marca, demonstrações de produto, mídia paga
MiniMax Hailuo 2.3 FastVelocidade, eficiência de custo em lote768p: até 10 segundos; 1080p: até 6 segundos$0.0248 (768p) / $0.0424 (1080p)Rascunhos, variantes criativas, geração em massa

A boa notícia é que uma única integração cobre os dois níveis. Então, se sua equipe quiser mudar do modo de rascunho para o modo de resultado final, é possível fazer isso sem alterar a lógica da requisição.

5.3 Pontos-Chave para Levar Adiante

Se você está escolhendo entre os dois níveis, a regra é bem simples: o Hailuo 2.3 foi criado para vídeos de formato curto, especialmente clipes breves em que a consistência de movimento e o alinhamento com a marca importam mais.

Antes de escalar, execute um piloto bem controlado. Gere um lote controlado de clipes de 6 segundos e 10 segundos. Depois, revise a qualidade de movimento e o alinhamento com a marca com sua equipe criativa, confirme que o tempo de entrega funciona para seu fluxo de produção, e verifique se a visualização de faturamento da APIMart corresponde aos segundos usados e ao custo total em USD.

Perguntas Frequentes

Com qual modelo devo começar?

Para a maioria dos usuários, o Hailuo 03 é o melhor ponto de partida. É o modelo mais novo e funciona melhor para fluxos de trabalho multimodais complexos, como texto para vídeo, imagem para vídeo, áudio sincronizado e controles de câmera precisos.

Se você precisa de arte estilizada, movimento humano ou microexpressões, o Hailuo 2.3 é uma boa escolha. Se o seu trabalho depende mais de movimento com física pesada e movimento altamente realista, o Hailuo 02 também é uma opção sólida.

Você pode acessar todos eles através da API unificada da APIMart definindo o parâmetro model.

Como posso criar clipes com mais de 10 segundos?

Para vídeos com mais de 5 segundos, use uma resolução menor, como 768p ou 512p. O 1080p suporta apenas clipes de até 5 segundos, então não funciona para resultados mais longos.

Precisa de mais do que o limite de 10 segundos por clipe da API? Gere alguns clipes e una-os no seu backend. É melhor lidar com isso de forma assíncrona, seja consultando o status do trabalho ou usando uma callback URL para receber uma notificação de conclusão.

O que costuma causar a falha de uma requisição de geração?

Uma requisição de geração pode falhar por alguns motivos comuns:

  • Parâmetros inválidos
  • Chaves de API inválidas
  • Saldo insuficiente na conta
  • Limites de taxa (429)
  • Erros internos do servidor (5xx)

Requisições baseadas em imagem também podem falhar quando os arquivos de entrada são maiores que 20 MB ou quando a proporção fica fora do intervalo 2:5 a 5:2.

Se o status de uma tarefa mudar para failed, verifique o campo error_message para saber o motivo exato.

Pronto para testar?

Escolha o modelo que você quer no marketplace

Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.

Modelos de chatModelos de imagemModelos de vídeo
Explorar marketplace