
API MiniMax Hailuo 03: geração de vídeo 1080p
Crie vídeo de IA em 1080p com a API MiniMax Hailuo 03: texto-para-vídeo, imagem-para-vídeo, jobs assíncronos, preço de $0.08/seg e dicas de produção para devs.
Se você quer vídeo de IA em 1080p por API, os principais limites são simples: clipes de no máximo 5 segundos, tratamento de jobs assíncronos e um custo de $0.08/seg. Eu trataria o Hailuo 03 como um modelo de vídeo de formato curto para apps que precisam de texto-para-vídeo ou imagem-para-vídeo sem rodar GPUs.
Aqui está o artigo em palavras simples:
- O que ele faz: gera vídeo MP4 em 1080p
- Tipos de entrada: prompt de texto, imagem-para-vídeo, primeiro-e-último quadro e referência de sujeito
- Limite do clipe: 5 segundos em 1080p
- Preço: $0.40 por clipe de 5 segundos em 1080p
- Fluxo da API: envie o job, depois faça polling do
task_idou usecallback_url - Controle de prompt: movimentos de câmera entre colchetes como
[Pan left]ou[Zoom in] - Tratamento de arquivos: a URL final do vídeo expira após 24 horas
- Regras de imagem: abaixo de 20 MB e proporção entre 2:5 e 5:2
- Nota sobre confiabilidade: o artigo cita um SLA de 99,9% de uptime
O que mais importa é isto: você precisa de lógica de backend, não apenas de um prompt. Isso significa lidar com verificações de status assíncronas, armazenar o MP4 imediatamente, repetir em 429 e 5xx e emendar clipes se precisar de algo mais longo que 5 segundos.
Se eu fosse montar isso, testaria os prompts em resolução mais baixa primeiro, fixaria a redação do movimento e só passaria para 1080p nas execuções finais, para manter o gasto sob controle.
Assista: automatizando a geração de vídeo do MiniMax
Capacidades centrais e opções de saída em 1080p
Antes de enviar sua primeira requisição, deixe claros os modos de entrada do Hailuo 03, os controles de movimento e os limites de saída.
Entradas suportadas: prompts de texto, imagens e instruções de movimento
O Hailuo 03 suporta quatro modos de entrada: texto-para-vídeo, imagem-para-vídeo (I2V), vídeo de primeiro-e-último quadro e vídeo com referência de sujeito [2].
Para controle de movimento, você pode combinar até três movimentos de câmera dentro de uma instrução entre colchetes, como [Pan left, Pedestal up] [3]. Isso lhe dá uma forma simples de guiar o enquadramento e o movimento da cena sem adicionar metadados extras.
Esses modos se alinham aos campos de requisição cobertos na próxima seção.
Especificações de saída 1080p que os devs devem verificar
A saída em 1080p é limitada a clipes de 5 segundos. Se precisar de uma sequência mais longa, gere vários clipes e emende-os no seu backend. Para projetos que exigem áudio integrado, considere o Veo 3.1 do Google como alternativa.
Esse limite deve moldar tanto as configurações da sua requisição quanto a lógica de montagem do seu backend.
Especificações do Hailuo 03
| Especificação | Detalhe |
|---|---|
| Modos de entrada | Texto-para-vídeo, imagem-para-vídeo, vídeo de primeiro-e-último quadro, vídeo com referência de sujeito |
| Controle de movimento | Até três movimentos de câmera por instrução entre colchetes |
| Duração máxima do clipe | 5 segundos |
| Resolução de saída | 1080p |
Como chamar a API do MiniMax Hailuo 03 na APIMart


Agora que você viu o que o Hailuo 03 pode criar, é hora de conectá-lo ao seu app.
Autenticação, URL base e cabeçalhos
Toda requisição à APIMart usa um token Bearer no cabeçalho Authorization, junto com Content-Type: application/json. Uma única chave de API da APIMart cuida de todas as requisições.
POST https://api.apimart.ai/v1/videos/generations
Authorization: Bearer YOUR_API_KEY
Content-Type: application/json
Exemplos de requisição para texto-para-vídeo e imagem-para-vídeo
Você usará o mesmo endpoint e a mesma configuração de autenticação sempre. O que muda são o prompt, a resolução, a duração e a URL de entrada.
O campo model aponta para o Hailuo 03. resolution controla a qualidade da saída. E se você quer 1080p, duration deve ser 5.
Requisição texto-para-vídeo:
{
"model": "MiniMax-Hailuo-03",
"prompt": "A product designer sketching at a sunlit desk, [Pan left, Zoom in], cinematic depth of field",
"resolution": "1080p",
"duration": 5,
"prompt_optimizer": true
}
Requisição imagem-para-vídeo:
{
"model": "MiniMax-Hailuo-03",
"prompt": "The product rotates slowly on a white surface, [Orbit right]",
"resolution": "1080p",
"duration": 5,
"first_frame_image": "https://your-storage.com/product-shot.jpg",
"prompt_optimizer": true
}
Para imagem-para-vídeo, envie a imagem primeiro e use a URL retornada em first_frame_image. A imagem deve ter menos de 20 MB, e sua proporção precisa ficar entre 2:5 e 5:2. Se cair fora desse intervalo, a API retorna um erro 400. Defina prompt_optimizer como true se quiser que o prompt seja refinado antes da geração.
Respostas assíncronas, status do job e URLs finais do vídeo
A geração de vídeo roda de forma assíncrona, então seu app precisa fazer polling do status ou usar um callback.
"Após enviar uma tarefa, faça polling do status usando o task_id até que ela tenha sucesso ou falhe." - Documentação da API MiniMax [2]
Faça polling deste endpoint a cada 15 a 30 segundos:
GET https://api.apimart.ai/v1/tasks/{task_id}
O campo status passa por alguns estágios:
| Status | Significado |
|---|---|
submitted / Preparing | Requisição recebida, inicializando |
queued / Queueing | Aguardando recursos de GPU |
processing | O vídeo está sendo renderizado ativamente |
completed / Success | Concluído - a URL do vídeo está disponível |
failed / Fail | Ocorreu um erro; verifique error_message |
Quando o status chega a completed, a resposta inclui a URL final do MP4. Baixe o MP4 imediatamente, porque o link expira após 24 horas [4].
Se você lida com muitos jobs, passe um callback_url na primeira requisição em vez de fazer polling. Seu servidor receberá um callback POST quando o job terminar, e ele deve retornar o valor de desafio dentro de 3 segundos [3].
Com o fluxo de jobs configurado, o próximo passo é ajustar qualidade e custo para produção. Você também pode considerar o Kling V3 para estilos de vídeo cinematográficos alternativos.
Parâmetros, desempenho e preços para cargas em 1080P
Controles de qualidade que importam em produção
Uma vez definido o formato da requisição, o próximo passo é ajustar a qualidade da saída, a velocidade e o gasto. Para a maioria dos jobs em 1080P, três configurações fazem a maior parte do trabalho: resolution, duration e prompt_optimizer.
O prompt_optimizer reescreve os prompts para tornar o movimento e a composição mais claros [1][3]. Na maioria dos casos de produção, é melhor mantê-lo ligado. Mas se o seu prompt precisa seguir de perto termos de marca ou redação exata, defina-o como false para que o sistema não reescreva a linguagem que você precisa preservar [3].
Você também pode usar fast_pretreatment para reduzir o tempo de preparo do prompt. O trade-off é uma pequena queda na qualidade da saída [1][3].
Para movimento de câmera, coloque as direções de movimento diretamente no prompt com comandos entre colchetes. Exemplos incluem [Pan left] e [Zoom in]. Você pode usar até três desses comandos em um único prompt [3][5].
Planejamento de latência e custo em USD
Depois que esses controles estão no lugar, o custo se resume principalmente à duração do clipe. Como a geração roda de forma assíncrona, planeje um fluxo de envio-e-polling. Se quiser que seu backend receba o resultado automaticamente, use callback_url para que ele receba um aviso quando o job estiver concluído [4].
A $0.08 por segundo, um clipe de 5 segundos em 1080P custa $0.40.
Uma forma simples de cortar desperdício é testar os prompts em 768P primeiro e depois mudar para 1080P quando o comportamento do prompt e o movimento de câmera ficarem certos [1][6].
Padrões de integração e próximos passos
Fluxo de backend para apps de marketing, produto e educação
Com o tratamento de requisições e o status de jobs configurados, o próximo passo é colocar o Hailuo 03 em fluxos de produto reais. O fluxo central de jobs permanece o mesmo entre os tipos de app. O que muda é o estilo do prompt, a entrada que você envia e o que o clipe precisa fazer.
Para clipes de anúncio de marketing, use texto-para-vídeo. Mantenha os prompts curtos e diretos e inclua dicas de câmera como [Pan left] ou [Tracking shot]. Para visuais de produto, use imagem-para-vídeo e passe tomadas de produto como imagem de referência. Para explicadores educacionais, 768P costuma ser a escolha prática quando você precisa de clipes mais longos.
Armazenamento, entrega e rastreamento de uso em escala
Assim que a renderização terminar, mova o arquivo para armazenamento persistente para entrega e rastreamento. Baixe cada MP4 imediatamente e armazene-o no seu próprio sistema para entrega. Para confiabilidade, adicione backoff exponencial em respostas 429 e 5xx. Se você lida com alto volume, use callback_url em vez de polling. Rastreie o uso em um só lugar para todos os jobs de vídeo. Essa configuração ajuda a manter a entrega estável conforme o volume cresce.
Conclusão: pontos-chave para desenvolvedores
Envie os jobs com o tipo de entrada certo para o caso de uso, lide com o fluxo assíncrono com cuidado e armazene a saída imediatamente - depois construa a partir daí.
Perguntas frequentes
Quanto tempo costuma levar para gerar um vídeo em 1080p?
A geração de vídeo de alta qualidade em 1080p costuma levar de 1 minuto e 38 segundos a 5 minutos, embora alguns jobs terminem em 30 a 90 segundos.
O tempo exato depende de duas coisas: quão complexo é o seu prompt e quão longo você quer o vídeo. Como a geração roda de forma assíncrona, seu app deve fazer polling do status da tarefa até que ela esteja concluída.
Qual é a melhor forma de fazer vídeos mais longos que 5 segundos?
Para criar vídeos mais longos que 5 segundos com a API MiniMax Hailuo, use uma resolução mais baixa.
O 1080p só suporta clipes de 5 ou 6 segundos, dependendo da versão do modelo. O 768p suporta clipes de até 10 segundos.
Então, se você quer um vídeo de 10 segundos, defina:
resolutioncomo768pdurationcomo10
Na sua requisição de API, deve ficar como esta ideia na prática: use 768p para a resolução e 10 para a duração.
Quando devo desligar o prompt_optimizer?
Desligue o prompt_optimizer quando quiser um controle mais apertado sobre a saída do vídeo. Por padrão, o sistema reescreve sua descrição para ajudar a melhorar o resultado.
Desligue-o se quiser que seu prompt seja usado exatamente como escrito, especialmente se você já o ajustou e não quer que nada seja alterado.
Escolha o modelo que você quer no marketplace
Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.