APIMart
API MiniMax Hailuo 03: geração de vídeo 1080p

API MiniMax Hailuo 03: geração de vídeo 1080p

Crie vídeo de IA em 1080p com a API MiniMax Hailuo 03: texto-para-vídeo, imagem-para-vídeo, jobs assíncronos, preço de $0.08/seg e dicas de produção para devs.

Tutorial

Se você quer vídeo de IA em 1080p por API, os principais limites são simples: clipes de no máximo 5 segundos, tratamento de jobs assíncronos e um custo de $0.08/seg. Eu trataria o Hailuo 03 como um modelo de vídeo de formato curto para apps que precisam de texto-para-vídeo ou imagem-para-vídeo sem rodar GPUs.

Aqui está o artigo em palavras simples:

  • O que ele faz: gera vídeo MP4 em 1080p
  • Tipos de entrada: prompt de texto, imagem-para-vídeo, primeiro-e-último quadro e referência de sujeito
  • Limite do clipe: 5 segundos em 1080p
  • Preço: $0.40 por clipe de 5 segundos em 1080p
  • Fluxo da API: envie o job, depois faça polling do task_id ou use callback_url
  • Controle de prompt: movimentos de câmera entre colchetes como [Pan left] ou [Zoom in]
  • Tratamento de arquivos: a URL final do vídeo expira após 24 horas
  • Regras de imagem: abaixo de 20 MB e proporção entre 2:5 e 5:2
  • Nota sobre confiabilidade: o artigo cita um SLA de 99,9% de uptime

O que mais importa é isto: você precisa de lógica de backend, não apenas de um prompt. Isso significa lidar com verificações de status assíncronas, armazenar o MP4 imediatamente, repetir em 429 e 5xx e emendar clipes se precisar de algo mais longo que 5 segundos.

Se eu fosse montar isso, testaria os prompts em resolução mais baixa primeiro, fixaria a redação do movimento e só passaria para 1080p nas execuções finais, para manter o gasto sob controle.

Assista: automatizando a geração de vídeo do MiniMax

Capacidades centrais e opções de saída em 1080p

Antes de enviar sua primeira requisição, deixe claros os modos de entrada do Hailuo 03, os controles de movimento e os limites de saída.

Entradas suportadas: prompts de texto, imagens e instruções de movimento

O Hailuo 03 suporta quatro modos de entrada: texto-para-vídeo, imagem-para-vídeo (I2V), vídeo de primeiro-e-último quadro e vídeo com referência de sujeito [2].

Para controle de movimento, você pode combinar até três movimentos de câmera dentro de uma instrução entre colchetes, como [Pan left, Pedestal up] [3]. Isso lhe dá uma forma simples de guiar o enquadramento e o movimento da cena sem adicionar metadados extras.

Esses modos se alinham aos campos de requisição cobertos na próxima seção.

Especificações de saída 1080p que os devs devem verificar

A saída em 1080p é limitada a clipes de 5 segundos. Se precisar de uma sequência mais longa, gere vários clipes e emende-os no seu backend. Para projetos que exigem áudio integrado, considere o Veo 3.1 do Google como alternativa.

Esse limite deve moldar tanto as configurações da sua requisição quanto a lógica de montagem do seu backend.

Especificações do Hailuo 03

EspecificaçãoDetalhe
Modos de entradaTexto-para-vídeo, imagem-para-vídeo, vídeo de primeiro-e-último quadro, vídeo com referência de sujeito
Controle de movimentoAté três movimentos de câmera por instrução entre colchetes
Duração máxima do clipe5 segundos
Resolução de saída1080p

Como chamar a API do MiniMax Hailuo 03 na APIMart

MiniMax Hailuo 03

API MiniMax Hailuo 03: fluxo de geração de vídeo assíncrona
API MiniMax Hailuo 03: fluxo de geração de vídeo assíncrona

Agora que você viu o que o Hailuo 03 pode criar, é hora de conectá-lo ao seu app.

Autenticação, URL base e cabeçalhos

Toda requisição à APIMart usa um token Bearer no cabeçalho Authorization, junto com Content-Type: application/json. Uma única chave de API da APIMart cuida de todas as requisições.

POST https://api.apimart.ai/v1/videos/generations
Authorization: Bearer YOUR_API_KEY
Content-Type: application/json

Exemplos de requisição para texto-para-vídeo e imagem-para-vídeo

Você usará o mesmo endpoint e a mesma configuração de autenticação sempre. O que muda são o prompt, a resolução, a duração e a URL de entrada.

O campo model aponta para o Hailuo 03. resolution controla a qualidade da saída. E se você quer 1080p, duration deve ser 5.

Requisição texto-para-vídeo:

{
  "model": "MiniMax-Hailuo-03",
  "prompt": "A product designer sketching at a sunlit desk, [Pan left, Zoom in], cinematic depth of field",
  "resolution": "1080p",
  "duration": 5,
  "prompt_optimizer": true
}

Requisição imagem-para-vídeo:

{
  "model": "MiniMax-Hailuo-03",
  "prompt": "The product rotates slowly on a white surface, [Orbit right]",
  "resolution": "1080p",
  "duration": 5,
  "first_frame_image": "https://your-storage.com/product-shot.jpg",
  "prompt_optimizer": true
}

Para imagem-para-vídeo, envie a imagem primeiro e use a URL retornada em first_frame_image. A imagem deve ter menos de 20 MB, e sua proporção precisa ficar entre 2:5 e 5:2. Se cair fora desse intervalo, a API retorna um erro 400. Defina prompt_optimizer como true se quiser que o prompt seja refinado antes da geração.

Respostas assíncronas, status do job e URLs finais do vídeo

A geração de vídeo roda de forma assíncrona, então seu app precisa fazer polling do status ou usar um callback.

"Após enviar uma tarefa, faça polling do status usando o task_id até que ela tenha sucesso ou falhe." - Documentação da API MiniMax [2]

Faça polling deste endpoint a cada 15 a 30 segundos:

GET https://api.apimart.ai/v1/tasks/{task_id}

O campo status passa por alguns estágios:

StatusSignificado
submitted / PreparingRequisição recebida, inicializando
queued / QueueingAguardando recursos de GPU
processingO vídeo está sendo renderizado ativamente
completed / SuccessConcluído - a URL do vídeo está disponível
failed / FailOcorreu um erro; verifique error_message

Quando o status chega a completed, a resposta inclui a URL final do MP4. Baixe o MP4 imediatamente, porque o link expira após 24 horas [4].

Se você lida com muitos jobs, passe um callback_url na primeira requisição em vez de fazer polling. Seu servidor receberá um callback POST quando o job terminar, e ele deve retornar o valor de desafio dentro de 3 segundos [3].

Com o fluxo de jobs configurado, o próximo passo é ajustar qualidade e custo para produção. Você também pode considerar o Kling V3 para estilos de vídeo cinematográficos alternativos.

Parâmetros, desempenho e preços para cargas em 1080P

Controles de qualidade que importam em produção

Uma vez definido o formato da requisição, o próximo passo é ajustar a qualidade da saída, a velocidade e o gasto. Para a maioria dos jobs em 1080P, três configurações fazem a maior parte do trabalho: resolution, duration e prompt_optimizer.

O prompt_optimizer reescreve os prompts para tornar o movimento e a composição mais claros [1][3]. Na maioria dos casos de produção, é melhor mantê-lo ligado. Mas se o seu prompt precisa seguir de perto termos de marca ou redação exata, defina-o como false para que o sistema não reescreva a linguagem que você precisa preservar [3].

Você também pode usar fast_pretreatment para reduzir o tempo de preparo do prompt. O trade-off é uma pequena queda na qualidade da saída [1][3].

Para movimento de câmera, coloque as direções de movimento diretamente no prompt com comandos entre colchetes. Exemplos incluem [Pan left] e [Zoom in]. Você pode usar até três desses comandos em um único prompt [3][5].

Planejamento de latência e custo em USD

Depois que esses controles estão no lugar, o custo se resume principalmente à duração do clipe. Como a geração roda de forma assíncrona, planeje um fluxo de envio-e-polling. Se quiser que seu backend receba o resultado automaticamente, use callback_url para que ele receba um aviso quando o job estiver concluído [4].

A $0.08 por segundo, um clipe de 5 segundos em 1080P custa $0.40.

Uma forma simples de cortar desperdício é testar os prompts em 768P primeiro e depois mudar para 1080P quando o comportamento do prompt e o movimento de câmera ficarem certos [1][6].

Padrões de integração e próximos passos

Fluxo de backend para apps de marketing, produto e educação

Com o tratamento de requisições e o status de jobs configurados, o próximo passo é colocar o Hailuo 03 em fluxos de produto reais. O fluxo central de jobs permanece o mesmo entre os tipos de app. O que muda é o estilo do prompt, a entrada que você envia e o que o clipe precisa fazer.

Para clipes de anúncio de marketing, use texto-para-vídeo. Mantenha os prompts curtos e diretos e inclua dicas de câmera como [Pan left] ou [Tracking shot]. Para visuais de produto, use imagem-para-vídeo e passe tomadas de produto como imagem de referência. Para explicadores educacionais, 768P costuma ser a escolha prática quando você precisa de clipes mais longos.

Armazenamento, entrega e rastreamento de uso em escala

Assim que a renderização terminar, mova o arquivo para armazenamento persistente para entrega e rastreamento. Baixe cada MP4 imediatamente e armazene-o no seu próprio sistema para entrega. Para confiabilidade, adicione backoff exponencial em respostas 429 e 5xx. Se você lida com alto volume, use callback_url em vez de polling. Rastreie o uso em um só lugar para todos os jobs de vídeo. Essa configuração ajuda a manter a entrega estável conforme o volume cresce.

Conclusão: pontos-chave para desenvolvedores

Envie os jobs com o tipo de entrada certo para o caso de uso, lide com o fluxo assíncrono com cuidado e armazene a saída imediatamente - depois construa a partir daí.

Perguntas frequentes

Quanto tempo costuma levar para gerar um vídeo em 1080p?

A geração de vídeo de alta qualidade em 1080p costuma levar de 1 minuto e 38 segundos a 5 minutos, embora alguns jobs terminem em 30 a 90 segundos.

O tempo exato depende de duas coisas: quão complexo é o seu prompt e quão longo você quer o vídeo. Como a geração roda de forma assíncrona, seu app deve fazer polling do status da tarefa até que ela esteja concluída.

Qual é a melhor forma de fazer vídeos mais longos que 5 segundos?

Para criar vídeos mais longos que 5 segundos com a API MiniMax Hailuo, use uma resolução mais baixa.

O 1080p só suporta clipes de 5 ou 6 segundos, dependendo da versão do modelo. O 768p suporta clipes de até 10 segundos.

Então, se você quer um vídeo de 10 segundos, defina:

  • resolution como 768p
  • duration como 10

Na sua requisição de API, deve ficar como esta ideia na prática: use 768p para a resolução e 10 para a duração.

Quando devo desligar o prompt_optimizer?

Desligue o prompt_optimizer quando quiser um controle mais apertado sobre a saída do vídeo. Por padrão, o sistema reescreve sua descrição para ajudar a melhorar o resultado.

Desligue-o se quiser que seu prompt seja usado exatamente como escrito, especialmente se você já o ajustou e não quer que nada seja alterado.

Pronto para testar?

Escolha o modelo que você quer no marketplace

Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.

Modelos de chatModelos de imagemModelos de vídeo
Explorar marketplace