

Como Começar a Usar o Wan 2.5 Preview
Um guia rápido do Wan 2.5 Preview para desenvolvedores: configure a API, escreva prompts cinematográficos de T2V e I2V, adicione áudio sincronizado e gerencie custos de vídeo 1080p.
O Wan 2.5 Preview é uma ferramenta de geração de vídeo da Alibaba que transforma descrições de texto ou imagens em clipes cinematográficos curtos com áudio sincronizado. Ele suporta dois modos: texto-para-vídeo (T2V) e imagem-para-vídeo (I2V). Outros modelos de alto desempenho, como o Kling V3, oferecem capacidades cinematográficas semelhantes. Os principais recursos incluem criação audiovisual em uma única passagem, sincronização labial precisa e saídas de até 1080p a 24fps para vídeos de 5 ou 10 segundos. A integração é facilitada pela APIMart, uma plataforma que oferece uma API unificada para acesso simples. Os preços começam em $0.0336/segundo para 480p. Veja o que você precisa saber para começar:
- Modos: T2V para criar vídeos a partir de prompts de texto, I2V para adicionar movimento a imagens.
- Qualidade: Saídas em 480p, 720p ou 1080p com áudio estéreo de 48kHz.
- Preços: Pague conforme o uso, cobrado por segundo de vídeo gerado.
- Configuração: Funciona com Python ou Node.js usando uma API REST. Requer uma chave de API da APIMart.
- Fluxo de trabalho: Envie uma solicitação, receba um task ID e consulte o resultado.
Comece com um clipe de 5 segundos em 480p para testar sua configuração. Quando estiver confortável, aumente para 1080p nas renderizações finais. Use prompts detalhados para obter melhores resultados e inclua instruções de áudio para som sincronizado.
Este guia cobre tudo, desde a configuração do seu ambiente até a criação de prompts e o gerenciamento eficaz de custos.
Configurando Seu Ambiente
Pré-requisitos para Desenvolvedores
Antes de mergulhar no código, é fundamental estar familiarizado com alguns conceitos básicos. Você deve ter um bom domínio de APIs REST e formatação JSON, já que todas as interações com o Wan 2.5 dependem desses padrões. Seja com Python 3.x ou Node.js (v14+), qualquer um funcionará para esta configuração.
Outro conceito importante a entender são os fluxos de trabalho assíncronos. O Wan 2.5 não entrega um vídeo finalizado imediatamente. Em vez disso, ele fornece um task_id que você precisará monitorar. Você terá que criar um loop de consulta para verificar o status da tarefa até que ele mude para "completed". Quando estiver pronto, acesse a APIMart para criar uma conta e obter sua chave de API.
Criando uma Conta e Chave de API na APIMart

Comece visitando apimart.ai para criar uma conta gratuita. Após fazer login, vá até a seção API Key Management no seu Console Dashboard para gerar sua chave de API. Certifique-se de copiar e armazenar sua chave com segurança imediatamente - ela é exibida apenas uma vez.
A APIMart utiliza um modelo de pagamento conforme o uso, então você precisará adicionar fundos à sua conta antes de fazer solicitações. Se você encontrar um erro 402, significa que o saldo da sua conta está muito baixo. Um erro 401, por outro lado, indica um problema com sua chave de API. Verifique novamente suas credenciais e certifique-se de que sua conta tem fundos suficientes.
Configurando Seu Ambiente de Desenvolvimento
Com sua chave de API pronta, configurar seu ambiente é simples. A APIMart é compatível com o OpenAI SDK. Para começar:
- Para Python: Execute
pip install openai - Para Node.js: Execute
npm install openai
O único ajuste em relação a uma configuração padrão da OpenAI é a base URL. Defina-a como:
https://api.apimart.ai/v1
Autentique suas solicitações incluindo sua chave de API como um token Bearer no cabeçalho, assim:
Authorization: Bearer YOUR_API_KEY
Para maior segurança, evite codificar sua chave de API diretamente nos seus scripts. Em vez disso, armazene-a em uma variável de ambiente. Usar um arquivo .env durante o desenvolvimento local é uma boa prática para manter suas credenciais seguras e fora do controle de versão. Depois que seu ambiente estiver configurado, você pode passar a fazer suas primeiras solicitações de API.
Fazendo Suas Primeiras Solicitações de API
Exemplo de Solicitação Texto-para-Vídeo
Depois de configurar tudo, você pode partir para sua primeira solicitação de API! Como mencionado anteriormente, essas solicitações são assíncronas, o que significa que você precisará aguardar a conclusão da tarefa antes de obter seus resultados.
Aqui está um exemplo simples em Python para começar a gerar uma saída de texto-para-vídeo:
import openai
import os
client = openai.OpenAI(
api_key=os.environ["APIMART_API_KEY"],
base_url="https://api.apimart.ai/v1"
)
response = client.post("/wan2.5-t2v-preview", json={
"model": "wan2.5-t2v-preview",
"input": {
"prompt": "A golden retriever runs along a sunlit beach, waves crashing in slow motion",
"negative_prompt": "low quality, blurry, distorted",
"duration": 5,
"size": "1280*720",
"prompt_extend": True
}
})
task_id = response.json()["task_id"]
print(f"Task started: {task_id}")
O único campo obrigatório aqui é prompt, que descreve a cena que você deseja criar. Outros parâmetros, como negative_prompt e size, ajudam a refinar a saída. Se o seu prompt for curto, definir prompt_extend como true permite que o modelo o expanda em uma descrição mais detalhada e cinematográfica. Lembre-se de usar dimensões exatas, como 1280*720, em vez de proporções de tela.
Depois de enviar sua solicitação, você receberá um task_id. Use esse ID para consultar o endpoint de status até que sua tarefa seja marcada como SUCCEEDED:
import time
while True:
result = client.get(f"/tasks/{task_id}")
status = result.json()["task_status"]
if status == "SUCCEEDED":
video_url = result.json()["video_url"]
print(f"Video ready: {video_url}")
break
elif status == "FAILED":
print("Generation failed.")
break
time.sleep(15)
A geração de vídeo normalmente leva de 1 a 5 minutos. Assim que seu vídeo estiver pronto, faça o download dentro de 24 horas, pois a URL expirará depois disso.
A seguir, vamos ver como gerar vídeos a partir de imagens usando uma abordagem semelhante. Você também pode explorar outros modelos, como o Grok Imagine Video, para diferentes estilos cinematográficos.
Exemplo de Solicitação Imagem-para-Vídeo
O processo de imagem-para-vídeo (I2V) segue o mesmo fluxo de trabalho assíncrono, mas inclui duas diferenças importantes: você precisa especificar o modelo wan2.5-i2v-preview e fornecer uma image_url apontando para a imagem de origem.
Aqui está um exemplo:
response = client.post("/wan2.5-i2v-preview", json={
"model": "wan2.5-i2v-preview",
"input": {
"image_url": "https://your-storage.com/character-portrait.jpg",
"prompt": "The character slowly turns their head and smiles at the camera",
"duration": 5,
"resolution": "720p",
"negative_prompt": "blurry, artifacts"
}
})
Para I2V, o prompt deve descrever movimento ou mudanças em relação à imagem inicial - como movimentos de personagens ou ações de câmera. A proporção de tela corresponderá à sua imagem de origem, então certifique-se de que ela esteja recortada na proporção desejada (por exemplo, 16:9, 9:16, 1:1) antes de enviar. As imagens de origem devem ter entre 360 e 2.000 pixels em cada lado e no máximo 10 MB.
Assim como no texto-para-vídeo, capture o task_id da resposta e use a mesma lógica de consulta para acompanhar o status da tarefa até que ela seja concluída.
Agora, vamos analisar a estrutura das respostas da API para entender o que cada campo significa.
Entendendo as Respostas da API
Quando você faz uma solicitação POST bem-sucedida, a API retorna um objeto JSON contendo um task_id que você pode usar para verificar o progresso da tarefa. Assim que a tarefa for concluída, você receberá os seguintes campos:
| Campo | Tipo | Descrição |
|---|---|---|
task_id / id | String | Um identificador único para a tarefa. |
task_status | Enum | Status atual da tarefa: PENDING, RUNNING, SUCCEEDED ou FAILED. |
video_url | String | Link direto para o vídeo MP4 gerado. |
meta.usage | Object | Detalhes sobre o uso de recursos, como credits_used. |
error | Object | Se a tarefa falhar, isto contém name e message com os detalhes do erro. |
Um código de status HTTP 200 e um task_id válido significam que sua solicitação foi aceita. Se a tarefa acabar falhando, verifique o campo error.message para obter detalhes, como formatos de resolução não suportados ou um prompt excessivamente longo.
Wan 2.5 (the Veo 3 Killer) is NOW in n8n (full tutorial & template)
Otimizando Prompts e Configurações
Depois que seu ambiente estiver configurado e você tiver feito as primeiras solicitações de API (ou explorado a mais recente WAN 2.6 API), o ajuste fino dos seus prompts pode melhorar muito a qualidade das suas saídas de vídeo.
Escrevendo Bons Prompts de Texto e Imagem
Os resultados que você obtém dependem muito de como você elabora seus prompts. Para o Wan 2.5, prompts entre 80 e 120 palavras funcionam melhor - longos o suficiente para fornecer orientação clara, mas não tão longos a ponto de confundir o modelo.
Aqui está uma estrutura útil a seguir: comece com o sujeito ou a cena, depois adicione movimentos de câmera, detalhes de movimento e estilo visual. Por exemplo, em vez de dizer "uma mulher caminhando em uma cidade", você poderia escrever: "Uma mulher de casaco vermelho caminha apressada por uma rua de Manhattan encharcada de chuva ao anoitecer. Aproximação lenta com dolly. Poças refletem letreiros de neon. Gradação de cor teal-and-orange, bokeh anamórfico, iluminação volumétrica de fim de tarde." Esse nível de detalhe dá ao modelo instruções claras sobre clima, composição e movimento.
Para controlar a câmera, use termos padrão de cinematografia como Pan left/right, Tilt up/down, Dolly in/out, Orbital arc ou Crane up/down. Adicione profundidade descrevendo efeitos de parallax - "a grama em primeiro plano balança enquanto as montanhas permanecem imóveis ao fundo." Você também pode ajustar o ritmo com termos como "slow-motion" ou "whip-pan (um giro rápido de câmera)."
Para tarefas de imagem-para-vídeo, concentre-se em descrever mudanças de movimento ou expressão, já que o modelo usa a imagem fornecida como referência de base.
Depois de definir seu prompt visual, você pode ir um passo além incorporando áudio e diálogo sincronizados.
Adicionando Áudio e Diálogo
Um dos recursos de destaque do Wan 2.5 é sua capacidade de gerar vídeo e áudio simultaneamente, criando uma experiência totalmente sincronizada com voz, sons ambientes e efeitos.
"O que realmente diferencia o Wan 2.5 é sua capacidade de gerar não apenas vídeos silenciosos, mas experiências audiovisuais completas em uma única passagem." - Scenario Knowledge Base [9]
Para diálogos com sincronização labial, inclua a fala do personagem entre aspas, assim: "Um cientista olha para a câmera e diz: 'Os resultados são extraordinários.'" Para sons ambientais, seja específico: "a chuva bate contra a janela, o trânsito distante zumbe." O modelo integra esses detalhes automaticamente na saída final.
Se você quiser usar seu próprio áudio, pode fornecer uma audio_url personalizada no formato .wav ou .mp3 (tamanho máximo: 15 MB). No entanto, o arquivo de áudio deve corresponder à duração do vídeo; se for mais curto, os quadros restantes ficarão em silêncio. Tenha cuidado ao combinar audio_url com várias URLs de imagem ou vídeo em uma única solicitação, pois isso pode levar a conflitos [4].
O modelo faz a correspondência automática do idioma do áudio com o seu prompt, então, se o seu prompt estiver em inglês, o áudio também estará em inglês - sem etapas extras necessárias [10].
Esse nível de sincronização garante que o áudio e as imagens funcionem juntos de forma perfeita para um resultado final refinado.
Escolhendo Resolução e Duração
Ao trabalhar com solicitações de API, selecionar a resolução e a duração corretas é fundamental para equilibrar qualidade e custo.
O Wan 2.5 Preview oferece duas durações fixas - 5 segundos ou 10 segundos - e resoluções de 480p, 720p e 1080p a 24 fps. Comece com um rascunho de 5 segundos em 480p para testar seu conceito e, em seguida, aumente para 1080p na sua renderização final.
Aqui está uma referência rápida para casos de uso comuns:
| Caso de Uso | Proporção de Tela | Resolução Recomendada | Duração |
|---|---|---|---|
| YouTube / Apresentações | 16:9 (1920×1080) | 1080p | 10s |
| TikTok / Reels / Shorts | 9:16 (1080×1920) | 1080p | 5–10s |
| Feed do Instagram / Anúncios Quadrados | 1:1 (1440×1440) | 1080p | 5s |
| Prototipagem / Testes | Qualquer | 480p | 5s |
| Tablet / Tela Clássica | 4:3 (1632×1248) | 720p | 5–10s |
Todas as resoluções incluem áudio estéreo de 48kHz, então até mesmo um rascunho de baixa resolução dará a você uma boa noção de como o áudio soará antes de se comprometer com uma renderização de maior qualidade.
Integrando o Wan 2.5 em Fluxos de Trabalho Multimodais

Depois de experimentar as APIs, é hora de integrar o Wan 2.5 ao seu pipeline de produção. Com a APIMart, você ganha acesso a mais de 500 modelos de IA através de uma única API. Essa configuração permite combinar de forma perfeita modelos de linguagem, imagem e vídeo sem precisar de configurações extras.
Construindo um Pipeline de Roteiro-para-Vídeo
Aqui está um fluxo de trabalho comum: comece com um modelo de linguagem para redigir um roteiro e dividi-lo em cenas. Em seguida, use um modelo de geração de imagens para criar um storyboard para cada cena. A partir daí, o Wan 2.5 entra em ação, pegando o storyboard e as descrições das cenas para produzir um clipe de vídeo. Ele até sincroniza o áudio de uma só vez, simplificando o processo [2][5].
Ao manter tudo dentro da APIMart, você otimiza seu fluxo de trabalho. Você só precisará gerenciar uma estrutura de API, uma chave de autenticação e um único painel de faturamento. Com essa configuração, você pode se concentrar em ajustar o equilíbrio entre desempenho e custo.
Gerenciando Custos e Desempenho
Para gerenciar as despesas de forma eficaz, adapte o modelo e a resolução ao estágio atual do seu projeto. Para os primeiros rascunhos, use a resolução 480p para clipes de 5 segundos, que custam 43 créditos por clipe. Depois que seu rascunho for aprovado, atualize para 720p a 85 créditos por 5 segundos ou 170 créditos por 10 segundos. Para as renderizações finais, aumente para 1080p a 128 créditos por 5 segundos ou 255 créditos por 10 segundos [1].
Precisa de iterações mais rápidas? A variante wan-2.5-fast oferece uma opção com melhor custo-benefício para 1080p, reduzindo o custo de um clipe de 10 segundos para 174 créditos em vez de 255 créditos [11]. Se você estiver lidando com tarefas de imagem-para-vídeo em escala, o modelo wan2.6-i2v-flash é uma escolha econômica, cobrando $0.0168 por segundo em 720p, em comparação com $0.05 por segundo do Wan 2.6 padrão [7].
Exemplo de Fluxo de Trabalho: Do Conceito ao Vídeo Final
Depois de otimizar custos e desempenho, siga este processo passo a passo para dar vida ao seu conceito:
- Escreva o roteiro: Use um modelo de linguagem como o GPT-5 (disponível via APIMart) para elaborar descrições detalhadas das cenas. Inclua indicações de áudio específicas, como "música suave de piano surge" ou "o trânsito distante da cidade zumbe".
- Gere storyboards e rascunhos de cenas em 480p: Alimente as descrições das cenas em um modelo de imagem para criar guias visuais. Depois, teste cada cena com o Wan 2.5 em 480p por 5 segundos para avaliar movimento, ritmo e sincronização de áudio.
- Renderização final em 1080p: Quando estiver satisfeito com os rascunhos, renderize novamente as cenas em 1080p para uma saída MP4 refinada de 10 segundos, completa com áudio estéreo nativo de 48kHz [8].
"A consistência do WAN 2.6 é incrível! As imagens dos personagens permanecem estáveis em vários clipes, o que antes era difícil de alcançar." - Wei Zhang, Animador Independente [7]
Para um impulso extra durante a renderização final, use o parâmetro enable_prompt_expansion. Esse recurso enriquece automaticamente seus prompts com detalhes cinematográficos, elevando a qualidade da sua saída sem exigir ajustes manuais adicionais [12][3].
Conclusão e Próximos Passos
Agora você está equipado com as ferramentas para começar a criar seu primeiro vídeo com o Wan 2.5. Com sua sincronização audiovisual embutida em uma única passagem, suporte para resoluções de até 1080p e modos de entrada versáteis como texto-para-vídeo e imagem-para-vídeo, este modelo está pronto para trabalhos de produção sérios - não apenas testes casuais.
Antes de começar, certifique-se de que sua configuração esteja totalmente preparada. Comece aos poucos, testando um clipe em 480p para ajustar seus prompts. Depois de dominar o processo, aumente para 1080p nas suas renderizações finais. Essa abordagem permite que você experimente e refine sem comprometer muitos recursos logo de início.
Para o seu primeiro projeto, tente focar em uma única cena. Escreva um prompt detalhado que inclua instruções de áudio claras e gere um clipe curto de 5 segundos. Os tempos de processamento são rápidos - normalmente entre 1 e 5 minutos - e o custo é acessível, começando em apenas $0.0336 por segundo para clipes em 480p [6]. É uma maneira acessível de explorar e se familiarizar com a ferramenta.
Quando estiver pronto para expandir, aproveite a biblioteca da APIMart com mais de 500 modelos de IA. Com uma única chave de API e um painel de faturamento, você pode otimizar seu fluxo de trabalho e criar um pipeline completo de roteiro-para-vídeo com facilidade, ou explorar alternativas como o MiniMax-Hailuo 2.3 para consistência de alta qualidade.
Perguntas Frequentes
Como lido com a consulta (polling) e os tempos limite para tarefas de vídeo de longa duração?
Para fluxos de trabalho de produção, é eficiente usar o parâmetro callbackUrl ao criar uma tarefa. Dessa forma, você receberá automaticamente uma solicitação POST assim que a tarefa for concluída.
Se você preferir a consulta, veja como funciona: envie sua tarefa para obter um taskId, depois aguarde 50 segundos antes de consultar o endpoint de status. Depois disso, verifique o status a cada 5 segundos. Para evitar sobrecarregar o sistema, certifique-se de tratar os erros 429 pausando e tentando novamente após um intervalo.
Qual é a melhor maneira de estimar o custo antes de gerar um clipe de 5s ou 10s?
Para calcular o custo de um clipe de vídeo de 5 ou 10 segundos, basta multiplicar a duração do clipe (em segundos) pela tarifa por segundo do provedor. Certifique-se de verificar a tarifa para a resolução desejada - seja 480p, 720p ou 1080p - já que uma qualidade mais alta geralmente vem com um preço mais alto. Por exemplo, se você estiver calculando para um clipe de 5 segundos, multiplique a tarifa por segundo por 5. Para um clipe de 10 segundos, multiplique por 10.
Como posso melhorar a sincronização labial e a qualidade do diálogo com meus prompts?
Para obter a melhor sincronização labial e qualidade de diálogo no Wan 2.5 Preview, use prompts estruturados. Eles devem especificar claramente as falas do personagem, juntamente com detalhes como emoção, tom, velocidade e timbre. Esse nível de detalhe ajuda o modelo a entregar resultados mais precisos e naturais.
Para uma precisão ainda maior, você pode enviar um arquivo de áudio personalizado no formato WAV ou MP3. Esse arquivo servirá como um guia para o modelo alinhar perfeitamente as expressões faciais e os movimentos da boca com o áudio.
Certifique-se de que sua imagem de entrada seja nítida e bem iluminada. Uma imagem de alta qualidade garante que o modelo possa interpretar e replicar as expressões de forma eficaz. Além disso, aproveite o recurso de extensão de prompt, que permite incluir descrições detalhadas para uma melhor interpretação pelo modelo.
Escolha o modelo que você quer no marketplace
Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.
