

API Qwen-Audio-3.0-TTS: Preços e Controles de Voz
Qwen-Audio-3.0-TTS cobra por milhão de caracteres de entrada, com limite de 4.096. Compare os níveis Flash e Plus, ajuste voz, idioma e velocidade e teste os códigos de erro.
Se você planeja usar o Qwen-Audio-3.0-TTS, dois números importam primeiro: preço por 1.000.000 de caracteres de entrada e o limite de 4.096 caracteres por requisição. Eu tomaria minha decisão de configuração com base nisso e depois fixaria voice, language, speed, response_format e instruct para uma saída estável.
Aqui está a versão resumida:
- O faturamento é baseado em caracteres, e apenas o texto no campo
inputconta. - Tanto o Flash quanto o Plus são cobrados por 1.000.000 de caracteres.
- Uma tarifa de exemplo no artigo usa US$ 15,00 por 1M de caracteres.
- Cada requisição é limitada a 4.096 caracteres.
- Você pode controlar a saída com:
voicepara a escolha do locutorlanguagepara a pronúnciaspeedde 0,5 a 2,0response_formatcomomp3,wav,opusoupcminstructpara tom, humor e entrega
- O modelo inclui 9 locutores predefinidos e dá suporte a 10 idiomas.
- Flash serve para trabalho de baixa latência e alto volume.
- Plus serve para narração, voz de marca e áudio de formato mais longo.
Alguns números mostram quão baixo o gasto pode começar. A US$ 15,00 por 1.000.000 de caracteres, 500 caracteres x 30.000 requisições resultam em cerca de US$ 0,225/mês na conta de exemplo do artigo. Isso significa que seu trabalho principal é menos sobre o preço bruto e mais sobre manter as configurações de voz estáveis entre os casos de uso.
Eu leria este guia como uma lista de verificação de configuração: estime o custo, escolha um locutor, defina os controles de base, teste códigos de erro como 413 e 429 e então publique.

Preços e Faturamento do Qwen-Audio-3.0-TTS

O Qwen-Audio-3.0-TTS é cobrado por caracteres de texto de entrada[1].
Como Funcionam as Unidades de Preço
Ambos os níveis de modelo - Flash e Plus - são cobrados por 1.000.000 de caracteres de texto de entrada. Apenas o texto dentro do campo input é cobrado[1]. Cada requisição pode incluir até 4.096 caracteres[1].
O Flash funciona bem para tarefas de baixa latência e alto volume. O Plus é mais adequado para narração e trabalho de voz de marca.
Como Estimar Seu Custo Mensal
A conta é bem simples: pegue a média de caracteres por requisição, multiplique pelo seu volume mensal de requisições, divida por 1.000.000 e depois multiplique pela tarifa por milhão.
Usando um preço de exemplo de US$ 15,00 por 1M de caracteres, veja como isso pode ficar:
| Caso de Uso | Média de Caracteres/Requisição | Requisições Mensais | Custo Mensal Est. |
|---|---|---|---|
| Assistente de chat | 500 | 30.000 | ~US$ 0,225 |
| Suporte ao cliente | 1.200 | 30.000 | ~US$ 0,54 |
| Narração de vídeo | 10.000 | 30.000 | ~US$ 4,50 |
Respostas curtas geralmente custam muito pouco. Narrações mais longas somam mais rápido.
Como Funciona o Faturamento do APIMart em Projetos Multimodelo

Se o seu fluxo de trabalho usa mais de um modelo, meça cada um pela sua própria unidade de faturamento.
Em projetos do APIMart que misturam áudio, texto, imagem ou vídeo, acompanhe cada modelo por conta própria. Para TTS, acompanhe caracteres. Para modelos de texto, acompanhe tokens. Para modelos de imagem, acompanhe chamadas. Para modelos de vídeo, acompanhe segundos.
Com o custo definido, o próximo passo é escolher os controles de voz que moldam a saída.
Controles de Voz no Qwen-Audio-3.0-TTS
Agora que os preços estão claros, o próximo passo é moldar a voz.
O Qwen-Audio-3.0-TTS divide o controle de voz em duas partes. Os parâmetros estruturados cuidam da configuração central, enquanto instruct cuida do estilo. Se você quer uma saída repetível, apoie-se nos campos estruturados. Se quer que o tom ou a emoção mude, use instruct.
Locutor, Idioma e Formato de Saída
A API vem com 9 perfis de locutores predefinidos, cada um com seu próprio timbre e estilo de voz [2]. Para aplicativos em inglês, Ryan e Aiden são as melhores escolhas para conteúdo em inglês. Se você está construindo para mais de um mercado, o parâmetro language aceita valores como English, Chinese ou Auto para detecção automática entre 10 idiomas suportados [2].
| Locutor | Descrição da Voz | Idioma Nativo |
|---|---|---|
| Ryan | Masculina dinâmica, forte impulso rítmico | Inglês |
| Aiden | Masculina americana ensolarada, médios claros | Inglês |
| Vivian | Feminina jovem brilhante, levemente incisiva | Chinês |
| Serena | Feminina jovem calorosa e suave | Chinês |
| Uncle_Fu | Masculina madura, timbre grave e aveludado | Chinês |
| Dylan | Masculina jovem, dialeto de Pequim | Chinês |
| Eric | Masculina animada, dialeto de Sichuan | Chinês |
| Ono_Anna | Feminina brincalhona, timbre leve e ágil | Japonês |
| Sohee | Feminina calorosa, emoção rica | Coreano |
Uma regra simples funciona bem aqui: combine o locutor com o idioma de destino. Para conteúdo em en-US, Ryan ou Aiden geralmente faz mais sentido [2].
Para a saída, você pode escolher mp3, wav, opus ou pcm. Formatos padrão como MP3 e WAV funcionam bem em navegadores modernos e ferramentas de mídia [1][2].
Tom, Velocidade e Emoção
O parâmetro speed aceita uma faixa numérica de 0,5 a 2,0, com 1,0 como padrão [2]. Os controles documentados nesta área são speed e instruct, que afetam emoção, timbre, prosódia e tom [2].
| Controle | Campo da Requisição | Valores / Faixa Esperados | Efeito no Áudio | Caso de Uso Mais Adequado |
|---|---|---|---|---|
| Locutor | speaker | Vivian, Ryan, Aiden, etc. | Define o timbre base e o sotaque nativo | Personagens de marca, conteúdo localizado |
| Idioma | language | English, Chinese, Auto, etc. | Determina a pronúncia e o locale | Aplicativos multilíngues |
| Velocidade | speed | 0,5–2,0 (padrão: 1,0) | Altera o ritmo da fala | Conteúdo educacional, avisos rápidos |
| Emoção/Tom | instruct | Very happy, Angry, Calm, Incredulous | Muda a prosódia e a entrega emocional | Marketing, personagens de jogos, suporte |
| Formato | response_format | wav, mp3, pcm, opus | Afeta o tamanho do arquivo e a compatibilidade | Reprodução em navegador e ferramentas de mídia |
Um detalhe vale a pena observar: se instruct pede uma entrega empolgada, o ritmo pode acelerar mesmo com speed: 1.0 inalterado [2]. Então, se a leitura parecer mais rápida do que o esperado, o prompt de estilo pode ser o motivo.
Parâmetros Estruturados Versus Instruções de Prompt
Ajuda pensar nos campos explícitos - speaker, language, speed e response_format - como sua base de produção. Eles definem a identidade central da voz para cada requisição. Então instruct fica em cima dessa camada base e molda como a voz se comporta [2].
Use parâmetros estruturados quando precisar de uma saída de produção estável. Use instruct quando quiser variação. Na prática, prompts mais descritivos tendem a produzir resultados mais nuançados do que instruções de uma palavra [2].
Esses padrões mapeiam diretamente no corpo da requisição na próxima seção.
Como Enviar Requisições Qwen-Audio-3.0-TTS pelo APIMart
Envie requisições POST para https://api.apimart.ai/v1/audio/speech e passe seu token Bearer no cabeçalho Authorization [1].
Estrutura Básica da Requisição
Os campos principais são model, input, voice, language, response_format, speed e instruct [1][2]. Além disso, mantenha input abaixo de 4.096 caracteres.
Esta requisição coloca o fator de preço e as configurações de voz em um único corpo:
{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Welcome to our platform. We are excited to have you here.",
"voice": "Aiden",
"language": "English",
"instruct": "Warm and welcoming tone",
"response_format": "mp3",
"speed": 1.0
}
Em resumo, esses campos dizem à API o que dizer, como dizer e qual formato retornar.
Para um teste rápido com cURL, use:
curl --request POST \
--url https://api.apimart.ai/v1/audio/speech \
--header 'Authorization: Bearer YOUR_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Your order has been confirmed and will ship shortly.",
"voice": "Serena",
"language": "English",
"response_format": "opus"
}' \
--output confirmation.opus
Isso salva a resposta de áudio diretamente em confirmation.opus [1].
Configurações Recomendadas para Cenários Comuns
Uma vez que você conhece o formato da requisição, escolher as configurações fica muito mais fácil. A tabela abaixo mapeia casos de uso comuns para um bom preset inicial.
| Cenário | Nível Sugerido | voice | Velocidade | Prompt de Instruct | Sensibilidade a Custo |
|---|---|---|---|---|---|
| Suporte ao Cliente | Flash (0.6B) | Serena | 1.1 | Helpful | Alta |
| Onboarding de App | Plus (1.7B) | Aiden | 1.0 | Warm and welcoming | Média |
| Narração Educacional | Plus (1.7B) | Uncle_Fu | 0.9 | Authoritative and measured | Média |
| Criativo de Anúncio | Plus (1.7B) | Vivian | 1.0 | Energetic and dynamic | Baixa |
| Locução de Vídeo de Produto | Plus (1.7B) | Ryan | 1.0 | Professional and clear | Baixa |
Se você precisa de saída multilíngue, defina language para corresponder ao seu roteiro. O modelo dá suporte a 10 idiomas principais: Chinês, Inglês, Japonês, Coreano, Alemão, Francês, Russo, Português, Espanhol e Italiano [2].
Limites de Taxa, Erros e Verificações de Produção
Antes de entrar em produção, teste alguns casos de falha de propósito. É um daqueles pequenos passos que podem poupar muita dor de cabeça depois.
| Código de Erro | Significado | Ação Recomendada |
|---|---|---|
| 400 | Parâmetros inválidos | Verifique a estrutura JSON e os valores aceitos |
| 401 | Chave de API ausente ou inválida | Verifique seu token Bearer |
| 402 | Saldo de conta insuficiente | Recarregue sua conta do APIMart |
| 413 | Entrada excede 4.096 caracteres | Divida o texto em segmentos menores |
| 429 | Limite de taxa excedido | Tente novamente com backoff exponencial |
| 500/502 | Erro de servidor ou gateway | Aguarde um pouco e tente de novo |
Um 400 geralmente significa que algo no corpo da requisição está errado. Um 413 é mais direto: seu texto é longo demais, então divida-o em pedaços menores. E se você receber 429, recue e tente novamente em vez de martelar o endpoint.
Escolhendo a Configuração Certa e Próximos Passos
Um Framework de Decisão Simples
Agora que os preços e os controles de voz estão definidos, use este último filtro para combinar o modelo ao trabalho que você precisa realizar.
Escolha com base em orçamento, controle de voz e caso de uso.
| Prioridade | Melhor Opção | Nível Recomendado |
|---|---|---|
| Baixa latência e alto volume | Assistentes ao vivo, IVR, tradução em tempo real | Flash |
| Eficiência de custo em alto volume | Localização em massa, suporte ao cliente de alto volume | Flash |
| Narração de marca expressiva | Narração de marca, áudio de formato longo, vozes de personagens | Plus |
Se você está fazendo narração de formato longo, mantenha um único locutor do início ao fim. Mantenha instruct conciso, simples e repetível. Isso geralmente lhe dá uma saída mais estável e menos surpresas.
Para configurações mais simples, mantenha-o ainda mais limpo: escolha um locutor e altere apenas o campo instruct quando necessário.
Pontos-Chave a Levar para a Implementação
Uma vez que você escolhe um nível, configure as coisas em torno do cenário que você rodará com mais frequência. Isso mantém seu plano de lançamento fundamentado no uso real, não em casos extremos.
- Defina alertas de uso antes do lançamento.
- Verifique cada cenário com seu próprio locutor, velocidade e prompt
instruct. - Teste a saída com ouvintes nativos dos EUA antes do lançamento.
- O APIMart permite alternar níveis sem alterar o padrão central de integração.
Além disso, teste como seu sistema lida com 402, 429 e 502 antes do lançamento.
Perguntas Frequentes
Como divido um texto longo com mais de 4.096 caracteres?
Divida o texto em pedaços de 4.096 caracteres ou menos e envie cada pedaço à API separadamente.
Tente dividir em pontos de parada naturais, como o fim de uma frase ou parágrafo. Depois disso, combine os arquivos de áudio retornados em uma faixa final única.
Quais configurações de voz devo fixar para uma saída consistente?
Para uma saída de formato longo estável, use o modelo VoiceDesign para configurar uma persona clara e um clipe de referência. Depois crie um prompt reutilizável com create_voice_clone_prompt e passe esse voice_clone_prompt para generate_voice_clone.
Também ajuda fixar configurações de geração como top_p para que a voz não se desvie ao longo do tempo. E antes de lançar, faça um ensaio para pegar problemas cedo.
Quando devo escolher Flash em vez de Plus?
Escolha Flash (0.6B) quando velocidade e baixa latência importam mais. Ele foi construído para casos de uso de alta concorrência como assistentes virtuais em tempo real, tradução ao vivo e suporte ao cliente, onde tempos de resposta rápidos são críticos.
Escolha Plus (1.7B) quando qualidade e precisão importam mais do que velocidade. Ele entrega melhor prosódia, uma faixa emocional mais ampla e maior precisão para audiolivros, locuções profissionais e mídia de marca.
Escolha o modelo que você quer no marketplace
Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.
