APIMart
APIMart

API Qwen-Audio-3.0-TTS: Preços e Controles de Voz

Qwen-Audio-3.0-TTS cobra por milhão de caracteres de entrada, com limite de 4.096. Compare os níveis Flash e Plus, ajuste voz, idioma e velocidade e teste os códigos de erro.

Tutorial

Se você planeja usar o Qwen-Audio-3.0-TTS, dois números importam primeiro: preço por 1.000.000 de caracteres de entrada e o limite de 4.096 caracteres por requisição. Eu tomaria minha decisão de configuração com base nisso e depois fixaria voice, language, speed, response_format e instruct para uma saída estável.

Aqui está a versão resumida:

  • O faturamento é baseado em caracteres, e apenas o texto no campo input conta.
  • Tanto o Flash quanto o Plus são cobrados por 1.000.000 de caracteres.
  • Uma tarifa de exemplo no artigo usa US$ 15,00 por 1M de caracteres.
  • Cada requisição é limitada a 4.096 caracteres.
  • Você pode controlar a saída com:
    • voice para a escolha do locutor
    • language para a pronúncia
    • speed de 0,5 a 2,0
    • response_format como mp3, wav, opus ou pcm
    • instruct para tom, humor e entrega
  • O modelo inclui 9 locutores predefinidos e dá suporte a 10 idiomas.
  • Flash serve para trabalho de baixa latência e alto volume.
  • Plus serve para narração, voz de marca e áudio de formato mais longo.

Alguns números mostram quão baixo o gasto pode começar. A US$ 15,00 por 1.000.000 de caracteres, 500 caracteres x 30.000 requisições resultam em cerca de US$ 0,225/mês na conta de exemplo do artigo. Isso significa que seu trabalho principal é menos sobre o preço bruto e mais sobre manter as configurações de voz estáveis entre os casos de uso.

Eu leria este guia como uma lista de verificação de configuração: estime o custo, escolha um locutor, defina os controles de base, teste códigos de erro como 413 e 429 e então publique.

APIMart
Qwen-Audio-3.0-TTS: Flash vs Plus – Preços, Vozes e Casos de Uso em um Relance

Preços e Faturamento do Qwen-Audio-3.0-TTS

APIMart

O Qwen-Audio-3.0-TTS é cobrado por caracteres de texto de entrada[1].

Como Funcionam as Unidades de Preço

Ambos os níveis de modelo - Flash e Plus - são cobrados por 1.000.000 de caracteres de texto de entrada. Apenas o texto dentro do campo input é cobrado[1]. Cada requisição pode incluir até 4.096 caracteres[1].

O Flash funciona bem para tarefas de baixa latência e alto volume. O Plus é mais adequado para narração e trabalho de voz de marca.

Como Estimar Seu Custo Mensal

A conta é bem simples: pegue a média de caracteres por requisição, multiplique pelo seu volume mensal de requisições, divida por 1.000.000 e depois multiplique pela tarifa por milhão.

Usando um preço de exemplo de US$ 15,00 por 1M de caracteres, veja como isso pode ficar:

Caso de UsoMédia de Caracteres/RequisiçãoRequisições MensaisCusto Mensal Est.
Assistente de chat50030.000~US$ 0,225
Suporte ao cliente1.20030.000~US$ 0,54
Narração de vídeo10.00030.000~US$ 4,50

Respostas curtas geralmente custam muito pouco. Narrações mais longas somam mais rápido.

Como Funciona o Faturamento do APIMart em Projetos Multimodelo

APIMart

Se o seu fluxo de trabalho usa mais de um modelo, meça cada um pela sua própria unidade de faturamento.

Em projetos do APIMart que misturam áudio, texto, imagem ou vídeo, acompanhe cada modelo por conta própria. Para TTS, acompanhe caracteres. Para modelos de texto, acompanhe tokens. Para modelos de imagem, acompanhe chamadas. Para modelos de vídeo, acompanhe segundos.

Com o custo definido, o próximo passo é escolher os controles de voz que moldam a saída.

Controles de Voz no Qwen-Audio-3.0-TTS

Agora que os preços estão claros, o próximo passo é moldar a voz.

O Qwen-Audio-3.0-TTS divide o controle de voz em duas partes. Os parâmetros estruturados cuidam da configuração central, enquanto instruct cuida do estilo. Se você quer uma saída repetível, apoie-se nos campos estruturados. Se quer que o tom ou a emoção mude, use instruct.

Locutor, Idioma e Formato de Saída

A API vem com 9 perfis de locutores predefinidos, cada um com seu próprio timbre e estilo de voz [2]. Para aplicativos em inglês, Ryan e Aiden são as melhores escolhas para conteúdo em inglês. Se você está construindo para mais de um mercado, o parâmetro language aceita valores como English, Chinese ou Auto para detecção automática entre 10 idiomas suportados [2].

LocutorDescrição da VozIdioma Nativo
RyanMasculina dinâmica, forte impulso rítmicoInglês
AidenMasculina americana ensolarada, médios clarosInglês
VivianFeminina jovem brilhante, levemente incisivaChinês
SerenaFeminina jovem calorosa e suaveChinês
Uncle_FuMasculina madura, timbre grave e aveludadoChinês
DylanMasculina jovem, dialeto de PequimChinês
EricMasculina animada, dialeto de SichuanChinês
Ono_AnnaFeminina brincalhona, timbre leve e ágilJaponês
SoheeFeminina calorosa, emoção ricaCoreano

Uma regra simples funciona bem aqui: combine o locutor com o idioma de destino. Para conteúdo em en-US, Ryan ou Aiden geralmente faz mais sentido [2].

Para a saída, você pode escolher mp3, wav, opus ou pcm. Formatos padrão como MP3 e WAV funcionam bem em navegadores modernos e ferramentas de mídia [1][2].

Tom, Velocidade e Emoção

O parâmetro speed aceita uma faixa numérica de 0,5 a 2,0, com 1,0 como padrão [2]. Os controles documentados nesta área são speed e instruct, que afetam emoção, timbre, prosódia e tom [2].

ControleCampo da RequisiçãoValores / Faixa EsperadosEfeito no ÁudioCaso de Uso Mais Adequado
LocutorspeakerVivian, Ryan, Aiden, etc.Define o timbre base e o sotaque nativoPersonagens de marca, conteúdo localizado
IdiomalanguageEnglish, Chinese, Auto, etc.Determina a pronúncia e o localeAplicativos multilíngues
Velocidadespeed0,5–2,0 (padrão: 1,0)Altera o ritmo da falaConteúdo educacional, avisos rápidos
Emoção/TominstructVery happy, Angry, Calm, IncredulousMuda a prosódia e a entrega emocionalMarketing, personagens de jogos, suporte
Formatoresponse_formatwav, mp3, pcm, opusAfeta o tamanho do arquivo e a compatibilidadeReprodução em navegador e ferramentas de mídia

Um detalhe vale a pena observar: se instruct pede uma entrega empolgada, o ritmo pode acelerar mesmo com speed: 1.0 inalterado [2]. Então, se a leitura parecer mais rápida do que o esperado, o prompt de estilo pode ser o motivo.

Parâmetros Estruturados Versus Instruções de Prompt

Ajuda pensar nos campos explícitos - speaker, language, speed e response_format - como sua base de produção. Eles definem a identidade central da voz para cada requisição. Então instruct fica em cima dessa camada base e molda como a voz se comporta [2].

Use parâmetros estruturados quando precisar de uma saída de produção estável. Use instruct quando quiser variação. Na prática, prompts mais descritivos tendem a produzir resultados mais nuançados do que instruções de uma palavra [2].

Esses padrões mapeiam diretamente no corpo da requisição na próxima seção.

Como Enviar Requisições Qwen-Audio-3.0-TTS pelo APIMart

Envie requisições POST para https://api.apimart.ai/v1/audio/speech e passe seu token Bearer no cabeçalho Authorization [1].

Estrutura Básica da Requisição

Os campos principais são model, input, voice, language, response_format, speed e instruct [1][2]. Além disso, mantenha input abaixo de 4.096 caracteres.

Esta requisição coloca o fator de preço e as configurações de voz em um único corpo:

{
  "model": "YOUR_QWEN_MODEL_ID",
  "input": "Welcome to our platform. We are excited to have you here.",
  "voice": "Aiden",
  "language": "English",
  "instruct": "Warm and welcoming tone",
  "response_format": "mp3",
  "speed": 1.0
}

Em resumo, esses campos dizem à API o que dizer, como dizer e qual formato retornar.

Para um teste rápido com cURL, use:

curl --request POST \
  --url https://api.apimart.ai/v1/audio/speech \
  --header 'Authorization: Bearer YOUR_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "YOUR_QWEN_MODEL_ID",
    "input": "Your order has been confirmed and will ship shortly.",
    "voice": "Serena",
    "language": "English",
    "response_format": "opus"
  }' \
  --output confirmation.opus

Isso salva a resposta de áudio diretamente em confirmation.opus [1].

Configurações Recomendadas para Cenários Comuns

Uma vez que você conhece o formato da requisição, escolher as configurações fica muito mais fácil. A tabela abaixo mapeia casos de uso comuns para um bom preset inicial.

CenárioNível SugeridovoiceVelocidadePrompt de InstructSensibilidade a Custo
Suporte ao ClienteFlash (0.6B)Serena1.1HelpfulAlta
Onboarding de AppPlus (1.7B)Aiden1.0Warm and welcomingMédia
Narração EducacionalPlus (1.7B)Uncle_Fu0.9Authoritative and measuredMédia
Criativo de AnúncioPlus (1.7B)Vivian1.0Energetic and dynamicBaixa
Locução de Vídeo de ProdutoPlus (1.7B)Ryan1.0Professional and clearBaixa

Se você precisa de saída multilíngue, defina language para corresponder ao seu roteiro. O modelo dá suporte a 10 idiomas principais: Chinês, Inglês, Japonês, Coreano, Alemão, Francês, Russo, Português, Espanhol e Italiano [2].

Limites de Taxa, Erros e Verificações de Produção

Antes de entrar em produção, teste alguns casos de falha de propósito. É um daqueles pequenos passos que podem poupar muita dor de cabeça depois.

Código de ErroSignificadoAção Recomendada
400Parâmetros inválidosVerifique a estrutura JSON e os valores aceitos
401Chave de API ausente ou inválidaVerifique seu token Bearer
402Saldo de conta insuficienteRecarregue sua conta do APIMart
413Entrada excede 4.096 caracteresDivida o texto em segmentos menores
429Limite de taxa excedidoTente novamente com backoff exponencial
500/502Erro de servidor ou gatewayAguarde um pouco e tente de novo

Um 400 geralmente significa que algo no corpo da requisição está errado. Um 413 é mais direto: seu texto é longo demais, então divida-o em pedaços menores. E se você receber 429, recue e tente novamente em vez de martelar o endpoint.

Escolhendo a Configuração Certa e Próximos Passos

Um Framework de Decisão Simples

Agora que os preços e os controles de voz estão definidos, use este último filtro para combinar o modelo ao trabalho que você precisa realizar.

Escolha com base em orçamento, controle de voz e caso de uso.

PrioridadeMelhor OpçãoNível Recomendado
Baixa latência e alto volumeAssistentes ao vivo, IVR, tradução em tempo realFlash
Eficiência de custo em alto volumeLocalização em massa, suporte ao cliente de alto volumeFlash
Narração de marca expressivaNarração de marca, áudio de formato longo, vozes de personagensPlus

Se você está fazendo narração de formato longo, mantenha um único locutor do início ao fim. Mantenha instruct conciso, simples e repetível. Isso geralmente lhe dá uma saída mais estável e menos surpresas.

Para configurações mais simples, mantenha-o ainda mais limpo: escolha um locutor e altere apenas o campo instruct quando necessário.

Pontos-Chave a Levar para a Implementação

Uma vez que você escolhe um nível, configure as coisas em torno do cenário que você rodará com mais frequência. Isso mantém seu plano de lançamento fundamentado no uso real, não em casos extremos.

  • Defina alertas de uso antes do lançamento.
  • Verifique cada cenário com seu próprio locutor, velocidade e prompt instruct.
  • Teste a saída com ouvintes nativos dos EUA antes do lançamento.
  • O APIMart permite alternar níveis sem alterar o padrão central de integração.

Além disso, teste como seu sistema lida com 402, 429 e 502 antes do lançamento.

Perguntas Frequentes

Como divido um texto longo com mais de 4.096 caracteres?

Divida o texto em pedaços de 4.096 caracteres ou menos e envie cada pedaço à API separadamente.

Tente dividir em pontos de parada naturais, como o fim de uma frase ou parágrafo. Depois disso, combine os arquivos de áudio retornados em uma faixa final única.

Quais configurações de voz devo fixar para uma saída consistente?

Para uma saída de formato longo estável, use o modelo VoiceDesign para configurar uma persona clara e um clipe de referência. Depois crie um prompt reutilizável com create_voice_clone_prompt e passe esse voice_clone_prompt para generate_voice_clone.

Também ajuda fixar configurações de geração como top_p para que a voz não se desvie ao longo do tempo. E antes de lançar, faça um ensaio para pegar problemas cedo.

Quando devo escolher Flash em vez de Plus?

Escolha Flash (0.6B) quando velocidade e baixa latência importam mais. Ele foi construído para casos de uso de alta concorrência como assistentes virtuais em tempo real, tradução ao vivo e suporte ao cliente, onde tempos de resposta rápidos são críticos.

Escolha Plus (1.7B) quando qualidade e precisão importam mais do que velocidade. Ele entrega melhor prosódia, uma faixa emocional mais ampla e maior precisão para audiolivros, locuções profissionais e mídia de marca.

Pronto para testar?

Escolha o modelo que você quer no marketplace

Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.

Modelos de chatModelos de imagemModelos de vídeo
Explorar marketplace