

API Qwen-Audio-3.0-TTS: precios y controles de voz
Qwen-Audio-3.0-TTS factura por millón de caracteres de entrada con un límite de 4096. Compara los niveles Flash y Plus, ajusta voz, idioma y velocidad, y prueba los códigos de error.
Si planeas usar Qwen-Audio-3.0-TTS, dos números importan primero: el precio por 1.000.000 de caracteres de entrada y el límite de 4096 caracteres por solicitud. Yo tomaría mi decisión de configuración a partir de eso y luego fijaría voice, language, speed, response_format e instruct para una salida estable.
Aquí va la versión corta:
- La facturación se basa en caracteres, y solo cuenta el texto del campo
input. - Tanto Flash como Plus se facturan por 1.000.000 de caracteres.
- Una tarifa de ejemplo en el artículo usa $15.00 por 1M de caracteres.
- Cada solicitud tiene un límite de 4096 caracteres.
- Puedes controlar la salida con:
voicepara la elección de locutorlanguagepara la pronunciaciónspeedde 0.5 a 2.0response_formatcomomp3,wav,opusopcminstructpara tono, ánimo y entonación
- El modelo incluye 9 locutores predefinidos y admite 10 idiomas.
- Flash encaja con trabajo de baja latencia y alto volumen.
- Plus encaja con narración, voz de marca y audio de formato más largo.
Algunos números muestran lo bajo que puede empezar el gasto. A $15.00 por 1.000.000 de caracteres, 500 caracteres x 30.000 solicitudes sale a alrededor de $0.225/mes en el cálculo de ejemplo del artículo. Eso significa que tu trabajo principal tiene menos que ver con el precio bruto y más con mantener estables los ajustes de voz entre casos de uso.
Yo leería esta guía como una lista de comprobación de configuración: estima el coste, elige un locutor, define los controles base, prueba códigos de error como 413 y 429, y luego lanza.

Precios y facturación de Qwen-Audio-3.0-TTS

Qwen-Audio-3.0-TTS se factura por caracteres de texto de entrada[1].
Cómo funcionan las unidades de precio
Ambos niveles del modelo —Flash y Plus— se facturan por 1.000.000 de caracteres de texto de entrada. Solo se factura el texto dentro del campo input[1]. Cada solicitud puede incluir hasta 4096 caracteres[1].
Flash funciona bien para trabajos de baja latencia y alto volumen. Plus encaja mejor con narración y trabajo de voz de marca.
Cómo estimar tu coste mensual
El cálculo es bastante sencillo: toma el promedio de caracteres por solicitud, multiplícalo por tu volumen mensual de solicitudes, divide entre 1.000.000 y luego multiplica por la tarifa por millón.
Usando un precio de ejemplo de $15.00 por 1M de caracteres, así puede verse:
| Caso de uso | Promedio caracteres/solicitud | Solicitudes mensuales | Coste mensual estimado |
|---|---|---|---|
| Asistente de chat | 500 | 30,000 | ~$0.225 |
| Atención al cliente | 1,200 | 30,000 | ~$0.54 |
| Narración de vídeo | 10,000 | 30,000 | ~$4.50 |
Las respuestas cortas suelen costar muy poco. La narración más larga se acumula más rápido.
Cómo funciona la facturación de APIMart en proyectos multimodelo

Si tu flujo de trabajo usa más de un modelo, mide cada uno por su propia unidad de facturación.
En proyectos de APIMart que combinan audio, texto, imagen o vídeo, haz seguimiento de cada modelo por separado. Para TTS, cuenta caracteres. Para modelos de texto, cuenta tokens. Para modelos de imagen, cuenta llamadas. Para modelos de vídeo, cuenta segundos.
Con el coste definido, el siguiente paso es elegir los controles de voz que dan forma a la salida.
Controles de voz en Qwen-Audio-3.0-TTS
Ahora que el precio está claro, el siguiente paso es dar forma a la voz.
Qwen-Audio-3.0-TTS divide el control de voz en dos partes. Los parámetros estructurados manejan la configuración central, mientras que instruct maneja el estilo. Si quieres una salida repetible, apóyate en los campos estructurados. Si quieres que el tono o la emoción cambien, usa instruct.
Locutor, idioma y formato de salida
La API viene con 9 perfiles de locutor predefinidos, cada uno con su propio timbre y estilo de voz [2]. Para aplicaciones en inglés, Ryan y Aiden son las mejores opciones para contenido en inglés. Si construyes para más de un mercado, el parámetro language acepta valores como English, Chinese o Auto para detección automática entre los 10 idiomas admitidos [2].
| Locutor | Descripción de la voz | Idioma nativo |
|---|---|---|
| Ryan | Voz masculina dinámica, fuerte impulso rítmico | Inglés |
| Aiden | Voz masculina estadounidense luminosa, gama media clara | Inglés |
| Vivian | Voz femenina joven brillante y algo intensa | Chino |
| Serena | Voz femenina joven cálida y suave | Chino |
| Uncle_Fu | Voz masculina madura, timbre grave y aterciopelado | Chino |
| Dylan | Voz masculina juvenil, dialecto de Pekín | Chino |
| Eric | Voz masculina vivaz, dialecto de Sichuan | Chino |
| Ono_Anna | Voz femenina juguetona, timbre ligero y ágil | Japonés |
| Sohee | Voz femenina cálida, rica en emoción | Coreano |
Aquí funciona bien una regla simple: haz coincidir el locutor con el idioma de destino. Para contenido en en-US, Ryan o Aiden suele ser lo más sensato [2].
Para la salida, puedes elegir mp3, wav, opus o pcm. Formatos estándar como MP3 y WAV funcionan bien en los navegadores y herramientas multimedia modernas [1][2].
Tono, velocidad y emoción
El parámetro speed acepta un rango numérico de 0.5 a 2.0, con 1.0 como valor predeterminado [2]. Los controles documentados en esta área son speed e instruct, que afectan a la emoción, el timbre, la prosodia y el tono [2].
| Control | Campo de solicitud | Valores/rango esperados | Efecto en el audio | Caso de uso idóneo |
|---|---|---|---|---|
| Locutor | speaker | Vivian, Ryan, Aiden, etc. | Fija el timbre base y el acento nativo | Personajes de marca, contenido localizado |
| Idioma | language | English, Chinese, Auto, etc. | Determina la pronunciación y la configuración regional | Aplicaciones multilingües |
| Velocidad | speed | 0.5–2.0 (predeterminado: 1.0) | Cambia el ritmo del habla | Contenido educativo, avisos legales rápidos |
| Emoción/Tono | instruct | Very happy, Angry, Calm, Incredulous | Cambia la prosodia y la entrega emocional | Marketing, personajes de juegos, soporte |
| Formato | response_format | wav, mp3, pcm, opus | Afecta al tamaño del archivo y a la compatibilidad | Reproducción en navegador y herramientas multimedia |
Un detalle vale la pena vigilar: si instruct pide una entrega entusiasta, el ritmo puede acelerarse incluso cuando speed: 1.0 permanece sin cambios [2]. Así que si la lectura parece más rápida de lo esperado, el prompt de estilo puede ser la razón.
Parámetros estructurados frente a instrucciones de prompt
Ayuda pensar en los campos explícitos —speaker, language, speed y response_format— como tu base de producción. Estos fijan la identidad de voz central de cada solicitud. Luego instruct se sitúa encima de esa capa base y da forma a cómo interpreta la voz [2].
Usa los parámetros estructurados cuando necesites una salida de producción estable. Usa instruct cuando quieras variación. En la práctica, los prompts más descriptivos tienden a producir resultados más matizados que las instrucciones de una sola palabra [2].
Estos valores predeterminados se trasladan directamente al cuerpo de la solicitud en la siguiente sección.
Cómo enviar solicitudes de Qwen-Audio-3.0-TTS a través de APIMart
Envía solicitudes POST a https://api.apimart.ai/v1/audio/speech y pasa tu token Bearer en la cabecera Authorization [1].
Estructura básica de la solicitud
Los campos principales son model, input, voice, language, response_format, speed e instruct [1][2]. Además, mantén input por debajo de 4096 caracteres.
Esta solicitud reúne el factor de precio y los ajustes de voz en un solo cuerpo:
{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Welcome to our platform. We are excited to have you here.",
"voice": "Aiden",
"language": "English",
"instruct": "Warm and welcoming tone",
"response_format": "mp3",
"speed": 1.0
}
Dicho de forma sencilla, estos campos le dicen a la API qué decir, cómo decirlo y qué formato devolver.
Para una prueba rápida con cURL, usa:
curl --request POST \
--url https://api.apimart.ai/v1/audio/speech \
--header 'Authorization: Bearer YOUR_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Your order has been confirmed and will ship shortly.",
"voice": "Serena",
"language": "English",
"response_format": "opus"
}' \
--output confirmation.opus
Esto guarda la respuesta de audio directamente en confirmation.opus [1].
Ajustes recomendados para escenarios comunes
Una vez que conoces la forma de la solicitud, elegir los ajustes se vuelve mucho más fácil. La tabla siguiente asocia casos de uso comunes con un buen preset de partida.
| Escenario | Nivel sugerido | voice | Velocidad | Prompt de instruct | Sensibilidad al coste |
|---|---|---|---|---|---|
| Atención al cliente | Flash (0.6B) | Serena | 1.1 | Helpful | Alta |
| Onboarding de app | Plus (1.7B) | Aiden | 1.0 | Warm and welcoming | Media |
| Narración educativa | Plus (1.7B) | Uncle_Fu | 0.9 | Authoritative and measured | Media |
| Creatividad publicitaria | Plus (1.7B) | Vivian | 1.0 | Energetic and dynamic | Baja |
| Voz en off de vídeo de producto | Plus (1.7B) | Ryan | 1.0 | Professional and clear | Baja |
Si necesitas salida multilingüe, ajusta language para que coincida con tu guion. El modelo admite 10 idiomas principales: chino, inglés, japonés, coreano, alemán, francés, ruso, portugués, español e italiano [2].
Límites de tasa, errores y comprobaciones de producción
Antes de pasar a producción, prueba a propósito algunos casos de fallo. Es uno de esos pequeños pasos que pueden ahorrarte mucho dolor más adelante.
| Código de error | Significado | Acción recomendada |
|---|---|---|
| 400 | Parámetros inválidos | Comprueba la estructura JSON y los valores aceptados |
| 401 | Clave de API ausente o inválida | Verifica tu token Bearer |
| 402 | Saldo de cuenta insuficiente | Recarga tu cuenta de APIMart |
| 413 | La entrada supera los 4096 caracteres | Divide el texto en segmentos más pequeños |
| 429 | Límite de tasa superado | Reintenta con retroceso exponencial |
| 500/502 | Error de servidor o de gateway | Espera un poco y reintenta |
Un 400 normalmente significa que algo en el cuerpo de la solicitud está mal. Un 413 es más directo: tu texto es demasiado largo, así que divídelo en fragmentos más pequeños. Y si obtienes un 429, espera y reintenta en lugar de martillear el endpoint.
Elegir la configuración adecuada y próximos pasos
Un marco de decisión sencillo
Ahora que el precio y los controles de voz están definidos, usa este último filtro para hacer coincidir el modelo con el trabajo que necesitas realizar.
Elige según el presupuesto, el control de voz y el caso de uso.
| Prioridad | Mejor opción | Nivel recomendado |
|---|---|---|
| Baja latencia y alto volumen | Asistentes en vivo, IVR, traducción en tiempo real | Flash |
| Eficiencia de costes a alto volumen | Localización masiva, atención al cliente de alto volumen | Flash |
| Narración de marca expresiva | Narración de marca, audio de formato largo, voces de personajes | Plus |
Si haces narración de formato largo, mantén un solo locutor de principio a fin. Mantén instruct conciso, sencillo y repetible. Eso suele darte una salida más estable y menos sorpresas.
Para configuraciones más simples, mantenlo aún más limpio: elige un solo locutor y cambia únicamente el campo instruct cuando haga falta.
Puntos clave para llevar a la implementación
Una vez que eliges un nivel, configura las cosas en torno al escenario que ejecutarás con más frecuencia. Eso mantiene tu plan de lanzamiento anclado en el uso real, no en los casos límite.
- Configura alertas de uso antes del lanzamiento.
- Verifica cada escenario con su propio locutor, velocidad y prompt de
instruct. - Prueba la salida con oyentes nativos de EE. UU. antes del lanzamiento.
- APIMart te permite cambiar de nivel sin cambiar el patrón de integración central.
Además, prueba cómo maneja tu sistema los códigos 402, 429 y 502 antes del lanzamiento.
Preguntas frecuentes
¿Cómo divido texto largo de más de 4096 caracteres?
Divide el texto en fragmentos de 4096 caracteres o menos y envía cada fragmento a la API por separado.
Intenta dividir en puntos de parada naturales, como el final de una frase o un párrafo. Después, combina los archivos de audio devueltos en una sola pista final.
¿Qué ajustes de voz debería fijar para una salida consistente?
Para una salida estable de formato largo, usa el modelo VoiceDesign para configurar una persona clara y un clip de referencia. Luego crea un prompt reutilizable con create_voice_clone_prompt y pasa ese voice_clone_prompt a generate_voice_clone.
También ayuda fijar ajustes de generación como top_p para que la voz no se desvíe con el tiempo. Y antes de lanzar, haz una prueba en seco para detectar problemas temprano.
¿Cuándo debería elegir Flash en lugar de Plus?
Elige Flash (0.6B) cuando la velocidad y la baja latencia importen más. Está pensado para casos de uso de alta concurrencia como asistentes virtuales en tiempo real, traducción en vivo y atención al cliente, donde los tiempos de respuesta rápidos son críticos.
Elige Plus (1.7B) cuando la calidad y la precisión importen más que la velocidad. Ofrece mejor prosodia, un rango emocional más amplio y mayor precisión para audiolibros, voces en off profesionales y medios de marca.
Elige el modelo que quieres en el marketplace
Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.
