APIMart
APIMart

API Qwen-Audio-3.0-TTS: precios y controles de voz

Qwen-Audio-3.0-TTS factura por millón de caracteres de entrada con un límite de 4096. Compara los niveles Flash y Plus, ajusta voz, idioma y velocidad, y prueba los códigos de error.

Tutorial

Si planeas usar Qwen-Audio-3.0-TTS, dos números importan primero: el precio por 1.000.000 de caracteres de entrada y el límite de 4096 caracteres por solicitud. Yo tomaría mi decisión de configuración a partir de eso y luego fijaría voice, language, speed, response_format e instruct para una salida estable.

Aquí va la versión corta:

  • La facturación se basa en caracteres, y solo cuenta el texto del campo input.
  • Tanto Flash como Plus se facturan por 1.000.000 de caracteres.
  • Una tarifa de ejemplo en el artículo usa $15.00 por 1M de caracteres.
  • Cada solicitud tiene un límite de 4096 caracteres.
  • Puedes controlar la salida con:
    • voice para la elección de locutor
    • language para la pronunciación
    • speed de 0.5 a 2.0
    • response_format como mp3, wav, opus o pcm
    • instruct para tono, ánimo y entonación
  • El modelo incluye 9 locutores predefinidos y admite 10 idiomas.
  • Flash encaja con trabajo de baja latencia y alto volumen.
  • Plus encaja con narración, voz de marca y audio de formato más largo.

Algunos números muestran lo bajo que puede empezar el gasto. A $15.00 por 1.000.000 de caracteres, 500 caracteres x 30.000 solicitudes sale a alrededor de $0.225/mes en el cálculo de ejemplo del artículo. Eso significa que tu trabajo principal tiene menos que ver con el precio bruto y más con mantener estables los ajustes de voz entre casos de uso.

Yo leería esta guía como una lista de comprobación de configuración: estima el coste, elige un locutor, define los controles base, prueba códigos de error como 413 y 429, y luego lanza.

APIMart
Qwen-Audio-3.0-TTS: Flash frente a Plus – precios, voces y casos de uso de un vistazo

Precios y facturación de Qwen-Audio-3.0-TTS

APIMart

Qwen-Audio-3.0-TTS se factura por caracteres de texto de entrada[1].

Cómo funcionan las unidades de precio

Ambos niveles del modelo —Flash y Plus— se facturan por 1.000.000 de caracteres de texto de entrada. Solo se factura el texto dentro del campo input[1]. Cada solicitud puede incluir hasta 4096 caracteres[1].

Flash funciona bien para trabajos de baja latencia y alto volumen. Plus encaja mejor con narración y trabajo de voz de marca.

Cómo estimar tu coste mensual

El cálculo es bastante sencillo: toma el promedio de caracteres por solicitud, multiplícalo por tu volumen mensual de solicitudes, divide entre 1.000.000 y luego multiplica por la tarifa por millón.

Usando un precio de ejemplo de $15.00 por 1M de caracteres, así puede verse:

Caso de usoPromedio caracteres/solicitudSolicitudes mensualesCoste mensual estimado
Asistente de chat50030,000~$0.225
Atención al cliente1,20030,000~$0.54
Narración de vídeo10,00030,000~$4.50

Las respuestas cortas suelen costar muy poco. La narración más larga se acumula más rápido.

Cómo funciona la facturación de APIMart en proyectos multimodelo

APIMart

Si tu flujo de trabajo usa más de un modelo, mide cada uno por su propia unidad de facturación.

En proyectos de APIMart que combinan audio, texto, imagen o vídeo, haz seguimiento de cada modelo por separado. Para TTS, cuenta caracteres. Para modelos de texto, cuenta tokens. Para modelos de imagen, cuenta llamadas. Para modelos de vídeo, cuenta segundos.

Con el coste definido, el siguiente paso es elegir los controles de voz que dan forma a la salida.

Controles de voz en Qwen-Audio-3.0-TTS

Ahora que el precio está claro, el siguiente paso es dar forma a la voz.

Qwen-Audio-3.0-TTS divide el control de voz en dos partes. Los parámetros estructurados manejan la configuración central, mientras que instruct maneja el estilo. Si quieres una salida repetible, apóyate en los campos estructurados. Si quieres que el tono o la emoción cambien, usa instruct.

Locutor, idioma y formato de salida

La API viene con 9 perfiles de locutor predefinidos, cada uno con su propio timbre y estilo de voz [2]. Para aplicaciones en inglés, Ryan y Aiden son las mejores opciones para contenido en inglés. Si construyes para más de un mercado, el parámetro language acepta valores como English, Chinese o Auto para detección automática entre los 10 idiomas admitidos [2].

LocutorDescripción de la vozIdioma nativo
RyanVoz masculina dinámica, fuerte impulso rítmicoInglés
AidenVoz masculina estadounidense luminosa, gama media claraInglés
VivianVoz femenina joven brillante y algo intensaChino
SerenaVoz femenina joven cálida y suaveChino
Uncle_FuVoz masculina madura, timbre grave y aterciopeladoChino
DylanVoz masculina juvenil, dialecto de PekínChino
EricVoz masculina vivaz, dialecto de SichuanChino
Ono_AnnaVoz femenina juguetona, timbre ligero y ágilJaponés
SoheeVoz femenina cálida, rica en emociónCoreano

Aquí funciona bien una regla simple: haz coincidir el locutor con el idioma de destino. Para contenido en en-US, Ryan o Aiden suele ser lo más sensato [2].

Para la salida, puedes elegir mp3, wav, opus o pcm. Formatos estándar como MP3 y WAV funcionan bien en los navegadores y herramientas multimedia modernas [1][2].

Tono, velocidad y emoción

El parámetro speed acepta un rango numérico de 0.5 a 2.0, con 1.0 como valor predeterminado [2]. Los controles documentados en esta área son speed e instruct, que afectan a la emoción, el timbre, la prosodia y el tono [2].

ControlCampo de solicitudValores/rango esperadosEfecto en el audioCaso de uso idóneo
LocutorspeakerVivian, Ryan, Aiden, etc.Fija el timbre base y el acento nativoPersonajes de marca, contenido localizado
IdiomalanguageEnglish, Chinese, Auto, etc.Determina la pronunciación y la configuración regionalAplicaciones multilingües
Velocidadspeed0.5–2.0 (predeterminado: 1.0)Cambia el ritmo del hablaContenido educativo, avisos legales rápidos
Emoción/TonoinstructVery happy, Angry, Calm, IncredulousCambia la prosodia y la entrega emocionalMarketing, personajes de juegos, soporte
Formatoresponse_formatwav, mp3, pcm, opusAfecta al tamaño del archivo y a la compatibilidadReproducción en navegador y herramientas multimedia

Un detalle vale la pena vigilar: si instruct pide una entrega entusiasta, el ritmo puede acelerarse incluso cuando speed: 1.0 permanece sin cambios [2]. Así que si la lectura parece más rápida de lo esperado, el prompt de estilo puede ser la razón.

Parámetros estructurados frente a instrucciones de prompt

Ayuda pensar en los campos explícitos —speaker, language, speed y response_format— como tu base de producción. Estos fijan la identidad de voz central de cada solicitud. Luego instruct se sitúa encima de esa capa base y da forma a cómo interpreta la voz [2].

Usa los parámetros estructurados cuando necesites una salida de producción estable. Usa instruct cuando quieras variación. En la práctica, los prompts más descriptivos tienden a producir resultados más matizados que las instrucciones de una sola palabra [2].

Estos valores predeterminados se trasladan directamente al cuerpo de la solicitud en la siguiente sección.

Cómo enviar solicitudes de Qwen-Audio-3.0-TTS a través de APIMart

Envía solicitudes POST a https://api.apimart.ai/v1/audio/speech y pasa tu token Bearer en la cabecera Authorization [1].

Estructura básica de la solicitud

Los campos principales son model, input, voice, language, response_format, speed e instruct [1][2]. Además, mantén input por debajo de 4096 caracteres.

Esta solicitud reúne el factor de precio y los ajustes de voz en un solo cuerpo:

{
  "model": "YOUR_QWEN_MODEL_ID",
  "input": "Welcome to our platform. We are excited to have you here.",
  "voice": "Aiden",
  "language": "English",
  "instruct": "Warm and welcoming tone",
  "response_format": "mp3",
  "speed": 1.0
}

Dicho de forma sencilla, estos campos le dicen a la API qué decir, cómo decirlo y qué formato devolver.

Para una prueba rápida con cURL, usa:

curl --request POST \
  --url https://api.apimart.ai/v1/audio/speech \
  --header 'Authorization: Bearer YOUR_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "YOUR_QWEN_MODEL_ID",
    "input": "Your order has been confirmed and will ship shortly.",
    "voice": "Serena",
    "language": "English",
    "response_format": "opus"
  }' \
  --output confirmation.opus

Esto guarda la respuesta de audio directamente en confirmation.opus [1].

Ajustes recomendados para escenarios comunes

Una vez que conoces la forma de la solicitud, elegir los ajustes se vuelve mucho más fácil. La tabla siguiente asocia casos de uso comunes con un buen preset de partida.

EscenarioNivel sugeridovoiceVelocidadPrompt de instructSensibilidad al coste
Atención al clienteFlash (0.6B)Serena1.1HelpfulAlta
Onboarding de appPlus (1.7B)Aiden1.0Warm and welcomingMedia
Narración educativaPlus (1.7B)Uncle_Fu0.9Authoritative and measuredMedia
Creatividad publicitariaPlus (1.7B)Vivian1.0Energetic and dynamicBaja
Voz en off de vídeo de productoPlus (1.7B)Ryan1.0Professional and clearBaja

Si necesitas salida multilingüe, ajusta language para que coincida con tu guion. El modelo admite 10 idiomas principales: chino, inglés, japonés, coreano, alemán, francés, ruso, portugués, español e italiano [2].

Límites de tasa, errores y comprobaciones de producción

Antes de pasar a producción, prueba a propósito algunos casos de fallo. Es uno de esos pequeños pasos que pueden ahorrarte mucho dolor más adelante.

Código de errorSignificadoAcción recomendada
400Parámetros inválidosComprueba la estructura JSON y los valores aceptados
401Clave de API ausente o inválidaVerifica tu token Bearer
402Saldo de cuenta insuficienteRecarga tu cuenta de APIMart
413La entrada supera los 4096 caracteresDivide el texto en segmentos más pequeños
429Límite de tasa superadoReintenta con retroceso exponencial
500/502Error de servidor o de gatewayEspera un poco y reintenta

Un 400 normalmente significa que algo en el cuerpo de la solicitud está mal. Un 413 es más directo: tu texto es demasiado largo, así que divídelo en fragmentos más pequeños. Y si obtienes un 429, espera y reintenta en lugar de martillear el endpoint.

Elegir la configuración adecuada y próximos pasos

Un marco de decisión sencillo

Ahora que el precio y los controles de voz están definidos, usa este último filtro para hacer coincidir el modelo con el trabajo que necesitas realizar.

Elige según el presupuesto, el control de voz y el caso de uso.

PrioridadMejor opciónNivel recomendado
Baja latencia y alto volumenAsistentes en vivo, IVR, traducción en tiempo realFlash
Eficiencia de costes a alto volumenLocalización masiva, atención al cliente de alto volumenFlash
Narración de marca expresivaNarración de marca, audio de formato largo, voces de personajesPlus

Si haces narración de formato largo, mantén un solo locutor de principio a fin. Mantén instruct conciso, sencillo y repetible. Eso suele darte una salida más estable y menos sorpresas.

Para configuraciones más simples, mantenlo aún más limpio: elige un solo locutor y cambia únicamente el campo instruct cuando haga falta.

Puntos clave para llevar a la implementación

Una vez que eliges un nivel, configura las cosas en torno al escenario que ejecutarás con más frecuencia. Eso mantiene tu plan de lanzamiento anclado en el uso real, no en los casos límite.

  • Configura alertas de uso antes del lanzamiento.
  • Verifica cada escenario con su propio locutor, velocidad y prompt de instruct.
  • Prueba la salida con oyentes nativos de EE. UU. antes del lanzamiento.
  • APIMart te permite cambiar de nivel sin cambiar el patrón de integración central.

Además, prueba cómo maneja tu sistema los códigos 402, 429 y 502 antes del lanzamiento.

Preguntas frecuentes

¿Cómo divido texto largo de más de 4096 caracteres?

Divide el texto en fragmentos de 4096 caracteres o menos y envía cada fragmento a la API por separado.

Intenta dividir en puntos de parada naturales, como el final de una frase o un párrafo. Después, combina los archivos de audio devueltos en una sola pista final.

¿Qué ajustes de voz debería fijar para una salida consistente?

Para una salida estable de formato largo, usa el modelo VoiceDesign para configurar una persona clara y un clip de referencia. Luego crea un prompt reutilizable con create_voice_clone_prompt y pasa ese voice_clone_prompt a generate_voice_clone.

También ayuda fijar ajustes de generación como top_p para que la voz no se desvíe con el tiempo. Y antes de lanzar, haz una prueba en seco para detectar problemas temprano.

¿Cuándo debería elegir Flash en lugar de Plus?

Elige Flash (0.6B) cuando la velocidad y la baja latencia importen más. Está pensado para casos de uso de alta concurrencia como asistentes virtuales en tiempo real, traducción en vivo y atención al cliente, donde los tiempos de respuesta rápidos son críticos.

Elige Plus (1.7B) cuando la calidad y la precisión importen más que la velocidad. Ofrece mejor prosodia, un rango emocional más amplio y mayor precisión para audiolibros, voces en off profesionales y medios de marca.

¿Listo para probar?

Elige el modelo que quieres en el marketplace

Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.

Modelos de chatModelos de imagenModelos de video
Explorar marketplace