

API Qwen-Audio-3.0-TTS : tarifs et contrôles de voix
Qwen-Audio-3.0-TTS facture au million de caractères d'entrée avec une limite de 4 096 car. Comparez Flash et Plus, réglez voix, langue, vitesse et codes d'erreur.
Si vous prévoyez d'utiliser Qwen-Audio-3.0-TTS, deux chiffres comptent en premier : le prix par 1 000 000 de caractères d'entrée et la limite de 4 096 caractères par requête. Je baserais mon choix de configuration là-dessus, puis je verrouillerais voice, language, speed, response_format et instruct pour une sortie stable.
Voici la version courte :
- La facturation est basée sur les caractères, et seul le texte du champ
inputcompte. - Flash comme Plus sont facturés par 1 000 000 de caractères.
- Un tarif d'exemple dans l'article utilise 15,00 $ par million de caractères.
- Chaque requête est plafonnée à 4 096 caractères.
- Vous pouvez contrôler la sortie avec :
voicepour le choix du locuteurlanguagepour la prononciationspeedde 0,5 à 2,0response_formatcommemp3,wav,opusoupcminstructpour le ton, l'humeur et le débit
- Le modèle inclut 9 locuteurs prédéfinis et prend en charge 10 langues.
- Flash convient au travail à faible latence et à fort volume.
- Plus convient à la narration, à la voix de marque et à l'audio de format long.
Quelques chiffres montrent à quel point la dépense peut démarrer bas. À 15,00 $ par 1 000 000 de caractères, 500 caractères × 30 000 requêtes revient à environ 0,225 $/mois dans le calcul d'exemple de l'article. Cela signifie que votre tâche principale porte moins sur le prix brut que sur le maintien de réglages de voix stables entre les cas d'usage.
Je lirais ce guide comme une checklist de configuration : estimez le coût, choisissez un locuteur, réglez les contrôles de base, testez les codes d'erreur comme 413 et 429, puis mettez en production.

Tarifs et facturation de Qwen-Audio-3.0-TTS

Qwen-Audio-3.0-TTS est facturé selon les caractères du texte d'entrée[1].
Comment fonctionnent les unités de tarification
Les deux niveaux de modèle — Flash et Plus — sont facturés par 1 000 000 de caractères de texte d'entrée. Seul le texte à l'intérieur du champ input est facturé[1]. Chaque requête peut inclure jusqu'à 4 096 caractères[1].
Flash fonctionne bien pour les tâches à faible latence et à fort volume. Plus convient mieux à la narration et au travail de voix de marque.
Comment estimer votre coût mensuel
Le calcul est plutôt simple : prenez votre moyenne de caractères par requête, multipliez-la par votre volume mensuel de requêtes, divisez par 1 000 000, puis multipliez par le tarif au million.
En utilisant un prix d'exemple de 15,00 $ par million de caractères, voici ce que cela peut donner :
| Cas d'usage | Moy. caractères/requête | Requêtes mensuelles | Coût mensuel est. |
|---|---|---|---|
| Assistant de chat | 500 | 30,000 | ~0,225 $ |
| Support client | 1,200 | 30,000 | ~0,54 $ |
| Narration vidéo | 10,000 | 30,000 | ~4,50 $ |
Les réponses courtes coûtent généralement très peu. La narration plus longue s'additionne plus vite.
Comment fonctionne la facturation APIMart sur les projets multi-modèles

Si votre workflow utilise plus d'un modèle, mesurez chacun selon sa propre unité de facturation.
Dans les projets APIMart qui mélangent audio, texte, image ou vidéo, suivez chaque modèle séparément. Pour le TTS, suivez les caractères. Pour les modèles de texte, suivez les tokens. Pour les modèles d'image, suivez les appels. Pour les modèles vidéo, suivez les secondes.
Une fois le coût défini, l'étape suivante consiste à choisir les contrôles de voix qui façonnent la sortie.
Contrôles de voix dans Qwen-Audio-3.0-TTS
Maintenant que la tarification est claire, l'étape suivante est de façonner la voix.
Qwen-Audio-3.0-TTS divise le contrôle de la voix en deux parties. Les paramètres structurés gèrent la configuration de base, tandis que instruct gère le style. Si vous voulez une sortie reproductible, appuyez-vous sur les champs structurés. Si vous voulez que le ton ou l'émotion varient, utilisez instruct.
Locuteur, langue et format de sortie
L'API est livrée avec 9 profils de locuteurs prédéfinis, chacun avec son propre timbre et style de voix [2]. Pour les applications en anglais, Ryan et Aiden sont les meilleurs choix pour le contenu en anglais. Si vous construisez pour plus d'un marché, le paramètre language accepte des valeurs comme English, Chinese ou Auto pour une détection automatique sur les 10 langues prises en charge [2].
| Locuteur | Description de la voix | Langue native |
|---|---|---|
| Ryan | Homme dynamique, forte impulsion rythmique | Anglais |
| Aiden | Homme américain ensoleillé, médiums clairs | Anglais |
| Vivian | Jeune femme lumineuse, légèrement mordante | Chinois |
| Serena | Jeune femme chaleureuse et douce | Chinois |
| Uncle_Fu | Homme aguerri, timbre grave et moelleux | Chinois |
| Dylan | Homme jeune, dialecte de Pékin | Chinois |
| Eric | Homme enjoué, dialecte du Sichuan | Chinois |
| Ono_Anna | Femme espiègle, timbre léger et agile | Japonais |
| Sohee | Femme chaleureuse, émotion riche | Coréen |
Une règle simple fonctionne bien ici : faites correspondre le locuteur à la langue cible. Pour le contenu en-US, Ryan ou Aiden a généralement le plus de sens [2].
Pour la sortie, vous pouvez choisir mp3, wav, opus ou pcm. Les formats standard comme MP3 et WAV fonctionnent bien avec les navigateurs modernes et les outils média [1][2].
Ton, vitesse et émotion
Le paramètre speed prend une plage numérique de 0,5 à 2,0, avec 1,0 par défaut [2]. Les contrôles documentés dans ce domaine sont speed et instruct, qui affectent l'émotion, le timbre, la prosodie et le ton [2].
| Contrôle | Champ de requête | Valeurs / plage attendues | Effet audio | Cas d'usage le plus adapté |
|---|---|---|---|---|
| Locuteur | speaker | Vivian, Ryan, Aiden, etc. | Définit le timbre de base et l'accent natif | Personnages de marque, contenu localisé |
| Langue | language | English, Chinese, Auto, etc. | Détermine la prononciation et la locale | Applications multilingues |
| Vitesse | speed | 0,5–2,0 (par défaut : 1,0) | Change le débit de la parole | Contenu éducatif, avertissements rapides |
| Émotion/Ton | instruct | Very happy, Angry, Calm, Incredulous | Modifie la prosodie et le rendu émotionnel | Marketing, personnages de jeu, support |
| Format | response_format | wav, mp3, pcm, opus | Affecte la taille du fichier et la compatibilité | Lecture navigateur et outils média |
Un détail vaut la peine d'être surveillé : si instruct demande un rendu excité, le rythme peut s'accélérer même quand speed: 1.0 reste inchangé [2]. Donc si la lecture semble plus rapide que prévu, le prompt de style peut en être la raison.
Paramètres structurés versus instructions de prompt
Il est utile de penser aux champs explicites — speaker, language, speed et response_format — comme votre référence de production. Ils définissent l'identité vocale de base pour chaque requête. Puis instruct se pose au-dessus de cette couche de base et façonne la façon dont la voix se produit [2].
Utilisez les paramètres structurés quand vous avez besoin d'une sortie de production stable. Utilisez instruct quand vous voulez de la variation. En pratique, des prompts plus descriptifs tendent à produire des résultats plus nuancés que des instructions d'un seul mot [2].
Ces valeurs par défaut se transposent directement dans le corps de la requête de la section suivante.
Comment envoyer des requêtes Qwen-Audio-3.0-TTS via APIMart
Envoyez des requêtes POST à https://api.apimart.ai/v1/audio/speech et passez votre jeton Bearer dans l'en-tête Authorization [1].
Structure de requête de base
Les champs principaux sont model, input, voice, language, response_format, speed et instruct [1][2]. Gardez aussi input sous 4 096 caractères.
Cette requête réunit le facteur de tarification et les réglages de voix dans un seul corps :
{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Welcome to our platform. We are excited to have you here.",
"voice": "Aiden",
"language": "English",
"instruct": "Warm and welcoming tone",
"response_format": "mp3",
"speed": 1.0
}
En clair, ces champs indiquent à l'API quoi dire, comment le dire et quel format retourner.
Pour un test cURL rapide, utilisez :
curl --request POST \
--url https://api.apimart.ai/v1/audio/speech \
--header 'Authorization: Bearer YOUR_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Your order has been confirmed and will ship shortly.",
"voice": "Serena",
"language": "English",
"response_format": "opus"
}' \
--output confirmation.opus
Cela enregistre la réponse audio directement dans confirmation.opus [1].
Réglages recommandés pour les scénarios courants
Une fois que vous connaissez la forme de la requête, choisir les réglages devient beaucoup plus facile. Le tableau ci-dessous fait correspondre les cas d'usage courants à un bon préréglage de départ.
| Scénario | Niveau suggéré | voice | Vitesse | Prompt Instruct | Sensibilité au coût |
|---|---|---|---|---|---|
| Support client | Flash (0.6B) | Serena | 1.1 | Helpful | Élevée |
| Onboarding d'application | Plus (1.7B) | Aiden | 1.0 | Warm and welcoming | Moyenne |
| Narration éducative | Plus (1.7B) | Uncle_Fu | 0.9 | Authoritative and measured | Moyenne |
| Création publicitaire | Plus (1.7B) | Vivian | 1.0 | Energetic and dynamic | Faible |
| Voix off vidéo produit | Plus (1.7B) | Ryan | 1.0 | Professional and clear | Faible |
Si vous avez besoin d'une sortie multilingue, réglez language pour correspondre à votre script. Le modèle prend en charge 10 langues majeures : chinois, anglais, japonais, coréen, allemand, français, russe, portugais, espagnol et italien [2].
Limites de débit, erreurs et contrôles de production
Avant de passer en production, testez volontairement quelques cas d'échec. C'est une de ces petites étapes qui peut éviter beaucoup de peine plus tard.
| Code d'erreur | Signification | Action recommandée |
|---|---|---|
| 400 | Paramètres invalides | Vérifiez la structure JSON et les valeurs acceptées |
| 401 | Clé API manquante ou invalide | Vérifiez votre jeton Bearer |
| 402 | Solde de compte insuffisant | Rechargez votre compte APIMart |
| 413 | L'entrée dépasse 4 096 caractères | Découpez le texte en segments plus petits |
| 429 | Limite de débit dépassée | Réessayez avec un backoff exponentiel |
| 500/502 | Erreur de serveur ou de passerelle | Attendez brièvement, puis réessayez |
Un 400 signifie généralement que quelque chose dans le corps de la requête ne va pas. Un 413 est plus direct : votre texte est trop long, alors découpez-le en morceaux plus petits. Et si vous rencontrez un 429, ralentissez et réessayez au lieu de marteler l'endpoint.
Choisir la bonne configuration et prochaines étapes
Un cadre de décision simple
Maintenant que la tarification et les contrôles de voix sont fixés, utilisez ce dernier filtre pour faire correspondre le modèle au travail à accomplir.
Choisissez selon le budget, le contrôle de la voix et le cas d'usage.
| Priorité | Meilleur choix | Niveau recommandé |
|---|---|---|
| Faible latence et fort volume | Assistants en direct, SVI, traduction en temps réel | Flash |
| Efficacité de coût à fort volume | Localisation en masse, support client à fort volume | Flash |
| Narration de marque expressive | Narration de marque, audio de format long, voix de personnages | Plus |
Si vous faites de la narration de format long, gardez un seul locuteur du début à la fin. Gardez instruct serré, simple et reproductible. Cela donne généralement une sortie plus stable et moins de surprises.
Pour des configurations plus simples, gardez les choses encore plus nettes : choisissez un seul locuteur et ne changez que le champ instruct au besoin.
Points clés à emporter en implémentation
Une fois que vous avez choisi un niveau, configurez les choses autour du scénario que vous exécuterez le plus souvent. Cela ancre votre plan de lancement dans l'usage réel, pas dans les cas limites.
- Réglez des alertes d'usage avant le lancement.
- Vérifiez chaque scénario avec son propre locuteur, sa vitesse et son prompt
instruct. - Testez la sortie avec des auditeurs natifs des États-Unis avant le lancement.
- APIMart vous laisse changer de niveau sans changer le schéma d'intégration de base.
Testez aussi comment votre système gère les codes 402, 429 et 502 avant le lancement.
FAQ
Comment découper un texte long de plus de 4 096 caractères ?
Découpez le texte en morceaux de 4 096 caractères ou moins et envoyez chaque morceau à l'API séparément.
Essayez de découper à des points d'arrêt naturels, comme la fin d'une phrase ou d'un paragraphe. Ensuite, combinez les fichiers audio retournés en une seule piste finale.
Quels réglages de voix verrouiller pour une sortie cohérente ?
Pour une sortie de format long stable, utilisez le modèle VoiceDesign pour établir un persona clair et un clip de référence. Créez ensuite un prompt réutilisable avec create_voice_clone_prompt et passez ce voice_clone_prompt dans generate_voice_clone.
Il est aussi utile de verrouiller les réglages de génération comme top_p pour que la voix ne dérive pas au fil du temps. Et avant de lancer, faites un essai à blanc pour détecter les problèmes tôt.
Quand choisir Flash plutôt que Plus ?
Choisissez Flash (0.6B) quand la vitesse et la faible latence comptent le plus. Il est conçu pour les cas d'usage à forte concurrence comme les assistants virtuels en temps réel, la traduction en direct et le support client, où des temps de réponse rapides sont critiques.
Choisissez Plus (1.7B) quand la qualité et la précision comptent plus que la vitesse. Il offre une meilleure prosodie, une plage émotionnelle plus large et une précision supérieure pour les livres audio, les voix off professionnelles et les médias de marque.
Choisissez le modèle qui vous convient dans le marketplace
Essayez les modèles de chat, image et vidéo sur le marketplace APIMart, puis découvrez rapidement leurs capacités avec une API unifiée.
