APIMart
APIMart

API Qwen-Audio-3.0-TTS : tarifs et contrôles de voix

Qwen-Audio-3.0-TTS facture au million de caractères d'entrée avec une limite de 4 096 car. Comparez Flash et Plus, réglez voix, langue, vitesse et codes d'erreur.

Tutoriel

Si vous prévoyez d'utiliser Qwen-Audio-3.0-TTS, deux chiffres comptent en premier : le prix par 1 000 000 de caractères d'entrée et la limite de 4 096 caractères par requête. Je baserais mon choix de configuration là-dessus, puis je verrouillerais voice, language, speed, response_format et instruct pour une sortie stable.

Voici la version courte :

  • La facturation est basée sur les caractères, et seul le texte du champ input compte.
  • Flash comme Plus sont facturés par 1 000 000 de caractères.
  • Un tarif d'exemple dans l'article utilise 15,00 $ par million de caractères.
  • Chaque requête est plafonnée à 4 096 caractères.
  • Vous pouvez contrôler la sortie avec :
    • voice pour le choix du locuteur
    • language pour la prononciation
    • speed de 0,5 à 2,0
    • response_format comme mp3, wav, opus ou pcm
    • instruct pour le ton, l'humeur et le débit
  • Le modèle inclut 9 locuteurs prédéfinis et prend en charge 10 langues.
  • Flash convient au travail à faible latence et à fort volume.
  • Plus convient à la narration, à la voix de marque et à l'audio de format long.

Quelques chiffres montrent à quel point la dépense peut démarrer bas. À 15,00 $ par 1 000 000 de caractères, 500 caractères × 30 000 requêtes revient à environ 0,225 $/mois dans le calcul d'exemple de l'article. Cela signifie que votre tâche principale porte moins sur le prix brut que sur le maintien de réglages de voix stables entre les cas d'usage.

Je lirais ce guide comme une checklist de configuration : estimez le coût, choisissez un locuteur, réglez les contrôles de base, testez les codes d'erreur comme 413 et 429, puis mettez en production.

APIMart
Qwen-Audio-3.0-TTS : Flash vs Plus – tarifs, voix et cas d'usage en un coup d'œil

Tarifs et facturation de Qwen-Audio-3.0-TTS

APIMart

Qwen-Audio-3.0-TTS est facturé selon les caractères du texte d'entrée[1].

Comment fonctionnent les unités de tarification

Les deux niveaux de modèle — Flash et Plus — sont facturés par 1 000 000 de caractères de texte d'entrée. Seul le texte à l'intérieur du champ input est facturé[1]. Chaque requête peut inclure jusqu'à 4 096 caractères[1].

Flash fonctionne bien pour les tâches à faible latence et à fort volume. Plus convient mieux à la narration et au travail de voix de marque.

Comment estimer votre coût mensuel

Le calcul est plutôt simple : prenez votre moyenne de caractères par requête, multipliez-la par votre volume mensuel de requêtes, divisez par 1 000 000, puis multipliez par le tarif au million.

En utilisant un prix d'exemple de 15,00 $ par million de caractères, voici ce que cela peut donner :

Cas d'usageMoy. caractères/requêteRequêtes mensuellesCoût mensuel est.
Assistant de chat50030,000~0,225 $
Support client1,20030,000~0,54 $
Narration vidéo10,00030,000~4,50 $

Les réponses courtes coûtent généralement très peu. La narration plus longue s'additionne plus vite.

Comment fonctionne la facturation APIMart sur les projets multi-modèles

APIMart

Si votre workflow utilise plus d'un modèle, mesurez chacun selon sa propre unité de facturation.

Dans les projets APIMart qui mélangent audio, texte, image ou vidéo, suivez chaque modèle séparément. Pour le TTS, suivez les caractères. Pour les modèles de texte, suivez les tokens. Pour les modèles d'image, suivez les appels. Pour les modèles vidéo, suivez les secondes.

Une fois le coût défini, l'étape suivante consiste à choisir les contrôles de voix qui façonnent la sortie.

Contrôles de voix dans Qwen-Audio-3.0-TTS

Maintenant que la tarification est claire, l'étape suivante est de façonner la voix.

Qwen-Audio-3.0-TTS divise le contrôle de la voix en deux parties. Les paramètres structurés gèrent la configuration de base, tandis que instruct gère le style. Si vous voulez une sortie reproductible, appuyez-vous sur les champs structurés. Si vous voulez que le ton ou l'émotion varient, utilisez instruct.

Locuteur, langue et format de sortie

L'API est livrée avec 9 profils de locuteurs prédéfinis, chacun avec son propre timbre et style de voix [2]. Pour les applications en anglais, Ryan et Aiden sont les meilleurs choix pour le contenu en anglais. Si vous construisez pour plus d'un marché, le paramètre language accepte des valeurs comme English, Chinese ou Auto pour une détection automatique sur les 10 langues prises en charge [2].

LocuteurDescription de la voixLangue native
RyanHomme dynamique, forte impulsion rythmiqueAnglais
AidenHomme américain ensoleillé, médiums clairsAnglais
VivianJeune femme lumineuse, légèrement mordanteChinois
SerenaJeune femme chaleureuse et douceChinois
Uncle_FuHomme aguerri, timbre grave et moelleuxChinois
DylanHomme jeune, dialecte de PékinChinois
EricHomme enjoué, dialecte du SichuanChinois
Ono_AnnaFemme espiègle, timbre léger et agileJaponais
SoheeFemme chaleureuse, émotion richeCoréen

Une règle simple fonctionne bien ici : faites correspondre le locuteur à la langue cible. Pour le contenu en-US, Ryan ou Aiden a généralement le plus de sens [2].

Pour la sortie, vous pouvez choisir mp3, wav, opus ou pcm. Les formats standard comme MP3 et WAV fonctionnent bien avec les navigateurs modernes et les outils média [1][2].

Ton, vitesse et émotion

Le paramètre speed prend une plage numérique de 0,5 à 2,0, avec 1,0 par défaut [2]. Les contrôles documentés dans ce domaine sont speed et instruct, qui affectent l'émotion, le timbre, la prosodie et le ton [2].

ContrôleChamp de requêteValeurs / plage attenduesEffet audioCas d'usage le plus adapté
LocuteurspeakerVivian, Ryan, Aiden, etc.Définit le timbre de base et l'accent natifPersonnages de marque, contenu localisé
LanguelanguageEnglish, Chinese, Auto, etc.Détermine la prononciation et la localeApplications multilingues
Vitessespeed0,5–2,0 (par défaut : 1,0)Change le débit de la paroleContenu éducatif, avertissements rapides
Émotion/ToninstructVery happy, Angry, Calm, IncredulousModifie la prosodie et le rendu émotionnelMarketing, personnages de jeu, support
Formatresponse_formatwav, mp3, pcm, opusAffecte la taille du fichier et la compatibilitéLecture navigateur et outils média

Un détail vaut la peine d'être surveillé : si instruct demande un rendu excité, le rythme peut s'accélérer même quand speed: 1.0 reste inchangé [2]. Donc si la lecture semble plus rapide que prévu, le prompt de style peut en être la raison.

Paramètres structurés versus instructions de prompt

Il est utile de penser aux champs explicites — speaker, language, speed et response_format — comme votre référence de production. Ils définissent l'identité vocale de base pour chaque requête. Puis instruct se pose au-dessus de cette couche de base et façonne la façon dont la voix se produit [2].

Utilisez les paramètres structurés quand vous avez besoin d'une sortie de production stable. Utilisez instruct quand vous voulez de la variation. En pratique, des prompts plus descriptifs tendent à produire des résultats plus nuancés que des instructions d'un seul mot [2].

Ces valeurs par défaut se transposent directement dans le corps de la requête de la section suivante.

Comment envoyer des requêtes Qwen-Audio-3.0-TTS via APIMart

Envoyez des requêtes POST à https://api.apimart.ai/v1/audio/speech et passez votre jeton Bearer dans l'en-tête Authorization [1].

Structure de requête de base

Les champs principaux sont model, input, voice, language, response_format, speed et instruct [1][2]. Gardez aussi input sous 4 096 caractères.

Cette requête réunit le facteur de tarification et les réglages de voix dans un seul corps :

{
  "model": "YOUR_QWEN_MODEL_ID",
  "input": "Welcome to our platform. We are excited to have you here.",
  "voice": "Aiden",
  "language": "English",
  "instruct": "Warm and welcoming tone",
  "response_format": "mp3",
  "speed": 1.0
}

En clair, ces champs indiquent à l'API quoi dire, comment le dire et quel format retourner.

Pour un test cURL rapide, utilisez :

curl --request POST \
  --url https://api.apimart.ai/v1/audio/speech \
  --header 'Authorization: Bearer YOUR_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "YOUR_QWEN_MODEL_ID",
    "input": "Your order has been confirmed and will ship shortly.",
    "voice": "Serena",
    "language": "English",
    "response_format": "opus"
  }' \
  --output confirmation.opus

Cela enregistre la réponse audio directement dans confirmation.opus [1].

Réglages recommandés pour les scénarios courants

Une fois que vous connaissez la forme de la requête, choisir les réglages devient beaucoup plus facile. Le tableau ci-dessous fait correspondre les cas d'usage courants à un bon préréglage de départ.

ScénarioNiveau suggérévoiceVitessePrompt InstructSensibilité au coût
Support clientFlash (0.6B)Serena1.1HelpfulÉlevée
Onboarding d'applicationPlus (1.7B)Aiden1.0Warm and welcomingMoyenne
Narration éducativePlus (1.7B)Uncle_Fu0.9Authoritative and measuredMoyenne
Création publicitairePlus (1.7B)Vivian1.0Energetic and dynamicFaible
Voix off vidéo produitPlus (1.7B)Ryan1.0Professional and clearFaible

Si vous avez besoin d'une sortie multilingue, réglez language pour correspondre à votre script. Le modèle prend en charge 10 langues majeures : chinois, anglais, japonais, coréen, allemand, français, russe, portugais, espagnol et italien [2].

Limites de débit, erreurs et contrôles de production

Avant de passer en production, testez volontairement quelques cas d'échec. C'est une de ces petites étapes qui peut éviter beaucoup de peine plus tard.

Code d'erreurSignificationAction recommandée
400Paramètres invalidesVérifiez la structure JSON et les valeurs acceptées
401Clé API manquante ou invalideVérifiez votre jeton Bearer
402Solde de compte insuffisantRechargez votre compte APIMart
413L'entrée dépasse 4 096 caractèresDécoupez le texte en segments plus petits
429Limite de débit dépasséeRéessayez avec un backoff exponentiel
500/502Erreur de serveur ou de passerelleAttendez brièvement, puis réessayez

Un 400 signifie généralement que quelque chose dans le corps de la requête ne va pas. Un 413 est plus direct : votre texte est trop long, alors découpez-le en morceaux plus petits. Et si vous rencontrez un 429, ralentissez et réessayez au lieu de marteler l'endpoint.

Choisir la bonne configuration et prochaines étapes

Un cadre de décision simple

Maintenant que la tarification et les contrôles de voix sont fixés, utilisez ce dernier filtre pour faire correspondre le modèle au travail à accomplir.

Choisissez selon le budget, le contrôle de la voix et le cas d'usage.

PrioritéMeilleur choixNiveau recommandé
Faible latence et fort volumeAssistants en direct, SVI, traduction en temps réelFlash
Efficacité de coût à fort volumeLocalisation en masse, support client à fort volumeFlash
Narration de marque expressiveNarration de marque, audio de format long, voix de personnagesPlus

Si vous faites de la narration de format long, gardez un seul locuteur du début à la fin. Gardez instruct serré, simple et reproductible. Cela donne généralement une sortie plus stable et moins de surprises.

Pour des configurations plus simples, gardez les choses encore plus nettes : choisissez un seul locuteur et ne changez que le champ instruct au besoin.

Points clés à emporter en implémentation

Une fois que vous avez choisi un niveau, configurez les choses autour du scénario que vous exécuterez le plus souvent. Cela ancre votre plan de lancement dans l'usage réel, pas dans les cas limites.

  • Réglez des alertes d'usage avant le lancement.
  • Vérifiez chaque scénario avec son propre locuteur, sa vitesse et son prompt instruct.
  • Testez la sortie avec des auditeurs natifs des États-Unis avant le lancement.
  • APIMart vous laisse changer de niveau sans changer le schéma d'intégration de base.

Testez aussi comment votre système gère les codes 402, 429 et 502 avant le lancement.

FAQ

Comment découper un texte long de plus de 4 096 caractères ?

Découpez le texte en morceaux de 4 096 caractères ou moins et envoyez chaque morceau à l'API séparément.

Essayez de découper à des points d'arrêt naturels, comme la fin d'une phrase ou d'un paragraphe. Ensuite, combinez les fichiers audio retournés en une seule piste finale.

Quels réglages de voix verrouiller pour une sortie cohérente ?

Pour une sortie de format long stable, utilisez le modèle VoiceDesign pour établir un persona clair et un clip de référence. Créez ensuite un prompt réutilisable avec create_voice_clone_prompt et passez ce voice_clone_prompt dans generate_voice_clone.

Il est aussi utile de verrouiller les réglages de génération comme top_p pour que la voix ne dérive pas au fil du temps. Et avant de lancer, faites un essai à blanc pour détecter les problèmes tôt.

Quand choisir Flash plutôt que Plus ?

Choisissez Flash (0.6B) quand la vitesse et la faible latence comptent le plus. Il est conçu pour les cas d'usage à forte concurrence comme les assistants virtuels en temps réel, la traduction en direct et le support client, où des temps de réponse rapides sont critiques.

Choisissez Plus (1.7B) quand la qualité et la précision comptent plus que la vitesse. Il offre une meilleure prosodie, une plage émotionnelle plus large et une précision supérieure pour les livres audio, les voix off professionnelles et les médias de marque.

Prêt à essayer ?

Choisissez le modèle qui vous convient dans le marketplace

Essayez les modèles de chat, image et vidéo sur le marketplace APIMart, puis découvrez rapidement leurs capacités avec une API unifiée.

Modèles chatModèles imageModèles vidéo
Explorer le marketplace