

Qwen-Audio-3.0-TTS API: Preise & Stimmsteuerung
Qwen-Audio-3.0-TTS rechnet pro Million Eingabezeichen mit einer Grenze von 4.096 Zeichen ab. Vergleiche Flash und Plus, setze Stimme, Sprache und Tempo und teste Fehlercodes.
Wenn du planst, Qwen-Audio-3.0-TTS zu nutzen, zählen zuerst zwei Zahlen: der Preis pro 1.000.000 Eingabezeichen und das Limit von 4.096 Zeichen pro Anfrage. Ich würde meine Einrichtungsentscheidung darauf stützen und dann voice, language, speed, response_format und instruct für eine stabile Ausgabe festlegen.
Hier die Kurzfassung:
- Die Abrechnung erfolgt zeichenbasiert, und nur der Text im Feld
inputzählt. - Sowohl Flash als auch Plus werden pro 1.000.000 Zeichen abgerechnet.
- Ein Beispieltarif im Artikel nutzt 15,00 $ pro 1 Mio. Zeichen.
- Jede Anfrage ist auf 4.096 Zeichen begrenzt.
- Du kannst die Ausgabe steuern mit:
voicefür die Sprecherwahllanguagefür die Aussprachespeedvon 0.5 bis 2.0response_formatwiemp3,wav,opusoderpcminstructfür Ton, Stimmung und Vortrag
- Das Modell enthält 9 vordefinierte Sprecher und unterstützt 10 Sprachen.
- Flash passt zu Arbeit mit niedriger Latenz und hohem Volumen.
- Plus passt zu Narration, Markenstimme und längeren Audio-Inhalten.
Ein paar Zahlen zeigen, wie niedrig die Ausgaben starten können. Bei 15,00 $ pro 1.000.000 Zeichen ergeben 500 Zeichen x 30.000 Anfragen in der Beispielrechnung des Artikels etwa 0,225 $/Monat. Das bedeutet: Deine Hauptaufgabe geht weniger um den reinen Preis und mehr darum, die Stimmeinstellungen über die Anwendungsfälle hinweg stabil zu halten.
Ich würde diesen Leitfaden als Einrichtungs-Checkliste lesen: Kosten schätzen, einen Sprecher wählen, Basis-Steuerungen setzen, Fehlercodes wie 413 und 429 testen und dann ausliefern.

Qwen-Audio-3.0-TTS Preise und Abrechnung

Qwen-Audio-3.0-TTS wird nach Eingabetext-Zeichen abgerechnet[1].
So funktionieren die Preiseinheiten
Beide Modellstufen - Flash und Plus - werden pro 1.000.000 Zeichen Eingabetext abgerechnet. Nur der Text im Feld input wird abgerechnet[1]. Jede Anfrage kann bis zu 4.096 Zeichen enthalten[1].
Flash eignet sich gut für Jobs mit niedriger Latenz und hohem Volumen. Plus passt besser zu Narration und Arbeit mit Markenstimme.
So schätzt du deine monatlichen Kosten
Die Rechnung ist ziemlich einfach: Nimm deine durchschnittlichen Zeichen pro Anfrage, multipliziere sie mit deinem monatlichen Anfragevolumen, teile durch 1.000.000 und multipliziere dann mit dem Tarif pro Million.
Mit einem Beispielpreis von 15,00 $ pro 1 Mio. Zeichen kann das so aussehen:
| Anwendungsfall | Ø Zeichen/Anfrage | Monatliche Anfragen | Gesch. Monatskosten |
|---|---|---|---|
| Chat-Assistent | 500 | 30,000 | ~$0.225 |
| Kundensupport | 1,200 | 30,000 | ~$0.54 |
| Video-Narration | 10,000 | 30,000 | ~$4.50 |
Kurze Antworten kosten meist sehr wenig. Längere Narration summiert sich schneller.
So funktioniert die APIMart-Abrechnung bei Multi-Modell-Projekten

Wenn dein Workflow mehr als ein Modell nutzt, miss jedes nach seiner eigenen Abrechnungseinheit.
In APIMart-Projekten, die Audio, Text, Bild oder Video mischen, verfolge jedes Modell für sich. Für TTS verfolge Zeichen. Für Textmodelle verfolge Token. Für Bildmodelle verfolge Aufrufe. Für Videomodelle verfolge Sekunden.
Mit definierten Kosten ist der nächste Schritt, die Stimmsteuerungen zu wählen, die die Ausgabe formen.
Stimmsteuerung in Qwen-Audio-3.0-TTS
Jetzt, da die Preise klar sind, ist der nächste Schritt, die Stimme zu formen.
Qwen-Audio-3.0-TTS teilt die Stimmsteuerung in zwei Teile. Strukturierte Parameter übernehmen die Kerneinrichtung, während instruct den Stil übernimmt. Wenn du wiederholbare Ausgabe willst, stütze dich auf die strukturierten Felder. Wenn Ton oder Emotion sich verändern sollen, nutze instruct.
Sprecher, Sprache und Ausgabeformat
Die API kommt mit 9 vordefinierten Sprecherprofilen, jedes mit eigenem Timbre und Stimmstil [2]. Für englischsprachige Apps sind Ryan und Aiden die besten Wahlmöglichkeiten für englischsprachige Inhalte. Wenn du für mehr als einen Markt baust, akzeptiert der Parameter language Werte wie English, Chinese oder Auto für die automatische Erkennung über 10 unterstützte Sprachen [2].
| Sprecher | Stimmbeschreibung | Muttersprache |
|---|---|---|
| Ryan | Dynamischer Mann, starker rhythmischer Antrieb | Englisch |
| Aiden | Sonniger amerikanischer Mann, klare Mittellage | Englisch |
| Vivian | Helle, leicht kantige junge Frau | Chinesisch |
| Serena | Warme, sanfte junge Frau | Chinesisch |
| Uncle_Fu | Erfahrener Mann, tiefes weiches Timbre | Chinesisch |
| Dylan | Jugendlicher Mann, Peking-Dialekt | Chinesisch |
| Eric | Lebhafter Mann, Sichuan-Dialekt | Chinesisch |
| Ono_Anna | Verspielte Frau, leichtes flinkes Timbre | Japanisch |
| Sohee | Warme Frau, reiche Emotion | Koreanisch |
Eine einfache Regel funktioniert hier gut: Passe den Sprecher an die Zielsprache an. Für en-US-Inhalte ergibt Ryan oder Aiden meist am meisten Sinn [2].
Für die Ausgabe kannst du mp3, wav, opus oder pcm wählen. Standardformate wie MP3 und WAV funktionieren gut über moderne Browser und Medienwerkzeuge hinweg [1][2].
Ton, Tempo und Emotion
Der Parameter speed nimmt einen numerischen Bereich von 0.5 bis 2.0, mit 1.0 als Standard [2]. Die dokumentierten Steuerungen in diesem Bereich sind speed und instruct, die Emotion, Timbre, Prosodie und Ton beeinflussen [2].
| Steuerung | Anfragefeld | Erwartete Werte / Bereich | Audio-Effekt | Am besten geeigneter Anwendungsfall |
|---|---|---|---|---|
| Sprecher | speaker | Vivian, Ryan, Aiden usw. | Legt das Basis-Timbre und den nativen Akzent fest | Markencharaktere, lokalisierte Inhalte |
| Sprache | language | English, Chinese, Auto usw. | Bestimmt Aussprache und Locale | Mehrsprachige Apps |
| Tempo | speed | 0.5–2.0 (Standard: 1.0) | Ändert die Sprechgeschwindigkeit | Bildungsinhalte, schnelle Haftungsausschlüsse |
| Emotion/Ton | instruct | Very happy, Angry, Calm, Incredulous | Verschiebt Prosodie und emotionalen Vortrag | Marketing, Spielcharaktere, Support |
| Format | response_format | wav, mp3, pcm, opus | Beeinflusst Dateigröße und Kompatibilität | Browser-Wiedergabe und Medienwerkzeuge |
Ein Detail lohnt sich zu beachten: Wenn instruct einen aufgeregten Vortrag verlangt, kann sich das Tempo beschleunigen, selbst wenn speed: 1.0 unverändert bleibt [2]. Wenn sich der Vortrag also schneller anfühlt als erwartet, kann der Stil-Prompt der Grund sein.
Strukturierte Parameter versus Prompt-Anweisungen
Es hilft, die expliziten Felder - speaker, language, speed und response_format - als deine Produktions-Baseline zu betrachten. Sie legen die Kern-Stimmidentität für jede Anfrage fest. Dann sitzt instruct auf dieser Basis-Schicht und formt, wie die Stimme performt [2].
Nutze strukturierte Parameter, wenn du stabile Produktionsausgabe brauchst. Nutze instruct, wenn du Variation willst. In der Praxis erzeugen beschreibendere Prompts tendenziell nuanciertere Ergebnisse als Ein-Wort-Anweisungen [2].
Diese Standardwerte übertragen sich direkt in den Anfragekörper im nächsten Abschnitt.
So sendest du Qwen-Audio-3.0-TTS-Anfragen über APIMart
Sende POST-Anfragen an https://api.apimart.ai/v1/audio/speech und übergib deinen Bearer-Token im Authorization-Header [1].
Grundlegende Anfragestruktur
Die Hauptfelder sind model, input, voice, language, response_format, speed und instruct [1][2]. Halte außerdem input unter 4.096 Zeichen.
Diese Anfrage bringt den Preisfaktor und die Stimmeinstellungen in einen Körper:
{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Welcome to our platform. We are excited to have you here.",
"voice": "Aiden",
"language": "English",
"instruct": "Warm and welcoming tone",
"response_format": "mp3",
"speed": 1.0
}
Einfach gesagt, teilen diese Felder der API mit, was zu sagen ist, wie es zu sagen ist und welches Format zurückzugeben ist.
Für einen schnellen cURL-Test nutze:
curl --request POST \
--url https://api.apimart.ai/v1/audio/speech \
--header 'Authorization: Bearer YOUR_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Your order has been confirmed and will ship shortly.",
"voice": "Serena",
"language": "English",
"response_format": "opus"
}' \
--output confirmation.opus
Das speichert die Audio-Antwort direkt in confirmation.opus [1].
Empfohlene Einstellungen für gängige Szenarien
Sobald du die Anfrageform kennst, wird die Wahl der Einstellungen viel einfacher. Die Tabelle unten ordnet gängige Anwendungsfälle einer guten Ausgangsvoreinstellung zu.
| Szenario | Empfohlene Stufe | voice | Tempo | Instruct-Prompt | Kostensensibilität |
|---|---|---|---|---|---|
| Kundensupport | Flash (0.6B) | Serena | 1.1 | Helpful | Hoch |
| App-Onboarding | Plus (1.7B) | Aiden | 1.0 | Warm and welcoming | Mittel |
| Bildungs-Narration | Plus (1.7B) | Uncle_Fu | 0.9 | Authoritative and measured | Mittel |
| Werbekreation | Plus (1.7B) | Vivian | 1.0 | Energetic and dynamic | Niedrig |
| Produktvideo-Voiceover | Plus (1.7B) | Ryan | 1.0 | Professional and clear | Niedrig |
Wenn du mehrsprachige Ausgabe brauchst, setze language passend zu deinem Skript. Das Modell unterstützt 10 wichtige Sprachen: Chinesisch, Englisch, Japanisch, Koreanisch, Deutsch, Französisch, Russisch, Portugiesisch, Spanisch und Italienisch [2].
Ratenbegrenzungen, Fehler und Produktionsprüfungen
Bevor du in die Produktion gehst, teste ein paar Fehlerfälle absichtlich. Es ist einer dieser kleinen Schritte, die dir später viel Schmerz ersparen können.
| Fehlercode | Bedeutung | Empfohlene Maßnahme |
|---|---|---|
| 400 | Ungültige Parameter | JSON-Struktur und akzeptierte Werte prüfen |
| 401 | Fehlender oder ungültiger API-Schlüssel | Deinen Bearer-Token verifizieren |
| 402 | Unzureichendes Kontoguthaben | Dein APIMart-Konto aufladen |
| 413 | Eingabe überschreitet 4.096 Zeichen | Text in kleinere Segmente aufteilen |
| 429 | Ratenbegrenzung überschritten | Mit exponentiellem Backoff erneut versuchen |
| 500/502 | Server- oder Gateway-Fehler | Kurz warten, dann erneut versuchen |
Ein 400 bedeutet meist, dass etwas im Anfragekörper nicht stimmt. Ein 413 ist eindeutiger: Dein Text ist zu lang, also teile ihn in kleinere Stücke. Und wenn du auf 429 triffst, drossle und versuche es erneut, statt den Endpunkt zu bombardieren.
Die richtige Einrichtung wählen und nächste Schritte
Ein einfaches Entscheidungsraster
Jetzt, da Preise und Stimmsteuerungen festgelegt sind, nutze diesen letzten Filter, um das Modell an die Arbeit anzupassen, die du erledigen musst.
Wähle nach Budget, Stimmkontrolle und Anwendungsfall.
| Priorität | Beste Passung | Empfohlene Stufe |
|---|---|---|
| Niedrige Latenz und hohes Volumen | Live-Assistenten, IVR, Echtzeit-Übersetzung | Flash |
| Kosteneffizienz bei hohem Volumen | Massen-Lokalisierung, Kundensupport mit hohem Volumen | Flash |
| Ausdrucksstarke Markennarration | Markennarration, längere Audio-Inhalte, Charakterstimmen | Plus |
Wenn du längere Narration machst, bleib von Anfang bis Ende bei einem Sprecher. Halte instruct knapp, schlicht und wiederholbar. Das gibt dir meist stabilere Ausgabe und weniger Überraschungen.
Für einfachere Setups halte es noch sauberer: Wähle einen Sprecher und ändere bei Bedarf nur das Feld instruct.
Wichtige Punkte für die Umsetzung
Sobald du eine Stufe gewählt hast, richte die Dinge rund um das Szenario ein, das du am häufigsten ausführen wirst. Das hält deinen Startplan an der tatsächlichen Nutzung verankert, nicht an Randfällen.
- Setze Nutzungswarnungen vor dem Start.
- Verifiziere jedes Szenario mit seinem eigenen Sprecher, Tempo und
instruct-Prompt. - Teste die Ausgabe mit muttersprachlichen US-Zuhörern vor dem Start.
- APIMart lässt dich die Stufen wechseln, ohne das zentrale Integrationsmuster zu ändern.
Teste außerdem vor dem Start, wie dein System 402, 429 und 502 behandelt.
FAQs
Wie teile ich langen Text über 4.096 Zeichen auf?
Zerlege den Text in Stücke von 4.096 Zeichen oder weniger und sende jedes Stück einzeln an die API.
Versuche, an natürlichen Haltepunkten zu teilen, etwa am Ende eines Satzes oder Absatzes. Kombiniere danach die zurückgegebenen Audiodateien zu einer finalen Spur.
Welche Stimmeinstellungen sollte ich für konsistente Ausgabe festlegen?
Für stabile längere Ausgabe nutze das VoiceDesign-Modell, um eine klare Persona und einen Referenzclip einzurichten. Erstelle dann einen wiederverwendbaren Prompt mit create_voice_clone_prompt und übergib diesen voice_clone_prompt an generate_voice_clone.
Es hilft außerdem, Generierungseinstellungen wie top_p festzulegen, damit die Stimme mit der Zeit nicht abdriftet. Und bevor du startest, mache einen Testlauf, um Probleme früh zu erkennen.
Wann sollte ich Flash statt Plus wählen?
Wähle Flash (0.6B), wenn Geschwindigkeit und niedrige Latenz am wichtigsten sind. Es ist für Anwendungsfälle mit hoher Nebenläufigkeit gebaut, wie Echtzeit-Virtualassistenten, Live-Übersetzung und Kundensupport, wo schnelle Antwortzeiten entscheidend sind.
Wähle Plus (1.7B), wenn Qualität und Präzision wichtiger sind als Geschwindigkeit. Es liefert bessere Prosodie, eine breitere emotionale Bandbreite und höhere Genauigkeit für Hörbücher, professionelle Voiceovers und Markenmedien.
Wählen Sie Ihr gewünschtes Modell im Marktplatz
Testen Sie Chat-, Bild- und Videomodelle im APIMart-Marktplatz und erleben Sie Modellfunktionen schnell über eine einheitliche API.
