APIMart
APIMart

Qwen-Audio-3.0-TTS API: Preise & Stimmsteuerung

Qwen-Audio-3.0-TTS rechnet pro Million Eingabezeichen mit einer Grenze von 4.096 Zeichen ab. Vergleiche Flash und Plus, setze Stimme, Sprache und Tempo und teste Fehlercodes.

Tutorial

Wenn du planst, Qwen-Audio-3.0-TTS zu nutzen, zählen zuerst zwei Zahlen: der Preis pro 1.000.000 Eingabezeichen und das Limit von 4.096 Zeichen pro Anfrage. Ich würde meine Einrichtungsentscheidung darauf stützen und dann voice, language, speed, response_format und instruct für eine stabile Ausgabe festlegen.

Hier die Kurzfassung:

  • Die Abrechnung erfolgt zeichenbasiert, und nur der Text im Feld input zählt.
  • Sowohl Flash als auch Plus werden pro 1.000.000 Zeichen abgerechnet.
  • Ein Beispieltarif im Artikel nutzt 15,00 $ pro 1 Mio. Zeichen.
  • Jede Anfrage ist auf 4.096 Zeichen begrenzt.
  • Du kannst die Ausgabe steuern mit:
    • voice für die Sprecherwahl
    • language für die Aussprache
    • speed von 0.5 bis 2.0
    • response_format wie mp3, wav, opus oder pcm
    • instruct für Ton, Stimmung und Vortrag
  • Das Modell enthält 9 vordefinierte Sprecher und unterstützt 10 Sprachen.
  • Flash passt zu Arbeit mit niedriger Latenz und hohem Volumen.
  • Plus passt zu Narration, Markenstimme und längeren Audio-Inhalten.

Ein paar Zahlen zeigen, wie niedrig die Ausgaben starten können. Bei 15,00 $ pro 1.000.000 Zeichen ergeben 500 Zeichen x 30.000 Anfragen in der Beispielrechnung des Artikels etwa 0,225 $/Monat. Das bedeutet: Deine Hauptaufgabe geht weniger um den reinen Preis und mehr darum, die Stimmeinstellungen über die Anwendungsfälle hinweg stabil zu halten.

Ich würde diesen Leitfaden als Einrichtungs-Checkliste lesen: Kosten schätzen, einen Sprecher wählen, Basis-Steuerungen setzen, Fehlercodes wie 413 und 429 testen und dann ausliefern.

APIMart
Qwen-Audio-3.0-TTS: Flash vs. Plus – Preise, Stimmen & Anwendungsfälle auf einen Blick

Qwen-Audio-3.0-TTS Preise und Abrechnung

APIMart

Qwen-Audio-3.0-TTS wird nach Eingabetext-Zeichen abgerechnet[1].

So funktionieren die Preiseinheiten

Beide Modellstufen - Flash und Plus - werden pro 1.000.000 Zeichen Eingabetext abgerechnet. Nur der Text im Feld input wird abgerechnet[1]. Jede Anfrage kann bis zu 4.096 Zeichen enthalten[1].

Flash eignet sich gut für Jobs mit niedriger Latenz und hohem Volumen. Plus passt besser zu Narration und Arbeit mit Markenstimme.

So schätzt du deine monatlichen Kosten

Die Rechnung ist ziemlich einfach: Nimm deine durchschnittlichen Zeichen pro Anfrage, multipliziere sie mit deinem monatlichen Anfragevolumen, teile durch 1.000.000 und multipliziere dann mit dem Tarif pro Million.

Mit einem Beispielpreis von 15,00 $ pro 1 Mio. Zeichen kann das so aussehen:

AnwendungsfallØ Zeichen/AnfrageMonatliche AnfragenGesch. Monatskosten
Chat-Assistent50030,000~$0.225
Kundensupport1,20030,000~$0.54
Video-Narration10,00030,000~$4.50

Kurze Antworten kosten meist sehr wenig. Längere Narration summiert sich schneller.

So funktioniert die APIMart-Abrechnung bei Multi-Modell-Projekten

APIMart

Wenn dein Workflow mehr als ein Modell nutzt, miss jedes nach seiner eigenen Abrechnungseinheit.

In APIMart-Projekten, die Audio, Text, Bild oder Video mischen, verfolge jedes Modell für sich. Für TTS verfolge Zeichen. Für Textmodelle verfolge Token. Für Bildmodelle verfolge Aufrufe. Für Videomodelle verfolge Sekunden.

Mit definierten Kosten ist der nächste Schritt, die Stimmsteuerungen zu wählen, die die Ausgabe formen.

Stimmsteuerung in Qwen-Audio-3.0-TTS

Jetzt, da die Preise klar sind, ist der nächste Schritt, die Stimme zu formen.

Qwen-Audio-3.0-TTS teilt die Stimmsteuerung in zwei Teile. Strukturierte Parameter übernehmen die Kerneinrichtung, während instruct den Stil übernimmt. Wenn du wiederholbare Ausgabe willst, stütze dich auf die strukturierten Felder. Wenn Ton oder Emotion sich verändern sollen, nutze instruct.

Sprecher, Sprache und Ausgabeformat

Die API kommt mit 9 vordefinierten Sprecherprofilen, jedes mit eigenem Timbre und Stimmstil [2]. Für englischsprachige Apps sind Ryan und Aiden die besten Wahlmöglichkeiten für englischsprachige Inhalte. Wenn du für mehr als einen Markt baust, akzeptiert der Parameter language Werte wie English, Chinese oder Auto für die automatische Erkennung über 10 unterstützte Sprachen [2].

SprecherStimmbeschreibungMuttersprache
RyanDynamischer Mann, starker rhythmischer AntriebEnglisch
AidenSonniger amerikanischer Mann, klare MittellageEnglisch
VivianHelle, leicht kantige junge FrauChinesisch
SerenaWarme, sanfte junge FrauChinesisch
Uncle_FuErfahrener Mann, tiefes weiches TimbreChinesisch
DylanJugendlicher Mann, Peking-DialektChinesisch
EricLebhafter Mann, Sichuan-DialektChinesisch
Ono_AnnaVerspielte Frau, leichtes flinkes TimbreJapanisch
SoheeWarme Frau, reiche EmotionKoreanisch

Eine einfache Regel funktioniert hier gut: Passe den Sprecher an die Zielsprache an. Für en-US-Inhalte ergibt Ryan oder Aiden meist am meisten Sinn [2].

Für die Ausgabe kannst du mp3, wav, opus oder pcm wählen. Standardformate wie MP3 und WAV funktionieren gut über moderne Browser und Medienwerkzeuge hinweg [1][2].

Ton, Tempo und Emotion

Der Parameter speed nimmt einen numerischen Bereich von 0.5 bis 2.0, mit 1.0 als Standard [2]. Die dokumentierten Steuerungen in diesem Bereich sind speed und instruct, die Emotion, Timbre, Prosodie und Ton beeinflussen [2].

SteuerungAnfragefeldErwartete Werte / BereichAudio-EffektAm besten geeigneter Anwendungsfall
SprecherspeakerVivian, Ryan, Aiden usw.Legt das Basis-Timbre und den nativen Akzent festMarkencharaktere, lokalisierte Inhalte
SprachelanguageEnglish, Chinese, Auto usw.Bestimmt Aussprache und LocaleMehrsprachige Apps
Tempospeed0.5–2.0 (Standard: 1.0)Ändert die SprechgeschwindigkeitBildungsinhalte, schnelle Haftungsausschlüsse
Emotion/ToninstructVery happy, Angry, Calm, IncredulousVerschiebt Prosodie und emotionalen VortragMarketing, Spielcharaktere, Support
Formatresponse_formatwav, mp3, pcm, opusBeeinflusst Dateigröße und KompatibilitätBrowser-Wiedergabe und Medienwerkzeuge

Ein Detail lohnt sich zu beachten: Wenn instruct einen aufgeregten Vortrag verlangt, kann sich das Tempo beschleunigen, selbst wenn speed: 1.0 unverändert bleibt [2]. Wenn sich der Vortrag also schneller anfühlt als erwartet, kann der Stil-Prompt der Grund sein.

Strukturierte Parameter versus Prompt-Anweisungen

Es hilft, die expliziten Felder - speaker, language, speed und response_format - als deine Produktions-Baseline zu betrachten. Sie legen die Kern-Stimmidentität für jede Anfrage fest. Dann sitzt instruct auf dieser Basis-Schicht und formt, wie die Stimme performt [2].

Nutze strukturierte Parameter, wenn du stabile Produktionsausgabe brauchst. Nutze instruct, wenn du Variation willst. In der Praxis erzeugen beschreibendere Prompts tendenziell nuanciertere Ergebnisse als Ein-Wort-Anweisungen [2].

Diese Standardwerte übertragen sich direkt in den Anfragekörper im nächsten Abschnitt.

So sendest du Qwen-Audio-3.0-TTS-Anfragen über APIMart

Sende POST-Anfragen an https://api.apimart.ai/v1/audio/speech und übergib deinen Bearer-Token im Authorization-Header [1].

Grundlegende Anfragestruktur

Die Hauptfelder sind model, input, voice, language, response_format, speed und instruct [1][2]. Halte außerdem input unter 4.096 Zeichen.

Diese Anfrage bringt den Preisfaktor und die Stimmeinstellungen in einen Körper:

{
  "model": "YOUR_QWEN_MODEL_ID",
  "input": "Welcome to our platform. We are excited to have you here.",
  "voice": "Aiden",
  "language": "English",
  "instruct": "Warm and welcoming tone",
  "response_format": "mp3",
  "speed": 1.0
}

Einfach gesagt, teilen diese Felder der API mit, was zu sagen ist, wie es zu sagen ist und welches Format zurückzugeben ist.

Für einen schnellen cURL-Test nutze:

curl --request POST \
  --url https://api.apimart.ai/v1/audio/speech \
  --header 'Authorization: Bearer YOUR_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "YOUR_QWEN_MODEL_ID",
    "input": "Your order has been confirmed and will ship shortly.",
    "voice": "Serena",
    "language": "English",
    "response_format": "opus"
  }' \
  --output confirmation.opus

Das speichert die Audio-Antwort direkt in confirmation.opus [1].

Empfohlene Einstellungen für gängige Szenarien

Sobald du die Anfrageform kennst, wird die Wahl der Einstellungen viel einfacher. Die Tabelle unten ordnet gängige Anwendungsfälle einer guten Ausgangsvoreinstellung zu.

SzenarioEmpfohlene StufevoiceTempoInstruct-PromptKostensensibilität
KundensupportFlash (0.6B)Serena1.1HelpfulHoch
App-OnboardingPlus (1.7B)Aiden1.0Warm and welcomingMittel
Bildungs-NarrationPlus (1.7B)Uncle_Fu0.9Authoritative and measuredMittel
WerbekreationPlus (1.7B)Vivian1.0Energetic and dynamicNiedrig
Produktvideo-VoiceoverPlus (1.7B)Ryan1.0Professional and clearNiedrig

Wenn du mehrsprachige Ausgabe brauchst, setze language passend zu deinem Skript. Das Modell unterstützt 10 wichtige Sprachen: Chinesisch, Englisch, Japanisch, Koreanisch, Deutsch, Französisch, Russisch, Portugiesisch, Spanisch und Italienisch [2].

Ratenbegrenzungen, Fehler und Produktionsprüfungen

Bevor du in die Produktion gehst, teste ein paar Fehlerfälle absichtlich. Es ist einer dieser kleinen Schritte, die dir später viel Schmerz ersparen können.

FehlercodeBedeutungEmpfohlene Maßnahme
400Ungültige ParameterJSON-Struktur und akzeptierte Werte prüfen
401Fehlender oder ungültiger API-SchlüsselDeinen Bearer-Token verifizieren
402Unzureichendes KontoguthabenDein APIMart-Konto aufladen
413Eingabe überschreitet 4.096 ZeichenText in kleinere Segmente aufteilen
429Ratenbegrenzung überschrittenMit exponentiellem Backoff erneut versuchen
500/502Server- oder Gateway-FehlerKurz warten, dann erneut versuchen

Ein 400 bedeutet meist, dass etwas im Anfragekörper nicht stimmt. Ein 413 ist eindeutiger: Dein Text ist zu lang, also teile ihn in kleinere Stücke. Und wenn du auf 429 triffst, drossle und versuche es erneut, statt den Endpunkt zu bombardieren.

Die richtige Einrichtung wählen und nächste Schritte

Ein einfaches Entscheidungsraster

Jetzt, da Preise und Stimmsteuerungen festgelegt sind, nutze diesen letzten Filter, um das Modell an die Arbeit anzupassen, die du erledigen musst.

Wähle nach Budget, Stimmkontrolle und Anwendungsfall.

PrioritätBeste PassungEmpfohlene Stufe
Niedrige Latenz und hohes VolumenLive-Assistenten, IVR, Echtzeit-ÜbersetzungFlash
Kosteneffizienz bei hohem VolumenMassen-Lokalisierung, Kundensupport mit hohem VolumenFlash
Ausdrucksstarke MarkennarrationMarkennarration, längere Audio-Inhalte, CharakterstimmenPlus

Wenn du längere Narration machst, bleib von Anfang bis Ende bei einem Sprecher. Halte instruct knapp, schlicht und wiederholbar. Das gibt dir meist stabilere Ausgabe und weniger Überraschungen.

Für einfachere Setups halte es noch sauberer: Wähle einen Sprecher und ändere bei Bedarf nur das Feld instruct.

Wichtige Punkte für die Umsetzung

Sobald du eine Stufe gewählt hast, richte die Dinge rund um das Szenario ein, das du am häufigsten ausführen wirst. Das hält deinen Startplan an der tatsächlichen Nutzung verankert, nicht an Randfällen.

  • Setze Nutzungswarnungen vor dem Start.
  • Verifiziere jedes Szenario mit seinem eigenen Sprecher, Tempo und instruct-Prompt.
  • Teste die Ausgabe mit muttersprachlichen US-Zuhörern vor dem Start.
  • APIMart lässt dich die Stufen wechseln, ohne das zentrale Integrationsmuster zu ändern.

Teste außerdem vor dem Start, wie dein System 402, 429 und 502 behandelt.

FAQs

Wie teile ich langen Text über 4.096 Zeichen auf?

Zerlege den Text in Stücke von 4.096 Zeichen oder weniger und sende jedes Stück einzeln an die API.

Versuche, an natürlichen Haltepunkten zu teilen, etwa am Ende eines Satzes oder Absatzes. Kombiniere danach die zurückgegebenen Audiodateien zu einer finalen Spur.

Welche Stimmeinstellungen sollte ich für konsistente Ausgabe festlegen?

Für stabile längere Ausgabe nutze das VoiceDesign-Modell, um eine klare Persona und einen Referenzclip einzurichten. Erstelle dann einen wiederverwendbaren Prompt mit create_voice_clone_prompt und übergib diesen voice_clone_prompt an generate_voice_clone.

Es hilft außerdem, Generierungseinstellungen wie top_p festzulegen, damit die Stimme mit der Zeit nicht abdriftet. Und bevor du startest, mache einen Testlauf, um Probleme früh zu erkennen.

Wann sollte ich Flash statt Plus wählen?

Wähle Flash (0.6B), wenn Geschwindigkeit und niedrige Latenz am wichtigsten sind. Es ist für Anwendungsfälle mit hoher Nebenläufigkeit gebaut, wie Echtzeit-Virtualassistenten, Live-Übersetzung und Kundensupport, wo schnelle Antwortzeiten entscheidend sind.

Wähle Plus (1.7B), wenn Qualität und Präzision wichtiger sind als Geschwindigkeit. Es liefert bessere Prosodie, eine breitere emotionale Bandbreite und höhere Genauigkeit für Hörbücher, professionelle Voiceovers und Markenmedien.

Bereit zum Ausprobieren?

Wählen Sie Ihr gewünschtes Modell im Marktplatz

Testen Sie Chat-, Bild- und Videomodelle im APIMart-Marktplatz und erleben Sie Modellfunktionen schnell über eine einheitliche API.

Chat-ModelleBildmodelleVideomodelle
Modellmarktplatz öffnen