

API Qwen-Audio-3.0-TTS: Harga & Kontrol Suara
Qwen-Audio-3.0-TTS menagih per satu juta karakter input dengan batas 4.096 karakter. Bandingkan tier Flash vs Plus, atur suara, bahasa, dan kecepatan, lalu uji kode error.
Jika Anda berencana memakai Qwen-Audio-3.0-TTS, dua angka lebih dulu yang penting: harga per 1.000.000 karakter input dan batas 4.096 karakter per permintaan. Saya akan membuat pilihan penyiapan berdasarkan itu, lalu mengunci voice, language, speed, response_format, dan instruct untuk keluaran yang stabil.
Berikut versi singkatnya:
- Penagihan berbasis karakter, dan hanya teks di field
inputyang dihitung. - Baik Flash maupun Plus ditagih per 1.000.000 karakter.
- Sebuah tarif contoh di artikel ini memakai $15,00 per 1 juta karakter.
- Setiap permintaan dibatasi 4.096 karakter.
- Anda dapat mengontrol keluaran dengan:
voiceuntuk pilihan penuturlanguageuntuk pengucapanspeeddari 0,5 hingga 2,0response_formatsepertimp3,wav,opus, ataupcminstructuntuk nada, suasana, dan penyampaian
- Model ini mencakup 9 penutur preset dan mendukung 10 bahasa.
- Flash cocok untuk pekerjaan latensi rendah bervolume tinggi.
- Plus cocok untuk narasi, suara merek, dan audio format panjang.
Beberapa angka menunjukkan betapa rendah pengeluaran bisa dimulai. Pada $15,00 per 1.000.000 karakter, 500 karakter x 30.000 permintaan menghasilkan sekitar $0,225/bulan dalam perhitungan contoh artikel. Artinya tugas utama Anda bukan soal harga mentah, melainkan menjaga pengaturan suara tetap stabil lintas kasus penggunaan.
Saya akan membaca panduan ini sebagai daftar periksa penyiapan: perkirakan biaya, pilih penutur, atur kontrol dasar, uji kode error seperti 413 dan 429, lalu rilis.

Harga Dan Penagihan Qwen-Audio-3.0-TTS

Qwen-Audio-3.0-TTS ditagih berdasarkan karakter teks input[1].
Cara Kerja Unit Harga
Kedua tier model - Flash dan Plus - ditagih per 1.000.000 karakter teks input. Hanya teks di dalam field input yang ditagih[1]. Setiap permintaan dapat mencakup hingga 4.096 karakter[1].
Flash bekerja baik untuk pekerjaan latensi rendah bervolume tinggi. Plus lebih cocok untuk narasi dan pekerjaan suara bermerek.
Cara Memperkirakan Biaya Bulanan Anda
Perhitungannya cukup sederhana: ambil rata-rata karakter per permintaan, kalikan dengan volume permintaan bulanan Anda, bagi 1.000.000, lalu kalikan dengan tarif per juta.
Menggunakan harga contoh $15,00 per 1 juta karakter, berikut gambarannya:
| Kasus Penggunaan | Rata-rata Karakter/Permintaan | Permintaan Bulanan | Estimasi Biaya Bulanan |
|---|---|---|---|
| Asisten chat | 500 | 30.000 | ~$0,225 |
| Dukungan pelanggan | 1.200 | 30.000 | ~$0,54 |
| Narasi video | 10.000 | 30.000 | ~$4,50 |
Respons pendek biasanya sangat murah. Narasi yang lebih panjang menumpuk lebih cepat.
Cara Kerja Penagihan APIMart Lintas Proyek Multi-Model

Jika alur kerja Anda memakai lebih dari satu model, ukur masing-masing dengan unit penagihannya sendiri.
Dalam proyek APIMart yang memadukan audio, teks, gambar, atau video, lacak setiap model secara terpisah. Untuk TTS, lacak karakter. Untuk model teks, lacak token. Untuk model gambar, lacak panggilan. Untuk model video, lacak detik.
Dengan biaya sudah terdefinisi, langkah berikutnya adalah memilih kontrol suara yang membentuk keluaran.
Kontrol Suara Di Qwen-Audio-3.0-TTS
Setelah harga jelas, langkah berikutnya adalah membentuk suara.
Qwen-Audio-3.0-TTS membagi kontrol suara menjadi dua bagian. Parameter terstruktur menangani penyiapan inti, sementara instruct menangani gaya. Jika Anda ingin keluaran yang dapat diulang, andalkan field terstruktur. Jika Anda ingin nada atau emosi bergeser, gunakan instruct.
Penutur, Bahasa, Dan Format Keluaran
API ini hadir dengan 9 profil penutur yang sudah ditentukan, masing-masing dengan timbre dan gaya suaranya sendiri [2]. Untuk aplikasi berbahasa Inggris, Ryan dan Aiden adalah pilihan terbaik untuk konten berbahasa Inggris. Jika Anda membangun untuk lebih dari satu pasar, parameter language menerima nilai seperti English, Chinese, atau Auto untuk deteksi otomatis di 10 bahasa yang didukung [2].
| Penutur | Deskripsi Suara | Bahasa Asli |
|---|---|---|
| Ryan | Pria dinamis, dorongan ritmis kuat | English |
| Aiden | Pria Amerika ceria, midrange jernih | English |
| Vivian | Wanita muda cerah, sedikit tajam | Chinese |
| Serena | Wanita muda hangat dan lembut | Chinese |
| Uncle_Fu | Pria berpengalaman, timbre rendah dan lembut | Chinese |
| Dylan | Pria muda, dialek Beijing | Chinese |
| Eric | Pria bersemangat, dialek Sichuan | Chinese |
| Ono_Anna | Wanita periang, timbre ringan dan gesit | Japanese |
| Sohee | Wanita hangat, emosi kaya | Korean |
Aturan sederhana bekerja baik di sini: cocokkan penutur dengan bahasa target. Untuk konten en-US, Ryan atau Aiden biasanya paling masuk akal [2].
Untuk keluaran, Anda dapat memilih mp3, wav, opus, atau pcm. Format standar seperti MP3 dan WAV bekerja baik di seluruh browser modern dan tool media [1][2].
Nada, Kecepatan, Dan Emosi
Parameter speed menerima rentang numerik dari 0,5 hingga 2,0, dengan 1,0 sebagai default [2]. Kontrol yang terdokumentasi di area ini adalah speed dan instruct, yang memengaruhi emosi, timbre, prosodi, dan nada [2].
| Kontrol | Field Permintaan | Nilai / Rentang yang Diharapkan | Efek Audio | Kasus Penggunaan Paling Cocok |
|---|---|---|---|---|
| Penutur | speaker | Vivian, Ryan, Aiden, dll. | Menetapkan timbre dasar dan aksen asli | Karakter bermerek, konten terlokalisasi |
| Bahasa | language | English, Chinese, Auto, dll. | Menentukan pengucapan dan lokal | Aplikasi multibahasa |
| Kecepatan | speed | 0,5–2,0 (default: 1,0) | Mengubah laju bicara | Konten edukasi, disclaimer cepat |
| Emosi/Nada | instruct | Very happy, Angry, Calm, Incredulous | Menggeser prosodi dan penyampaian emosional | Pemasaran, karakter game, dukungan |
| Format | response_format | wav, mp3, pcm, opus | Memengaruhi ukuran file dan kompatibilitas | Pemutaran browser dan tool media |
Satu detail patut diperhatikan: jika instruct meminta penyampaian yang bersemangat, temponya bisa mempercepat meski speed: 1.0 tetap tak berubah [2]. Jadi jika pembacaan terasa lebih cepat dari perkiraan, prompt gaya mungkin penyebabnya.
Parameter Terstruktur Versus Instruksi Prompt
Ada baiknya menganggap field eksplisit - speaker, language, speed, dan response_format - sebagai baseline produksi Anda. Mereka menetapkan identitas suara inti untuk setiap permintaan. Lalu instruct berada di atas lapisan dasar itu dan membentuk cara suara tampil [2].
Gunakan parameter terstruktur saat Anda membutuhkan keluaran produksi yang stabil. Gunakan instruct saat Anda menginginkan variasi. Dalam praktik, prompt yang lebih deskriptif cenderung menghasilkan hasil yang lebih bernuansa dibanding instruksi satu kata [2].
Default ini memetakan langsung ke body permintaan di bagian berikutnya.
Cara Mengirim Permintaan Qwen-Audio-3.0-TTS Melalui APIMart
Kirim permintaan POST ke https://api.apimart.ai/v1/audio/speech dan sertakan Bearer token Anda di header Authorization [1].
Struktur Permintaan Dasar
Field utamanya adalah model, input, voice, language, response_format, speed, dan instruct [1][2]. Selain itu, jaga input tetap di bawah 4.096 karakter.
Permintaan ini menyatukan faktor harga dan pengaturan suara ke dalam satu body:
{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Welcome to our platform. We are excited to have you here.",
"voice": "Aiden",
"language": "English",
"instruct": "Warm and welcoming tone",
"response_format": "mp3",
"speed": 1.0
}
Sederhananya, field ini memberi tahu API apa yang harus dikatakan, bagaimana mengatakannya, dan format mana yang dikembalikan.
Untuk uji cURL cepat, gunakan:
curl --request POST \
--url https://api.apimart.ai/v1/audio/speech \
--header 'Authorization: Bearer YOUR_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "YOUR_QWEN_MODEL_ID",
"input": "Your order has been confirmed and will ship shortly.",
"voice": "Serena",
"language": "English",
"response_format": "opus"
}' \
--output confirmation.opus
Ini menyimpan respons audio langsung ke confirmation.opus [1].
Pengaturan yang Direkomendasikan Untuk Skenario Umum
Setelah Anda tahu bentuk permintaannya, memilih pengaturan menjadi jauh lebih mudah. Tabel di bawah memetakan kasus penggunaan umum ke preset awal yang baik.
| Skenario | Tier yang Disarankan | voice | Kecepatan | Prompt Instruct | Sensitivitas Biaya |
|---|---|---|---|---|---|
| Dukungan Pelanggan | Flash (0.6B) | Serena | 1,1 | Helpful | Tinggi |
| Onboarding Aplikasi | Plus (1.7B) | Aiden | 1,0 | Warm and welcoming | Sedang |
| Narasi Edukasi | Plus (1.7B) | Uncle_Fu | 0,9 | Authoritative and measured | Sedang |
| Materi Iklan | Plus (1.7B) | Vivian | 1,0 | Energetic and dynamic | Rendah |
| Sulih Suara Video Produk | Plus (1.7B) | Ryan | 1,0 | Professional and clear | Rendah |
Jika Anda membutuhkan keluaran multibahasa, atur language agar cocok dengan skrip Anda. Model ini mendukung 10 bahasa utama: Chinese, English, Japanese, Korean, German, French, Russian, Portuguese, Spanish, dan Italian [2].
Batas Laju, Error, Dan Pemeriksaan Produksi
Sebelum Anda beralih ke produksi, uji beberapa kasus kegagalan dengan sengaja. Ini salah satu langkah kecil yang bisa menghemat banyak kerepotan nanti.
| Kode Error | Arti | Tindakan yang Direkomendasikan |
|---|---|---|
| 400 | Parameter tidak valid | Periksa struktur JSON dan nilai yang diterima |
| 401 | API key hilang atau tidak valid | Verifikasi Bearer token Anda |
| 402 | Saldo akun tidak cukup | Isi ulang akun APIMart Anda |
| 413 | Input melebihi 4.096 karakter | Pecah teks menjadi segmen lebih kecil |
| 429 | Batas laju terlampaui | Coba lagi dengan exponential backoff |
| 500/502 | Error server atau gateway | Tunggu sebentar, lalu coba lagi |
400 biasanya berarti ada yang tidak beres di body permintaan. 413 lebih lugas: teks Anda terlalu panjang, jadi pecah menjadi potongan lebih kecil. Dan jika Anda kena 429, mundur dan coba lagi alih-alih menghajar endpoint.
Memilih Penyiapan yang Tepat Dan Langkah Berikutnya
Kerangka Keputusan Sederhana
Kini setelah harga dan kontrol suara ditetapkan, gunakan filter terakhir ini untuk mencocokkan model dengan pekerjaan yang perlu Anda selesaikan.
Pilih berdasarkan anggaran, kontrol suara, dan kasus penggunaan.
| Prioritas | Paling Cocok | Tier yang Direkomendasikan |
|---|---|---|
| Latensi rendah dan volume tinggi | Asisten langsung, IVR, terjemahan real-time | Flash |
| Efisiensi biaya volume tinggi | Lokalisasi massal, dukungan pelanggan volume tinggi | Flash |
| Narasi bermerek ekspresif | Narasi bermerek, audio format panjang, suara karakter | Plus |
Jika Anda mengerjakan narasi format panjang, gunakan satu penutur dari awal hingga akhir. Jaga instruct tetap ringkas, sederhana, dan dapat diulang. Itu biasanya memberi keluaran yang lebih stabil dan lebih sedikit kejutan.
Untuk penyiapan lebih sederhana, jaga tetap lebih bersih: pilih satu penutur dan ubah hanya field instruct saat diperlukan.
Poin Kunci yang Perlu Dibawa ke Implementasi
Setelah Anda memilih tier, siapkan segalanya di sekitar skenario yang paling sering Anda jalankan. Itu menjaga rencana peluncuran Anda tetap berpijak pada penggunaan nyata, bukan kasus tepi.
- Atur peringatan penggunaan sebelum peluncuran.
- Verifikasi setiap skenario dengan penutur, kecepatan, dan prompt
instruct-nya sendiri. - Uji keluaran dengan pendengar asli A.S. sebelum peluncuran.
- APIMart memungkinkan Anda berpindah tier tanpa mengubah pola integrasi inti.
Selain itu, uji bagaimana sistem Anda menangani 402, 429, dan 502 sebelum peluncuran.
FAQ
Bagaimana cara memecah teks panjang di atas 4.096 karakter?
Pecah teks menjadi potongan 4.096 karakter atau kurang dan kirim setiap potongan ke API secara terpisah.
Cobalah memecah pada titik henti alami, seperti akhir kalimat atau paragraf. Setelah itu, gabungkan file audio yang dikembalikan menjadi satu track final.
Pengaturan suara mana yang sebaiknya saya kunci untuk keluaran yang konsisten?
Untuk keluaran format panjang yang stabil, gunakan model VoiceDesign untuk menyiapkan persona yang jelas dan klip referensi. Lalu buat prompt yang dapat dipakai ulang dengan create_voice_clone_prompt dan teruskan voice_clone_prompt itu ke generate_voice_clone.
Membantu juga untuk mengunci pengaturan generasi seperti top_p agar suara tidak menyimpang seiring waktu. Dan sebelum Anda meluncurkan, lakukan uji coba untuk menangkap masalah lebih awal.
Kapan saya sebaiknya memilih Flash alih-alih Plus?
Pilih Flash (0.6B) ketika kecepatan dan latensi rendah paling penting. Ia dibangun untuk kasus penggunaan konkurensi tinggi seperti asisten virtual real-time, terjemahan langsung, dan dukungan pelanggan, di mana waktu respons cepat sangat krusial.
Pilih Plus (1.7B) ketika kualitas dan presisi lebih penting daripada kecepatan. Ia memberikan prosodi lebih baik, rentang emosi lebih luas, dan akurasi lebih tinggi untuk audiobook, sulih suara profesional, dan media bermerek.
Pilih model yang Anda inginkan di marketplace model
Coba model chat, gambar, dan video di marketplace model APIMart, lalu rasakan kemampuan model dengan cepat melalui satu API terpadu.
