APIMart
APIMart

API Qwen-Audio-3.0-TTS: Harga & Kontrol Suara

Qwen-Audio-3.0-TTS menagih per satu juta karakter input dengan batas 4.096 karakter. Bandingkan tier Flash vs Plus, atur suara, bahasa, dan kecepatan, lalu uji kode error.

Tutorial

Jika Anda berencana memakai Qwen-Audio-3.0-TTS, dua angka lebih dulu yang penting: harga per 1.000.000 karakter input dan batas 4.096 karakter per permintaan. Saya akan membuat pilihan penyiapan berdasarkan itu, lalu mengunci voice, language, speed, response_format, dan instruct untuk keluaran yang stabil.

Berikut versi singkatnya:

  • Penagihan berbasis karakter, dan hanya teks di field input yang dihitung.
  • Baik Flash maupun Plus ditagih per 1.000.000 karakter.
  • Sebuah tarif contoh di artikel ini memakai $15,00 per 1 juta karakter.
  • Setiap permintaan dibatasi 4.096 karakter.
  • Anda dapat mengontrol keluaran dengan:
    • voice untuk pilihan penutur
    • language untuk pengucapan
    • speed dari 0,5 hingga 2,0
    • response_format seperti mp3, wav, opus, atau pcm
    • instruct untuk nada, suasana, dan penyampaian
  • Model ini mencakup 9 penutur preset dan mendukung 10 bahasa.
  • Flash cocok untuk pekerjaan latensi rendah bervolume tinggi.
  • Plus cocok untuk narasi, suara merek, dan audio format panjang.

Beberapa angka menunjukkan betapa rendah pengeluaran bisa dimulai. Pada $15,00 per 1.000.000 karakter, 500 karakter x 30.000 permintaan menghasilkan sekitar $0,225/bulan dalam perhitungan contoh artikel. Artinya tugas utama Anda bukan soal harga mentah, melainkan menjaga pengaturan suara tetap stabil lintas kasus penggunaan.

Saya akan membaca panduan ini sebagai daftar periksa penyiapan: perkirakan biaya, pilih penutur, atur kontrol dasar, uji kode error seperti 413 dan 429, lalu rilis.

APIMart
Qwen-Audio-3.0-TTS: Flash vs Plus – Harga, Suara & Kasus Penggunaan Sekilas

Harga Dan Penagihan Qwen-Audio-3.0-TTS

APIMart

Qwen-Audio-3.0-TTS ditagih berdasarkan karakter teks input[1].

Cara Kerja Unit Harga

Kedua tier model - Flash dan Plus - ditagih per 1.000.000 karakter teks input. Hanya teks di dalam field input yang ditagih[1]. Setiap permintaan dapat mencakup hingga 4.096 karakter[1].

Flash bekerja baik untuk pekerjaan latensi rendah bervolume tinggi. Plus lebih cocok untuk narasi dan pekerjaan suara bermerek.

Cara Memperkirakan Biaya Bulanan Anda

Perhitungannya cukup sederhana: ambil rata-rata karakter per permintaan, kalikan dengan volume permintaan bulanan Anda, bagi 1.000.000, lalu kalikan dengan tarif per juta.

Menggunakan harga contoh $15,00 per 1 juta karakter, berikut gambarannya:

Kasus PenggunaanRata-rata Karakter/PermintaanPermintaan BulananEstimasi Biaya Bulanan
Asisten chat50030.000~$0,225
Dukungan pelanggan1.20030.000~$0,54
Narasi video10.00030.000~$4,50

Respons pendek biasanya sangat murah. Narasi yang lebih panjang menumpuk lebih cepat.

Cara Kerja Penagihan APIMart Lintas Proyek Multi-Model

APIMart

Jika alur kerja Anda memakai lebih dari satu model, ukur masing-masing dengan unit penagihannya sendiri.

Dalam proyek APIMart yang memadukan audio, teks, gambar, atau video, lacak setiap model secara terpisah. Untuk TTS, lacak karakter. Untuk model teks, lacak token. Untuk model gambar, lacak panggilan. Untuk model video, lacak detik.

Dengan biaya sudah terdefinisi, langkah berikutnya adalah memilih kontrol suara yang membentuk keluaran.

Kontrol Suara Di Qwen-Audio-3.0-TTS

Setelah harga jelas, langkah berikutnya adalah membentuk suara.

Qwen-Audio-3.0-TTS membagi kontrol suara menjadi dua bagian. Parameter terstruktur menangani penyiapan inti, sementara instruct menangani gaya. Jika Anda ingin keluaran yang dapat diulang, andalkan field terstruktur. Jika Anda ingin nada atau emosi bergeser, gunakan instruct.

Penutur, Bahasa, Dan Format Keluaran

API ini hadir dengan 9 profil penutur yang sudah ditentukan, masing-masing dengan timbre dan gaya suaranya sendiri [2]. Untuk aplikasi berbahasa Inggris, Ryan dan Aiden adalah pilihan terbaik untuk konten berbahasa Inggris. Jika Anda membangun untuk lebih dari satu pasar, parameter language menerima nilai seperti English, Chinese, atau Auto untuk deteksi otomatis di 10 bahasa yang didukung [2].

PenuturDeskripsi SuaraBahasa Asli
RyanPria dinamis, dorongan ritmis kuatEnglish
AidenPria Amerika ceria, midrange jernihEnglish
VivianWanita muda cerah, sedikit tajamChinese
SerenaWanita muda hangat dan lembutChinese
Uncle_FuPria berpengalaman, timbre rendah dan lembutChinese
DylanPria muda, dialek BeijingChinese
EricPria bersemangat, dialek SichuanChinese
Ono_AnnaWanita periang, timbre ringan dan gesitJapanese
SoheeWanita hangat, emosi kayaKorean

Aturan sederhana bekerja baik di sini: cocokkan penutur dengan bahasa target. Untuk konten en-US, Ryan atau Aiden biasanya paling masuk akal [2].

Untuk keluaran, Anda dapat memilih mp3, wav, opus, atau pcm. Format standar seperti MP3 dan WAV bekerja baik di seluruh browser modern dan tool media [1][2].

Nada, Kecepatan, Dan Emosi

Parameter speed menerima rentang numerik dari 0,5 hingga 2,0, dengan 1,0 sebagai default [2]. Kontrol yang terdokumentasi di area ini adalah speed dan instruct, yang memengaruhi emosi, timbre, prosodi, dan nada [2].

KontrolField PermintaanNilai / Rentang yang DiharapkanEfek AudioKasus Penggunaan Paling Cocok
PenuturspeakerVivian, Ryan, Aiden, dll.Menetapkan timbre dasar dan aksen asliKarakter bermerek, konten terlokalisasi
BahasalanguageEnglish, Chinese, Auto, dll.Menentukan pengucapan dan lokalAplikasi multibahasa
Kecepatanspeed0,5–2,0 (default: 1,0)Mengubah laju bicaraKonten edukasi, disclaimer cepat
Emosi/NadainstructVery happy, Angry, Calm, IncredulousMenggeser prosodi dan penyampaian emosionalPemasaran, karakter game, dukungan
Formatresponse_formatwav, mp3, pcm, opusMemengaruhi ukuran file dan kompatibilitasPemutaran browser dan tool media

Satu detail patut diperhatikan: jika instruct meminta penyampaian yang bersemangat, temponya bisa mempercepat meski speed: 1.0 tetap tak berubah [2]. Jadi jika pembacaan terasa lebih cepat dari perkiraan, prompt gaya mungkin penyebabnya.

Parameter Terstruktur Versus Instruksi Prompt

Ada baiknya menganggap field eksplisit - speaker, language, speed, dan response_format - sebagai baseline produksi Anda. Mereka menetapkan identitas suara inti untuk setiap permintaan. Lalu instruct berada di atas lapisan dasar itu dan membentuk cara suara tampil [2].

Gunakan parameter terstruktur saat Anda membutuhkan keluaran produksi yang stabil. Gunakan instruct saat Anda menginginkan variasi. Dalam praktik, prompt yang lebih deskriptif cenderung menghasilkan hasil yang lebih bernuansa dibanding instruksi satu kata [2].

Default ini memetakan langsung ke body permintaan di bagian berikutnya.

Cara Mengirim Permintaan Qwen-Audio-3.0-TTS Melalui APIMart

Kirim permintaan POST ke https://api.apimart.ai/v1/audio/speech dan sertakan Bearer token Anda di header Authorization [1].

Struktur Permintaan Dasar

Field utamanya adalah model, input, voice, language, response_format, speed, dan instruct [1][2]. Selain itu, jaga input tetap di bawah 4.096 karakter.

Permintaan ini menyatukan faktor harga dan pengaturan suara ke dalam satu body:

{
  "model": "YOUR_QWEN_MODEL_ID",
  "input": "Welcome to our platform. We are excited to have you here.",
  "voice": "Aiden",
  "language": "English",
  "instruct": "Warm and welcoming tone",
  "response_format": "mp3",
  "speed": 1.0
}

Sederhananya, field ini memberi tahu API apa yang harus dikatakan, bagaimana mengatakannya, dan format mana yang dikembalikan.

Untuk uji cURL cepat, gunakan:

curl --request POST \
  --url https://api.apimart.ai/v1/audio/speech \
  --header 'Authorization: Bearer YOUR_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "YOUR_QWEN_MODEL_ID",
    "input": "Your order has been confirmed and will ship shortly.",
    "voice": "Serena",
    "language": "English",
    "response_format": "opus"
  }' \
  --output confirmation.opus

Ini menyimpan respons audio langsung ke confirmation.opus [1].

Pengaturan yang Direkomendasikan Untuk Skenario Umum

Setelah Anda tahu bentuk permintaannya, memilih pengaturan menjadi jauh lebih mudah. Tabel di bawah memetakan kasus penggunaan umum ke preset awal yang baik.

SkenarioTier yang DisarankanvoiceKecepatanPrompt InstructSensitivitas Biaya
Dukungan PelangganFlash (0.6B)Serena1,1HelpfulTinggi
Onboarding AplikasiPlus (1.7B)Aiden1,0Warm and welcomingSedang
Narasi EdukasiPlus (1.7B)Uncle_Fu0,9Authoritative and measuredSedang
Materi IklanPlus (1.7B)Vivian1,0Energetic and dynamicRendah
Sulih Suara Video ProdukPlus (1.7B)Ryan1,0Professional and clearRendah

Jika Anda membutuhkan keluaran multibahasa, atur language agar cocok dengan skrip Anda. Model ini mendukung 10 bahasa utama: Chinese, English, Japanese, Korean, German, French, Russian, Portuguese, Spanish, dan Italian [2].

Batas Laju, Error, Dan Pemeriksaan Produksi

Sebelum Anda beralih ke produksi, uji beberapa kasus kegagalan dengan sengaja. Ini salah satu langkah kecil yang bisa menghemat banyak kerepotan nanti.

Kode ErrorArtiTindakan yang Direkomendasikan
400Parameter tidak validPeriksa struktur JSON dan nilai yang diterima
401API key hilang atau tidak validVerifikasi Bearer token Anda
402Saldo akun tidak cukupIsi ulang akun APIMart Anda
413Input melebihi 4.096 karakterPecah teks menjadi segmen lebih kecil
429Batas laju terlampauiCoba lagi dengan exponential backoff
500/502Error server atau gatewayTunggu sebentar, lalu coba lagi

400 biasanya berarti ada yang tidak beres di body permintaan. 413 lebih lugas: teks Anda terlalu panjang, jadi pecah menjadi potongan lebih kecil. Dan jika Anda kena 429, mundur dan coba lagi alih-alih menghajar endpoint.

Memilih Penyiapan yang Tepat Dan Langkah Berikutnya

Kerangka Keputusan Sederhana

Kini setelah harga dan kontrol suara ditetapkan, gunakan filter terakhir ini untuk mencocokkan model dengan pekerjaan yang perlu Anda selesaikan.

Pilih berdasarkan anggaran, kontrol suara, dan kasus penggunaan.

PrioritasPaling CocokTier yang Direkomendasikan
Latensi rendah dan volume tinggiAsisten langsung, IVR, terjemahan real-timeFlash
Efisiensi biaya volume tinggiLokalisasi massal, dukungan pelanggan volume tinggiFlash
Narasi bermerek ekspresifNarasi bermerek, audio format panjang, suara karakterPlus

Jika Anda mengerjakan narasi format panjang, gunakan satu penutur dari awal hingga akhir. Jaga instruct tetap ringkas, sederhana, dan dapat diulang. Itu biasanya memberi keluaran yang lebih stabil dan lebih sedikit kejutan.

Untuk penyiapan lebih sederhana, jaga tetap lebih bersih: pilih satu penutur dan ubah hanya field instruct saat diperlukan.

Poin Kunci yang Perlu Dibawa ke Implementasi

Setelah Anda memilih tier, siapkan segalanya di sekitar skenario yang paling sering Anda jalankan. Itu menjaga rencana peluncuran Anda tetap berpijak pada penggunaan nyata, bukan kasus tepi.

  • Atur peringatan penggunaan sebelum peluncuran.
  • Verifikasi setiap skenario dengan penutur, kecepatan, dan prompt instruct-nya sendiri.
  • Uji keluaran dengan pendengar asli A.S. sebelum peluncuran.
  • APIMart memungkinkan Anda berpindah tier tanpa mengubah pola integrasi inti.

Selain itu, uji bagaimana sistem Anda menangani 402, 429, dan 502 sebelum peluncuran.

FAQ

Bagaimana cara memecah teks panjang di atas 4.096 karakter?

Pecah teks menjadi potongan 4.096 karakter atau kurang dan kirim setiap potongan ke API secara terpisah.

Cobalah memecah pada titik henti alami, seperti akhir kalimat atau paragraf. Setelah itu, gabungkan file audio yang dikembalikan menjadi satu track final.

Pengaturan suara mana yang sebaiknya saya kunci untuk keluaran yang konsisten?

Untuk keluaran format panjang yang stabil, gunakan model VoiceDesign untuk menyiapkan persona yang jelas dan klip referensi. Lalu buat prompt yang dapat dipakai ulang dengan create_voice_clone_prompt dan teruskan voice_clone_prompt itu ke generate_voice_clone.

Membantu juga untuk mengunci pengaturan generasi seperti top_p agar suara tidak menyimpang seiring waktu. Dan sebelum Anda meluncurkan, lakukan uji coba untuk menangkap masalah lebih awal.

Kapan saya sebaiknya memilih Flash alih-alih Plus?

Pilih Flash (0.6B) ketika kecepatan dan latensi rendah paling penting. Ia dibangun untuk kasus penggunaan konkurensi tinggi seperti asisten virtual real-time, terjemahan langsung, dan dukungan pelanggan, di mana waktu respons cepat sangat krusial.

Pilih Plus (1.7B) ketika kualitas dan presisi lebih penting daripada kecepatan. Ia memberikan prosodi lebih baik, rentang emosi lebih luas, dan akurasi lebih tinggi untuk audiobook, sulih suara profesional, dan media bermerek.

Siap mencoba?

Pilih model yang Anda inginkan di marketplace model

Coba model chat, gambar, dan video di marketplace model APIMart, lalu rasakan kemampuan model dengan cepat melalui satu API terpadu.

Model chatModel gambarModel video
Buka marketplace model