
Panduan API Vidu MoE: Video Mixture-of-Experts
Panduan developer API video Vidu MoE (Vidu Q3): tingkatan model, struktur permintaan, parameter, harga, dan alur kerja async submit-poll-download di APIMart.
Jika harus saya rangkum dalam satu kalimat: Vidu MoE adalah API video bentuk pendek untuk tim yang membutuhkan klip 1–16 detik, hingga 1080p, 24 fps, pengiriman async, dan audio opsional dalam satu permintaan.
Jika Anda sedang menilai kecocokannya untuk produksi, inilah jawaban singkatnya: ia bekerja paling baik ketika Anda dapat menangani pekerjaan async, menganggarkan untuk percobaan ulang, dan memilih tingkatan model yang tepat untuk setiap tahap. Saya akan menggunakan viduq3-turbo untuk pratinjau dan viduq3-pro untuk keluaran akhir. Sebagian besar pekerjaan selesai dalam sekitar 60–120 detik pada 720p dan 90–180 detik pada 1080p, dengan waktu tunggu puncak mencapai sekitar 4 menit.
Inilah yang paling penting:
- Mode masukan: text-to-video, animasi satu gambar, alternatif Grok Imagine Video, video dua frame awal/akhir, dan masukan referensi multi-gambar
- Batas klip: 1 hingga 16 detik
- Keluaran: hingga 1080p pada 24 fps
- Audio: dapat diaktifkan dalam permintaan yang sama
- Referensi gambar: hingga 7 gambar dalam set fitur model yang lebih luas
- Aturan API utama: jika Anda mengirim URL gambar, jangan kirim
aspect_ratio - Pengiriman: async dengan
task_id, polling, atau callback - Contoh harga: Pro sekitar $0.60 untuk 5 detik dan $1.44 untuk 12 detik
- Realitas anggaran: rencanakan 2–3 percobaan per klip yang disetujui
Beberapa detail menonjol. API menggunakan permintaan JSON sederhana dengan model, prompt, dan masukan media opsional. Pilihan model cukup jelas: turbo untuk pengujian berbiaya lebih rendah, pro untuk render kelas atas. Kontrol seed membantu Anda menjaga keluaran tetap dalam arah yang serupa di seluruh percobaan ulang, meskipun bukan sebagai kecocokan yang persis.
Jika saya mengevaluasi ini untuk tim produk, saya akan fokus pada tiga pertanyaan:
- Dapatkah aplikasi saya menangani pemrosesan async dengan rapi?
- Apakah saya memerlukan generasi hanya-prompt, kontrol berbasis gambar, atau kontrol frame awal/akhir?
- Apakah anggaran saya masih masuk akal setelah percobaan ulang, bukan hanya biaya percobaan pertama?
Perbandingan singkat
| Item | Apa yang perlu diketahui |
|---|---|
| Paling cocok untuk | Klip pemasaran, video produk, penjelasan, varian iklan |
| Pilihan model | viduq3-turbo, viduq3-pro, viduq3 |
| Kontrol masukan | Hanya prompt, 1 gambar, 2 gambar, atau generasi berbasis referensi |
| Latensi | Biasanya 1–3 menit, terkadang lebih lama saat puncak |
| Resolusi | 540p, 720p, 1080p |
| Audio | Didukung dalam permintaan |
| Kecocokan alur kerja | Tim yang dapat menunggu beberapa menit dan menyimpan file setelah selesai |
| Hal yang perlu diwaspadai | URL keluaran yang kedaluwarsa, biaya percobaan ulang, dan kesalahan permintaan dari kombinasi parameter yang buruk |
Jadi sebelum Anda membaca panduan lengkapnya, intinya sederhana: Vidu MoE cocok untuk generasi video pendek berbasis API ketika Anda menginginkan beberapa mode masukan, audio bawaan, dan kontrol biaya dengan beralih antara turbo dan pro. Sisanya bergantung pada pengaturan permintaan, penanganan status, dan pemilihan metode masukan yang sesuai dengan alur kerja Anda.
Gambaran Umum API Vidu MoE dan Kemampuan Inti

Pada tingkat API, Vidu MoE dipetakan ke sekumpulan kecil nama model, alur kerja, dan bidang keluaran.
Vidu MoE muncul di API sebagai viduq3-mix, model Q3 yang seimbang. viduq3-turbo condong ke kecepatan, sedangkan viduq3-pro condong ke lebih banyak detail.
Apa Arti Mixture-of-Experts dalam Generasi Video
Mixture-of-experts mengirim bagian-bagian berbeda dari proses generasi ke komponen-komponen khusus. Dalam praktiknya, hal itu membantu gerakan, komposisi adegan, dan kepatuhan terhadap prompt.
Seri Q3 juga mendukung peralihan adegan cerdas dan peralihan kamera cerdas [2][4]. Hal itu paling penting dalam urutan multi-shot, di mana kontinuitas dapat hancur dengan cepat jika model kehilangan jejak adegan.
Alur Kerja yang Didukung: Text-to-Video, Image-to-Video, dan Generasi Berpandu Referensi
Dari sana, perbedaan utamanya bergantung pada jenis masukan yang Anda kirim.
viduq3-mix mendukung empat alur kerja:
- Text-to-Video dari prompt saja
- Image-to-Video dari satu gambar awal
- Reference-to-Video dari 1 hingga 7 gambar untuk konsistensi tampilan dan gaya
- Start-End to Video dari dua frame yang mendefinisikan transisi
Prompt mendukung hingga 5.000 karakter [3][4]. viduq3-mix tidak mendukung pustaka entitas Subjects.
Masukan dan Keluaran Sekilas
| Alur Kerja | Bidang Masukan Tipikal | Bidang yang Dikembalikan |
|---|---|---|
| Text-to-Video | model, prompt, duration, aspect_ratio, audio | task_id, state, credits, video_url |
| Image-to-Video | model, images (1 frame awal), prompt, audio | task_id, state, credits, video_url |
| Reference-to-Video | model, images (1–7), prompt, audio | task_id, state, credits, video_url |
| Start-End to Video | model, images (2 frame), prompt, resolution | task_id, state, credits, video_url |
Setiap pekerjaan mengembalikan task_id dan state, dan video_url akhir menjadi tersedia setelah pemrosesan.
Video Q3 berjalan pada 24 fps, mendukung durasi dari 1 hingga 16 detik (sebanding dengan kemampuan Sora 2), dan menawarkan keluaran 540p, 720p, atau 1080p [2]. Masukan gambar dibatasi hingga 50 MB per file [4][1].
Opsi alur kerja ini membentuk payload yang Anda kirim berikutnya, yang dijelaskan bagian berikut menjadi autentikasi dan format permintaan.
Autentikasi, Struktur Permintaan, dan Penyiapan APIMart

Untuk menghasilkan video Vidu MoE, Anda perlu mengirim permintaan JSON yang terautentikasi. Badan permintaan bergantung pada mode masukan: hanya teks, gambar tunggal, atau multi-gambar.
Mendapatkan Kredensial API dan Mengatur Header Permintaan
Hasilkan kunci API Anda dari Halaman Pengelolaan Kunci API APIMart [6]. Simpan sebagai APIMART_API_KEY, lalu muat saat runtime dengan os.environ.get("APIMART_API_KEY") di Python atau process.env.APIMART_API_KEY di Node.js.
Sertakan header ini dengan setiap permintaan:
Authorization: Bearer YOUR_API_KEYContent-Type: application/json
Payload Permintaan Minimum untuk Pekerjaan Generasi Video
Endpoint APIMart standar untuk generasi Vidu Q3 (MoE) adalah https://api.apimart.ai/v1/videos/generations [6]. API menentukan mode dari image_urls:
0URL = text-to-video1URL = image-to-video2URL = frame pertama-ke-terakhir
Berikut bidang inti dan kapan menggunakannya [6]:
| Parameter | Wajib | Default | Catatan |
|---|---|---|---|
model | Ya | - | viduq3-pro, viduq3-turbo, atau viduq3 |
prompt | Kondisional | - | Wajib untuk text-to-video; maks 2.000 karakter |
image_urls | Kondisional | - | Wajib untuk image-to-video (1 URL) atau frame pertama-ke-terakhir (2 URL) |
duration | Tidak | 5 dtk | Rentang: 1–16 detik |
resolution | Tidak | 720p | Opsi: 540p, 720p, 1080p |
aspect_ratio | Tidak | 16:9 | Hanya text-to-video; hilangkan saat menyediakan image_urls |
audio | Tidak | true | Atur ke false untuk video tanpa suara |
seed | Tidak | - | Integer dari -1 hingga 2^32-1 untuk reproduktibilitas |
Satu kesalahan mudah di sini: jangan kirim aspect_ratio dengan image_urls. Saat Anda menyertakan gambar, API menarik rasio aspek dari gambar sumber. Jika Anda tetap mengirim aspect_ratio, permintaan mengembalikan kesalahan 400.
Setelah payload diatur, Anda dapat mengirimkan pekerjaan dan mulai melakukan polling untuk hasilnya.
Contoh Panggilan API dan Pola Respons
Contoh permintaan text-to-video:
curl -X POST https://api.apimart.ai/v1/videos/generations \
-H "Authorization: Bearer $APIMART_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "viduq3-turbo",
"prompt": "A product shot of a glass perfume bottle on a marble surface, camera slowly zooms in, soft studio lighting",
"duration": 5,
"resolution": "720p",
"aspect_ratio": "16:9",
"audio": false
}'
Pengiriman yang berhasil mengembalikan task_id dan status submitted [6]:
{
"code": 200,
"data": [{
"status": "submitted",
"task_id": "task_xxxxxxxxxx"
}]
}
API berjalan secara asinkron. Itu berarti respons pertama hanya memberi tahu Anda bahwa pekerjaan diterima. Gunakan task_id untuk melakukan polling ke endpoint "Get Task Status". Saat pekerjaan selesai, respons menyertakan tautan MP4, biasanya valid selama 7 hari [6].
Ritme polling sederhana bekerja dengan baik:
- Polling setiap 5 detik selama 5 menit pertama
- Setelah itu, polling sekali per menit
- Terus polling hingga statusnya
completed
Pada titik itu, unduh dan simpan tautan video yang dikembalikan.
Selanjutnya, sesuaikan durasi, resolusi, rasio aspek, dan masukan referensi untuk mengontrol video akhir. Untuk proyek yang memerlukan gaya sinematik berbeda, Anda juga dapat membandingkan kemampuan Kling V3 untuk generasi video kelas atas.
Alur Kerja Generasi, Parameter, dan Kontrol Keluaran
Alur End-to-End: Kirim, Pantau, Ambil, dan Simpan Hasil
Setelah Anda mengirimkan pekerjaan, keputusan produksi besar itu sederhana: gunakan callback atau polling untuk status. Dalam sebagian besar kasus, callback_url adalah pilihan yang lebih baik untuk produksi. Polling berfungsi, tetapi itu sebaiknya menjadi rencana cadangan Anda. Saat Anda menggunakan callback, API mengirim status akhir ke endpoint Anda. Jika pengiriman gagal, ia mencoba ulang hingga tiga kali [3].
Pekerjaan kemudian bergerak melalui jalur status tetap: created → queueing → processing → success atau failed [3][4]. Jika sebuah tugas berakhir di failed, respons menyertakan kode kesalahan. Catat kode itu dan tangani dalam alur kerja Anda agar tim Anda dapat melihat pola dan memperbaiki masalah lebih cepat.
Saat status mencapai success, segera unduh keluarannya dan simpan ke penyimpanan tahan lama. Langkah itu penting karena URL yang dihosting API dapat kedaluwarsa [9].
Parameter Kunci yang Memengaruhi Komposisi, Gerakan, Durasi, dan Konsistensi
Setelah sebuah pekerjaan berjalan, beberapa parameter membentuk tampilan hasilnya, seberapa stabil ia tetap dari satu jalankan ke jalankan lain, dan berapa banyak kredit yang Anda habiskan.
| Parameter | Apa yang Dikontrol | Efek Visual / Kualitas | Dampak Biaya |
|---|---|---|---|
seed | Pengacakan | Gunakan kembali seed yang sama dengan prompt yang sama untuk mereproduksi gerakan dan komposisi yang serupa | Tidak ada dampak biaya langsung [3][6] |
off_peak | Penjadwalan pekerjaan | Tidak ada dampak visual; mengarahkan pekerjaan prioritas rendah ke pemrosesan off-peak | Dapat mengurangi konsumsi kredit; dapat menunda penyelesaian hingga 48 jam [11] |
audio_type | Lapisan suara | Pilih Speech_only, Sound-effect_only, atau All (mirip dengan dukungan audio di kling-v2-6) | Tidak ada biaya tambahan untuk opsi audio standar [1][4] |
is_rec | Peningkatan prompt AI | Meningkatkan keselarasan prompt-gambar saat prompting manual menghasilkan hasil yang tidak konsisten | Membebani 10 kredit tambahan per tugas [1] |
Satu parameter layak dilacak dari awal: seed. Jika Anda mendapatkan pola gerakan yang Anda sukai, catat integer itu dan simpan. Lalu, saat Anda menyesuaikan prompt nanti, Anda dapat menggunakan kembali seed yang sama untuk mempertahankan komposisi keseluruhan yang serupa alih-alih memulai dari awal.
Kapan Menggunakan Hanya Prompt, Referensi Gambar, atau Keduanya
Mode masukan ini memungkinkan Anda menukar kecepatan dengan kontrol. Pilih yang sesuai dengan seberapa terkunci arah visual Anda.
- Hanya-prompt (text-to-video): Paling cocok untuk ideasi awal, uji gaya, dan eksperimen adegan sebelum aset visual difinalisasi. Gunakan
viduq3-turbopada 540p atau 720p untuk menjaga biaya iterasi tetap rendah, atau bandingkan dengan WAN 2.6 untuk alternatif berkonsistensi tinggi [7]. - Gambar tunggal (image-to-video): Paling cocok saat Anda ingin menganimasikan sesuatu yang spesifik, seperti foto produk, ilustrasi karakter, atau visual merek. Ini sangat cocok untuk pekerjaan e-commerce dan pemasaran.
- Dua gambar (frame pertama-ke-terakhir): Paling cocok saat transisi perlu mencapai hasil yang ditetapkan, seperti produk yang berputar ke sudut tertentu atau karakter yang bergerak ke pose yang ditentukan [5].
Jika prompting manual memberi Anda hasil yang tidak merata, aktifkan is_rec: true. API akan menghasilkan prompt yang dioptimalkan dari gambar Anda, yang dapat membantu keselarasan gambar-prompt, tetapi menambah 10 kredit per tugas [1].
Performa, Harga, dan Skenario Integrasi Nyata

Cara Mengevaluasi Latensi, Keandalan, dan Biaya Per Video
Setelah Anda mengunci format permintaan, hal berikutnya yang perlu dilihat adalah kecepatan, harga, dan tingkat keberhasilan pekerjaan. Ini adalah alur kerja async, jadi aplikasi Anda harus mengirimkan pekerjaan, menyimpan task_id, dan mengambil MP4 akhir nanti melalui polling atau callback [3][6].
Pekerjaan biasanya bergerak melalui jalur sederhana: antre, selesai, atau gagal. Saat sebuah pekerjaan gagal, kredit sering dikembalikan secara otomatis [3][10]. Itu penting dalam produksi, karena percobaan ulang adalah bagian dari proses, bukan kasus tepi.
Dalam hal waktu penyelesaian, generasi 720p biasanya selesai dalam 60–120 detik. Untuk 1080p, perkirakan lebih seperti 90–180 detik. Waktu antrean sering 15–30 detik selama jam off-peak, sedangkan latensi p95 puncak dapat meregang hingga sekitar 4 menit [7]. Jadi ya, ia dapat bekerja dengan baik dalam produksi - tetapi hanya jika sistem Anda dibangun untuk menangani penyelesaian async dengan rapi.
Soal harga, tarif Pro menempatkan klip 5 detik pada $0.60 dan klip 12 detik pada $1.44 [10]. Dalam praktiknya, sebagian besar tim harus menganggarkan 2–3 percobaan per aset yang disetujui. Itu menempatkan biaya akhir untuk klip yang dapat digunakan dalam rentang $1.20–$4.32, tergantung panjangnya [10]. Jika Anda dalam mode pengujian, viduq3-turbo sekitar setengah harga Pro dan lebih masuk akal untuk iterasi cepat. Pro lebih baik disimpan untuk render akhir [10].
| Tingkatan Volume | Video Bulanan | Durasi Rata-rata | Biaya Bulanan Dasar (USD) |
|---|---|---|---|
| Ringan | 50 | 12s | $72.00 |
| Sedang | 200 | 12s | $288.00 |
| Berat | 500 | 12s | $720.00 |
Angka-angka ini hanya mencakup generasi dasar. Mereka tidak termasuk percobaan ulang. Jika tim Anda memperkirakan beberapa kali pengerjaan - dan kebanyakan memang begitu - kalikan totalnya dengan 2–3 untuk anggaran yang lebih dekat dengan produksi sehari-hari.
Kasus Penggunaan: Video Pemasaran, Klip Edukasi, dan Visual Produk E-Commerce
Setelah biaya dan waktu tunggu jelas, langkah berikutnya adalah memilih mode masukan yang tepat untuk aset yang perlu Anda kirim. Pilihan terbaik sebagian besar bergantung pada satu hal: seberapa banyak kontrol visual yang sudah Anda miliki.
| Skenario | Jenis Masukan yang Direkomendasikan | Ekspektasi Keluaran | Catatan Operasional |
|---|---|---|---|
| Kreatif Pemasaran | Reference-to-Video | Avatar atau maskot merek yang konsisten di seluruh klip | Kirim referensi karakter dan latar belakang bersama-sama untuk konsistensi visual. |
| Visual E-Commerce | Image-to-Video | Tampilan produk yang konsisten | Mulai dengan satu gambar katalog berkualitas tinggi; kualitas keluaran mengikuti frame masukan. |
| Klip Edukasi | First-Last Frame | Transisi mulus antar keadaan | Sediakan gambar awal dan gambar akhir untuk memandu gerakan. |
| Iklan Media Sosial | Text-to-Video | Klip vertikal (9:16) atau persegi (1:1) | Gunakan prompt vertikal atau persegi pendek untuk varian iklan cepat. |
Cara sederhana untuk memikirkannya:
- Jika konsistensi merek penting, gunakan Reference-to-Video
- Jika gambar sumber sudah terlihat bagus, gunakan Image-to-Video
- Jika Anda memerlukan gerakan antara dua keadaan, gunakan First-Last Frame
- Jika Anda ingin banyak varian iklan dengan cepat, gunakan Text-to-Video atau pertimbangkan MiniMax Hailuo 2.3 untuk keluaran profesional berkonsistensi tinggi.
Untuk tim yang berusaha memangkas waktu pengeditan, audio native paling banyak mengubah alur kerja. Audio native memangkas pekerjaan pencarian dan pengeditan terpisah [8], yang dapat menghilangkan langkah pasca-produksi tambahan bagi tim yang menginginkan klip jadi dari satu kali generasi. Di situlah model menjadi paling berguna: saat tujuannya adalah mendekati aset siap kirim tanpa memantulkan file melalui rantai serah-terima yang panjang.
Kesimpulan: Cara Memutuskan Apakah Vidu MoE Cocok untuk Alur Kerja Produksi Anda
Vidu MoE masuk akal saat Anda membutuhkan klip pendek hingga 12–16 detik, beberapa mode masukan, dan audio native dalam penyiapan API async. Parameter seed dapat membantu menjaga pekerjaan berulang bergerak ke arah yang kira-kira sama, tetapi Anda tidak boleh berharap masukan yang identik menghasilkan keluaran yang cocok bit-demi-bit [6][10]. Pekerjaan yang gagal juga cenderung memicu pengembalian kredit otomatis [3][10].
Ini cocok untuk tim yang memproduksi video bentuk pendek dalam skala besar, dapat menunggu beberapa menit untuk hasil, dan memiliki ruang dalam anggaran untuk percobaan ulang. Jika itu terdengar seperti alur kerja Anda, APIMart memberi Anda cara yang rapi untuk menjalankan kreatif pemasaran, visual produk, dan konten penjelasan melalui satu permukaan API.
FAQ
Model Vidu MoE mana yang harus saya gunakan pertama kali?
Untuk sebagian besar developer, viduq3-turbo adalah tempat terbaik untuk memulai. Ia memberi Anda kecepatan generasi tercepat, rasio harga-terhadap-performa yang kuat, dan fitur lanjutan seperti sinkronisasi audio-visual dan peralihan adegan cerdas.
Pilih viduq3-pro jika Anda menginginkan set fitur paling lengkap. Ia mencakup generasi storyboard dan keselarasan audio-visual berkualitas tertinggi. Kedua model mendukung video dari 1 hingga 16 detik dan resolusi hingga 1080p.
Bagaimana saya harus menangani pekerjaan video yang gagal atau tertunda?
Gunakan task ID dalam alur kerja async Anda.
Untuk pekerjaan yang memakan waktu lebih lama, baik lakukan polling ke API status dari waktu ke waktu atau atur URL callback agar Anda mendapat pemberitahuan saat tugas mencapai keadaan terminal.
Jika sebuah pekerjaan gagal, periksa callback atau respons status untuk detail kesalahan.
Untuk stabilitas produksi, gunakan exponential backoff saat polling agar Anda tidak terkena batas laju.
Tugas off-peak yang berjalan melewati 48 jam dibatalkan secara otomatis, dan poin dikembalikan.
Mode masukan apa yang menawarkan kontrol paling banyak?
Multi-Frame Generation memberi Anda kontrol paling banyak atas bagaimana sebuah video bergerak dari satu momen ke momen berikutnya. Alih-alih mengandalkan satu prompt atau penyiapan dua frame, Anda dapat memetakan urutan hingga 9 key frame.
Kontrol tambahan itu penting. Untuk setiap transisi, Anda dapat menambahkan gambar spesifik dan prompt khusus, sehingga cerita visual mengikuti jalur yang Anda inginkan, frame demi frame.
Untuk menggunakannya, kirim gambar dan prompt Anda ke endpoint multiframe dalam array image_settings.
Pilih model yang Anda inginkan di marketplace model
Coba model chat, gambar, dan video di marketplace model APIMart, lalu rasakan kemampuan model dengan cepat melalui satu API terpadu.