

Cara Memulai dengan Wan 2.5 Preview
Panduan cepat Wan 2.5 Preview untuk developer — siapkan API, tulis prompt sinematik T2V dan I2V, tambahkan audio tersinkron, dan kelola biaya video 1080p.
Wan 2.5 Preview adalah alat pembuatan video dari Alibaba yang mengubah deskripsi teks atau gambar menjadi klip sinematik pendek dengan audio tersinkron. Ia mendukung dua mode: text-to-video (T2V) dan image-to-video (I2V). Model berperforma tinggi lainnya seperti Kling V3 menawarkan kemampuan sinematik serupa. Fitur utamanya meliputi pembuatan audio-visual sekali jalan, sinkronisasi bibir yang presisi, dan keluaran hingga 1080p pada 24fps untuk video berdurasi 5 atau 10 detik. Integrasi dipermudah melalui APIMart, sebuah platform yang menawarkan API terpadu untuk akses yang mulus. Harga mulai dari $0.0336/detik untuk 480p. Berikut hal-hal yang perlu Anda ketahui untuk memulai:
- Mode: T2V untuk membuat video dari prompt teks, I2V untuk menambahkan gerakan pada gambar.
- Kualitas: Keluaran dalam 480p, 720p, atau 1080p dengan audio stereo 48kHz.
- Harga: Bayar sesuai pemakaian, ditagih per detik video yang dihasilkan.
- Penyiapan: Bekerja dengan Python atau Node.js menggunakan REST API. Membutuhkan kunci API dari APIMart.
- Alur kerja: Kirim permintaan, dapatkan task ID, dan lakukan polling untuk hasilnya.
Mulailah dengan klip 480p berdurasi 5 detik untuk menguji penyiapan Anda. Setelah nyaman, tingkatkan ke 1080p untuk render akhir. Gunakan prompt yang detail untuk hasil yang lebih baik, dan sertakan instruksi audio untuk suara yang tersinkron.
Panduan ini mencakup semuanya, mulai dari menyiapkan lingkungan Anda hingga menyusun prompt dan mengelola biaya secara efektif.
Menyiapkan Lingkungan Anda
Prasyarat Developer
Sebelum menyelami kode, penting untuk memahami beberapa dasar. Anda sebaiknya memiliki pemahaman yang baik tentang REST API dan format JSON, karena semua interaksi dengan Wan 2.5 mengandalkan standar ini. Baik Anda lebih suka Python 3.x atau Node.js (v14+), keduanya akan bekerja untuk penyiapan ini.
Konsep penting lain yang perlu dipahami adalah alur kerja asinkron. Wan 2.5 tidak langsung memberikan video jadi. Sebaliknya, ia menyediakan task_id yang perlu Anda pantau. Anda harus membuat loop polling untuk memeriksa status tugas hingga statusnya berubah menjadi "completed". Setelah siap, kunjungi APIMart untuk membuat akun dan mendapatkan kunci API Anda.
Membuat Akun APIMart dan Kunci API

Mulailah dengan mengunjungi apimart.ai untuk menyiapkan akun gratis. Setelah masuk, buka bagian API Key Management di Console Dashboard Anda untuk menghasilkan kunci API. Pastikan untuk menyalin dan menyimpan kunci Anda dengan aman segera - kunci hanya ditampilkan satu kali.
APIMart menggunakan model bayar sesuai pemakaian, jadi Anda perlu mengisi saldo akun sebelum membuat permintaan. Jika Anda menemui error 402, itu berarti saldo akun Anda terlalu rendah. Sementara error 401 menunjukkan masalah dengan kunci API Anda. Periksa kembali kredensial Anda dan pastikan akun Anda memiliki dana yang cukup.
Mengonfigurasi Lingkungan Pengembangan Anda
Dengan kunci API siap, menyiapkan lingkungan Anda menjadi sederhana. APIMart kompatibel dengan OpenAI SDK. Untuk memulai:
- Untuk Python: Jalankan
pip install openai - Untuk Node.js: Jalankan
npm install openai
Satu-satunya penyesuaian dari penyiapan OpenAI standar adalah base URL. Aturlah ke:
https://api.apimart.ai/v1
Autentikasi permintaan Anda dengan menyertakan kunci API sebagai Bearer token di header, seperti ini:
Authorization: Bearer YOUR_API_KEY
Untuk keamanan tambahan, hindari menuliskan kunci API secara langsung ke dalam skrip Anda. Sebagai gantinya, simpan di dalam variabel lingkungan. Menggunakan file .env selama pengembangan lokal adalah praktik yang baik untuk menjaga kredensial Anda tetap aman dan di luar version control. Setelah lingkungan Anda dikonfigurasi, Anda dapat melanjutkan ke pembuatan permintaan API pertama Anda.
Membuat Permintaan API Pertama Anda
Contoh Permintaan Text-to-Video
Setelah Anda siap, Anda dapat langsung membuat permintaan API pertama Anda! Seperti disebutkan sebelumnya, permintaan ini bersifat asinkron, artinya Anda perlu menunggu tugas selesai sebelum mendapatkan hasilnya.
Berikut contoh Python sederhana untuk mulai menghasilkan keluaran text-to-video:
import openai
import os
client = openai.OpenAI(
api_key=os.environ["APIMART_API_KEY"],
base_url="https://api.apimart.ai/v1"
)
response = client.post("/wan2.5-t2v-preview", json={
"model": "wan2.5-t2v-preview",
"input": {
"prompt": "A golden retriever runs along a sunlit beach, waves crashing in slow motion",
"negative_prompt": "low quality, blurry, distorted",
"duration": 5,
"size": "1280*720",
"prompt_extend": True
}
})
task_id = response.json()["task_id"]
print(f"Task started: {task_id}")
Satu-satunya field wajib di sini adalah prompt, yang mendeskripsikan adegan yang ingin Anda buat. Parameter lain, seperti negative_prompt dan size, membantu menyempurnakan keluaran. Jika prompt Anda pendek, mengatur prompt_extend menjadi true memungkinkan model memperluasnya menjadi deskripsi sinematik yang lebih detail. Ingatlah untuk menggunakan dimensi yang tepat, seperti 1280*720, bukan rasio aspek.
Setelah mengirim permintaan Anda, Anda akan menerima task_id. Gunakan ID ini untuk melakukan polling pada endpoint status hingga tugas Anda ditandai sebagai SUCCEEDED:
import time
while True:
result = client.get(f"/tasks/{task_id}")
status = result.json()["task_status"]
if status == "SUCCEEDED":
video_url = result.json()["video_url"]
print(f"Video ready: {video_url}")
break
elif status == "FAILED":
print("Generation failed.")
break
time.sleep(15)
Pembuatan video biasanya memakan waktu 1–5 menit. Setelah video Anda siap, unduh dalam waktu 24 jam, karena URL akan kedaluwarsa setelah itu.
Berikutnya, mari kita lihat cara menghasilkan video dari gambar menggunakan pendekatan serupa. Anda juga dapat menjelajahi model lain seperti Grok Imagine Video untuk gaya sinematik yang berbeda.
Contoh Permintaan Image-to-Video
Proses image-to-video (I2V) mengikuti alur kerja asinkron yang sama tetapi mencakup dua perbedaan utama: Anda perlu menentukan model wan2.5-i2v-preview dan menyediakan image_url yang menunjuk ke gambar sumber.
Berikut contohnya:
response = client.post("/wan2.5-i2v-preview", json={
"model": "wan2.5-i2v-preview",
"input": {
"image_url": "https://your-storage.com/character-portrait.jpg",
"prompt": "The character slowly turns their head and smiles at the camera",
"duration": 5,
"resolution": "720p",
"negative_prompt": "blurry, artifacts"
}
})
Untuk I2V, prompt sebaiknya mendeskripsikan gerakan atau perubahan relatif terhadap gambar awal - seperti pergerakan karakter atau aksi kamera. Rasio aspek akan mengikuti gambar sumber Anda, jadi pastikan gambar dipotong sesuai rasio yang diinginkan (mis. 16:9, 9:16, 1:1) sebelum dikirim. Gambar sumber sebaiknya berukuran antara 360 dan 2.000 piksel di setiap sisi dan tidak lebih besar dari 10 MB.
Sama seperti text-to-video, ambil task_id dari respons dan gunakan logika polling yang sama untuk melacak status tugas hingga selesai.
Sekarang, mari kita uraikan struktur respons API untuk memahami arti setiap field.
Memahami Respons API
Saat Anda membuat permintaan POST yang berhasil, API mengembalikan objek JSON yang berisi task_id yang dapat Anda gunakan untuk memeriksa progres tugas. Setelah tugas selesai, Anda akan menerima field berikut:
| Field | Tipe | Deskripsi |
|---|---|---|
task_id / id | String | Pengenal unik untuk tugas. |
task_status | Enum | Status terkini tugas: PENDING, RUNNING, SUCCEEDED, atau FAILED. |
video_url | String | Tautan langsung ke video MP4 yang dihasilkan. |
meta.usage | Object | Detail tentang penggunaan sumber daya, seperti credits_used. |
error | Object | Jika tugas gagal, ini berisi name dan message dengan detail error. |
Kode status HTTP 200 dan task_id yang valid berarti permintaan Anda diterima. Jika tugas akhirnya gagal, periksa field error.message untuk detailnya, seperti format resolusi yang tidak didukung atau prompt yang terlalu panjang.
Wan 2.5 (the Veo 3 Killer) is NOW in n8n (full tutorial & template)
Mengoptimalkan Prompt dan Konfigurasi
Setelah lingkungan Anda disiapkan dan Anda telah membuat permintaan API awal (atau menjelajahi WAN 2.6 API yang lebih baru), menyempurnakan prompt Anda dapat sangat meningkatkan kualitas keluaran video.
Menulis Prompt Teks dan Gambar yang Baik
Hasil yang Anda peroleh sangat bergantung pada seberapa baik Anda menyusun prompt. Untuk Wan 2.5, prompt sepanjang 80 hingga 120 kata bekerja paling baik - cukup panjang untuk memberikan panduan yang jelas tetapi tidak terlalu panjang sehingga membingungkan model.
Berikut struktur yang berguna untuk diikuti: mulailah dengan subjek atau adegan, lalu tambahkan pergerakan kamera, detail gerakan, dan gaya visual. Misalnya, alih-alih mengatakan "seorang wanita berjalan di kota," Anda dapat menulis: "Seorang wanita bermantel merah berjalan cepat menyusuri jalanan Manhattan yang basah oleh hujan saat senja. Dolly in perlahan. Genangan air memantulkan tanda neon. Gradasi warna teal-dan-oranye, bokeh anamorfik, pencahayaan senja volumetrik." Tingkat detail ini memberi model instruksi yang jelas tentang suasana, komposisi, dan gerakan.
Untuk mengontrol kamera, gunakan istilah sinematografi standar seperti Pan left/right, Tilt up/down, Dolly in/out, Orbital arc, atau Crane up/down. Tambahkan kedalaman dengan mendeskripsikan efek paralaks - "rumput di latar depan bergoyang sementara pegunungan tetap diam di latar belakang." Anda juga dapat menyesuaikan tempo dengan istilah seperti "slow-motion" atau "whip-pan (gerakan pan kamera yang cepat)."
Untuk tugas image-to-video, fokuslah mendeskripsikan gerakan atau perubahan ekspresi karena model menggunakan gambar yang disediakan sebagai referensi dasar.
Setelah prompt visual Anda terkunci, Anda dapat melangkah lebih jauh dengan menyertakan audio dan dialog yang tersinkron.
Menambahkan Audio dan Dialog
Salah satu fitur unggulan Wan 2.5 adalah kemampuannya menghasilkan video dan audio secara bersamaan, menciptakan pengalaman yang sepenuhnya tersinkron dengan suara, suara ambien, dan efek.
"Yang benar-benar membedakan Wan 2.5 adalah kemampuannya menghasilkan bukan sekadar video bisu, melainkan pengalaman audio-visual lengkap dalam sekali jalan." - Scenario Knowledge Base [9]
Untuk dialog dengan sinkronisasi bibir, sertakan ucapan karakter dalam tanda kutip, seperti ini: "Seorang ilmuwan menatap kamera dan berkata, 'Hasilnya luar biasa.'" Untuk suara lingkungan, jelaskan secara spesifik: "hujan mengetuk jendela, deru lalu lintas di kejauhan." Model mengintegrasikan detail ini ke dalam keluaran akhir secara otomatis.
Jika Anda ingin menggunakan audio Anda sendiri, Anda dapat menyediakan audio_url khusus dalam format .wav atau .mp3 (ukuran maks: 15 MB). Namun, file audio sebaiknya sesuai dengan durasi video; jika lebih pendek, frame yang tersisa akan hening. Berhati-hatilah saat menggabungkan audio_url dengan beberapa URL gambar atau video dalam satu permintaan, karena hal ini dapat menyebabkan konflik [4].
Model secara otomatis menyesuaikan bahasa audio dengan prompt Anda, jadi jika prompt Anda dalam bahasa Inggris, audionya juga akan dalam bahasa Inggris - tanpa langkah tambahan [10].
Tingkat sinkronisasi ini memastikan audio dan visual bekerja sama dengan mulus untuk hasil akhir yang halus.
Memilih Resolusi dan Durasi
Saat bekerja dengan permintaan API, memilih resolusi dan durasi yang tepat adalah kunci untuk menyeimbangkan kualitas dan biaya.
Wan 2.5 Preview menawarkan dua durasi tetap - 5 detik atau 10 detik - dan resolusi 480p, 720p, dan 1080p pada 24 fps. Mulailah dengan draf 5 detik di 480p untuk menguji konsep Anda, lalu tingkatkan ke 1080p untuk render akhir Anda.
Berikut referensi cepat untuk kasus penggunaan umum:
| Kasus Penggunaan | Rasio Aspek | Resolusi yang Direkomendasikan | Durasi |
|---|---|---|---|
| YouTube / Presentasi | 16:9 (1920×1080) | 1080p | 10d |
| TikTok / Reels / Shorts | 9:16 (1080×1920) | 1080p | 5–10d |
| Feed Instagram / Iklan Persegi | 1:1 (1440×1440) | 1080p | 5d |
| Prototipe / Pengujian | Apa saja | 480p | 5d |
| Tablet / Layar Klasik | 4:3 (1632×1248) | 720p | 5–10d |
Semua resolusi menyertakan audio stereo 48kHz, jadi bahkan draf beresolusi rendah pun akan memberi Anda gambaran yang baik tentang bagaimana audio akan terdengar sebelum berkomitmen pada render berkualitas lebih tinggi.
Mengintegrasikan Wan 2.5 ke dalam Alur Kerja Multi-Modal

Setelah Anda mencoba-coba eksperimen API, saatnya mengintegrasikan Wan 2.5 ke dalam pipeline produksi Anda. Dengan APIMart, Anda mendapatkan akses ke lebih dari 500 model AI melalui satu API. Penyiapan ini memungkinkan Anda memadukan model bahasa, gambar, dan video dengan mulus tanpa memerlukan konfigurasi tambahan.
Membangun Pipeline Script-to-Video
Berikut alur kerja yang umum: mulailah dengan model bahasa untuk menyusun naskah dan membaginya menjadi beberapa adegan. Selanjutnya, gunakan model pembuatan gambar untuk membuat storyboard bagi setiap adegan. Dari sana, Wan 2.5 masuk, mengambil storyboard dan deskripsi adegan untuk menghasilkan klip video. Ia bahkan menyinkronkan audio sekaligus, menyederhanakan prosesnya [2][5].
Dengan menjaga semuanya di dalam APIMart, Anda merampingkan alur kerja Anda. Anda hanya perlu mengelola satu struktur API, satu kunci autentikasi, dan satu dashboard penagihan. Dengan penyiapan ini, Anda dapat fokus menyempurnakan keseimbangan antara performa dan biaya.
Mengelola Biaya dan Performa
Untuk mengelola pengeluaran secara efektif, sesuaikan model dan resolusi dengan tahap proyek Anda saat ini. Untuk draf awal, gunakan resolusi 480p untuk klip 5 detik, yang menghabiskan 43 credit per klip. Setelah draf Anda disetujui, tingkatkan ke 720p dengan 85 credit untuk 5 detik atau 170 credit untuk 10 detik. Untuk render akhir, tingkatkan ke 1080p dengan 128 credit untuk 5 detik atau 255 credit untuk 10 detik [1].
Butuh iterasi yang lebih cepat? Varian wan-2.5-fast menawarkan opsi yang lebih hemat biaya untuk 1080p, mengurangi biaya klip 10 detik menjadi 174 credit alih-alih 255 credit [11]. Jika Anda menangani tugas image-to-video dalam skala besar, model wan2.6-i2v-flash adalah pilihan yang ramah anggaran, dengan tarif $0.0168 per detik pada 720p dibandingkan $0.05 per detik untuk Wan 2.6 standar [7].
Contoh Alur Kerja: Dari Konsep ke Video Akhir
Setelah Anda mengoptimalkan biaya dan performa, ikuti proses langkah demi langkah ini untuk mewujudkan konsep Anda:
- Tulis naskah: Gunakan model bahasa seperti GPT-5 (tersedia melalui APIMart) untuk menyusun deskripsi adegan yang detail. Sertakan isyarat audio spesifik, seperti "musik piano lembut memudar masuk" atau "deru lalu lintas kota di kejauhan."
- Buat storyboard dan draf adegan di 480p: Masukkan deskripsi adegan ke model gambar untuk membuat panduan visual. Kemudian, uji setiap adegan dengan Wan 2.5 di 480p selama 5 detik untuk mengevaluasi gerakan, tempo, dan sinkronisasi audio.
- Render akhir di 1080p: Setelah puas dengan draf, render ulang adegan di 1080p untuk keluaran MP4 10 detik yang halus, lengkap dengan audio stereo 48kHz native [8].
"Konsistensi WAN 2.6 luar biasa! Gambar karakter tetap stabil di beberapa klip, yang sebelumnya sulit dicapai." - Wei Zhang, Animator Independen [7]
Untuk dorongan ekstra selama render akhir, gunakan parameter enable_prompt_expansion. Fitur ini secara otomatis memperkaya prompt Anda dengan detail sinematik, meningkatkan kualitas keluaran Anda tanpa memerlukan penyesuaian manual tambahan [12][3].
Kesimpulan dan Langkah Selanjutnya
Kini Anda telah dilengkapi dengan alat untuk mulai membuat video Wan 2.5 pertama Anda. Dengan sinkronisasi audio-video sekali jalan bawaannya, dukungan resolusi hingga 1080p, dan mode input serbaguna seperti text-to-video dan image-to-video, model ini siap untuk pekerjaan produksi serius - bukan sekadar uji coba biasa.
Sebelum terjun, pastikan penyiapan Anda benar-benar siap. Mulailah dari yang kecil dengan menguji klip 480p untuk menyempurnakan prompt Anda. Setelah Anda menguasai prosesnya, tingkatkan ke 1080p untuk render akhir Anda. Pendekatan ini memungkinkan Anda bereksperimen dan menyempurnakan tanpa mengeluarkan terlalu banyak sumber daya di awal.
Untuk proyek pertama Anda, cobalah fokus pada satu adegan. Tulis prompt yang detail yang mencakup instruksi audio yang jelas, dan hasilkan klip pendek 5 detik. Waktu pemrosesan cepat - biasanya antara 1 dan 5 menit - dan biayanya terjangkau, mulai dari hanya $0.0336 per detik untuk klip 480p [6]. Ini adalah cara yang terjangkau untuk menjelajahi dan menjadi terbiasa dengan alat ini.
Saat Anda siap berkembang, manfaatkan pustaka APIMart yang berisi lebih dari 500 model AI. Dengan satu kunci API dan dashboard penagihan, Anda dapat merampingkan alur kerja Anda dan membuat pipeline script-to-video lengkap dengan mudah, atau menjelajahi alternatif seperti MiniMax-Hailuo 2.3 untuk konsistensi berkualitas tinggi.
FAQ
Bagaimana cara menangani polling dan timeout untuk tugas video yang berjalan lama?
Untuk alur kerja produksi, efisien untuk menggunakan parameter callbackUrl saat membuat tugas. Dengan cara ini, Anda akan otomatis menerima permintaan POST setelah tugas selesai.
Jika Anda lebih suka polling, berikut cara kerjanya: kirim tugas Anda untuk mendapatkan taskId, lalu tunggu 50 detik sebelum meng-query endpoint status. Setelah itu, periksa status setiap 5 detik. Untuk mencegah pembebanan berlebih pada sistem, pastikan menangani error 429 dengan berhenti sejenak dan mencoba lagi setelah jeda.
Apa cara terbaik untuk memperkirakan biaya sebelum menghasilkan klip 5d atau 10d?
Untuk menghitung biaya klip video 5 detik atau 10 detik, cukup kalikan durasi klip (dalam detik) dengan tarif per detik penyedia. Pastikan memeriksa tarif untuk resolusi yang Anda inginkan - baik itu 480p, 720p, atau 1080p - karena kualitas yang lebih tinggi biasanya disertai harga yang lebih tinggi. Misalnya, jika Anda menghitung untuk klip 5 detik, kalikan tarif per detik dengan 5. Untuk klip 10 detik, kalikan dengan 10.
Bagaimana cara meningkatkan sinkronisasi bibir dan kualitas dialog dengan prompt saya?
Untuk mendapatkan sinkronisasi bibir dan kualitas dialog terbaik di Wan 2.5 Preview, gunakan prompt terstruktur. Prompt ini sebaiknya secara jelas menentukan dialog karakter, beserta detail seperti emosi, nada, kecepatan, dan timbre. Tingkat detail ini membantu model memberikan hasil yang lebih akurat dan alami.
Untuk presisi yang lebih tinggi lagi, Anda dapat mengunggah file audio khusus dalam format WAV atau MP3. File ini akan berperan sebagai panduan bagi model untuk menyelaraskan ekspresi wajah dan gerakan mulut dengan audio secara sempurna.
Pastikan gambar input Anda tajam dan cukup cahaya. Gambar berkualitas tinggi memastikan model dapat menafsirkan dan mereplikasi ekspresi secara efektif. Selain itu, manfaatkan fitur perluasan prompt, yang memungkinkan Anda menyertakan deskripsi detail untuk interpretasi yang lebih baik oleh model.
Pilih model yang Anda inginkan di marketplace model
Coba model chat, gambar, dan video di marketplace model APIMart, lalu rasakan kemampuan model dengan cepat melalui satu API terpadu.
