

API Kimi K3: Fitur, Harga & Cara Mengakses
Kimi K3 menawarkan jendela konteks 1M token, dukungan visi native, dan akses API bergaya OpenAI. Lihat fitur, harga token, dan cara memanggilnya lewat APIMart.
Jika Anda butuh model untuk input yang sangat panjang, Kimi K3 dibuat untuk tugas itu. Singkatnya begini: model ini menawarkan jendela konteks 1.048.576 token, mendukung input gambar + teks, menggunakan API bergaya OpenAI, dan biayanya sekitar $3.00 per 1 juta token input, $0.30 per 1 juta token input yang di-cache, dan $15.00 per 1 juta token output.
Berikut versi singkatnya dalam bahasa yang mudah dipahami:
- Saya akan melirik Kimi K3 jika Anda perlu memproses dokumen besar, riwayat chat panjang, basis kode, atau prompt campuran gambar/teks
- Saya sering bisa menghubungkannya dengan kode SDK OpenAI yang sudah ada cukup dengan mengganti base URL dan API key
- Saya tetap akan memeriksa ulang nama model, dukungan endpoint, dan batasan sebelum meluncurkannya
- Saya akan mengawasi biaya dengan ketat karena token output adalah bagian paling mahal
- Saya juga akan menyiapkan rencana untuk masalah API umum seperti error 401, 402, dan 429
Beberapa fakta langsung terlihat menonjol:
- Jendela konteks: 1.048.576 token
- Jenis input: teks dan gambar
- Gaya API: chat completions ala OpenAI dan messages ala Anthropic
- Akses berbayar: dimulai dengan top-up minimum $1
- Kasus penggunaan utama: penalaran konteks panjang dengan input multimodal
Jika saya harus memutuskan dengan cepat, kesimpulan saya sederhana: Kimi K3 masuk akal digunakan ketika jendela 1 juta token dan dukungan visi cukup penting untuk membenarkan biaya output yang lebih tinggi. Untuk tugas yang lebih pendek atau berbiaya lebih rendah, model Kimi lain mungkin lebih cocok.
Kimi K3 dalam 10 Menit

Perbandingan Singkat
| Model | Konteks | Jenis Input | Paling Cocok Untuk | Arah Harga |
|---|---|---|---|---|
| Kimi K3 | 1.000.000+ token | Teks + gambar | Dokumen panjang, penalaran, pekerjaan multimodal | Paling tinggi di grup ini |
| Kimi K2.7-Code | Standar | Teks | Tugas coding | Lebih rendah dari K3 |
| Kimi K2.5 | Standar | Teks | Chat umum dan konten | Lebih rendah dari K3 |
| Kimi K2-Thinking | Standar | Teks | Matematika, logika, penalaran bergaya hukum | Lebih rendah dari K3 |
Dengan kata lain, saya akan memperlakukan Kimi K3 sebagai opsi untuk beban kerja berkonteks besar dan berbiaya lebih tinggi, bukan sebagai pilihan default untuk setiap aplikasi.
Fitur API Kimi K3 dan Kemampuan yang Didukung
Fitur Inti: Konteks Panjang, Penalaran, dan Input Visi
Kimi K3 menonjol karena dua hal besar: penalaran dan pemahaman gambar native. Kombinasi ini membuatnya cocok untuk analisis dokumen panjang dan prompt multimodal.
Konfigurasi yang mengutamakan penalaran ini bekerja baik untuk tugas terstruktur seperti matematika, logika, dan tinjauan hukum. Selain itu, dukungan visi memungkinkan Anda mengirim prompt teks-dan-gambar dalam satu permintaan. Kemampuan ini juga memengaruhi cara Anda mengakses dan mengintegrasikan Kimi K3.
Akses Kompatibel OpenAI dan Opsi Model

Di sisi API, Kimi K3 mendukung dua gaya akses umum. Model Kimi mendukung chat completions yang kompatibel dengan OpenAI dan messages bergaya Anthropic[1][5].
Gunakan protokol Anthropic (/v1/messages) untuk integrasi CLI Claude Code. Gunakan protokol OpenAI (/v1/chat/completions) untuk SDK Python dan Node.js standar[5].
Satu hal kecil yang perlu diperhatikan: saat Anda menggunakan protokol Anthropic, respons mungkin mengembalikan nama model yang berbeda, seperti kimi-for-coding. Jadi sebaiknya hindari asersi ketat pada field model di respons[5].
Posisi Kimi K3 dalam Lini Model Kimi
Gunakan perbandingan ini untuk memutuskan apakah jendela konteks K3 yang lebih besar dan dukungan visinya sepadan dengan overhead tambahannya.
| Model Name | Panjang Konteks | Dukungan Multimodal | Perilaku Penalaran | Beban Kerja yang Direkomendasikan |
|---|---|---|---|---|
| Kimi K3 | 1.000.000 token | Visi Native | Mengutamakan Penalaran | Analisis dokumen panjang |
| Kimi K2.7-Code | Standar | Hanya Teks | Dioptimalkan untuk Coding | Otomatisasi coding |
| Kimi K2.5 | Standar | Hanya Teks | Serbaguna | Chat, pembuatan konten |
| Kimi K2-Thinking | Standar | Hanya Teks | Penalaran Diperluas | Matematika, logika, tinjauan hukum |
Perbedaan ini memengaruhi penggunaan token dan biaya, yang akan dijabarkan pada bagian berikutnya.
Harga API Kimi K3 dan Perencanaan Biaya

Cara Kerja Penagihan Token: Input, Output, dan Cache Hit
Kimi K3 menggunakan penagihan token bayar-sesuai-pemakaian yang dihitung per 1 juta token. API ini mengenakan tarif terpisah untuk input yang di-cache, input baru, dan token output.[6][2][7][8][9][10][14]
Token input baru berbiaya sekitar $3.00 per 1M token. Ini adalah token prompt yang belum di-cache, seperti pesan pengguna baru atau system prompt yang berubah.[6][2][7][8][9][10][13][14] Token input yang di-cache berbiaya sekitar $0.30 per 1M token. Itu sekitar 90% lebih murah saat Kimi menggunakan kembali prefix yang berulang, seperti system prompt bersama atau konteks proyek statis.[6][7][8][9][10][13][14] Token output berbiaya sekitar $15.00 per 1M token dan mencakup seluruh output model.[6][2][7][8][9][10][13][14]
Cara sederhana untuk memahaminya:
- Input baru = teks prompt baru yang Anda kirim
- Input yang di-cache = teks prompt berulang yang bisa digunakan kembali oleh Kimi
- Output = semua yang dikirim kembali oleh Kimi
Ketiganya dapat ditagih. Input yang di-cache lebih murah, tetapi tidak gratis. Struktur harga ini berdampak langsung pada desain prompt, penggunaan ulang konteks, dan estimasi biaya bulanan. Periksa tarif terkini di akun Anda sebelum digunakan untuk produksi.[6][14]
Perkiraan Biaya Bulanan Berdasarkan Pola Penggunaan
Contoh-contoh ini menunjukkan bagaimana harga dapat berubah skala pada berbagai beban kerja umum.
- Chat ringan: sekitar $650–$700/bulan, ketika prompt sering berubah dan caching tetap rendah.[2][7][8]
- Otomatisasi menengah: sekitar $4,000–$4,500/bulan, ketika system prompt yang stabil atau skema tool bersama memangkas pengeluaran input.[2][7][8][9][14]
- Riset atau coding konteks panjang yang berat: sekitar $14,000–$15,000/bulan, ketika prefix cache yang stabil membantu menurunkan biaya input per permintaan dalam skala besar.[2][7][8][9][13][14]
Tabel Harga untuk Model Kimi
Gunakan tabel ini untuk membandingkan pengeluaran K3 dengan opsi Kimi lain yang sebanding. Top-up minimum $1 diperlukan untuk mengaktifkan akses API berbayar.[17][19][16]
| Model | Cached Input (per 1M) | Standard Input (per 1M) | Output (per 1M) | Catatan |
|---|---|---|---|---|
| Kimi K3 | ~$0.30 | ~$3.00 | ~$15.00 | Analisis konteks panjang |
| Kimi K2.7 Code | ~$0.19 | ~$0.95 | ~$4.00 | Varian fokus coding |
| Kimi K2.6 | ~$0.16 | ~$0.95 | ~$4.00 | Performa seimbang |
| Kimi K2 Thinking | - | ~$0.40 | ~$1.68 | Mode penalaran diperluas |
| Kimi K2.5 | ~$0.10 | ~$0.60 | ~$3.00 | Chat volume tinggi dan pembuatan konten |
Periksa tarif terkini di akun Anda sebelum digunakan untuk produksi.[6][14][15][17][3][18][19][4][11][12] Singkatnya, Kimi K3 paling masuk akal untuk beban kerja yang membutuhkan konteks jutaan token dan input multimodal.
Setelah harga sudah dipetakan, langkah berikutnya adalah akses akun, API key, dan permintaan pertama Anda.
Cara Mengakses dan Menyiapkan API Kimi K3
Buat Akun dan Buat API Key
Setelah harga jelas, langkah berikutnya adalah mendapatkan akses dan membuat permintaan uji pertama Anda. Anda bisa mengakses Kimi melalui Kimi Code Console atau APIMart, menambahkan dana ke saldo Anda, dan membuat API key dari dashboard console.
Key Kimi mungkin terlihat seperti sk-kimi-.... Saat membuat key, Anda bisa memberinya nama, mengatur kuota penggunaan, dan menambahkan whitelist IP. Segera salin key tersebut, karena mungkin tidak akan ditampilkan lagi.
Simpan di file .env pada root proyek Anda, lalu muat dengan os.getenv("API_KEY") di Python atau process.env.API_KEY di Node.js. Jangan hardcode secret di file source, dan jangan commit ke version control. Setelah itu, verifikasi key dengan panggilan chat-completions dasar.
Kirim Permintaan API Pertama Anda
Kirim permintaan chat-completions standar untuk menguji key Anda. Untuk APIMart, base URL-nya adalah https://api.apimart.ai/v1, dan setiap permintaan membutuhkan header berikut:
Authorization: Bearer YOUR_API_KEYContent-Type: application/json
Berikut contoh cURL sederhana untuk menguji pengaturan Anda:
curl -X POST https://api.apimart.ai/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k2.7-code",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Summarize the latest trends in long-context LLMs."}
],
"stream": false
}'
Jika Anda membuat permintaan konteks panjang, atur timeout client yang lebih lama agar koneksi tidak terputus terlalu cepat. 401 biasanya berarti key tidak valid atau sudah kedaluwarsa. 429 berarti Anda telah mencapai batas rate limit, sehingga Anda memerlukan throttling atau kuota yang lebih tinggi.
Gunakan base URL dan key yang sama pada SDK atau client serverless Anda.
Opsi Integrasi untuk Python, Node.js, dan Aplikasi Serverless
Karena model Kimi kompatibel dengan OpenAI, tim yang sudah menggunakan SDK OpenAI sering kali bisa beralih hanya dengan mengubah pengaturan base_url dan api_key. Ini membuat penyiapannya cukup sederhana.
| Environment | Jalur Integrasi | Konfigurasi Utama |
|---|---|---|
| Python | pip install openai | OpenAI(base_url="https://api.apimart.ai/v1", api_key="...") |
| Node.js | npm install openai | new OpenAI({ baseURL: "https://api.apimart.ai/v1", apiKey: "..." }) |
| Serverless | REST langsung via Fetch atau Axios | Header: Authorization: Bearer <key> |
Untuk aplikasi serverless, panggilan REST langsung dapat menjaga integrasi tetap ringan.
Menggunakan APIMart untuk Alur Kerja Berbasis Kimi dan Kesimpulan Akhir

Posisi APIMart dalam Alur Kerja Berbasis Kimi
Setelah Kimi K3 disiapkan, APIMart bisa berada di depannya sebagai satu lapisan API untuk alur kerja multimodal. Anda tetap menggunakan client bergaya OpenAI yang sama dan cukup mengarahkannya ke https://api.apimart.ai/v1.[20][22][23]
Contoh Alur Kerja Multi-Model Menggunakan APIMart
Salah satu pengaturan umum adalah alur dokumen-ke-konten. Kimi K3 mengambil file sumber yang panjang dan mengubahnya menjadi ide kampanye plus rencana aset JSON terstruktur, sementara model audio dan visi menangani pekerjaan produksi selanjutnya.[1][21][23]
Mengapa itu penting? Karena biaya Anda akan sebagian besar berasal dari token output.
Kesimpulan: Poin Penting yang Perlu Diperiksa Sebelum Membangun
Sebelum meluncurkan produk, fokuslah pada dasar-dasar yang membentuk performa maupun biaya.
- Kimi K3 menonjol karena jendela konteks 1M token, konfigurasi yang mengutamakan penalaran, dan visi native.[24][25]
- Harganya adalah $3.00 per 1M token input cache-miss, $0.30 per 1M token input yang di-cache, dan $15.00 per 1M token output.[24][25]
- Uji rate limit
429dan error saldo tidak cukup402sebelum peluncuran.
Jika aplikasi Anda membutuhkan lebih dari sekadar penalaran konteks panjang, APIMart memberi Anda satu lapisan API untuk memperluas stack tanpa harus membangun ulang integrasi Anda dari awal.[1]
FAQ
Kapan Kimi K3 Sepadan dengan Biayanya?
Kimi K3 sepadan dengan biayanya ketika aplikasi Anda membutuhkan analisis dokumen yang kuat, pembacaan konteks panjang, atau peringkasan yang kompleks. Model ini semakin menonjol dalam alur kerja yang membutuhkan nuansa lebih dalam, terutama dengan konten yang banyak mengandung CJK.
Anda mendapatkan manfaat maksimal saat menggunakannya untuk tugas-tugas tersebut dan menyimpan model frontier berbiaya lebih tinggi untuk chat interaktif dengan risiko tinggi atau penalaran tingkat lanjut. Pembagian ini bisa membantu menjaga total pengeluaran AI tetap terkendali tanpa mengorbankan kualitas di area yang penting.
Bagaimana Cara Mengurangi Pengeluaran Token Kimi K3?
Untuk memangkas pengeluaran token Kimi K3, cocokkan setiap tugas dengan model yang tepat, bukan mengirim semua permintaan ke tier flagship. Untuk tugas yang lebih sederhana seperti peringkasan atau klasifikasi, beralihlah ke model khusus berbiaya lebih rendah.
Anda juga bisa memangkas biaya dengan beberapa cara lain:
- Gunakan pemrosesan batch untuk tugas bervolume tinggi atau tugas latar belakang
- Aktifkan prompt caching untuk permintaan berulang atau query konteks panjang
- Pantau penggunaan secara real time di dashboard APIMart, lalu atur alert dan batas pengeluaran
Ini perubahan yang sederhana, tapi bisa menghemat banyak dalam jangka panjang.
Apa yang Perlu Saya Uji Sebelum Go Live?
Sebelum go live dengan API Kimi K3, uji prompt Anda sendiri pada level traffic yang Anda perkirakan akan dihadapi. Halaman harga hanya memberi titik awal, bukan gambaran lengkap. Anda perlu melihat bagaimana pengaturan Anda sendiri memengaruhi latensi p95, tingkat retry, dan waktu antrean saat traffic sedang tinggi.
Selain itu, bijaksana juga untuk memeriksa manajemen secret yang aman, menyiapkan monitoring dan alert anggaran, dan mengajukan upgrade tier jauh-jauh hari sebelum peluncuran dengan traffic tinggi.
Pilih model yang Anda inginkan di marketplace model
Coba model chat, gambar, dan video di marketplace model APIMart, lalu rasakan kemampuan model dengan cepat melalui satu API terpadu.
