APIMart
APIMart

API Kimi K3: Fitur, Harga & Cara Mengakses

Kimi K3 menawarkan jendela konteks 1M token, dukungan visi native, dan akses API bergaya OpenAI. Lihat fitur, harga token, dan cara memanggilnya lewat APIMart.

Tutorial

Jika Anda butuh model untuk input yang sangat panjang, Kimi K3 dibuat untuk tugas itu. Singkatnya begini: model ini menawarkan jendela konteks 1.048.576 token, mendukung input gambar + teks, menggunakan API bergaya OpenAI, dan biayanya sekitar $3.00 per 1 juta token input, $0.30 per 1 juta token input yang di-cache, dan $15.00 per 1 juta token output.

Berikut versi singkatnya dalam bahasa yang mudah dipahami:

  • Saya akan melirik Kimi K3 jika Anda perlu memproses dokumen besar, riwayat chat panjang, basis kode, atau prompt campuran gambar/teks
  • Saya sering bisa menghubungkannya dengan kode SDK OpenAI yang sudah ada cukup dengan mengganti base URL dan API key
  • Saya tetap akan memeriksa ulang nama model, dukungan endpoint, dan batasan sebelum meluncurkannya
  • Saya akan mengawasi biaya dengan ketat karena token output adalah bagian paling mahal
  • Saya juga akan menyiapkan rencana untuk masalah API umum seperti error 401, 402, dan 429

Beberapa fakta langsung terlihat menonjol:

  • Jendela konteks: 1.048.576 token
  • Jenis input: teks dan gambar
  • Gaya API: chat completions ala OpenAI dan messages ala Anthropic
  • Akses berbayar: dimulai dengan top-up minimum $1
  • Kasus penggunaan utama: penalaran konteks panjang dengan input multimodal

Jika saya harus memutuskan dengan cepat, kesimpulan saya sederhana: Kimi K3 masuk akal digunakan ketika jendela 1 juta token dan dukungan visi cukup penting untuk membenarkan biaya output yang lebih tinggi. Untuk tugas yang lebih pendek atau berbiaya lebih rendah, model Kimi lain mungkin lebih cocok.

Kimi K3 dalam 10 Menit

APIMart

Perbandingan Singkat

ModelKonteksJenis InputPaling Cocok UntukArah Harga
Kimi K31.000.000+ tokenTeks + gambarDokumen panjang, penalaran, pekerjaan multimodalPaling tinggi di grup ini
Kimi K2.7-CodeStandarTeksTugas codingLebih rendah dari K3
Kimi K2.5StandarTeksChat umum dan kontenLebih rendah dari K3
Kimi K2-ThinkingStandarTeksMatematika, logika, penalaran bergaya hukumLebih rendah dari K3

Dengan kata lain, saya akan memperlakukan Kimi K3 sebagai opsi untuk beban kerja berkonteks besar dan berbiaya lebih tinggi, bukan sebagai pilihan default untuk setiap aplikasi.

Fitur API Kimi K3 dan Kemampuan yang Didukung

Fitur Inti: Konteks Panjang, Penalaran, dan Input Visi

Kimi K3 menonjol karena dua hal besar: penalaran dan pemahaman gambar native. Kombinasi ini membuatnya cocok untuk analisis dokumen panjang dan prompt multimodal.

Konfigurasi yang mengutamakan penalaran ini bekerja baik untuk tugas terstruktur seperti matematika, logika, dan tinjauan hukum. Selain itu, dukungan visi memungkinkan Anda mengirim prompt teks-dan-gambar dalam satu permintaan. Kemampuan ini juga memengaruhi cara Anda mengakses dan mengintegrasikan Kimi K3.

Akses Kompatibel OpenAI dan Opsi Model

APIMart

Di sisi API, Kimi K3 mendukung dua gaya akses umum. Model Kimi mendukung chat completions yang kompatibel dengan OpenAI dan messages bergaya Anthropic[1][5].

Gunakan protokol Anthropic (/v1/messages) untuk integrasi CLI Claude Code. Gunakan protokol OpenAI (/v1/chat/completions) untuk SDK Python dan Node.js standar[5].

Satu hal kecil yang perlu diperhatikan: saat Anda menggunakan protokol Anthropic, respons mungkin mengembalikan nama model yang berbeda, seperti kimi-for-coding. Jadi sebaiknya hindari asersi ketat pada field model di respons[5].

Posisi Kimi K3 dalam Lini Model Kimi

Gunakan perbandingan ini untuk memutuskan apakah jendela konteks K3 yang lebih besar dan dukungan visinya sepadan dengan overhead tambahannya.

Model NamePanjang KonteksDukungan MultimodalPerilaku PenalaranBeban Kerja yang Direkomendasikan
Kimi K31.000.000 tokenVisi NativeMengutamakan PenalaranAnalisis dokumen panjang
Kimi K2.7-CodeStandarHanya TeksDioptimalkan untuk CodingOtomatisasi coding
Kimi K2.5StandarHanya TeksSerbagunaChat, pembuatan konten
Kimi K2-ThinkingStandarHanya TeksPenalaran DiperluasMatematika, logika, tinjauan hukum

Perbedaan ini memengaruhi penggunaan token dan biaya, yang akan dijabarkan pada bagian berikutnya.

Harga API Kimi K3 dan Perencanaan Biaya

APIMart
Perbandingan Model Kimi: Harga, Konteks & Kemampuan

Cara Kerja Penagihan Token: Input, Output, dan Cache Hit

Kimi K3 menggunakan penagihan token bayar-sesuai-pemakaian yang dihitung per 1 juta token. API ini mengenakan tarif terpisah untuk input yang di-cache, input baru, dan token output.[6][2][7][8][9][10][14]

Token input baru berbiaya sekitar $3.00 per 1M token. Ini adalah token prompt yang belum di-cache, seperti pesan pengguna baru atau system prompt yang berubah.[6][2][7][8][9][10][13][14] Token input yang di-cache berbiaya sekitar $0.30 per 1M token. Itu sekitar 90% lebih murah saat Kimi menggunakan kembali prefix yang berulang, seperti system prompt bersama atau konteks proyek statis.[6][7][8][9][10][13][14] Token output berbiaya sekitar $15.00 per 1M token dan mencakup seluruh output model.[6][2][7][8][9][10][13][14]

Cara sederhana untuk memahaminya:

  • Input baru = teks prompt baru yang Anda kirim
  • Input yang di-cache = teks prompt berulang yang bisa digunakan kembali oleh Kimi
  • Output = semua yang dikirim kembali oleh Kimi

Ketiganya dapat ditagih. Input yang di-cache lebih murah, tetapi tidak gratis. Struktur harga ini berdampak langsung pada desain prompt, penggunaan ulang konteks, dan estimasi biaya bulanan. Periksa tarif terkini di akun Anda sebelum digunakan untuk produksi.[6][14]

Perkiraan Biaya Bulanan Berdasarkan Pola Penggunaan

Contoh-contoh ini menunjukkan bagaimana harga dapat berubah skala pada berbagai beban kerja umum.

  • Chat ringan: sekitar $650–$700/bulan, ketika prompt sering berubah dan caching tetap rendah.[2][7][8]
  • Otomatisasi menengah: sekitar $4,000–$4,500/bulan, ketika system prompt yang stabil atau skema tool bersama memangkas pengeluaran input.[2][7][8][9][14]
  • Riset atau coding konteks panjang yang berat: sekitar $14,000–$15,000/bulan, ketika prefix cache yang stabil membantu menurunkan biaya input per permintaan dalam skala besar.[2][7][8][9][13][14]

Tabel Harga untuk Model Kimi

Gunakan tabel ini untuk membandingkan pengeluaran K3 dengan opsi Kimi lain yang sebanding. Top-up minimum $1 diperlukan untuk mengaktifkan akses API berbayar.[17][19][16]

ModelCached Input (per 1M)Standard Input (per 1M)Output (per 1M)Catatan
Kimi K3~$0.30~$3.00~$15.00Analisis konteks panjang
Kimi K2.7 Code~$0.19~$0.95~$4.00Varian fokus coding
Kimi K2.6~$0.16~$0.95~$4.00Performa seimbang
Kimi K2 Thinking-~$0.40~$1.68Mode penalaran diperluas
Kimi K2.5~$0.10~$0.60~$3.00Chat volume tinggi dan pembuatan konten

Periksa tarif terkini di akun Anda sebelum digunakan untuk produksi.[6][14][15][17][3][18][19][4][11][12] Singkatnya, Kimi K3 paling masuk akal untuk beban kerja yang membutuhkan konteks jutaan token dan input multimodal.

Setelah harga sudah dipetakan, langkah berikutnya adalah akses akun, API key, dan permintaan pertama Anda.

Cara Mengakses dan Menyiapkan API Kimi K3

Buat Akun dan Buat API Key

Setelah harga jelas, langkah berikutnya adalah mendapatkan akses dan membuat permintaan uji pertama Anda. Anda bisa mengakses Kimi melalui Kimi Code Console atau APIMart, menambahkan dana ke saldo Anda, dan membuat API key dari dashboard console.

Key Kimi mungkin terlihat seperti sk-kimi-.... Saat membuat key, Anda bisa memberinya nama, mengatur kuota penggunaan, dan menambahkan whitelist IP. Segera salin key tersebut, karena mungkin tidak akan ditampilkan lagi.

Simpan di file .env pada root proyek Anda, lalu muat dengan os.getenv("API_KEY") di Python atau process.env.API_KEY di Node.js. Jangan hardcode secret di file source, dan jangan commit ke version control. Setelah itu, verifikasi key dengan panggilan chat-completions dasar.

Kirim Permintaan API Pertama Anda

Kirim permintaan chat-completions standar untuk menguji key Anda. Untuk APIMart, base URL-nya adalah https://api.apimart.ai/v1, dan setiap permintaan membutuhkan header berikut:

  • Authorization: Bearer YOUR_API_KEY
  • Content-Type: application/json

Berikut contoh cURL sederhana untuk menguji pengaturan Anda:

curl -X POST https://api.apimart.ai/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k2.7-code",
    "messages": [
      {"role": "system", "content": "You are a helpful assistant."},
      {"role": "user", "content": "Summarize the latest trends in long-context LLMs."}
    ],
    "stream": false
  }'

Jika Anda membuat permintaan konteks panjang, atur timeout client yang lebih lama agar koneksi tidak terputus terlalu cepat. 401 biasanya berarti key tidak valid atau sudah kedaluwarsa. 429 berarti Anda telah mencapai batas rate limit, sehingga Anda memerlukan throttling atau kuota yang lebih tinggi.

Gunakan base URL dan key yang sama pada SDK atau client serverless Anda.

Opsi Integrasi untuk Python, Node.js, dan Aplikasi Serverless

Karena model Kimi kompatibel dengan OpenAI, tim yang sudah menggunakan SDK OpenAI sering kali bisa beralih hanya dengan mengubah pengaturan base_url dan api_key. Ini membuat penyiapannya cukup sederhana.

EnvironmentJalur IntegrasiKonfigurasi Utama
Pythonpip install openaiOpenAI(base_url="https://api.apimart.ai/v1", api_key="...")
Node.jsnpm install openainew OpenAI({ baseURL: "https://api.apimart.ai/v1", apiKey: "..." })
ServerlessREST langsung via Fetch atau AxiosHeader: Authorization: Bearer <key>

Untuk aplikasi serverless, panggilan REST langsung dapat menjaga integrasi tetap ringan.

Menggunakan APIMart untuk Alur Kerja Berbasis Kimi dan Kesimpulan Akhir

APIMart

Posisi APIMart dalam Alur Kerja Berbasis Kimi

Setelah Kimi K3 disiapkan, APIMart bisa berada di depannya sebagai satu lapisan API untuk alur kerja multimodal. Anda tetap menggunakan client bergaya OpenAI yang sama dan cukup mengarahkannya ke https://api.apimart.ai/v1.[20][22][23]

Contoh Alur Kerja Multi-Model Menggunakan APIMart

Salah satu pengaturan umum adalah alur dokumen-ke-konten. Kimi K3 mengambil file sumber yang panjang dan mengubahnya menjadi ide kampanye plus rencana aset JSON terstruktur, sementara model audio dan visi menangani pekerjaan produksi selanjutnya.[1][21][23]

Mengapa itu penting? Karena biaya Anda akan sebagian besar berasal dari token output.

Kesimpulan: Poin Penting yang Perlu Diperiksa Sebelum Membangun

Sebelum meluncurkan produk, fokuslah pada dasar-dasar yang membentuk performa maupun biaya.

  • Kimi K3 menonjol karena jendela konteks 1M token, konfigurasi yang mengutamakan penalaran, dan visi native.[24][25]
  • Harganya adalah $3.00 per 1M token input cache-miss, $0.30 per 1M token input yang di-cache, dan $15.00 per 1M token output.[24][25]
  • Uji rate limit 429 dan error saldo tidak cukup 402 sebelum peluncuran.

Jika aplikasi Anda membutuhkan lebih dari sekadar penalaran konteks panjang, APIMart memberi Anda satu lapisan API untuk memperluas stack tanpa harus membangun ulang integrasi Anda dari awal.[1]

FAQ

Kapan Kimi K3 Sepadan dengan Biayanya?

Kimi K3 sepadan dengan biayanya ketika aplikasi Anda membutuhkan analisis dokumen yang kuat, pembacaan konteks panjang, atau peringkasan yang kompleks. Model ini semakin menonjol dalam alur kerja yang membutuhkan nuansa lebih dalam, terutama dengan konten yang banyak mengandung CJK.

Anda mendapatkan manfaat maksimal saat menggunakannya untuk tugas-tugas tersebut dan menyimpan model frontier berbiaya lebih tinggi untuk chat interaktif dengan risiko tinggi atau penalaran tingkat lanjut. Pembagian ini bisa membantu menjaga total pengeluaran AI tetap terkendali tanpa mengorbankan kualitas di area yang penting.

Bagaimana Cara Mengurangi Pengeluaran Token Kimi K3?

Untuk memangkas pengeluaran token Kimi K3, cocokkan setiap tugas dengan model yang tepat, bukan mengirim semua permintaan ke tier flagship. Untuk tugas yang lebih sederhana seperti peringkasan atau klasifikasi, beralihlah ke model khusus berbiaya lebih rendah.

Anda juga bisa memangkas biaya dengan beberapa cara lain:

  • Gunakan pemrosesan batch untuk tugas bervolume tinggi atau tugas latar belakang
  • Aktifkan prompt caching untuk permintaan berulang atau query konteks panjang
  • Pantau penggunaan secara real time di dashboard APIMart, lalu atur alert dan batas pengeluaran

Ini perubahan yang sederhana, tapi bisa menghemat banyak dalam jangka panjang.

Apa yang Perlu Saya Uji Sebelum Go Live?

Sebelum go live dengan API Kimi K3, uji prompt Anda sendiri pada level traffic yang Anda perkirakan akan dihadapi. Halaman harga hanya memberi titik awal, bukan gambaran lengkap. Anda perlu melihat bagaimana pengaturan Anda sendiri memengaruhi latensi p95, tingkat retry, dan waktu antrean saat traffic sedang tinggi.

Selain itu, bijaksana juga untuk memeriksa manajemen secret yang aman, menyiapkan monitoring dan alert anggaran, dan mengajukan upgrade tier jauh-jauh hari sebelum peluncuran dengan traffic tinggi.

Siap mencoba?

Pilih model yang Anda inginkan di marketplace model

Coba model chat, gambar, dan video di marketplace model APIMart, lalu rasakan kemampuan model dengan cepat melalui satu API terpadu.

Model chatModel gambarModel video
Buka marketplace model