

Panduan Unified LLM API - GPT, Claude & Gemini
Panduan praktis menjalankan GPT, Claude, Gemini, DeepSeek, Qwen, dan lainnya melalui satu unified LLM API — pemilihan model, pola kode, dan kontrol biaya.
Bidang LLM telah terpecah menjadi setengah lusin keluarga besar — GPT, Claude, Gemini, DeepSeek, Qwen, Doubao, Kimi, MiniMax, GLM — masing-masing dengan kekuatan, kurva harga, dan karakteristik operasional yang berbeda. Tim yang berkomitmen pada satu provider akan menghabiskan kuartal berikutnya menulis ulang integrasi ketika provider tersebut menaikkan harga, mengubah batas laju, atau sekadar tertinggal dalam kemampuan yang mereka butuhkan. Artikel ini membahas mengapa unified LLM gateway telah menjadi setup produksi default, cara memilih model yang tepat untuk tugas tertentu, dan seperti apa kode integrasi sebenarnya.
Mengapa Unified API Menjadi Standar Saat Ini
Biaya integrasi LLM tidak lagi terletak pada pemanggilan model itu sendiri — melainkan pada kode penghubung di sekitarnya. Setiap provider memiliki SDK, bentuk autentikasi, model error, header batas laju, dan portal penagihan masing-masing. Kalikan itu dengan lima provider, dan integrasi menjadi produk kedua tersendiri.
Pajak Integrasi pada Banyak SDK
Integrasi langsung dengan tiga provider berujung pada tiga alur autentikasi, tiga kebijakan retry, tiga dasbor penggunaan, dan tiga rangkaian insiden produksi. Setiap rilis model baru memicu pembaruan SDK di suatu tempat. Tim secara rutin kehilangan 1-2 minggu engineer per kuartal untuk urusan pipa provider yang tidak menggerakkan satu pun metrik bisnis.
Harga dan Risiko Provider
Harga LLM bergerak terus-menerus — beberapa provider menurunkan tarif hingga 80% dalam satu rilis; yang lain menambahkan tingkatan baru yang membatalkan model biaya Anda dalam semalam. Terikat pada satu provider berarti menyerap setiap perubahan tersebut tanpa kemampuan untuk beralih. Unified gateway menjaga biaya peralihan hanya pada satu perubahan konfigurasi.
Apa yang Diselesaikan oleh Unified Gateway
Unified LLM API menggabungkan semua provider di balik satu endpoint yang kompatibel dengan OpenAI. Satu kunci, satu SDK, satu tampilan penagihan, satu tempat untuk mengatur batas laju dan fallback. Pemilihan model menjadi parameter string — "gpt-5" hari ini, "claude-4-6-sonnet" besok, "deepseek-v3" untuk batch job yang berjalan semalaman. Kode integrasi tidak berubah.
Memilih Keluarga LLM yang Tepat untuk Pekerjaan
Tidak ada satu model pun yang menang di setiap benchmark. Memilih dengan baik berarti mencocokkan kekuatan model dengan bentuk tugas. Tabel di bawah adalah heuristik kekuatan kasar di antara keluarga-keluarga besar yang akan Anda gunakan dalam produksi — jadikan ini titik awal, lalu lakukan benchmark pada traffic Anda sendiri.
| Keluarga | Kekuatan | Penggunaan Umum |
|---|---|---|
| GPT (OpenAI) | Serba guna, penggunaan alat yang kuat, ekosistem besar | Chat default, agen, alur berbasis alat |
| Claude (Anthropic) | Penulisan panjang, penalaran bernuansa, keamanan | Penyusunan, analisis, konten dengan kontrol nada |
| Gemini (Google) | Multimodal, konteks panjang, faktualitas berbasis bukti | QA dokumen, pemahaman video/gambar, riset |
| DeepSeek | Penalaran kuat dengan biaya rendah | Matematika, kode, beban kerja penalaran volume tinggi |
| Qwen (Alibaba) | Bahasa Mandarin kuat, multibahasa kompetitif | Konten berat CJK, lokalisasi |
| Doubao (ByteDance) | Bahasa Mandarin kuat, kompetitif dalam biaya | Chat CJK, asisten untuk konsumen |
| Kimi | Pembacaan konteks panjang, analisis dokumen | Alternatif RAG, ringkasan dokumen panjang |
| MiniMax | Karakter/roleplay, kehangatan percakapan | Aplikasi pendamping, chat hiburan |
| GLM (Zhipu) | Serba guna seimbang, bilingual yang baik | Chat umum dengan kualitas CJK yang diperhitungkan |
Penalaran dan Analisis Kompleks
Ketika kebenaran dalam rantai pemikiran panjang menjadi penting — matematika bertahap, analisis hukum, tinjauan kode — Anda membutuhkan model dengan perilaku penalaran yang matang. Claude, tingkatan penalaran GPT, dan DeepSeek semuanya unggul di sini. DeepSeek khususnya menggeser kurva biaya, membuat beban kerja penalaran volume tinggi menjadi layak secara ekonomi padahal setahun lalu tidak.
Coding dan Alur Kerja Developer
Coding masih menjadi pilihan imbang antara Claude dan GPT untuk tugas sehari-hari, dengan DeepSeek dan Qwen yang semakin menutup jarak pada biaya yang jauh lebih rendah untuk batch job seperti refaktor skala besar atau pembuatan tes. Pilihan yang tepat biasanya bergantung pada seberapa besar beban kerja menghargai kualitas puncak versus throughput per dolar.
Beban Kerja Volume Tinggi yang Sensitif Biaya
Klasifikasi, pemberian tag, ringkasan, dan pengayaan latar belakang hampir tidak pernah membutuhkan model frontier. Arahkan ini ke tingkatan yang lebih murah — DeepSeek, Qwen, atau varian yang lebih kecil dari keluarga frontier — dan hemat model mahal untuk panggilan interaktif yang berhadapan langsung dengan pengguna. Tingkatan campuran sering kali menjadi satu-satunya tuas biaya terbesar yang dimiliki aplikasi LLM produksi.
Konten Multibahasa dan Spesifik Wilayah
Untuk beban kerja berat CJK, Qwen, Doubao, GLM, dan Kimi secara rutin mengungguli model frontier Barat dalam nuansa budaya dan idiom. Menjalankan set evaluasi kecil dalam bahasa target terhadap tiga kandidat jauh lebih berharga daripada papan peringkat benchmark mana pun.
Integrasi Melalui Unified API
Unified LLM gateway menggunakan protokol OpenAI, yang berarti setiap SDK mainstream bekerja tanpa perubahan — Anda cukup mengarahkan base URL ke gateway. Contoh-contoh di bawah menggunakan endpoint APIMart, tetapi bentuknya identik untuk setup apa pun yang kompatibel dengan OpenAI.
Penyelesaian Chat Dasar
Berikut adalah panggilan minimum yang layak — penyelesaian satu giliran dengan system prompt:
curl https://api.apimart.ai/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5",
"messages": [
{"role": "system", "content": "You are a concise assistant."},
{"role": "user", "content": "Explain vector embeddings in two sentences."}
]
}'
Ganti "gpt-5" dengan "claude-4-6-sonnet", "gemini-2-5-pro", atau "deepseek-v3" dan permintaannya tetap identik. Itulah inti permasalahannya.
Respons Streaming
Untuk UI interaktif, Anda menginginkan streaming token per token. OpenAI SDK menangani ini secara langsung terhadap gateway yang kompatibel:
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.APIMART_API_KEY,
baseURL: "https://api.apimart.ai/v1",
});
const stream = await client.chat.completions.create({
model: "claude-4-6-sonnet",
stream: true,
messages: [{ role: "user", content: "Write a haiku about TCP." }],
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}
Hanya dua baris yang berbeda dari integrasi OpenAI langsung: baseURL dan string model.
Output JSON Terstruktur
Pipeline agen hampir selalu membutuhkan data terstruktur sebagai balikan. Setiap keluarga besar kini mendukung mode JSON, dan unified gateway menormalkan parameternya:
const response = await client.chat.completions.create({
model: "gpt-5",
response_format: { type: "json_object" },
messages: [
{ role: "system", content: "Return JSON with fields: sentiment, topic, score." },
{ role: "user", content: "The product arrived late but the support team was amazing." },
],
});
const parsed = JSON.parse(response.choices[0].message.content ?? "{}");
// { sentiment: "mixed", topic: "customer-service", score: 0.7 }
Untuk jaminan yang lebih ketat, gunakan format respons json_schema — sebagian besar keluarga frontier sudah mendukungnya, dan gateway menyembunyikan provider mana yang masih membutuhkan fallback.
Mengganti Model Secara Dinamis
Nilai sesungguhnya dari unified API terlihat ketika Anda merutekan permintaan berbeda ke model berbeda berdasarkan biaya atau kemampuan. Router minimal terlihat seperti ini:
function pickModel(task: "chat" | "reasoning" | "bulk"): string {
switch (task) {
case "chat": return "claude-4-6-sonnet"; // quality-sensitive user chat
case "reasoning": return "deepseek-v3"; // cheap, strong reasoning
case "bulk": return "qwen-plus"; // cheapest for classification at scale
}
}
const completion = await client.chat.completions.create({
model: pickModel(task),
messages,
});
Semua yang berada di luar router tetap konstan. Menambahkan model baru berarti menambahkan satu string. Menghapus model berarti menghapus satu string. Tidak ada penggantian SDK, tidak ada migrasi autentikasi, tidak ada setup penagihan baru.
Memilih LLM dulu adalah keputusan sekali jalan yang harus Anda jalani selama setahun. Di tahun 2026 ini, itu adalah parameter konfigurasi yang Anda evaluasi ulang setiap bulan seiring perubahan harga dan munculnya model-model baru. Unified API mengubahnya menjadi operasi ringan — integrasi ditulis sekali, campuran model berkembang terus-menerus, dan perhatian tim tetap pada produk, bukan pada urusan pipa provider.
Pilih model yang Anda inginkan di marketplace model
Coba model chat, gambar, dan video di marketplace model APIMart, lalu rasakan kemampuan model dengan cepat melalui satu API terpadu.