APIMart
APIMart

Panduan Unified LLM API - GPT, Claude & Gemini

Panduan praktis menjalankan GPT, Claude, Gemini, DeepSeek, Qwen, dan lainnya melalui satu unified LLM API — pemilihan model, pola kode, dan kontrol biaya.

Tutorial

Bidang LLM telah terpecah menjadi setengah lusin keluarga besar — GPT, Claude, Gemini, DeepSeek, Qwen, Doubao, Kimi, MiniMax, GLM — masing-masing dengan kekuatan, kurva harga, dan karakteristik operasional yang berbeda. Tim yang berkomitmen pada satu provider akan menghabiskan kuartal berikutnya menulis ulang integrasi ketika provider tersebut menaikkan harga, mengubah batas laju, atau sekadar tertinggal dalam kemampuan yang mereka butuhkan. Artikel ini membahas mengapa unified LLM gateway telah menjadi setup produksi default, cara memilih model yang tepat untuk tugas tertentu, dan seperti apa kode integrasi sebenarnya.

Mengapa Unified API Menjadi Standar Saat Ini

Biaya integrasi LLM tidak lagi terletak pada pemanggilan model itu sendiri — melainkan pada kode penghubung di sekitarnya. Setiap provider memiliki SDK, bentuk autentikasi, model error, header batas laju, dan portal penagihan masing-masing. Kalikan itu dengan lima provider, dan integrasi menjadi produk kedua tersendiri.

Pajak Integrasi pada Banyak SDK

Integrasi langsung dengan tiga provider berujung pada tiga alur autentikasi, tiga kebijakan retry, tiga dasbor penggunaan, dan tiga rangkaian insiden produksi. Setiap rilis model baru memicu pembaruan SDK di suatu tempat. Tim secara rutin kehilangan 1-2 minggu engineer per kuartal untuk urusan pipa provider yang tidak menggerakkan satu pun metrik bisnis.

Harga dan Risiko Provider

Harga LLM bergerak terus-menerus — beberapa provider menurunkan tarif hingga 80% dalam satu rilis; yang lain menambahkan tingkatan baru yang membatalkan model biaya Anda dalam semalam. Terikat pada satu provider berarti menyerap setiap perubahan tersebut tanpa kemampuan untuk beralih. Unified gateway menjaga biaya peralihan hanya pada satu perubahan konfigurasi.

Apa yang Diselesaikan oleh Unified Gateway

Unified LLM API menggabungkan semua provider di balik satu endpoint yang kompatibel dengan OpenAI. Satu kunci, satu SDK, satu tampilan penagihan, satu tempat untuk mengatur batas laju dan fallback. Pemilihan model menjadi parameter string — "gpt-5" hari ini, "claude-4-6-sonnet" besok, "deepseek-v3" untuk batch job yang berjalan semalaman. Kode integrasi tidak berubah.

Memilih Keluarga LLM yang Tepat untuk Pekerjaan

Tidak ada satu model pun yang menang di setiap benchmark. Memilih dengan baik berarti mencocokkan kekuatan model dengan bentuk tugas. Tabel di bawah adalah heuristik kekuatan kasar di antara keluarga-keluarga besar yang akan Anda gunakan dalam produksi — jadikan ini titik awal, lalu lakukan benchmark pada traffic Anda sendiri.

KeluargaKekuatanPenggunaan Umum
GPT (OpenAI)Serba guna, penggunaan alat yang kuat, ekosistem besarChat default, agen, alur berbasis alat
Claude (Anthropic)Penulisan panjang, penalaran bernuansa, keamananPenyusunan, analisis, konten dengan kontrol nada
Gemini (Google)Multimodal, konteks panjang, faktualitas berbasis buktiQA dokumen, pemahaman video/gambar, riset
DeepSeekPenalaran kuat dengan biaya rendahMatematika, kode, beban kerja penalaran volume tinggi
Qwen (Alibaba)Bahasa Mandarin kuat, multibahasa kompetitifKonten berat CJK, lokalisasi
Doubao (ByteDance)Bahasa Mandarin kuat, kompetitif dalam biayaChat CJK, asisten untuk konsumen
KimiPembacaan konteks panjang, analisis dokumenAlternatif RAG, ringkasan dokumen panjang
MiniMaxKarakter/roleplay, kehangatan percakapanAplikasi pendamping, chat hiburan
GLM (Zhipu)Serba guna seimbang, bilingual yang baikChat umum dengan kualitas CJK yang diperhitungkan

Penalaran dan Analisis Kompleks

Ketika kebenaran dalam rantai pemikiran panjang menjadi penting — matematika bertahap, analisis hukum, tinjauan kode — Anda membutuhkan model dengan perilaku penalaran yang matang. Claude, tingkatan penalaran GPT, dan DeepSeek semuanya unggul di sini. DeepSeek khususnya menggeser kurva biaya, membuat beban kerja penalaran volume tinggi menjadi layak secara ekonomi padahal setahun lalu tidak.

Coding dan Alur Kerja Developer

Coding masih menjadi pilihan imbang antara Claude dan GPT untuk tugas sehari-hari, dengan DeepSeek dan Qwen yang semakin menutup jarak pada biaya yang jauh lebih rendah untuk batch job seperti refaktor skala besar atau pembuatan tes. Pilihan yang tepat biasanya bergantung pada seberapa besar beban kerja menghargai kualitas puncak versus throughput per dolar.

Beban Kerja Volume Tinggi yang Sensitif Biaya

Klasifikasi, pemberian tag, ringkasan, dan pengayaan latar belakang hampir tidak pernah membutuhkan model frontier. Arahkan ini ke tingkatan yang lebih murah — DeepSeek, Qwen, atau varian yang lebih kecil dari keluarga frontier — dan hemat model mahal untuk panggilan interaktif yang berhadapan langsung dengan pengguna. Tingkatan campuran sering kali menjadi satu-satunya tuas biaya terbesar yang dimiliki aplikasi LLM produksi.

Konten Multibahasa dan Spesifik Wilayah

Untuk beban kerja berat CJK, Qwen, Doubao, GLM, dan Kimi secara rutin mengungguli model frontier Barat dalam nuansa budaya dan idiom. Menjalankan set evaluasi kecil dalam bahasa target terhadap tiga kandidat jauh lebih berharga daripada papan peringkat benchmark mana pun.

Integrasi Melalui Unified API

Unified LLM gateway menggunakan protokol OpenAI, yang berarti setiap SDK mainstream bekerja tanpa perubahan — Anda cukup mengarahkan base URL ke gateway. Contoh-contoh di bawah menggunakan endpoint APIMart, tetapi bentuknya identik untuk setup apa pun yang kompatibel dengan OpenAI.

Penyelesaian Chat Dasar

Berikut adalah panggilan minimum yang layak — penyelesaian satu giliran dengan system prompt:

curl https://api.apimart.ai/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5",
    "messages": [
      {"role": "system", "content": "You are a concise assistant."},
      {"role": "user", "content": "Explain vector embeddings in two sentences."}
    ]
  }'

Ganti "gpt-5" dengan "claude-4-6-sonnet", "gemini-2-5-pro", atau "deepseek-v3" dan permintaannya tetap identik. Itulah inti permasalahannya.

Respons Streaming

Untuk UI interaktif, Anda menginginkan streaming token per token. OpenAI SDK menangani ini secara langsung terhadap gateway yang kompatibel:

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.APIMART_API_KEY,
  baseURL: "https://api.apimart.ai/v1",
});

const stream = await client.chat.completions.create({
  model: "claude-4-6-sonnet",
  stream: true,
  messages: [{ role: "user", content: "Write a haiku about TCP." }],
});

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}

Hanya dua baris yang berbeda dari integrasi OpenAI langsung: baseURL dan string model.

Output JSON Terstruktur

Pipeline agen hampir selalu membutuhkan data terstruktur sebagai balikan. Setiap keluarga besar kini mendukung mode JSON, dan unified gateway menormalkan parameternya:

const response = await client.chat.completions.create({
  model: "gpt-5",
  response_format: { type: "json_object" },
  messages: [
    { role: "system", content: "Return JSON with fields: sentiment, topic, score." },
    { role: "user", content: "The product arrived late but the support team was amazing." },
  ],
});

const parsed = JSON.parse(response.choices[0].message.content ?? "{}");
// { sentiment: "mixed", topic: "customer-service", score: 0.7 }

Untuk jaminan yang lebih ketat, gunakan format respons json_schema — sebagian besar keluarga frontier sudah mendukungnya, dan gateway menyembunyikan provider mana yang masih membutuhkan fallback.

Mengganti Model Secara Dinamis

Nilai sesungguhnya dari unified API terlihat ketika Anda merutekan permintaan berbeda ke model berbeda berdasarkan biaya atau kemampuan. Router minimal terlihat seperti ini:

function pickModel(task: "chat" | "reasoning" | "bulk"): string {
  switch (task) {
    case "chat": return "claude-4-6-sonnet";       // quality-sensitive user chat
    case "reasoning": return "deepseek-v3";         // cheap, strong reasoning
    case "bulk": return "qwen-plus";                // cheapest for classification at scale
  }
}

const completion = await client.chat.completions.create({
  model: pickModel(task),
  messages,
});

Semua yang berada di luar router tetap konstan. Menambahkan model baru berarti menambahkan satu string. Menghapus model berarti menghapus satu string. Tidak ada penggantian SDK, tidak ada migrasi autentikasi, tidak ada setup penagihan baru.


Memilih LLM dulu adalah keputusan sekali jalan yang harus Anda jalani selama setahun. Di tahun 2026 ini, itu adalah parameter konfigurasi yang Anda evaluasi ulang setiap bulan seiring perubahan harga dan munculnya model-model baru. Unified API mengubahnya menjadi operasi ringan — integrasi ditulis sekali, campuran model berkembang terus-menerus, dan perhatian tim tetap pada produk, bukan pada urusan pipa provider.

Siap mencoba?

Pilih model yang Anda inginkan di marketplace model

Coba model chat, gambar, dan video di marketplace model APIMart, lalu rasakan kemampuan model dengan cepat melalui satu API terpadu.

Model chatModel gambarModel video
Buka marketplace model