

Tiga Model Baru Google DeepMind untuk Agen AI
Gemini 3.6 Flash, 3.5 Flash-Lite, dan Gemma 4 dari Google DeepMind membentuk stack tiga tingkat untuk agen AI. Bandingkan latensi, biaya, penggunaan tool, dan kontrol deployment.
Kalau harus saya ringkas dalam satu kalimat, begini: gunakan Gemini 3.5 Flash-Lite untuk routing awal yang murah, Gemini 3.6 Flash untuk pekerjaan agen utama, dan Gemma 4 ketika Anda perlu menjalankan semuanya di sistem sendiri.
Ini versi singkatnya. Artikel ini membandingkan tiga model pada poin-poin yang paling penting bagi agen AI: latensi, biaya, penggunaan tool, input multimodal, perencanaan, dan kontrol deployment. Satu model dibangun untuk triase bervolume tinggi, satu cocok untuk eksekusi sehari-hari, dan satu dibangun untuk beban kerja self-hosted dan privat.
Yang paling menonjol bagi saya:
- Gemini 3.5 Flash-Lite adalah pemecah trafik berbiaya rendah untuk klasifikasi, ekstraksi, dan routing, dengan latensi di bawah 200 ms
- Gemini 3.6 Flash berada di tengah sebagai pekerja utama untuk pemanggilan tool, pekerjaan dokumen, dan langkah alur kerja, dengan latensi sekitar ~500 ms
- Gemma 4 menggeser trade-off ke arah open weight, lisensi Apache 2.0, deployment lokal, dan penanganan data privat
- Gemma 4 membentang dari 2.3B sampai 31B parameter, dengan konteks hingga 256K
- Versi 26B A4B MoE mengaktifkan 3.8B dari 25.2B parameter saat inferensi
- Setup bertingkat bisa menekan pengeluaran dengan menjaga tugas sederhana di model kecil dan mengirim kasus sulit ke model yang lebih besar
Jika Anda harus memilih cepat:
pilih Flash-Lite untuk routing, Flash untuk eksekusi, dan Gemma 4 untuk kontrol self-hosted.

3.6 Flash dari Google Membuktikan Agen AI Akan Segera Jadi Murah
Perbandingan Cepat
| Model | Penggunaan terbaik | Latensi | Deployment | Trade-off utama |
|---|---|---|---|---|
| Gemini 3.5 Flash-Lite | Klasifikasi, ekstraksi, routing | <200 ms | Google AI Studio / Vertex AI | Kedalaman penalaran lebih rendah |
| Gemini 3.6 Flash | Eksekusi agen inti, penggunaan tool, tugas berkonteks panjang | ~500 ms | Google AI Studio / Vertex AI | Biaya lebih tinggi dari Lite |
| Gemma 4 | Pekerjaan agen privat, teregulasi, atau offline | Bergantung pada hardware | Self-hosted / private cloud | Lebih banyak kerja infra |
Dengan kata lain, ini bukan soal memilih satu model "terbaik". Ini soal mencocokkan setiap model dengan tugasnya memakai unified LLM API agar stack agen Anda tetap cepat, sadar biaya, dan berada di bawah kendali Anda saat diperlukan.
1. Gemini 3.6 Flash

Kecocokan beban kerja agen
Dari ketiga model, Gemini 3.6 Flash adalah opsi yang mengutamakan throughput. Gunakan untuk agen bervolume tinggi yang membutuhkan latensi rendah, biaya stabil, dan penyelesaian cepat.
Latensi dan throughput
Itu membuatnya cocok untuk alur padat permintaan seperti triase tiket, pencarian dokumen, atau routing tugas skala besar. Dalam kasus-kasus ini, kecepatan paling penting justru ketika model juga harus bertindak secara stabil dan dapat diandalkan.
Penggunaan tool dan kustomisasi
Anda bisa memadukannya dengan function calling, retrieval, pengecekan kebijakan, dan langkah persetujuan manusia untuk menjaga otomasi tetap terkendali. Misalnya, ia bekerja baik untuk agen yang membaca permintaan, menarik dokumen sumber, memanggil tool, dan mengirim kasus-kasus ekstrem ke manusia.
Berikutnya, Gemini 3.5 Flash-Lite menggeser trade-off ke arah tugas agen yang lebih ringan dan lebih murah.
2. Gemini 3.5 Flash-Lite

Kecocokan beban kerja agen
Gemini 3.5 Flash-Lite adalah model murah default untuk klasifikasi, ekstraksi, dan routing bervolume tinggi. Anggap saja ia lapisan kontrol ringan dalam stack agen: ia menangani sebagian besar trafik sementara model yang lebih besar turun tangan untuk keputusan yang lebih sulit.
Latensi dan throughput
Latensinya yang di bawah 200 ms membuatnya sangat cocok untuk alur kerja fan-out, batching, dan routing cepat. Ketika sistem agen memecah satu pekerjaan besar menjadi banyak tugas kecil, Flash-Lite bisa menyelesaikan subtugas-subtugas itu dengan cepat, lalu mengembalikan hasilnya untuk dikonsolidasikan.
Model biaya dan deployment
Biayanya yang rendah menjadikannya model lintasan-pertama default untuk antrean besar tugas sederhana. Jika kontrol deployment dan open weight lebih penting daripada setup ini, Gemma 4 menggeser trade-off tersebut.
Penggunaan tool dan kustomisasi
Flash-Lite mendukung output terstruktur dan penyetelan tugas ringan untuk routing dan ekstraksi. Pola umumnya sederhana: gunakan Flash-Lite sebagai classifier atau extractor lintasan-pertama, lalu kirim hanya kasus-kasus ekstrem ke model yang lebih kuat. Dengan begitu, agen yang lebih besar bisa menyimpan model berat untuk perencanaan, penalaran multimodal, dan pengecualian yang sulit.
3. Gemma 4

Kecocokan beban kerja agen
Gemma 4 adalah pilihan yang mengutamakan kontrol untuk stack agen yang perlu berjalan secara lokal, bekerja dengan data sensitif, dan tetap mudah disetel. Lisensi Apache 2.0-nya memungkinkan tim melakukan fine-tuning dan men-deploy-nya di sistem lokal, yang cocok untuk setup teregulasi atau offline dengan aturan tata kelola data yang ketat. Ia juga bisa meredaksi PII di titik masuk sebelum data meninggalkan sistem lokal, yang berguna bagi tim kesehatan dan keuangan [1].
Ini penting karena kontrol lokal bukan cuma soal privasi. Ini juga soal menentukan seberapa jauh Anda bisa menyetel model, di mana ia berjalan, dan jenis beban kerja apa yang bisa ia tangani. Dengan Gemma 4, itu bergantung pada ukuran model, context window, dan biaya runtime.
Latensi dan throughput
Gemma 4 membentang dari model mobile 2.3B hingga model server 31B. Itu memberi tim ruang untuk mencocokkan model dengan tugasnya alih-alih memaksa satu model mengerjakan segalanya. Model kecil bisa menangani tugas di edge, sementara yang lebih besar bisa mengambil perencanaan atau penalaran berkonteks panjang.
Varian 26B A4B MoE menonjol di sini. Saat inferensi, ia mengaktifkan 3.8B dari 25.2B parameter, yang membantu runtime tetap lebih efisien. Soal panjang konteks, model-model kecil mendukung 128K token, sementara model 12B, 26B A4B, dan 31B mendukung 256K token. Itu sangat cocok untuk dokumen panjang dan jejak agen yang panjang [1].
Model biaya dan deployment
Menjalankan Gemma 4 di hardware sendiri menghapus biaya API per token, tetapi tagihannya tidak lenyap. Ia berpindah ke server, scaling, dan uptime. Jadi alih-alih membayar provider, Anda membayar stack di balik model itu.
Gemma 4 juga memberi tim beberapa cara untuk memangkas penggunaan memori. Checkpoint Quantization-Aware Training (QAT) tersedia dalam format GGUF, wNa8o8 yang dioptimalkan untuk mobile, dan Compressed Tensors w4a16. Format-format ini bisa menurunkan kebutuhan memori sambil menjaga kualitas output tetap dekat dengan bfloat16 [1].
Setup itu membuat model ini sangat cocok ketika agen membutuhkan kontrol lokal dan eksekusi terstruktur, dan ketika tim siap mengelola infra yang menyertainya.
Penggunaan tool dan kustomisasi
Gemma 4 mendukung function calling native dan system role native, yang memberi developer agen kontrol lebih langsung atas alur percakapan dan eksekusi tugas [1]. Ia juga bekerja dengan transformers, vLLM, dan llama.cpp [1], sehingga bisa masuk ke stack yang sudah dipakai banyak tim.
Varian Unified 12B bisa menerima input gambar dan audio secara langsung. Itu berguna untuk agen multimodal yang membutuhkan satu jalur fine-tuning untuk input teks, gambar, dan audio sekaligus [1].
Gemma 4 juga menyertakan mode "Thinking" bawaan. Mode ini membantu pada tugas yang lebih sulit, tetapi menambah latensi. Secara sederhana: gunakan untuk perencanaan dan penalaran kompleks, bukan untuk routing cepat [1]. Jadi meski Gemma 4 sangat condong ke kontrol, kontrol itu datang dengan tuntutan infra dan sejumlah trade-off kecepatan.
Trade-Off, Opsi Integrasi, serta Kelebihan dan Kekurangan
Jika Anda melihat model-model ini sebagai satu stack, mereka terbagi cukup rapi ke dalam tiga tugas: triase, eksekusi, dan kontrol lokal.
Jadi keputusan utamanya bukan sekadar model mana yang terbaik. Melainkan apakah Anda ingin satu model menangani segalanya, atau setup bertingkat di mana setiap model mengambil bagian yang paling ia kuasai.
Arsitektur bertingkat cenderung paling cocok untuk agen kompleks skala enterprise. Flash-Lite bisa mengambil triase dan routing bervolume tinggi dengan latensi dan biaya terendah. Gemini 3.6 Flash bisa menangani eksekusi alur kerja inti, penggunaan tool, dan pekerjaan berkonteks panjang. Gemma 4 cocok untuk beban kerja teregulasi atau privat yang membutuhkan self-hosting atau deployment private cloud.
Dipakai dengan cara ini, tim bisa memangkas biaya secara berarti dibandingkan mengirim setiap permintaan ke satu model berkemampuan lebih tinggi. Pada titik itu, trade-off-nya bergeser: kontrol deployment vs. kesederhanaan operasional.
Untuk pembuatan gambar atau video di luar penalaran teks, APIMart bisa merutekan tugas melalui satu API multimodal.
Tabel di bawah merangkum jalur-jalur integrasi utamanya.
| Model / Setup | Jalur Integrasi | Latensi | Profil Biaya | Trade-off Kunci |
|---|---|---|---|---|
| APIMart (Gateway Terpadu) | Satu API → 500+ model | Bergantung pada orchestrator | Berbasis penggunaan | Menambah ketergantungan pada lapisan terkelola |
| Gemini 3.5 Flash-Lite | Google AI Studio / Vertex AI | <200 ms | Terendah | Penalaran mendalam terbatas |
| Gemini 3.6 Flash | Google AI Studio / Vertex AI | ~500 ms | Sedang | Biaya lebih tinggi dari Lite |
| Gemma 4 (Self-Hosted) | vLLM / llama.cpp / private cloud | Bergantung pada hardware | Tinggi (biaya infra) | Beban pemeliharaan berat; kepemilikan data penuh |
| Setup Bertingkat | Orchestrator (mis. LangChain) | Campuran / dioptimalkan | Dioptimalkan | Lebih sulit di-debug dan dilacak; kontrol hibrida |
Dalam praktiknya, trade-off ini membentuk pilihan yang cukup sederhana: pakai satu model dari ujung ke ujung, atau pisahkan routing, eksekusi, dan beban kerja privat ke lapisan-lapisan yang berbeda.
Kesimpulan
Model yang tepat bergantung pada tiga hal: kompleksitas tugas, anggaran, dan kontrol deployment.
Dengan kacamata itu, Gemini 3.5 Flash-Lite adalah pilihan pertama untuk routing ringan. Ia cocok untuk pekerjaan routing dan ekstraksi bervolume tinggi. Gunakan untuk klasifikasi, ekstraksi, dan routing lintasan-pertama. Jika tugasnya butuh koordinasi lebih, naik ke Gemini 3.6 Flash.
Gemini 3.6 Flash bekerja sebagai lapisan eksekusi default untuk agen produksi. Ia berada di antara biaya lebih rendah milik Flash-Lite dan deployment mengutamakan kontrol milik Gemma 4, yang menjadikannya default solid bagi tim yang menginginkan output kuat dalam skala besar. Jika kontrol deployment yang paling penting, Gemma 4 menjadi pilihan yang lebih tepat.
Gemma 4 dibangun untuk tim yang membutuhkan kontrol, privasi, atau akses offline. Ia cocok untuk lingkungan teregulasi karena mendukung pemrosesan on-device atau self-hosted dan redaksi PII lokal. Open weight-nya juga membuat fine-tuning per domain lebih sederhana.
Gunakan Flash-Lite untuk routing, Gemini 3.6 Flash untuk eksekusi, dan Gemma 4 untuk kontrol self-hosted.
FAQ
Kapan saya sebaiknya memakai setup model bertingkat?
Gunakan setup model bertingkat ketika Anda perlu menyeimbangkan performa, biaya, dan keandalan seiring aplikasi Anda tumbuh.
Ide dasarnya begini: kirim tugas sederhana bervolume tinggi ke model berbiaya rendah, dan simpan model frontier untuk pekerjaan kompleks berisiko tinggi.
Pembagian itu bisa memangkas biaya API sebesar 60% sampai 80%, terutama ketika Anda hanya mengeskalasi permintaan setelah model yang lebih ringan gagal memenuhi ambang keyakinan Anda.
Trade-off-nya cukup sederhana. Anda tidak butuh model tercanggih Anda menangani setiap tugas rutin. Biarkan model yang lebih ringan mengambil lintasan pertama, lalu panggil model yang lebih berat hanya ketika tugasnya menuntut.
Bagaimana cara memilih antara Gemini 3.6 Flash dan Gemma 4?
Pilih berdasarkan apa yang paling penting bagi Anda: kecepatan, skala, atau kontrol.
Gemini 3.6 Flash adalah model multimodal berkinerja tinggi yang dibangun untuk tugas berlatensi rendah dan bervolume tinggi. Itu membuatnya sangat cocok untuk aplikasi real-time dan alur kerja yang sensitif terhadap biaya.
Gemma 4 lebih masuk akal jika Anda ingin kontrol dan fleksibilitas lebih, seperti deployment lokal atau menjalankan model di infrastruktur sendiri. Pilih Gemini 3.6 Flash untuk produksi yang cepat dan scalable. Pilih Gemma 4 untuk penggunaan privat, on-device, atau fine-tuning kustom.
Tugas agen apa yang paling cocok untuk Flash-Lite?
Flash-Lite sangat cocok untuk pekerjaan bervolume tinggi dan sensitif biaya di mana efisiensi lebih penting daripada penalaran mendalam. Ia sangat baik dalam ekstraksi data dasar dan klasifikasi.
Ia juga bekerja baik sebagai lapisan pertama dalam cascade model. Pada banyak setup, ia bisa menangani 70% sampai 85% permintaan sebelum mengirim kueri yang lebih sulit ke model premium. Itu bisa memangkas biaya 60% sampai 75% sambil menjaga alur kerja agen standar tetap stabil.
Pilih model yang Anda inginkan di marketplace model
Coba model chat, gambar, dan video di marketplace model APIMart, lalu rasakan kemampuan model dengan cepat melalui satu API terpadu.
