
Penjelasan Model AI Open-Source Inkling-Small
Pelajari Inkling-Small, MoE multimodal 276B dari Thinking Machines dengan 12B parameter aktif, konteks 1M token, bobot terbuka, dan opsi deployment yang fleksibel.
Jika Anda menginginkan model terbuka yang mampu menangani input panjang dengan biaya lebih rendah daripada banyak sistem teratas, Inkling-Small patut diperhatikan. Pada 30 Juli 2026, Thinking Machines merilis model MoE multimodal dengan 276 miliar parameter tetapi hanya 12 miliar parameter aktif per permintaan, disertai jendela konteks 1 juta token dan lisensi Apache 2.0.
Berikut ringkasannya:
- Saya dapat menggunakannya dengan teks, gambar, dan audio
- Saya memperoleh output berupa teks, kode, dan JSON
- Saya dapat mengatur upaya berpikir dari 0.2 hingga 0.99 untuk menyeimbangkan biaya dan kedalaman penalaran
- Saya dapat menghosting sendiri model ini untuk memperoleh jendela konteks penuh 1,000,000 token
- Saya dapat memakai Tinker untuk akses terkelola, dengan batas konteks 256,000 token
- Saya dapat mengunduh bobot terbuka dari Hugging Face
- Saya dapat memakai versi 4-bit NVFP4 pada GPU NVIDIA
- Saya dapat melakukan fine-tuning dengan data privat dan menjalankannya dalam lingkungan sendiri
Beberapa angkanya sangat menonjol. Inkling-Small meraih 77.6% pada SWE-bench Verified, menyamai Nemotron 3 Ultra pada Terminal Bench 2.1 dengan sekitar sepertiga biaya token, dan mencatat 98.6% pada StrongREJECT. Jadi, meskipun namanya mengandung Small, model ini ditujukan untuk pemrograman serius, pekerjaan dokumen, alur dukungan, dan tugas agen.
Inkling-Small Sama Sekali Tidak Kecil: Menguji Model 276B Ini
Perbandingan Singkat
| Bidang | Inkling-Small | Akses Tinker |
|---|---|---|
| Jenis akses | Bobot terbuka yang dihosting sendiri | API terkelola |
| Lisensi | Apache 2.0 | Layanan terkelola |
| Konteks maksimum | 1,000,000 token | 256,000 token |
| Input | Teks, gambar, audio | Teks, gambar, audio |
| Output | Teks, kode, JSON | Teks, kode, JSON |
| Kontrol | Kendali penuh atas infrastruktur dan model | Lebih sedikit pekerjaan konfigurasi |
| Fine-tuning | Ya | Ya |
Kesimpulan saya: rilis ini memberikan pilihan yang jelas bagi tim AS untuk deployment berbiaya lebih rendah, konfigurasi privat, dan pekerjaan multimodal berkonteks panjang tanpa terikat pada API tertutup.
Ikhtisar Inkling-Small: Arsitektur, Ukuran, dan Kemampuan
Inkling-Small adalah transformer Mixture-of-Experts (MoE) khusus decoder dengan 276 miliar total parameter dan sekitar 12 miliar parameter aktif per token. Sebagai perbandingan, model unggulan memiliki 975 miliar total parameter dan 41 miliar parameter aktif per token [2][1][3]. Selisih tersebut penting. Hal itu menjelaskan mengapa Inkling-Small terasa lebih ringan digunakan tetapi tetap mampu menangani pekerjaan berat. Dampaknya terlihat paling jelas pada dukungan input multimodal dan jendela konteks panjang.
Input Multimodal, Output Teks, dan Dukungan Konteks Panjang
Inkling-Small menerima teks, gambar, dan audio sebagai input serta mengembalikan output teks, termasuk bahasa alami, kode, dan JSON [2][1]. Model ini dilatih awal dengan 45 triliun token data multimodal yang mencakup teks, gambar, audio, dan video [1][3].
Model ini juga mendukung jendela konteks hingga 1 juta token [1]. Hal tersebut sangat penting bagi tim yang menangani basis kode besar, dokumen panjang, atau transkrip berkepanjangan. Alih-alih memecah materi menjadi bagian kecil dan berharap tidak ada konteks yang hilang, mereka dapat memberikan gambaran yang jauh lebih lengkap kepada model sekaligus. Kemampuan ini cenderung penting saat Anda mempertimbangkan hosting mandiri, fine-tuning, atau penggunaan model melalui perkakas.
Performa Benchmark dan Arti Sebenarnya dari “Small”
Hasil benchmark membantu menempatkan nama Small dalam konteks yang tepat.
Pada SWE-bench Verified, Inkling-Small meraih 77.6%, melampaui Nemotron 3 milik Nvidia yang memperoleh 71.9% [2]. Pada Terminal Bench 2.1, model ini menyamai Nemotron 3 Ultra dengan sekitar sepertiga biaya token [1][3]. Model ini juga mencatat 98.6% pada StrongREJECT, yang menunjukkan penanganan penolakan yang kuat [2].
Sederhananya, Small bukan berarti lemah. Dalam praktiknya, konfigurasi MoE dan dukungan konteks panjang berguna pada pekerjaan yang penting bagi tim: peninjauan kode, analisis dokumen, dan alur kerja agen.
Cara Mengakses Inkling-Small: Bobot, Perkakas, dan Opsi Integrasi

Bobot Terbuka, Kartu Model, dan File yang Dapat Diunduh
Bobot Inkling-Small tersedia untuk publik di Hugging Face di bawah organisasi thinkingmachines [2][6].
Rilis ini dilengkapi file inti yang umumnya dibutuhkan tim: bobot, kartu model, tokenizer, file konfigurasi, dan encoder modalitas [4][2]. Jadi, Anda tidak perlu memulai dari nol atau merangkai semuanya secara manual.
Jika melakukan deployment pada GPU NVIDIA, tersedia pula versi terkuantisasi 4-bit bernama Inkling-Small-NVFP4 untuk performa yang lebih baik dalam konfigurasi tersebut [4][5]. Jika tim ingin mencoba model sebelum menangani hosting mandiri, Tinker adalah jalur tercepat.
Perbandingan Hosting Mandiri, API Terkelola, dan Fine-Tuning
Thinking Machines menawarkan Tinker, API pengujian dan fine-tuning yang memungkinkan developer mencoba model, membatasi panjang respons, mengaktifkan pencarian web, dan menjalankan fine-tuning tingkat perusahaan [2][1].
Tinker juga mendukung integrasi sejak hari pertama dengan perkakas inferensi dan deployment utama [6][1]. Hal ini penting karena model itu sendiri hanya sebagian dari pekerjaan. Anda juga memerlukan jalur untuk memasukkannya ke dalam stack aktif tanpa banyak konfigurasi.
Pertimbangannya cukup sederhana:
- Hosting mandiri memberi Anda kontrol penuh dan akses ke jendela konteks 1 juta token [6][1].
- Tinker mengurangi pekerjaan operasional, tetapi konteks dibatasi hingga 256,000 token [6][1].
Jadi, pilihannya bergantung pada kecepatan atau kontrol. Jika Anda menginginkan akses terkelola dengan lebih sedikit pekerjaan infrastruktur, Tinker adalah jalur yang mudah. Jika membutuhkan jendela konteks penuh dan kontrol deployment yang lebih ketat, hosting mandiri lebih masuk akal.
Peran APIMart dalam Alur Kerja Produksi Multimodal

Setelah tim memilih jalur akses, masih ada sisi praktis produksi: mengalirkan permintaan multimodal melalui satu alur kerja yang rapi.
Bagi tim yang membutuhkan analisis dan generasi dalam alur yang sama, APIMart menyediakan satu lapisan integrasi untuk API multimodal.
Kasus Penggunaan dan Deployment Hemat Biaya untuk Tim AS
Asisten Pemrograman, Agen, Perkakas Dukungan, dan Analisis Dokumen
Setelah aksesnya jelas, pertanyaan berikutnya sederhana: di mana Inkling-Small paling bermanfaat? Desain MoE membantu menjaga inferensi tetap efisien untuk pekerjaan produksi bervolume tinggi [1].
Bagi tim perangkat lunak, hal ini menjadikannya pilihan kuat untuk perbaikan bug tingkat repositori, peninjauan PR, dan agen pemrograman multi-langkah yang perlu bekerja di seluruh basis kode besar [2].
Konfigurasi yang sama juga cocok untuk pekerjaan yang memerlukan klasifikasi cepat dan pembacaan konteks panjang. Misalnya, kopilot dukungan dapat menyortir tiket, menjawab pertanyaan kebijakan, dan mengirim eskalasi ke pihak yang tepat. Pada skala besar, peningkatan kecil dalam latensi dan komputasi cepat terakumulasi.
Model ini juga cocok untuk analisis dokumen besar, termasuk kontrak, file kebijakan, dan manual teknis [1]. Jika tim Anda menangani dokumen padat sepanjang hari, jenis beban kerja inilah yang membuat pembacaan konteks panjang mulai terasa penting.
Untuk platform pendidikan, Inkling-Small dapat mendukung bimbingan matematika dan logika dengan upaya berpikir yang dapat disesuaikan [2]. Tim dapat menyesuaikan upaya model dengan tugas, alih-alih membayar biaya komputasi yang sama setiap saat.
Penggunaan yang umum meliputi:
- Agen pemrograman
- Kopilot dukungan
- Analisis dokumen
- Bimbingan belajar
- Pelabelan multimodal
Biaya, Latensi, dan Perencanaan Anggaran untuk Tim AS
Pengungkit biaya utamanya adalah desain MoE. Desain ini membantu menekan biaya inferensi dan latensi untuk permintaan berulang [1].
Developer juga dapat mengatur upaya berpikir melalui kode, dari 0.2 untuk tugas yang lebih sederhana hingga 0.99 untuk penalaran yang lebih sulit [2]. Sederhananya, tim dapat memakai lebih sedikit komputasi untuk pekerjaan bervolume tinggi dan berkompleksitas rendah, lalu menyimpan lebih banyak waktu berpikir bagi kasus yang benar-benar membutuhkannya.
Kontrol seperti ini penting ketika Anda merencanakan pengeluaran tim AS. Alur dukungan yang menangani ribuan permintaan rutin per hari tidak memerlukan pengaturan yang sama dengan agen pemrograman yang menghadapi kasus tepi rumit. Satu model, tingkat upaya yang berbeda, dan cara yang lebih jelas untuk mengelola anggaran.
Karena model ini dirilis dengan lisensi Apache 2.0, tim AS juga dapat menjalankannya secara lokal atau di dalam VPC saat kontrol data menjadi prioritas [2][1].
Opsi deployment tersebut mengantar pada temuan riset di bagian berikutnya.
Temuan Riset dan Ringkasan Akhir
Mengapa Rilis Bobot Terbuka Penting untuk Pengujian dan Penyesuaian
Setelah akses dan deployment dibahas, sudut pandang riset utamanya berpusat pada manfaat praktis yang diberikan bobot terbuka kepada tim.
Karena bobotnya terbuka, peneliti dapat memeriksa arsitektur dan kontrol penalaran secara langsung. Mereka juga dapat menguji model dengan data internal tanpa mengirim data tersebut melalui API eksternal. Tingkat visibilitas ini turut membantu pengujian keamanan. Alih-alih menerima klaim yang dipublikasikan begitu saja, organisasi dapat memverifikasi hasil pada infrastruktur mereka sendiri.
Adaptasi domain merupakan kelebihan besar lainnya. Tim dalam bidang seperti analisis keuangan atau rekayasa perangkat lunak dapat melakukan fine-tuning dengan data milik sendiri alih-alih bergantung pada sistem serbaguna [2]. Keterbukaan yang sama juga mendukung deployment lokal dan adaptasi khusus domain, sehingga tim dapat menjalankan audit independen sesuai kebutuhan mereka.
Poin Utama yang Perlu Diingat
Beberapa poin yang paling penting adalah:
- Bobot terbuka memungkinkan tim menguji, melakukan fine-tuning, dan mengukur performa model pada infrastruktur sendiri.
- Bobot tersedia di Hugging Face, sedangkan Tinker memberi tim sarana untuk menguji pengaturan secara intensif sebelum beralih ke produksi [2][1].
- Inkling-Small dibangun untuk deployment yang terkendali dan sensitif terhadap biaya, dengan bobot terbuka yang mendukung pengujian, fine-tuning, dan benchmark independen.
Bagi tim yang membutuhkan kontrol, penyesuaian, dan validasi independen, konfigurasi tersebut menjadikan Inkling-Small pilihan yang praktis.
Pertanyaan Umum
Perangkat keras apa yang diperlukan untuk menghosting Inkling-Small sendiri?
Inkling-Small dibangun di atas arsitektur 276 miliar parameter dan menggunakan checkpoint terkuantisasi NVFP4 native untuk sistem NVIDIA Blackwell.
Konfigurasi Anda juga harus mendukung pustaka inferensi open-source seperti SGLang, vLLM, TokenSpeed, atau llama.cpp. Meskipun Thinking Machines menggunakan sistem GB300 NVL72 selama pengembangan, varian Small ditujukan sebagai pilihan yang lebih hemat biaya dan berlatensi rendah untuk deployment lokal.
Kapan sebaiknya saya memilih hosting mandiri daripada Tinker?
Gunakan hosting mandiri ketika organisasi Anda memerlukan kontrol penuh atas beban kerja AI berbasis agen. Ini dapat berarti menjalankan model secara lokal atau dalam cloud privat virtual, dengan tim Anda bertanggung jawab atas konfigurasi dan operasi sehari-hari.
Pilihan ini juga cocok bagi tim yang ingin mengelola infrastruktur sendiri, mengurangi biaya token berkelanjutan, atau memenuhi persyaratan privasi data tertentu.
Tinker adalah pilihan yang lebih baik jika Anda menginginkan konfigurasi praktis dan minim hambatan untuk riset serta fine-tuning. Hosting mandiri memberi lebih banyak ruang untuk menyesuaikan performa dan biaya dengan perangkat keras sendiri.
Bagaimana upaya berpikir memengaruhi biaya dan kualitas respons?
Upaya berpikir Inkling yang dapat dikontrol memberi developer cara sederhana untuk mengatur anggaran penalaran model dari 0.2 hingga 0.99. Pengaturan lebih tinggi menggunakan lebih banyak komputasi untuk penalaran kompleks dan multi-langkah. Pengaturan lebih rendah mengurangi penggunaan token dan latensi untuk tugas yang lebih sederhana.
Karena Inkling memadatkan penalaran chain-of-thought, model ini sering dapat mencapai hasil akurat dengan lebih sedikit token. Pengguna memperoleh kontrol lebih besar atas biaya dan performa sesuai kebutuhan deployment mereka.
Pilih model yang Anda inginkan di marketplace model
Coba model chat, gambar, dan video di marketplace model APIMart, lalu rasakan kemampuan model dengan cepat melalui satu API terpadu.