APIMart
Model Cohere Apache 2.0 dan AI Self-Hosted

Model Cohere Apache 2.0 dan AI Self-Hosted

Jelajahi roadmap model Apache 2.0 Cohere untuk AI teks, suara, kode, dan multibahasa, beserta manfaat dan konsekuensi deployment self-hosted.

Wawasan Model

Jika Anda ingin menjalankan AI di dalam stack sendiri, roadmap Cohere pada Juli 2026 membuatnya jauh lebih mudah. Ringkasnya: Cohere menempatkan lebih banyak keluarga model di bawah lisensi Apache 2.0. Artinya, Anda dapat menggunakannya untuk pekerjaan komersial, memodifikasinya, dan menjalankannya secara self-hosted tanpa masalah lisensi yang kerap memperlambat proyek AI perusahaan.

Berikut versi singkatnya:

  • Perubahan yang terjadi: Cohere kini memiliki model Apache 2.0 untuk kasus penggunaan teks, suara, kode, dan multibahasa.
  • Model yang penting: Command A+, Cohere Transcribe, North Mini Code, dan sebagian keluarga Aya.
  • Alasan tim memperhatikannya: Apache 2.0 memungkinkan Anda menggunakan, memodifikasi, dan mendistribusikan bobot model, termasuk untuk produk berbayar.
  • Hal yang tetap menjadi tanggung jawab Anda: Anda masih harus menangani infrastruktur, pemberitahuan, berkas lisensi, dan peninjauan klausul paten.
  • Tempat model-model ini cocok digunakan: Lingkungan on-prem, VPC privat, atau hybrid yang menjaga data privat tetap lokal.
  • Pihak yang perlu memperhatikan: Tim yang menangani PII, PHI, dokumen internal, pencarian teregulasi, asisten privat, atau transkripsi on-prem.
  • Angka penting dari artikel ini:
    • Command A+: model MoE 218B
    • Harga API Command A+: $2.50 per 1 juta token masukan dan $10.00 per 1 juta token keluaran
    • Jendela konteks: 128K token, dengan rencana perluasan menjadi 1 juta
    • WER Cohere Transcribe: 5.42% dibandingkan 7.44% untuk Whisper Large v3
    • Kecepatan Transcribe: sekitar 525 menit audio per menit waktu nyata
    • Akses APIMart: 500+ model AI melalui satu API

Artinya bagi Anda sederhana: jika tim menginginkan kontrol lebih besar atas data, deployment, dan biaya dari waktu ke waktu, jalur open-weight Cohere kini menjadi pilihan yang lebih kuat daripada AI yang hanya tersedia secara hosted.

Membangun Klona ChatGPT Self-Hosted dengan AI Cohere

Cohere

Perbandingan singkat

OpsiKontrolData tetap berada di lingkungan AndaPekerjaan infrastruktur awalPaling sesuai untuk
Model Cohere self-hostedTinggiYaTinggiBeban kerja teregulasi, privat, dan air-gapped
Hybrid dengan APIMartMenengah hingga tinggiYa, untuk alur sensitifMenengahTim yang memisahkan beban kerja privat dan eksternal
Hanya API terkelolaRendahTidakRendahPeluncuran cepat dan operasi internal yang lebih ringan

Kesimpulan utamanya adalah: Apache 2.0 menghapus satu hambatan hukum besar, tetapi tim Anda tetap membutuhkan GPU, MLOps, dan konfigurasi kepatuhan agar self-hosting berjalan dengan baik.

Perubahan dalam roadmap model Cohere

Cohere Apache 2.0 vs CC-BY-NC vs API Proprietary: Perbandingan Lisensi AI Self-Hosted
Cohere Apache 2.0 vs CC-BY-NC vs API Proprietary: Perbandingan Lisensi AI Self-Hosted

Cohere menempatkan beberapa keluarga model unggulannya di bawah Apache 2.0. Ini memberi tim cara yang jauh lebih jelas untuk melakukan self-hosting, penyesuaian, dan deployment untuk penggunaan komersial. Bagi perusahaan, perubahan besarnya sederhana: lebih sedikit kerumitan lisensi dan lebih banyak keleluasaan untuk menjalankan model di dalam stack sendiri.

Keluarga model Cohere yang beralih ke Apache 2.0

Apache 2.0

Per Juli 2026, beberapa keluarga model Cohere berada di bawah Apache 2.0:

  • Command A+ - Dirilis pada Mei 2026, model mixture-of-experts (MoE) dengan 218B parameter ini mencakup varian terkuantisasi W4A4 untuk mengurangi penggunaan memori GPU dalam deployment perusahaan [3][4].
  • Cohere Transcribe - Keluarga model speech-to-text dengan 2B parameter yang dirilis di bawah Apache 2.0, termasuk model dasar yang diluncurkan pada Maret 2026 dan versi khusus bahasa Arab yang dirilis pada Juli 2026 [3][6].
  • North Mini Code - Dirilis pada Juni 2026, model yang berfokus pada kode dan memperluas roadmap ke bobot khusus coding [5][7].
  • Keluarga Aya - Model multibahasa, termasuk Tiny Aya dan Aya Vision, yang dibuat untuk penggunaan multibahasa secara lokal atau pada perangkat [3].

Polanya sulit diabaikan. Cohere memperluas jajaran open-weight untuk pembuatan teks, pengenalan suara, coding, dan beban kerja multibahasa.

Hal ini penting karena Apache 2.0 mengubah apa yang dapat dilakukan tim setelah memiliki bobot model.

Bobot Apache 2.0 dibandingkan dengan ketentuan API hosted

Apache 2.0 memberi Anda bobot model, sehingga Anda dapat menjalankan dan memodifikasi model secara lokal. API hosted memiliki konfigurasi berbeda. Dalam hal ini, inferensi tetap berjalan di infrastruktur Cohere berdasarkan ketentuan berbayar terpisah. Misalnya, harga Command A+ melalui API adalah $2.50 per 1 juta token masukan dan $10.00 per 1 juta token keluaran [6].

Pemisahan itu mengubah konsekuensinya. Self-hosting membebankan pekerjaan infrastruktur kepada tim Anda, tetapi juga menjaga data tetap berada di lingkungan sendiri. Dengan API, deployment lebih sederhana, tetapi penyedia mempertahankan lebih banyak kontrol atas cara model berjalan.

Perbedaannya terlihat cukup jelas pada tabel di bawah ini.

Perbandingan lisensi: CC-BY-NC, akses proprietary, dan Apache 2.0

FiturApache 2.0 (misalnya, Command A+)CC-BY-NC (Model Riset)Akses API Proprietary
Penggunaan KomersialDiizinkan sepenuhnyaDilarangDiizinkan melalui ketentuan berbayar
Hak ModifikasiAkses penuh ke bobotDiizinkan hanya untuk risetTerbatas pada fine-tuning
RedistribusiDiizinkanDiizinkan untuk penggunaan nonkomersialDilarang
Self-HostingDapat dilakukan - on-prem, VPC, air-gappedDapat dilakukan, tetapi tidak untuk mencari keuntunganTidak tersedia
Dampak KepatuhanTinggi - data tetap berada di dalam organisasiMenengah - hanya untuk penggunaan risetLebih rendah - data keluar dari perimeter Anda

CC-BY-NC dapat membuat penggunaan produksi menjadi tidak jelas. Akses API proprietary memudahkan peluncuran, tetapi kontrol tetap berada pada penyedia. Apache 2.0 lebih sesuai ketika penggunaan komersial, perubahan model internal, dan kontrol data lokal sama-sama berada di urutan atas daftar prioritas.

Berikutnya adalah bagian praktis: hal-hal yang dapat dilakukan tim dalam produksi berkat Apache 2.0 dan kewajiban yang masih harus dipenuhi.

Hal yang diizinkan Apache 2.0 dan alasan perusahaan memperhatikannya

Penjelasan penggunaan komersial, modifikasi, redistribusi, dan ketentuan paten

Apache 2.0 memberikan lisensi abadi, berlaku di seluruh dunia, dan bebas royalti kepada perusahaan untuk menggunakan, memodifikasi, serta mendistribusikan model [9]. Dalam bahasa sederhana: Anda dapat menjalankan, mengubah, dan mendistribusikannya tanpa membayar biaya lisensi.

Bagi perusahaan, hal ini menghilangkan banyak hambatan, terutama ketika mereka ingin menjaga inferensi tetap berada di lingkungan sendiri. Semua penggunaan komersial diizinkan. Bagi tim self-hosted, izin hukum tersebut memberi keleluasaan jauh lebih besar untuk men-deploy model di tempat dan dengan cara yang mereka inginkan.

Tim dapat melakukan fine-tuning model dengan data proprietary, menyesuaikan perilaku domain, dan menyelaraskan keluaran dengan istilah internal. Mereka juga dapat menjaga perubahan tersebut tetap privat. Tidak ada kewajiban untuk memublikasikan bobot yang telah dimodifikasi [9]. Ini penting jika perubahan model mencerminkan pengetahuan internal atau logika produk yang tidak ingin Anda ungkapkan ke publik.

Pemberian hak paten menambahkan lapisan perlindungan lain. Hak ini mencakup klaim paten yang pasti dilanggar oleh model, tetapi berakhir jika organisasi Anda menggugat kontributor atas pelanggaran paten [9][10]. Apache 2.0 juga tidak memberikan hak merek dagang, sehingga nama Cohere hanya boleh digunakan untuk menunjukkan sumbernya [9][10].

Kewajiban kepatuhan yang tetap harus dipenuhi tim

Masih ada sejumlah dokumen yang harus dibereskan dengan benar.

Jika Anda mendistribusikan model atau turunannya, Anda harus menyertakan lisensi, mempertahankan pemberitahuan yang diwajibkan, meneruskan berkas NOTICE, dan menandai berkas yang dimodifikasi dengan jelas [9]. Tim hukum sebaiknya meninjau klausul pembalasan paten sejak awal. Pada saat yang sama, tim MLOps harus memastikan pemberitahuan tetap ada di seluruh pipeline build dan rilis.

Setelah ketentuan tersebut diselesaikan, persoalan berikutnya bersifat praktis: tempat model sebaiknya dijalankan.

Tabel: pemetaan hak Apache 2.0 terhadap hasil bisnis

Hak LisensiHal yang Diizinkan Secara HukumManfaat Bisnis
Penggunaan KomersialMenggunakan model dalam produk atau layanan apa pun yang menghasilkan pendapatanTanpa biaya royalti
ModifikasiMelakukan fine-tuning atau mengubah bobot dan kode modelMembangun kemampuan proprietary di atas model open-weight
RedistribusiMembagikan model atau karya turunannya kepada pihak lainMengurangi hambatan bagi tim produk yang merilis aplikasi berbasis AI
Pemberian Hak PatenMenggunakan klaim paten milik kontributor yang pasti dilanggar oleh modelPerlindungan dari klaim paten kontributor
Penafian JaminanMenggunakan model "apa adanya" tanpa jaminanMengurangi hambatan untuk eksperimen

Konsekuensi tersebut langsung mengarah pada pilihan deployment on-prem, VPC, dan hybrid.

Cara men-deploy dan menggunakan model Cohere self-hosted

Opsi deployment: on-prem, VPC privat, dan hybrid

Apache 2.0 hanya berarti jika Anda dapat menjalankan model di tempat data Anda sudah berada. Itulah sisi praktis roadmap Cohere. Bagi sebagian besar tim, ada tiga cara utama untuk men-deploy: on-prem, di dalam VPC privat, atau dalam konfigurasi hybrid. Pilihan yang tepat ditentukan oleh kontrol, kepatuhan, dan kecepatan.

Klaster GPU on-premises memberi Anda kontrol terbesar atas data. Jika diperlukan, klaster dapat sepenuhnya air-gapped dan juga menjaga latensi inferensi tetap rendah karena data tidak pernah meninggalkan jaringan Anda. Command A+ dapat berjalan hanya dengan dua GPU H100 menggunakan kuantisasi W4A4, sehingga deployment on-prem dapat dijangkau oleh tim yang sudah memiliki infrastruktur GPU modern [4][8].

Deployment VPC privat memindahkan komputasi tersebut ke dalam lingkungan cloud terisolasi. Anda tetap memperoleh pemisahan yang kuat, tetapi tanpa menjalankan semuanya di pusat data sendiri. Pilihan ini sering kali sesuai bagi perusahaan SaaS dan tim keuangan.

Konfigurasi hybrid membagi pekerjaan. Penalaran dan retrieval sensitif tetap berada di lingkungan sendiri, sedangkan beban kerja eksternal yang lebih berat berjalan melalui lapisan API. Model ini sering menjadi jalan tengah ketika perusahaan membutuhkan privasi pada sebagian proses, tetapi tidak di semua tempat.

Opsi DeploymentKontrol DataLatensiJenis BiayaKasus Penggunaan Paling Sesuai
Klaster GPU On-PremMaksimumSangat rendahModal (CapEx)Lingkungan air-gapped dengan keamanan tinggi
VPC Privat (Cloud)TinggiRendah hingga menengahOperasional (OpEx)Pencarian teregulasi, RAG perusahaan
Konfigurasi HybridTinggi untuk beban kerja sensitifBervariasiCampuranAplikasi multimodal dan alur dukungan

Konsekuensi ini terlihat paling jelas pada asisten privat, pencarian teregulasi, dan lapisan API internal.

Kasus penggunaan: asisten privat, pencarian teregulasi, dan API on-prem

Pilihan deployment segera menjadi penting ketika beban kerja melibatkan data yang sama sekali tidak boleh bocor. Di berbagai tim perusahaan, tiga pola terus muncul.

Asisten karyawan privat sering menjadi langkah pertama. Tim hukum atau SDM dapat memasukkan dokumen kebijakan internal, kontrak, atau panduan tunjangan ke dalam instance Command A+ self-hosted. Model kemudian menjawab pertanyaan menggunakan retrieval-augmented generation (RAG) berdasarkan dokumen tersebut, sementara seluruh alur tetap berada di lingkungan perusahaan. Command A+ mendukung jendela konteks 128K token, dengan kemungkinan perluasan menjadi 1 juta token [8].

Pencarian pengetahuan teregulasi adalah tingkat berikutnya. Kelompok layanan kesehatan dan lembaga keuangan sering perlu mencari catatan yang terikat aturan residensi data yang ketat. Dalam konfigurasi tersebut, model Cohere self-hosted dapat menangani embedding, retrieval, dan reranking tanpa mengirim data ke luar perimeter.

Lapisan API on-prem membawa pendekatan ini lebih jauh. Tim dapat membangun endpoint internal untuk tugas seperti klasifikasi dokumen, transkripsi, dan peringkasan. Di sinilah Cohere Transcribe menonjol. Model ini mencatat Word Error Rate sebesar 5.42% di Open ASR Leaderboard, lebih baik daripada Whisper Large v3 yang mencapai 7.44%, serta dapat memproses sekitar 525 menit audio per menit waktu nyata [1][3]. Bagi pusat panggilan dan rekaman kepatuhan, ini menjadikannya pilihan praktis, bukan sekadar demo laboratorium.

Ketika hanya satu bagian stack yang harus tetap privat, lapisan API hybrid dapat menangani sisanya.

Posisi APIMart dalam konfigurasi hybrid

APIMart

Dalam arsitektur hybrid, APIMart berfungsi sebagai satu lapisan API untuk beban kerja video, gambar, dan bahasa yang tidak sensitif, sementara penalaran sensitif, retrieval, dan data privat tetap berada di lingkungan self-hosted milik pelanggan. APIMart memberi tim akses ke 500+ model AI melalui satu API, sehingga deployment internal Cohere dapat tetap berfokus pada alur data privat tanpa harus bercabang menjadi banyak integrasi eksternal terpisah.

Pembagian ini sederhana tetapi berguna: pertahankan penalaran sensitif secara lokal, lalu kirim tugas yang berhadapan dengan pihak luar melalui satu titik koneksi.

Masalah BisnisPenempatan ModelManfaat UtamaSensitivitas Data
Pencarian Pengetahuan TeregulasiVPC Privat / On-PremRAG pada dokumen internal tanpa data keluarTinggi
Asisten Karyawan PrivatVPC PrivatAlur agentik yang aman untuk tugas SDM dan hukumMenengah hingga Tinggi
Lapisan API On-PremOn-PremTranskripsi berlatensi rendah dan analisis dokumen untuk PII/PHITinggi
Konten Video dan MultimodalAPIMart (API)Akses ke 500+ model melalui satu endpointRendah hingga Menengah
Alur Dukungan MultibahasaHybridDukungan 48 bahasa dengan data sensitif tetap lokalMenengah

Cara menentukan apakah roadmap terbuka Cohere sesuai dengan stack Anda

Kriteria keputusan: kontrol, kepatuhan, biaya, dan kapasitas MLOps

Setelah mengetahui opsi deployment, langkah berikutnya lebih sederhana: pilih model yang dapat dijalankan dan didukung tim Anda dari waktu ke waktu.

Model terbaik bukan hanya yang memiliki benchmark kuat, melainkan yang dapat ditangani tim selama 12 hingga 24 bulan ke depan. Dalam banyak kasus, empat pertanyaan dapat memperjelas keputusan dengan cepat.

Seberapa sensitif data Anda? Jika alur Anda melibatkan PHI, PII, atau dokumen dengan hak istimewa hukum, self-hosting atau VPC privat sering kali tidak dapat ditawar. Jika beban kerja kurang sensitif, API terkelola mungkin sudah memadai.

Seberapa matang tim MLOps Anda? Menjalankan model Apache 2.0 Cohere secara on-prem berarti tim Anda bertanggung jawab atas orkestrasi Kubernetes, pengadaan GPU, serta pekerjaan penyesuaian model seperti kuantisasi [11]. Ini bukan pekerjaan kecil. Beban operasionalnya nyata.

Bagaimana anggaran Anda untuk 12 hingga 24 bulan ke depan? Akses API hosted biasanya lebih murah di awal. Self-hosting mengalihkan lebih banyak pengeluaran ke infrastruktur dan operasi sehari-hari.

Apakah Anda membutuhkan hak komersial yang jelas untuk produk? Apache 2.0 memberikan kejelasan tersebut untuk penggunaan komersial, modifikasi, dan redistribusi [2].

Bagi banyak tim di AS, konfigurasi hybrid menjadi pilihan yang paling seimbang. APIMart dapat menyediakan akses multimodal yang lebih luas, sementara penalaran sensitif tetap lokal.

Tabel perbandingan: hanya self-hosted, hybrid dengan APIMart, atau API terkelola

Gunakan tabel ini untuk menyelaraskan kontrol, kepatuhan, anggaran, dan kapasitas MLOps dengan pola deployment yang sesuai.

Hanya Self-HostedHybrid dengan APIMartAPI Terkelola
Prioritas KontrolMaksimumTinggi untuk beban kerja sensitifRendah (dikelola vendor)
Kepatuhan / Residensi DataDapat dibuat air-gappedData sensitif tetap lokalStandar (SOC 2/ISO 27001)
Profil AnggaranCapEx tinggi + operasi berkelanjutanCampuran CapEx/OpExOpEx murni, berdasarkan penggunaan
Upaya MLOpsTinggiMenengahMinimal
Paling SesuaiAI teregulasi, berdaulat, air-gappedRAG perusahaan dan alur multimodalStartup, pembuatan prototipe cepat

Kesimpulan: hal praktis yang perlu dipahami tim di AS

Roadmap Apache 2.0 Cohere memberi tim lebih dari satu jalan ke depan tanpa memaksa semua pihak menggunakan konfigurasi yang sama.

Sebuah startup dapat memulai dengan akses API terkelola, lalu beralih ke self-hosting jika sensitivitas data atau skala mulai menuntutnya. Perusahaan teregulasi dapat menjalankan seluruh stack secara on-prem sejak hari pertama. Sementara itu, tim pasar menengah dapat mengambil jalan tengah dengan mempertahankan retrieval dan penalaran sensitif secara lokal, sekaligus menggunakan APIMart untuk alur multimodal yang lebih luas.

Arsitektur yang paling sesuai adalah yang selaras dengan kebutuhan kepatuhan nyata, kapasitas infrastruktur tim, dan anggaran Anda untuk satu hingga dua tahun ke depan.

FAQ

Model Cohere mana yang kini menggunakan Apache 2.0?

Model Apache 2.0 Cohere saat ini mencakup Command A+ dan Transcribe.

Rilis ini mendukung penggunaan komersial, deployment lokal, dan penyesuaian dalam infrastruktur privat. Hal tersebut memberi organisasi kontrol lebih besar, membantu kepatuhan, dan mengurangi ketergantungan pada sistem eksternal.

Apa yang masih harus dikelola jika kami melakukan self-hosting?

Ketika melakukan self-hosting, Anda bertanggung jawab atas seluruh stack.

Artinya, Anda bertanggung jawab atas segala sesuatu yang biasanya ditangani layanan terkelola: perangkat keras dan sumber daya komputasi, konfigurasi, pemeliharaan, data, log, keamanan, kepatuhan, dan memastikan performa tetap terjaga di lingkungan sendiri.

Kapan self-hosting lebih masuk akal daripada menggunakan API?

Self-hosting lebih masuk akal ketika Anda membutuhkan kontrol penuh atas data, konfigurasi kepatuhan, dan infrastruktur.

Pilihan ini sering lebih sesuai bagi organisasi dengan aturan residensi data yang ketat atau tim di industri teregulasi yang tidak dapat mengirim data sensitif ke server eksternal.

Self-hosting juga dapat mengurangi ketergantungan pada penyedia eksternal. Dalam produksi bervolume tinggi, opsi ini mungkin membantu Anda menghindari biaya per menit atau per token—jika Anda sudah memiliki perangkat keras on-premises atau kapasitas cloud privat untuk menanganinya.

Siap mencoba?

Pilih model yang Anda inginkan di marketplace model

Coba model chat, gambar, dan video di marketplace model APIMart, lalu rasakan kemampuan model dengan cepat melalui satu API terpadu.

Model chatModel gambarModel video
Buka marketplace model