
Inkling-SmallオープンソースAIモデル徹底解説
Thinking Machinesの276BマルチモーダルMoE、Inkling-Smallを解説。12Bのアクティブパラメータ、1Mトークンのコンテキスト、オープンウェイト、柔軟な導入方法を詳しく紹介します。
多くのトップクラスのシステムと同等のコストをかけずに長い入力を処理できるオープンモデルを求めるなら、Inkling-Smallがその答えです。 July 30, 2026、Thinking Machinesは、リクエストごとに有効になるパラメータがわずか12 billionの276-billion-parameterマルチモーダルMoEモデルをリリースしました。さらに、1 million-tokenのコンテキストウィンドウと**Apache 2.0**ライセンスを備えています。
要点をまとめると、次のとおりです。
- テキスト、画像、音声を入力として利用できます
- テキスト、コード、JSONで出力を受け取れます
- thinking effortを0.2から0.99まで調整し、コストと推論の深さのバランスを取れます
- セルフホストにより、完全な1,000,000-tokenコンテキストウィンドウを利用できます
- ホスト型アクセスを求める場合は、256,000-tokenのコンテキスト上限で**Tinker**を利用できます
- **Hugging Face**からオープンウェイトをダウンロードできます
- NVIDIA GPU上で4-bit NVFP4バージョンを利用できます
- プライベートデータでファインチューニングし、独自の環境内で実行できます
いくつかの数字が特に目を引きます。Inkling-Smallは**SWE-bench Verifiedで77.6%を記録し、Terminal Bench 2.1ではNemotron 3 Ultraに、約三分の一のトークンコストで並びました。さらに、StrongREJECTで98.6%**を記録しています。名前に_Small_と付いていても、このモデルは本格的なコーディング、文書処理、サポートフロー、エージェントタスクを想定しています。
Inkling-Smallは決して小さくない:この276Bモデルを検証
クイック比較
| 項目 | Inkling-Small | Tinkerでのアクセス |
|---|---|---|
| アクセス方式 | セルフホスト型オープンウェイト | ホスト型API |
| ライセンス | Apache 2.0 | マネージドサービス |
| 最大コンテキスト | 1,000,000 tokens | 256,000 tokens |
| 入力 | テキスト、画像、音声 | テキスト、画像、音声 |
| 出力 | テキスト、コード、JSON | テキスト、コード、JSON |
| 制御 | インフラとモデルを全面的に制御 | セットアップ作業を削減 |
| ファインチューニング | 対応 | 対応 |
結論: このリリースは、米国のチームに対し、クローズドAPIに縛られることなく、低コストの導入、プライベート環境、長文コンテキストを扱うマルチモーダル処理を実現する明確な選択肢を提供します。
Inkling-Smallの概要:アーキテクチャ、規模、機能
Inkling-Smallは、276 billionの総パラメータと、トークンごとに約12 billionのアクティブパラメータを持つ、デコーダー専用のMixture-of-Experts(MoE)Transformerです。これに対し、フラッグシップモデルは975 billionの総パラメータと、トークンごとに41 billionのアクティブパラメータを持ちます[2][1][3]。この差は重要です。要求の厳しい処理にも対応しながら、Inkling-Smallをより軽快に扱える理由を説明しています。その効果が最も明確に表れるのが、マルチモーダル入力への対応と長いコンテキストウィンドウです。
マルチモーダル入力、テキスト出力、長文コンテキスト対応
Inkling-Smallはテキスト、画像、音声を入力として受け取り、自然言語、コード、JSONを含むテキスト出力を返します[2][1]。テキスト、画像、音声、動画にまたがる45 trillion tokensのマルチモーダルデータで事前学習されています[1][3]。
最大1 million tokensのコンテキストウィンドウにも対応します[1]。これは、大規模なコードベース、長い文書、長時間の文字起こしを扱うチームにとって大きな意味を持ちます。素材を細切れにして情報が失われないことを祈る代わりに、全体像を一度にはるかに多くモデルへ渡せます。セルフホスティング、ファインチューニング、ツール経由での利用を比較する際に、この違いが重要になります。
ベンチマーク性能と「Small」が本当に意味するもの
ベンチマーク結果を見ると、_Small_という名称を適切に理解できます。
SWE-bench Verifiedでは、Inkling-Smallは77.6%を記録し、NvidiaのNemotron 3が記録した71.9%を上回りました[2]。Terminal Bench 2.1では、約三分の一のトークンコストでNemotron 3 Ultraに並びました[1][3]。さらにStrongREJECTで**98.6%**を記録し、強力な拒否処理能力を示しています[2]。
簡単に言えば、_Small_は性能が低いという意味ではありません。実際、MoE構成と長文コンテキストへの対応は、コードレビュー、文書分析、エージェントワークフローなど、チームが重視する仕事で効果を発揮します。
Inkling-Smallへのアクセス方法:ウェイト、ツール、統合オプション

オープンウェイト、モデルカード、ダウンロード可能なファイル
Inkling-Smallのウェイトは、Hugging Faceのthinkingmachines organizationで公開されています[2][6]。
このリリースには、ウェイト、モデルカード、トークナイザー、設定ファイル、モダリティエンコーダーなど、多くのチームが期待する主要ファイルが含まれています[4][2]。ゼロから始めたり、手作業で部品を組み合わせたりする必要はありません。
NVIDIA GPUへ導入する場合は、その環境でより優れた性能を得られるInkling-Small-NVFP4という4-bit量子化バージョンもあります[4][5]。また、セルフホスティングに取り組む前にモデルを試したいチームにとって、Tinkerが最短のアクセス手段です。
セルフホスティング、ホスト型API、ファインチューニングの比較
Thinking Machinesは、モデルの試用、応答長の上限設定、Web検索の有効化、エンタープライズグレードのファインチューニングを行えるテスト/ファインチューニングAPI、Tinkerを提供しています[2][1]。
Tinkerは、主要な推論/デプロイツールとのリリース初日からの統合にも対応しています[6][1]。モデル自体は作業の一部にすぎないため、これは重要です。膨大なセットアップ作業なしに、本番スタックへ組み込む手段も必要になります。
トレードオフは非常にシンプルです。
- セルフホスティングでは、完全な制御と1 million-tokenコンテキストウィンドウへのアクセスが得られます[6][1]。
- Tinkerでは運用作業を削減できますが、コンテキストは256,000 tokensに制限されます[6][1]。
つまり、選択の基準は速度か制御かです。マネージドアクセスと少ないインフラ作業を重視するなら、Tinkerが容易な選択肢です。完全なコンテキストウィンドウとデプロイに対する厳密な制御が必要なら、セルフホスティングが適しています。
マルチモーダル本番ワークフローにおけるAPIMartの位置づけ

アクセス方法を選んだ後も、本番運用には実践的な課題が残ります。マルチモーダルリクエストを一つの整ったワークフローで処理することです。
分析と生成を同じフローで必要とするチームに対し、APIMartはマルチモーダルAPI向けの単一の統合レイヤーを提供します。
米国チーム向けのユースケースとコスト効率の高い導入
コーディングアシスタント、エージェント、サポートツール、文書分析
アクセス方法が明確になったところで、次の問いはシンプルです。Inkling-Smallはどこで真価を発揮するのでしょうか。 MoE設計により、大量の本番ワークロードでも推論処理を効率的に保てます[1]。
ソフトウェアチームにとって、これはリポジトリ規模のバグ修正、PRレビュー、大規模コードベースを横断して作業する多段階コーディングエージェントに適した特性です[2]。
同じ構成は、高速な分類と長文コンテキストの読解が必要な処理にも適しています。チケットの振り分け、ポリシーに関する質問への回答、適切な担当先へのエスカレーションを行うサポートコパイロットがその例です。規模が大きくなると、レイテンシと計算量の小さな改善がすぐに積み重なります。
契約書、ポリシーファイル、技術マニュアルを含む大規模文書の分析にも適しています[1]。チームが一日中密度の高い文書を扱うなら、長文コンテキストの読解が重要になるタイプのワークロードです。
教育プラットフォームでは、調整可能なthinking effortを使い、Inkling-Smallで数学や論理の個別指導を提供できます[2]。毎回同じ計算コストを払う代わりに、タスクに応じてモデルの処理量を合わせられます。
代表的な用途は次のとおりです。
- コーディングエージェント
- サポートコパイロット
- 文書分析
- 個別指導
- マルチモーダルタグ付け
米国チームのコスト、レイテンシ、予算計画
ここでコストを左右する主な要素はMoE設計です。反復的なリクエストの推論コストとレイテンシを低く抑えるのに役立ちます[1]。
開発者はコードからthinking effortを調整し、単純なタスクには0.2、難しい推論には最大0.99を指定できます[2]。簡単に言えば、大量かつ複雑さの低い処理では計算量を抑え、本当に必要なケースに多くの思考時間を割り当てられます。
米国のチーム全体で支出を計画する際、このような制御が重要です。毎日数千件の定型リクエストを扱うサポートフローと、複雑なエッジケースを処理するコーディングエージェントでは、同じ設定を使う必要はありません。一つのモデルで処理量を変え、より明確に予算を管理できます。
モデルはApache 2.0ライセンスで公開されているため、データ管理が優先される場合、米国のチームはオンプレミスやVPC内でも実行できます[2][1]。
こうした導入オプションを踏まえ、次のセクションでは研究上の要点を説明します。
研究上の要点と最終まとめ
テストとカスタマイズにオープンウェイトが重要な理由
アクセス方法とデプロイを確認したところで、研究上の主要な論点は、オープンウェイトによってチームが実際に何をできるかという点に集約されます。
ウェイトが公開されているため、研究者はアーキテクチャと推論制御を直接調査できます。また、内部データを外部APIへ送らず、そのデータ上でモデルをテストできます。この可視性は安全性テストにも役立ちます。公開された主張をそのまま受け入れるのではなく、組織が独自のインフラ上で結果を検証できます。
ドメイン適応も大きな利点です。金融分析やソフトウェアエンジニアリングなどの分野では、汎用システムに依存する代わりに、独自データでモデルをファインチューニングできます[2]。同じオープン性がローカル導入とドメイン固有の適応にも役立ち、チームは独自の条件で独立監査を実施できます。
覚えておくべき重要ポイント
特に重要なのは次の点です。
- オープンウェイトにより、チームは独自のインフラ上でモデルをテスト、ファインチューニング、ベンチマークできます。
- ウェイトはHugging Faceで提供されており、Tinkerを使えば、本番環境へ移行する前に設定を徹底的に検証できます[2][1]。
- Inkling-Smallは制御可能でコストを重視する導入向けに設計され、オープンウェイトによってテスト、ファインチューニング、独立したベンチマークを実施できます。
制御、カスタマイズ、独立した検証を必要とするチームにとって、この構成はInkling-Smallを実用的な選択肢にします。
よくある質問
Inkling-Smallのセルフホスティングにはどのようなハードウェアが必要ですか?
Inkling-Smallは276-billion-parameterアーキテクチャを採用し、NVIDIA Blackwellシステム向けのネイティブなNVFP4量子化チェックポイントを使用します。
環境は、SGLang、vLLM、TokenSpeed、llama.cppなどのオープンソース推論ライブラリにも対応する必要があります。Thinking Machinesは開発中にGB300 NVL72システムを使用しましたが、Smallバリアントはローカル導入向けに、より費用対効果が高く、レイテンシの低い選択肢となるよう設計されています。
Tinkerではなくセルフホスティングを選ぶべきなのはどのような場合ですか?
組織がエージェント型AIワークロードを全面的に制御する必要がある場合は、セルフホスティングを選びます。オンプレミスまたは仮想プライベートクラウド内でモデルを実行し、チームがセットアップと日常的な運用を管理するケースが該当します。
独自のインフラを管理したい、継続的なトークンコストを削減したい、特定のデータプライバシー要件を満たしたいチームにも適しています。
研究とファインチューニング向けに便利で導入しやすい環境を求めるなら、Tinkerが適しています。セルフホスティングでは、独自のハードウェアに合わせて性能とコストを調整する余地が広がります。
thinking effortはコストと応答品質にどのような影響を与えますか?
Inklingの制御可能なthinking effortにより、開発者はモデルの推論予算を0.2から0.99まで簡単に調整できます。高い設定では、複雑な多段階推論により多くの計算量を使います。低い設定では、単純なタスクのトークン使用量とレイテンシを削減します。
Inklingは思考連鎖推論を圧縮するため、より少ないトークンで正確な結果に到達できる場合があります。これにより、導入要件に応じてコストとパフォーマンスをより細かく制御できます。
モデルマーケットで使いたいモデルを選ぶ
APIMart のモデルマーケットでチャット、画像、動画モデルを試し、統一 API でモデルの能力をすばやく体験できます。