APIMart
MAI-Thinking-1 の主要スペックとデータガイド

MAI-Thinking-1 の主要スペックとデータガイド

MAI-Thinking-1 のスペック、トレーニングデータ、スパース MoE アーキテクチャ、256K コンテキスト、ベンチマーク結果、プライベートプレビューへのアクセス、API セットアップ、エンタープライズ用途を解説します。

モデル解説

MAI-Thinking-1 は、数学、コーディング、エンタープライズアプリケーションといったタスク向けに設計された Microsoft の先進的な AI モデルです。350 億のアクティブパラメータを備えたスパース Mixture-of-Experts(MoE)アーキテクチャと、巨大な 256,000 トークン(約 600 ページ)のコンテキストウィンドウを特徴としています。33.55 兆トークンのクリーンでライセンス済みのデータでトレーニングされており、ヘルスケア、金融、法務などの業界に対してデータの安全性と信頼性を確保します。

主な特徴:

  • アーキテクチャ: スパース MoE、350 億のアクティブパラメータ(合計約 1 兆)。
  • トレーニングデータ: 33.55 兆トークン、すべて商用ライセンス済みで人間が生成したもの。
  • コンテキストウィンドウ: 大規模なワークフローを扱うための 256,000 トークン。
  • パフォーマンス: 数学(AIME 2025 で 97%)およびコーディングのベンチマークでトップスコア。
  • マルチモーダル統合: MAI-Image-2.5(画像)や MAI-Voice-2(音声クローン)などのツールと連携。
  • API アクセス: OpenAI 互換で、高度な関数呼び出しに対応。

現在はプライベートプレビュー段階にある MAI-Thinking-1 は、エンタープライズ規模のタスク向けに最適化されており、規制遵守を維持しながら強力な推論能力を提供します。他の MAI ツールとの統合により、業界を横断した複雑なワークフローをサポートします。

MAI-Thinking-1: ヒルクライミングマシンの構築

MAI-Thinking-1 のコアスペック

MAI-Thinking-1 の技術的基盤は、高度なマルチモーダル出力を生み出すために必要な機能を提供し、動画生成や統合 LLM API ワークフローのための強力なツールとなっています。

モデルアーキテクチャとパラメータ

MAI-Thinking-1 は、スパース Mixture-of-Experts(MoE)アーキテクチャとデコーダ専用 Transformer 構成を組み合わせて設計されています。その「LatentMoE」構成では、必要なエキスパートのみ(通常はトークンごとに 512 のうち 8)が活性化されるため、効率的でスケーラブルな処理が可能になります[2][6]。このモデルは 350 億のアクティブパラメータと約 1 兆の合計パラメータで動作します。コンテキストウィンドウは 256,000 トークンに及び、これはおよそ 600 ページ分のコンテンツに相当し、単一セッション内で大規模なデータ処理を可能にします[6]

このアーキテクチャは Gemma-3 スタイルのアテンションを採用しており、グローバルレイヤーごとに 5 つのローカルレイヤー、512 トークンのスライディングウィンドウ、そして 8 つの KV ヘッドを持つ Grouped-Query Attention(GQA)を備えています。トークナイザーである o200k_base は約 200,000 トークンの語彙をサポートし、処理能力をさらに高めています。

MAI-Thinking-1 は Microsoft の Maia 200 シリコンと共同開発され、標準的なハードウェア構成と比較してワットあたりのパフォーマンスを 1.4 倍向上させています。トレーニングには 8,000 基の NVIDIA GB200 GPU が使用され、高品質な計算リソースへのアクセスを通じてモデルの堅牢なパフォーマンスを確保しています[6]

トレーニングソースとデータの互換性

このモデルは、クリーンで商用ライセンス済みの、人間が生成したコンテンツ合計 33.55 兆トークンでトレーニングされました。これには、主要な事前トレーニング段階の 30 兆トークンと、中間トレーニング時の追加 3.55 兆トークンが含まれます[6]。このデータセットは、ウェブテキスト、公開されている GitHub コード、書籍、学術論文、ニュース、多言語コンテンツ、特定ドメイン向けに調整された資料など、幅広いソースを網羅しています。

「MAI-Thinking-1 は、入念に調達された商用ライセンス済みデータ 33.55 兆トークンを用いてゼロからトレーニングされ、完全に監査可能なトレーニングパイプラインを保証しています。」

この透明性のあるデータ調達により、知的財産の安全性と規制遵守が重要となるヘルスケア、金融、法務などの業界にとって、このモデルは信頼できる選択肢となっています[4]

API と統合機能

MAI-Thinking-1 は Chat Completions API とシームレスに統合され、OpenAI スタイルのワークフローと互換性があります。また、関数呼び出しや階層化された開発者向け指示などの高度な機能もサポートしており、動画生成やエンタープライズレベルのアプリケーションを含む複雑なマルチモーダルタスクに適しています。

機能スペック
アーキテクチャスパース MoE / デコーダ専用 Transformer
アクティブパラメータ350 億
合計パラメータ約 1 兆
コンテキストウィンドウ256,000 トークン(約 600 ページ)
トレーニングデータ33.55 兆トークン(クリーン、人間生成、ライセンス済み)
API 互換性Chat Completions API、関数呼び出し、開発者向け指示
トークナイザーo200k_base(語彙約 20 万)
主要シリコンMicrosoft Maia 200

主要なパフォーマンスと機能データ

MAI-Thinking-1: 主要スペックとベンチマークパフォーマンスの一覧
MAI-Thinking-1: 主要スペックとベンチマークパフォーマンスの一覧

MAI-Thinking-1 は、数学、コーディング、科学的推論といった重要な分野で測定可能な成果を提供します。これらの指標は、エンタープライズのニーズに合致した標準化された問題セットにおけるパフォーマンスを反映しています。

推論とワークフローの最適化

256,000 トークンのコンテキストウィンドウにより、MAI-Thinking-1 は複雑な複数ステップのワークフローを扱うことができます。これには、長大な契約書の分析、詳細なエージェントトレースの処理、複雑な研究文書のレビューといったタスクが含まれ、すべて単一のパスで実行できます。そのスパース Mixture-of-Experts(MoE)アーキテクチャは、計算需要を比例的に増加させることなくスケーラビリティを確保するため、大量処理タスクのコストを低く抑えることができます。

たとえば、2026 年 6 月に Microsoft は、自動化された Excel タスク向けにファインチューニングされた MAI モデルを披露しました。このモデルは、公開ベンチマークとプライベートベンチマークの両方で GPT-5.4 と同等のパフォーマンスを達成しました[6]

「MAI-Thinking-1 は、エンタープライズが大規模に実行するワークロード向けに特別に構築されています……大量で常時稼働の AI ワークロードを経済的に実現可能にする価格対性能のポイントで提供します。」 - Naomi Moneypenny、Microsoft [3]

これらの推論能力により、高度なコードおよび数学的パフォーマンスを必要とするタスクにおける有力な候補となっています。

コードと数学のパフォーマンス

MAI-Thinking-1 は、そのカテゴリーで最高クラスのベンチマークスコアをいくつか達成しています。注目すべき結果は以下のとおりです:

  • AIME 2025 で 97.0%
  • AIME 2026 で 94.5%
  • SWE-Bench Pro で 52.8%
  • SWE-Bench Verified で 73.5%
  • GPQA Diamond で 84.2%
  • LiveCodeBench v6 で 87.7% [6]

これらのスコアは、決定論的な環境でモデルをトレーニングするという Microsoft の重視姿勢を反映しており、そのパフォーマンスが信頼性が高く操縦可能であることを保証しています。このような一貫性により、要求の厳しいエンタープライズアプリケーションに最適です。

エンタープライズ導入の特性

MAI-Thinking-1 は、スケーラビリティとデータの安全性を中核に据えて設計されています。独自の高品質なデータのみで構築されているため、監査可能性と知的財産(IP)保護を確保しており、これはヘルスケア、金融、法務などの規制業界において特に重要です。2026 年 6 月、Microsoft は Mayo Clinic と提携し、MAI フレームワークを用いて、リスクの高い臨床推論向けに調整された専門の臨床モデルを開発しました[6]

機能スペックエンタープライズへのメリット
アクティブパラメータ350 億(MoE)推論コストを抑えつつ高パフォーマンスを実現
コンテキストウィンドウ256,000 トークンチャンク分割なしで 600 ページ超の文書を処理
AIME 2025 スコア97.0%卓越した数学的推論
SWE-Bench Pro スコア52.8%信頼性が高く本番品質のコード生成
GPQA Diamond スコア84.2%高度な科学的・技術的推論
データ基準クリーン、商用ライセンス済み機密性の高い業界向けに IP の安全性を確保
カスタマイズFrontier Tuning / RLEsユーザー所有のチェックポイントとワークフローを実現

この堅牢なパフォーマンスは、高度なマルチモーダルモデルを含むマルチモーダル統合と組み合わさり、動画生成や API 最適化といったアプリケーションをサポートします。

エンタープライズは、Reinforcement Learning Environments(RLEs)を用いて MAI-Thinking-1 をさらにカスタマイズできます。Microsoft は 2026 年 6 月に、McKinsey の特定のニーズに合わせてモデルをチューニングした結果、GPT-5.5 よりも高い品質を、10 分の 1 のコストで運用しながら実現したと報告しました[6]

トレーニングパイプラインとデータ要件

トレーニングパイプラインの概要

MAI-Thinking-1 は継続的に進化するように構築されており、これはデータ、計算能力、報酬シグナルといったすべての要素を時間をかけて洗練・最適化できる、入念に設計されたパイプラインのおかげです[2][6]

「目標は、より優れたデータ、より強力な報酬、より高性能な環境、そしてより多くの計算リソースを吸収できる、再現可能なシステムです。」 - Microsoft AI [2]

このプロセスは、多段階のトークントレーニングアプローチを通じて作成される MAI-Base-1 から始まります[6][7]。そこから、Microsoft は 3 つの専門モデルを並行して開発します。これらは以下に焦点を当てています:

  • STEM および競技レベルのコーディング。
  • エージェント型コーディングとツール活用。
  • 有用性と安全性。

これらのモデルはその後、教師あり学習を用いて統合されます。最終ステップでは、強化学習(RL)を用いて統合モデルをファインチューニングし、MAI-Thinking-1 が完成します。トレーニングプロセス全体は、Microsoft が運用する Azure クラスター上で稼働する 8,000 基の NVIDIA GB200 GPU によって支えられました[6]

Microsoft はモデル開発に対して独自の立場をとっています。すなわち、知能は継承されるのではなく学習によって構築されるという考え方です。サードパーティのモデルから知識を蒸留するのではなく、MAI-Thinking-1 は推論能力を独自に発達させるようにトレーニングされています[2][7]

「能力は継承されるのではなく学習されるべきです。継承された知能は習得が速いものの、実世界での利用に不可欠な操縦可能性を欠いています。」 - Microsoft AI [2]

この基礎的なアプローチにより、システムは能力が高いだけでなく実世界のアプリケーションにも適応可能となり、厳格なデータガバナンスと統合のための土台を築いています。

データ品質とガバナンス基準

トレーニングデータは入念にキュレーションされており、人間が書いた商用ライセンス済みのコンテンツのみで構成されています[2][6]。これによりクリーンなデータの来歴が確保され、規制遵守が追跡可能で監査可能なデータに依存するヘルスケアや金融などの業界にとって極めて重要です[2][5]

整合性を維持するため、Microsoft はトレーニング中に標準的な機械学習ベンチマークの使用を避けています。これにより、モデルがテストデータを記憶するのを防ぎ、ベンチマークスコアが丸暗記ではなく真の推論を反映するようにしています[6]

「モデルを形作ったものを説明できなければ、その挙動を完全に理解することも、信頼できる形で改善することもできません。」 - Microsoft AI Superintelligence Team [2]

マルチモーダルデータの統合

トレーニングプロセスは従来のテキストデータの枠を超え、多様なマルチモーダル形式を取り込むことで、実用的なシナリオにおける関連性を高めています。コーパスには、ウェブテキスト、公開 GitHub コード、書籍、学術論文、ニュース記事、多言語コンテンツが含まれます[6]。コーディングおよびエージェント型タスクについては、Microsoft はデータを検証するために決定論的で実行可能な環境を採用しています[2][6]

テキストとコードに加えて、MAI モデルは音声データと視覚データも統合します。たとえば:

  • MAI-Transcribe-1.5 は高度なエンティティ認識を用いて、ドメイン固有の語彙を高精度で処理します。
  • MAI-Voice-2 は一貫した音声出力のためのアイデンティティ保持機能を備えています[3]
  • MAI-Image-2.5 は、ブランドとキャラクターの一貫性を保ちながら精密な画像から画像への編集を可能にします[3]

このマルチモーダル統合により、MAI-Thinking-1 はテキスト生成から複雑な視覚・音声タスクまで幅広いアプリケーションに対応でき、実世界のニーズに応える十分な汎用性を確保しています。

APIMart での API 統合要件

APIMart

このセクションでは、高度なマルチモーダルワークフロー向けに設計された MAI-Thinking-1 にアクセスするために、APIMart の API と統合する手順を説明します。

API アクセスのセットアップ

MAI-Thinking-1 にアクセスするには、APIMart の OpenAI 互換ゲートウェイを使用します。まず、OpenAI SDK(Python または Node.js)をエンドポイントに向けるように設定します:

https://api.apimart.ai/v1

OpenAI API キーを APIMart API キーに置き換えてください。モデル識別子として "mai-thinking-1" を指定するようにしてください。

認証には、リクエストヘッダーで Bearer トークンを使用します:

Authorization: Bearer YOUR_API_KEY

API キーは、環境変数またはシークレットマネージャーのいずれかに安全に保管することが不可欠です。現在、アクセスはプライベートプレビューに限定されていることに注意してください。本番環境へのアクセスは Microsoft Foundry を通じてリクエストできます[2][3]

関数呼び出しと開発者ツール

MAI-Thinking-1 は、標準的なチャット補完の枠を超え、機能を強化するランタイムツールを提供します。統合プロセスは簡単です:

  1. モデルが入力を処理し、ツール呼び出しリクエストを識別します。
  2. クライアントがツール呼び出しを実行し、その結果をモデルに送り返します。
  3. モデルはその結果を用いて最終的なレスポンスを生成します[8]

サポートされているツールとそのユースケースの内訳は以下のとおりです:

ツールタイプ説明ユースケース例
関数呼び出しJSON Schema を介してカスタム関数を実行データベースクエリやビジネスロジックをトリガー
Web 検索インターネットからリアルタイムデータを取得株価や技術文書を取得
ファイル検索アップロードされた文書内を検索社内マニュアルやコンプライアンスファイルを分析
リモート MCPModel Context Protocol サービスに接続保護されたデータやドメイン固有のモデルにアクセス

これらのツールにより、開発者は幅広いアプリケーション向けにモデルの機能を拡張できます。

運用上の前提条件

MAI-Thinking-1 との統合を最適化するには、以下の運用要件が満たされていることを確認してください:

  • 256,000 トークンのコンテキストウィンドウのサポート。これには、大規模なインコンテキストデータセットを扱うための効率的なメモリおよびレイテンシ管理が必要です[2]
  • 主要なエラーコードの適切な処理:
    • 401: 認証失敗
    • 402: 残高不足
    • 429: レート制限超過

技術要件の簡単な概要は以下のとおりです:

要件詳細
モデル識別子mai-thinking-1
認証方式Bearer トークン
コンテキストウィンドウ256,000 トークン
アーキテクチャスパース Mixture-of-Experts(350 億アクティブ / 1 兆合計パラメータ)
API 互換性OpenAI Chat Completions

実践的な導入の制約

現在の導入状況

2026 年 6 月時点で、MAI-Thinking-1 は Microsoft Foundry 上の_プライベートプレビュー_を通じてのみ利用可能です。アクセスには Foundry ポータル経由でのリクエスト送信が必要です。より広範なパブリックプレビューは MAI Playground 上で「まもなく」提供される見込みで、一般提供は世界中の複数の Foundry リージョンへ段階的に拡大されていきます[1][2]。この段階的な展開は、複雑なマルチモーダル AI ワークフローを扱う上でのこのモデルの重要性を示しています。

この段階での大きな制約の 1 つは、トークンあたりの価格が公開されていないことです。これにより、チームが統合のための予算を正確に立てることが難しくなっています。ただし、参考までに、Foundry 上の MAI シリーズの他のモデルは、100 万入力トークンあたり 5 ドル(MAI-Image-2.5)、1 時間あたり 0.36 ドル(MAI-Transcribe-1.5)という価格設定で、価格構造の一般的な目安を提供しています[3]

推論とパフォーマンスのトレードオフ

MAI-Thinking-1 は_スパース Mixture-of-Experts_ アーキテクチャを採用しており、推論パス中に約 1 兆の合計パラメータのうち 350 億のみを活性化します。この設計は、計算コストの削減と高度な推論能力の維持のバランスを取っています:

「MAI-Thinking-1 は、エンタープライズが大規模に実行するワークロード向けに特別に構築されています……大量で常時稼働の AI ワークロードを経済的に実現可能にする価格対性能のポイントで提供します。」 [3]

とはいえ、このモデルはテキストおよび推論タスクに限定されています。視覚ベースのタスクやマルチモーダル文書理解はサポートしていません。画像分析や視覚的な文書解析を必要とするワークフローには、追加のモデルが必要になります。これらの制約は、業界や具体的なユースケースに応じて、導入戦略を大きく左右する可能性があります。

業界固有のユースケース

これらの制約は、このモデルがさまざまな業界でどのように適用されるかに直接影響します。たとえば、Mayo Clinic は Microsoft と協力し、MAI-Thinking-1 を臨床および研究のワークフローに統合しました。この提携は、ヘルスケアのような規制業界において、アクセス制御と信頼性要件が極めて重要な役割を果たすことを示しています[6][9]

総じて、MAI-Thinking-1 は、法務分析、財務モデリング、医療研究、エンタープライズソフトウェア開発といった分野における大量の推論タスクに最も適しています。これらの分野はスケーラブルでコスト効率の高いインテリジェンスソリューションを必要としており、このモデルのテキスト中心のアーキテクチャと制御されたアクセス可能性の組み合わせは、これらの業界のコンプライアンスおよび運用上のニーズによく合致しています。

結論と要点

MAI-Thinking-1 は、強力なアーキテクチャとスムーズな統合により際立っており、マルチモーダルアプリケーションにとって最適な選択肢となっています。推論タスクにおけるそのパフォーマンスは高い基準を打ち立て、効率性と優れたベンチマーク結果を兼ね備えています。クリーンで商用ライセンス済みのトレーニングデータと蒸留なしのアプローチの採用により、特にデータの透明性と来歴が重要となるヘルスケア、法務、金融などの業界において明確な優位性を持っています。

開発者は APIMart を通じて MAI-Thinking-1 に簡単にアクセスできます。APIMart は、MAI-Image-2.5、Sora 2Kling V3 を含む 500 を超える AI モデルに対応した統合エンドポイントを提供します。このセットアップは、マルチモーダルパイプラインの構築を簡素化します。たとえば、推論には MAI-Thinking-1、視覚タスクには MAI-Image-2.5、動画出力には Sora 2 または Kling V3 を使用するといった具合です。これらすべては、信頼性の高い 99.9% の稼働率 SLA に支えられています。

コストとパフォーマンスを最適化するため、エンタープライズは、複雑な推論タスクを MAI-Thinking-1 に割り当て、より単純なタスクを軽量なモデルに委任する階層型ルーティングを実装できます。需要が高まる前にシステムをテスト、洗練、スケールする時間を確保できるため、早期の統合が推奨されます。MAI-Thinking-1 を採用することで、組織はさまざまな分野で運用効率を引き出しながら、卓越した技術的パフォーマンスを実現できます。

よくある質問

256,000 トークンのコンテキストウィンドウは何に使うべきですか?

256,000 トークンのコンテキストウィンドウは、大量のデータの処理を伴うタスクの処理に最適です。たとえば、最大 600 ページに及ぶ膨大な文書をレビューしたり、複雑なコーディングワークフローを難なく処理したりできます。この機能は、コードリポジトリ全体を分析してエラーを発見したり、バグを解決したり、複雑で階層化された指示を実行したりといった、エンタープライズレベルの業務に特に役立ちます。

また、非同期で大量処理のシナリオでも力を発揮します。アーキテクチャの一貫性を評価したり、広範なデータセットのパターンを特定したりといったタスクは、特に即時のレスポンスが必要でない場合に、はるかに扱いやすくなります。

MAI-Thinking-1 がプライベートプレビューの場合、どうすればアクセスできますか?

プライベートプレビュー期間中に MAI-Thinking-1 を試すには、Azure AI Foundry の公式関心フォームを通じて早期アクセスリクエストを送信する必要があります。また、BasetenFireworks AIOpen Router などのプラットフォームでモデルをテストすることもできます。Azure AI Foundry のモデルカードまたはカタログ内の登録リンクを探してください。一般提供と価格の詳細は、プレビュー段階の後に共有されます。

OpenAI SDK から MAI-Thinking-1 を呼び出すには何を変更する必要がありますか?

OpenAI SDK で MAI-Thinking-1 を使用するには、クライアント設定とリクエスト構造の両方を調整する必要があります。手順は以下のとおりです:

  • MAI-Thinking-1 専用の API ベース URL を使用します。
  • モデルパラメータを mai-thinking-1 に設定します。
  • ステップバイステップの推論を導くように設計されたシステムプロンプトを含めます。
  • 推論の労力を制御するために extra_body パラメータを調整します。これは計算時間と関連コストの両方に影響することに留意してください。

最良の結果を得るには、推論スタイルの出力を適切に処理できるように統合を整えておくようにしてください。

関連ブログ記事

次は試してみましょう

モデルマーケットで使いたいモデルを選ぶ

APIMart のモデルマーケットでチャット、画像、動画モデルを試し、統一 API でモデルの能力をすばやく体験できます。

チャットモデル画像モデル動画モデル
モデルマーケットを見る