
AI API 料金比較:従量課金モデル完全ガイド
2026 年の従量課金型 AI API 料金を比較。APIMart、OpenAI、Google Cloud、Amazon Bedrock のトークン単価、ボリューム割引、コスト削減戦略を解説します。
2026 年のベスト AI API 料金プランをお探しですか? ここでは押さえておくべきポイントをご紹介します。
従量課金(PAYG)モデルはトークン使用量に応じて課金されるため、あらゆる規模の企業にとって柔軟に利用できる仕組みです。過去 2 年でトークン価格は 80% 下落し、APIMart、OpenAI、Google Cloud AI、Amazon AI Services といった各プロバイダーが競争力のある選択肢を提供しています。ただし、同じタスクであっても料金は最大 625 倍 もの差が生じることがあります。
主なポイント:
- APIMart: 500 以上のモデルにアクセスでき、公式料金より 20% 安く利用できます。多様なニーズと請求の一元化に最適です。
- OpenAI: prompt caching などの高度なツールや機能を備えていますが、上位モデルは高額になりがちです。
- Google Cloud AI: 業界最大級のコンテキストウィンドウ(最大 200 万トークン)と multimodal 機能を提供します。
- Amazon AI Services: 低い初期コストと AWS との深い統合が魅力ですが、Bedrock の統一 API ではわずかなマークアップが発生します。
ヒント: 高ボリュームのタスクには低コストのモデルを使い、上位モデルは重要なユースケースに限定して活用しましょう。バッチ処理や prompt caching のような戦略を活用すれば、コストを 50〜90% 削減できます。
ここからは、各プロバイダーの料金、機能、割引を詳しく見ていきます。
AI モデル API 料金比較:Claude、Kimi、GPT-4o ほか
1. APIMart

APIMart は、1 本の API key、1 通の請求書、1 つのダッシュボードだけで 500 を超える AI モデルへのアクセスを簡素化します。
ユニット単価
APIMart は従量課金モデルを採用しており、月額の最低料金や隠れた手数料はありません。以下のサンプル料金は、公式料金と比較して一貫して 20% の節約となっていることを示しています [7]:
| モデル | APIMart 価格 | 公式価格 | 節約率 |
|---|---|---|---|
| Wan 2.7 Image | $0.0216/call | $0.027/call | 20% |
| GPT Image 2 | $0.006/call | $0.0075/call | 20% |
| Imagen 4.0 | $0.04/call | $0.05/call | 20% |
| Qwen Image 2.0 | $0.02/1K tokens | $0.025/1K tokens | 20% |
| Z Image Turbo | $0.01/call | $0.0125/call | 20% |
コスト削減に加えて、APIMart はさまざまな AI 機能をカバーする幅広いモデルを提供しています。
モデルの多様性とモダリティ
APIMart のカタログには、チャット、画像生成、動画生成、編集に対応するモデルが揃っており、いずれも単一のエンドポイントから利用できます。動画では Sora 2($0.08/sec)、Veo 3、Kling V3(720p で $0.0672/sec)といった選択肢が用意されています。画像と言語の領域では、Flux.1、Imagen 4.0、GPT-5、Claude Sonnet 4.5 などが利用可能です。これにより、各タスクに最適なモデルを選び、複数ベンダーを管理する手間なくテキスト・画像・動画にまたがるワークフローを構築できます。
ボリューム割引と拡張性
使用量が増えると、自動的にボリューム割引が適用されます。APIMart は「Discount Bundles」も提供しており、複数のモデルタイプを同一アカウントで利用するチームに恩恵をもたらします。例えば、推論タスクに GPT-5、画像生成に Flux.1 を組み合わせることで、より上位の割引ティアに到達できます。統一されたダッシュボードでは、すべてのモデルファミリーにわたるリアルタイムの使用量とクォータを把握でき、スケール時のコスト管理や予測がより簡単になります [7]。
こうしたコスト面のメリットは、シンプルな統合と手厚いサポート体制と相まって強みを発揮します。
統合とサポート機能
APIMart のセットアップは迅速かつシンプルで、わずか 3 分で完了します。API key を発行し、ベース URL を更新するだけで利用を開始できます [7]。すでに OpenAI SDK を使っている場合は、1 行のコード変更だけで済みます。本プラットフォームは OpenAI と完全互換で、Python と JavaScript の SDK をサポートし、ストリーミング、function calling、ビジョン、multimodal 入力にも対応します。GPT-5 と Claude Sonnet 4.5 のようにモデルを切り替える際も、コード変更なしでシームレスに行えます [8]。
サポートはチャット経由で人間のエンジニアが対応し、320 件のレビューで 4.6/5 の評価を獲得しています。ユーザーは特に、シングル key 統合と低レイテンシを際立った特徴として高く評価しています [9]。
2. OpenAI API

OpenAI はトークンベースの従量課金モデルを採用しており、100 万(1M)トークンあたりの処理量で料金が計算されます。料金はモデルによって大きく異なり、例えば GPT‑5 nano は入力 1M トークンあたり $0.05 から、GPT‑5.5 Pro は入力 1M トークンあたり最大 $30.00 と、実に 600 倍もの差があります [11]。以下にモデル別の料金を詳しく見ていきます。
ユニット単価
コストは選択するモデルティアに大きく依存します。料金の詳細は次のとおりです:
| モデル | 入力(1M トークンあたり) | キャッシュ入力 | 出力(1M トークンあたり) |
|---|---|---|---|
| GPT‑5.5 Pro (Reasoning) | $30.00 | – | $180.00 |
| GPT‑5.5 (Standard Edition) | $5.00 | $0.50 | $30.00 |
| GPT‑5.4 | $2.50 | $0.25 | $15.00 |
| GPT‑5.4 mini | $0.75 | $0.075 | $4.50 |
| GPT‑5.4 nano | $0.20 | $0.02 | $1.25 |
| GPT‑5 nano | $0.05 | $0.005 | $0.40 |
テキスト以外のワークロードは別途課金されます。例えば、Sora‑2 動画処理は 720p で 1 秒あたり $0.10、1080p で 1 秒あたり $0.70 です。音声向け Realtime API は入力 1M トークンあたり $32.00、出力 1M トークンあたり $64.00 です [10]。
モデルの多様性とモダリティ
OpenAI はテキスト、ビジョン、音声、動画、ウェブ検索、コード実行など幅広いタスクに対応しています。Realtime API ではライブの音声合成や翻訳サービスを提供しており、翻訳は 1 分あたり $0.034、文字起こしは 1 分あたり $0.017 です。ウェブ検索は 1,000 回あたり $10.00、ホスト型コード実行("Containers")は 20 分セッションごとにメモリ使用量に応じて $0.03〜$1.92 が課金されます [10]。
ボリューム割引と拡張性
コスト管理を支援するため、OpenAI はいくつかの節約オプションを提供しています:
- Batch API: 24 時間以内に非同期で処理できるタスクについて、入出力コストを 50% 削減します。バッチ処理に最適です。
- Flex Tier: 応答時間が多少遅れても問題ないリアルタイムリクエスト向けに 50% の割引を提供します。
- Priority Processing: 標準料金より 150% 高くなりますが、より高速で安定したスループットを保証します。例えば、GPT‑5.5 の priority レートは入力 1M トークンあたり $12.50 で、標準の $5.00 と比較されます。
「Priority processing は、ピーク需要時においても Standard processing サービスより高速かつ安定した速度でトークンを生成します。」 - OpenAI [14]
自動 prompt caching を活用することで入力コストをさらに最大 90% 削減でき、繰り返しの多いタスクや長いコンテキストを扱うタスクに最適です [14]。
統合とサポート機能
OpenAI はシームレスな統合を実現する充実したツール群を提供しています。これには標準 SDK、Agents SDK、CLI が含まれ、いずれも WebRTC、WebSocket、SIP 接続に対応してリアルタイムアプリケーションを構築できます [12]。開発者は Chat Completions API の service_tier パラメータを "priority"、"auto"、"default" に設定することで処理速度を調整できます [15]。
チームがコストを監視・管理しやすいよう、Usage Dashboard ではサービスティアや明細ごとの支出を詳細に把握できます。特定のデータレジデンシー要件があるユーザー向けには、リージョン別の処理エンドポイントも用意されていますが、こちらは 10% の値上げが適用されます [13]。
3. Google Cloud AI API

Google Cloud の AI 料金体系は OpenAI と同様に従量課金のトークン単位ですが、モデルラインアップやコスト構造は独自のものです。Google は Gemini モデルを 2 つのティアに分類しています:速度とコスト効率を重視する 「Flash」 と、より複雑な推論向けに設計された 「Pro」 です。この構成により、開発者は予算制約に合わせてモデル機能を選択できます。
ユニット単価
料金はモデルによって大きく異なります。例えば、Gemini 3 4B は最も安価で、入力 1M トークンあたり $0.04 ですが、Gemini 3.1 Pro は 200,000 トークン未満のプロンプトで入力 1M トークンあたり $2.00、それを超えると $4.00 に上昇します [17]。出力トークンは一般的に入力トークンの 4〜10 倍のコストになります [17]。
| モデル | 入力(1M トークンあたり) | 出力(1M トークンあたり) | コンテキストウィンドウ |
|---|---|---|---|
| Gemini 3.1 Pro (Preview) | $2.00 | $12.00 | 1M〜2M tokens |
| Gemini 2.5 Pro | $1.25 | $10.00 | 2M tokens |
| Gemini 3 Flash (Preview) | $0.50 | $3.00 | 1M tokens |
| Gemini 2.5 Flash | $0.30 | $2.50 | 1M tokens |
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 | 1M tokens |
| Gemini 2.5 Flash-Lite / 2.0 Flash | $0.10 | $0.40 | 1M tokens |
| Gemini 3 4B | $0.04 | $0.08 | 131K tokens |
画像・動画生成では、Imagen 4.0 は画質に応じて 1 枚あたり $0.02〜$0.06、Veo 3.1 の動画生成は通常処理で 1 秒あたり $0.40、preview モードで 1 秒あたり $0.15 です [16]。
モデルの多様性とモダリティ
Google のモデルは、テキスト、画像、動画、音声、コードといった広範なタスクをカバーします。これにより、文字起こしなどの外部ツールが不要になります [20]。特筆すべき特徴は Gemini 2.5 Pro と Gemini 3.1 Pro モデルで利用できる 200 万トークンのコンテキストウィンドウ で、業界でも他を圧倒する容量を提供します [16][3]。ただし、音声入力はテキストよりも料金が高く設定されています。例えば、Gemini 3.1 Flash-Lite はテキストが 1M トークンあたり $0.25 に対し、音声は 1M トークンあたり $0.50 です [17]。加えて、新しい推論モデルは「thinking tokens」を使用するため、複雑な出力ではコストが増加します [17][19]。
ボリューム割引と拡張性
Google Cloud は企業向けにさまざまなコスト削減オプションを提供しています。Batch API は 24 時間以内に非同期で処理されるタスクの入出力コストを 50% 削減します [17][19]。例えば、Gemini 3.1 Pro の入力コストはバッチモードで 1M トークンあたり $2.00 から $1.00 へ低下します。もう一つの特徴である context caching では、頻繁に使用されるプロンプトやドキュメントを 1 時間あたり 1M トークンあたり $1.00 で保存し、RAG パイプラインや長時間チャットセッションのような反復タスクのコストを削減できます [17]。複数のプロバイダーをまたぐスマートルーティングを実装することで、開発者はコストをさらに最適化できます。
さらに Google は 支出ベースのスループット制度 を運用しており、30 日間で $2,000 を超える支出 がある組織には、より高いレート制限が自動的に解放されます [18]。大規模運用向けには、保証された容量とカスタム価格を提供する Enterprise tier が用意されています [17]。
統合とサポート機能
Google Cloud のツールはシームレスな統合と拡張性を念頭に設計されています。API は Vertex AI を通じて Google Workspace、Drive、モバイルプラットフォームとネイティブに連携します [20][19]。注目すべき機能の一つに Grounding with Google Search があり、モデルの応答をリアルタイムデータで補強します。この機能は Gemini 3 モデルで月 5,000 プロンプトまで無料で、それ以降は 1,000 クエリあたり $14 で課金されます [17]。
その他、Function Calling、Streaming、Code Execution などの組み込みツールも用意されています。ただし、プライバシーポリシーはティアによって異なります。無料ティア(Google AI Studio) では、送信したデータが製品開発に使われる場合があります。一方、有料ティアと Enterprise ティアでは、データがこうした目的で使用されないことが保証されており、機密情報を扱うチームにとって重要な検討事項です [17][3]。
4. Amazon AI Services
Amazon の AI 製品は主に 2 つのプラットフォームに分かれています:マネージド API を通じて基盤モデルへのアクセスを提供する Amazon Bedrock と、カスタムモデルの作成・デプロイ向けに設計された Amazon SageMaker です。どちらも従量課金モデルを採用していますが、その構造は利用規約に応じて異なります。他の競合と同様、Amazon もさまざまなビジネス要件に応える柔軟な利用量ベースの料金プランとティアオプションを提供しています。
ユニット単価
Amazon Bedrock の料金は 4 つのティアに整理されています:Standard(オンデマンド)、Flex(応答時間が長いがコストは低い)、Priority(高速だが高額)、Batch(非同期処理)です。以下は Amazon Nova 2 Lite モデルのコスト内訳です:
| ティア | 入力(1M トークンあたり) | 出力(1M トークンあたり) |
|---|---|---|
| Standard | $0.30 | $2.50 |
| Priority | $0.525 | $4.375 |
| Flex | $0.15 | $1.25 |
| Batch | $0.15 | $1.25 |
Nova モデルファミリーは幅広い料金オプションを提供します。例えば、Nova Micro は入力 1M トークンあたり $0.035 からスタートし、Nova Premier は入力 1M トークンあたり $2.50 です。サードパーティモデルはより高額で、例えば Claude 4.7 Opus は入力 1M トークンあたり $5.00、出力 1M トークンあたり $25.00 です [22]。
モデルの多様性とモダリティ
Amazon Nova モデルは画像、動画、音声、embeddings など、複数のコンテンツタイプに対応しています。期待できる内容は次のとおりです:
- Nova Canvas: 画像生成は 1 枚あたり $0.04〜$0.06 です。
- Nova Reel: 動画生成は 1 秒あたり $0.08(720p/24fps)です。
- Nova Sonic: 音声処理は 1M 入力トークンあたり $3.00〜$3.40 です [22]。
さらに、Nova モデル向けのウェブ grounding は 1,000 リクエストあたり一律 $30.00 で利用できます [22]。
ボリューム割引と拡張性
Amazon は予測可能または大規模な要件を持つ企業向けに、大幅なコスト削減オプションを提供しています:
- Batch inference は標準オンデマンド料金と比較してコストを 50% 削減します [22]。
- Machine Learning Savings Plans では、SageMaker ユーザーが 1 年または 3 年プランにコミットすることで最大 64% の節約 が可能です [23]。
- Managed Spot Training は未使用の AWS 容量を活用し、計算コストを最大 90% まで削減できます [23]。
AWS は次のように説明しています:
「従量課金モデルなら、予測ではなく需要に応じてビジネスを適応させ、オーバープロビジョニングや容量不足のリスクを抑えられます。」 [21]
統合とサポート機能
Amazon Bedrock は Anthropic、Meta、Cohere、AI21 Labs、DeepSeek、Amazon の Nova ファミリーなどのプロバイダー提供の基盤モデルへのアクセスを簡素化します。統一 API により、既存の統合に大きな変更を加えずに機能をシームレスに切り替えたり組み合わせたりできます [24][25]。Bedrock は Amazon S3、AWS Lambda、SageMaker とネイティブに連携し、安全性のための Amazon Bedrock Guardrails や人間によるレビューを伴うワークフロー向けの Amazon Augmented AI (A2I) などの機能も含みます [26]。
信頼性をさらに高めるため、AWS は推論リクエストを最適なリージョンに自動でルーティングし、データがパブリックインターネットを通過しないようにします [25]。
プロバイダー別メリット・デメリット

各プロバイダーは、ワークロードのサイズや技術的要件に合わせて料金と機能を調整しています。ここでは主要プレイヤーの強みと弱みを簡潔に見ていきましょう。
APIMart は、500 を超えるモデルを単一の統一 API で提供することで、API 管理を簡素化します。これにより、複数の請求アカウントを扱う煩雑さがなくなります。ただし、個々のモデルプロバイダーと直接契約する場合と比べると、アグリゲーターレイヤーのぶんわずかにコストが増える可能性があります。大規模プロジェクトであれば、このようなコスト管理のシンプル化は大きなメリットとなります。
OpenAI は成熟した開発者エコシステムと堅牢な prompt caching システムを備えており、キャッシュされた入力のコストを最大 50% 削減できます。とはいえ、上位モデルは高額で、推論モデル(o シリーズなど)には隠れたコストがあります。reasoning tokens は最終出力に表示されなくても、出力レートで全額課金されるためです [1][5]。
「プロンプト設計、モデル選択、コンテキスト長のちょっとした変更で、月額請求は 10 倍も変動し得ます。」 - Lyne Carolyne, CloudZero [5]
Google Cloud AI は最大 200 万トークンという最大級のコンテキストウィンドウと強力な multimodal 機能を提供します。無料ティアは魅力的ですが、トレードオフがあります。送信したデータがモデルトレーニングに使用される可能性があり、プライバシーを重視するユーザーには懸念点となるでしょう [3]。加えて、Gemini 3.1 Pro のようなモデルではティア型の料金が採用されており、プロンプトが 200,000 トークンを超えると入力レートが 2 倍になります [5]。
Amazon AI Services (Bedrock) は、すでに AWS を利用しているチームに最適です。Nova Micro モデルは入力 1M トークンあたり $0.035 という業界最低水準のエントリーポイントを提供し、緊急性の低いワークロードでは batch inference によりコストを 50% 削減できます [2]。ただし、Amazon Bedrock の統一 API を使うと、基盤となるモデルプロバイダーの直接料金と比べて通常 10〜20% のマークアップが上乗せされます [5]。
主なトレードオフを以下に簡単に比較します:
| プロバイダー | 主な強み | 主な弱み | 最適な用途 |
|---|---|---|---|
| APIMart | 1 つの API で 500 以上のモデルにアクセス、multi-modal 対応 | アグリゲーターレイヤーで若干のコスト増 | 複数の請求アカウントを管理せず、多様なモデルアクセスを必要とするチーム |
| OpenAI | 成熟したエコシステム、prompt caching、Batch API | フラッグシップ/推論モデルが高額、隠れた thinking tokens | 複雑なコーディング、多段階の推論、本番アプリ |
| Google Cloud AI | 業界最大級のコンテキストウィンドウ(2M トークン)、multimodal | 無料ティアでは送信データがモデルトレーニングに使われる可能性、200K トークン超で段階課金 | 長文ドキュメント解析、動画/音声ワークロード |
| Amazon Bedrock | AWS との深い統合、超低価格のエントリーポイント | 直接料金より 10〜20% のマークアップ、料金透明性がやや低い | 既存の AWS インフラ内で行う大量・低複雑度のタスク |
これらのトレードオフからもわかるように、各プロバイダーは特定の技術ニーズや予算と相性が異なります。出力量の多いアプリケーションでは、出力トークンが入力トークンの 3〜10 倍のコストになることを踏まえると、バッチ処理や prompt caching といった戦略は特にコスト効率を高めます [4][6]。
まとめ
最適な AI API プロバイダーの選定は、自分たちのニーズに最も適したツールを見極めることに尽きます。AI API の価格は過去 2 年で約 10 倍下落(2026 年初頭時点)しましたが [2]、同じタスクであっても最安と最高額のオプションには最大 625 倍 の差が残ります [4]。そのため、プロバイダーの選択は米国の開発チームにとって極めて重要な意思決定となります。
実践的なアプローチは、分類やデータ抽出のような高ボリュームで低複雑度のタスクには低コストモデルを使い、ミッションクリティカルなタスクには高額なフラッグシップモデルを残しておくことです。このような スマートモデルルーティング を導入すれば、品質を犠牲にすることなくコストを 60〜80% 削減 できます [28]。コスト削減だけでなく、特に統合プラットフォームを利用する場合は、複数の API アカウントを管理する手間が減り、運用も簡素化されます。
もう一つの重要な要素が運用効率です。複数のプロバイダーを管理すると、相当なオーバーヘッドが発生します。APIMart のようなプラットフォームは、単一の API と請求システムで 500 以上のモデルへのアクセスを提供することでこの課題に対応しています。このトレードオフは、直接プロバイダーと契約してわずかなコストを絞り出すよりも、スピードとシンプルさを優先するアプローチです。
「統合の価値はコストだけではありません。インフラに費やされずに済むエンジニアリングの時間こそが、製品開発に振り向けられるのです。」 - Louis Amira, Co-founder, ATXP [28]
最後に、どのプロバイダーを選んでも、すべてのチームが必ず実装すべきコスト削減戦略が 2 つあります:prompt caching と バッチ処理 です。Prompt caching は繰り返しのコンテキストに対して入力コストを最大 90% 削減でき [27]、バッチ処理は即時の結果が不要なタスクに対して標準で 50% の割引を提供します [2]。これらの手法はコスト面のメリットだけでなく、ワークフロー管理の複雑さも軽減してくれるため、どのチームにとっても欠かせない要素となります。
よくある質問
デプロイ前にワークロードのトークン数を見積もるにはどうすればよいですか?
トークンは本質的にテキストの小さな断片で、おおよそ 1 トークンが 0.75 単語に相当します。送る入力プロンプトと受け取る出力応答の両方を測定するのに使われます。トークン使用量を明確に把握するために、まずトークンカウンターツールを活用しましょう。これらのツールはサンプルプロンプトと応答を解析し、コンテンツが必要とするトークン数を把握する手助けをしてくれます。
このデータを集めたら、自分のワークロードに基づいて入出力それぞれに必要なトークン数を見積もります。その後、プロバイダーの料金(通常は 1M トークン単位の課金)を当てはめてコストを計算します。このステップは、デプロイに進む前に支出を理解し、予算を計画する上で欠かせません。
品質を損なわずに PAYG コストを削減する最良の方法は?
従量課金(PAYG)型 AI API のコスト削減は、パフォーマンスを犠牲にする必要はありません。コストを効果的に管理する方法は次のとおりです:
- リクエストをバッチ化: 小さなリクエストを複数送るのではなく、まとめてバッチにします。これにより API 呼び出し回数が減り、コストを節約できます。
- プロンプトの簡素化: 不必要だったり過度に複雑なプロンプトは避けましょう。明確で簡潔な指示は、結果の品質を損なわずにトークン使用量を抑えられます。
- 適切なモデルの選択: 単純なタスクや重要度の低いタスクには、より小型でコスト効率の高いモデルを使います。高度(で高額)なモデルは本当に必要な場面に限定しましょう。
- トークン使用量の追跡: 使用しているトークン数を常に把握しましょう。非効率が見つかったらアプローチを見直したり、モデルを切り替えたりします。
ワークロードが変動的または小規模であれば、トークン効率とリクエストのバッチ化に注力するとよいでしょう。一方で、大規模かつ一定のニーズがある場合は、予測可能なコストとより低いレートを得られるサブスクリプションプランが適しているかもしれません。
APIMart のような統合 AI API が経済的に合理的なのはどんなときですか?
APIMart のような 統合 AI API は、複数ベンダーのモデルを使っている組織にとって特にコスト削減につながります。すべてを 1 つのプラットフォームに集約することで、管理が効率化され、コスト削減にも貢献します。
マルチメディア案件や言語処理のように幅広く異なるタスクを扱う場合、APIMart は multi-modal 入力、高度な編集機能、請求の一元化 といったツールを提供します。これらの機能は、使用パターンが予測しづらかったり常に変化したりする状況でも、コストを効果的に管理する助けとなります。
関連記事
モデルマーケットで使いたいモデルを選ぶ
APIMart のモデルマーケットでチャット、画像、動画モデルを試し、統一 API でモデルの能力をすばやく体験できます。