2026年 AI APIコスト試算:Claude / GPT-5.6 / Gemini / Groq の選び方
AI機能を持つサイドプロジェクトを作っているけれど、まだはっきりしていないことがある。APIの請求書はいったいいくらになるのか?
AIをChatGPTやClaudeで対話的に使う場合はサブスクリプション、製品から呼び出す場合は token、tools、service tier による API 課金になる。両者は直接換算できない。
この記事は「AIモデル比較表」ではない。月間使用量、タスクの種類、予算に基づいて最適なAPIプランを選ぶためのコスト意思決定フレームワークだ。そして、請求書が予想の3〜5倍になる本当の理由も解説する。
TL;DR
- 出力 token は入力より高いことが多く、長い回答が請求の中心になりやすい
- 低コストのテキスト処理は Groq GPT-OSS 20B、GPT-5.6 Luna、Gemini 3.7 Flash を試し、品質要件に応じて Claude Sonnet 5 を比較する
- Groq の Llama 4 Scout と Maverick は一般 developer tier から廃止済み。新規開発では現行 production models を使う
- Context の膨張でコストは増える。以下の前提では、10 回目の call は初回の約 2.7 倍になる
- Anthropic の現行 5 分 cache 料金では、write 後に 1 回 read できれば同じ入力を標準料金で 2 回送るより安い
2026年主要AI API料金一覧
主要APIはすべて「token単位の従量課金、入力と出力で別料金」を採用している。注目すべきは3列目——出力が入力の何倍かかるか。
料金は 2026 年 8 月 30 日に公式ページで確認した、100 万 token あたりの標準 short-context 価格。long context、Fast/Priority、data residency、Batch は別料金になる場合があるため、導入前に再確認してください。
| プロバイダー | モデル | 入力 $/1M | 出力 $/1M | 出力/入力比 | 特別割引 |
|---|---|---|---|---|---|
| Anthropic | Haiku 4.5 | $1.00 | $5.00 | 5x | Batch 50% off, Cache 90% off |
| Anthropic | Sonnet 5 | $2.00 | $10.00 | 5x | Batch 50% off、cache read 90% off |
| Anthropic | Opus 5 | $5.00 | $25.00 | 5x | 同上 |
| OpenAI | GPT-4o mini | $0.15 | $0.60 | 4x | Batch 50% off |
| OpenAI | GPT-4o | $2.50 | $10.00 | 4x | Batch 50% off, Cache 50% off |
| OpenAI | GPT-5.6 Sol | $4.00 | $20.00 | 5x | 2026-11-21 までは促銷価格 |
| OpenAI | GPT-5.6 Terra | $2.00 | $12.00 | 6x | Cached input $0.20 |
| OpenAI | GPT-5.6 Luna | $0.20 | $1.20 | 6x | Cached input $0.02 |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | 4x | Batch 50% off | |
| Gemini 3.7 Flash(2026 年の促銷) | $0.75 | $3.75 | 5x | 2026-12-31 まで;Batch 50% off | |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 8.3x | Batch 50% off | |
| xAI | Grok 4.3(context < 200K) | $1.25 | $2.50 | 2x | 200K 以上は $2.50/$5.00 |
| Groq | GPT-OSS 20B | $0.075 | $0.30 | 4x | Cached input $0.0375 |
| Groq | GPT-OSS 120B | $0.15 | $0.60 | 4x | Cached input $0.075 |
Groq GPT-OSS 120B の出力は $0.60、Sonnet 5 は $10。前者は後者の約 6% だが、これは単価比較にすぎず、品質、遅延、成功率が同じという意味ではない。
2026年8月末の競争環境
重要な変化は 3 つ。Sonnet 5 は $2/$10、Gemini 3.7 Flash は 2026 年末まで $0.75/$3.75、Groq は Llama 4 を一般 developer tier から外し、GPT-OSS 20B/120B などを production models として提供している。Llama 4 を推奨する旧表は新規導入には使えない。
GPT-5.6:8月に再び料金変更
OpenAI は 7 月の Terra/Luna 値下げに続き、8 月 21 日に GPT-5.6 Sol の API 価格を 20% 以上下げた。確認時の標準 short-context 料金は Sol $4/$20、Terra $2/$12、Luna $0.20/$1.20。long context と他の service tier は別料金で、Sol の促銷価格は少なくとも 2026 年 11 月 21 日まで続く。
なぜ請求書は見積もりの3〜5倍になるのか?
多くの開発者がAPIコストを見積もるときに犯す共通のミスがある——入力料金しか見ていないことだ。
落とし穴1:出力tokenが請求書の主役
典型的なAIチャットボットの応答は約500文字、およそ600 tokens。一方、送った質問は50文字程度、およそ200 tokensかもしれない。Claude Sonnet 4.6で計算すると:
- 入力:200 tokens x $3.00/1M = $0.0006
- 出力:600 tokens x $15.00/1M = $0.009
- 出力が占める割合:93.75%
これはSonnetだけの問題ではない。すべてのプロバイダーで出力料金は入力の3〜10倍。料金表の「$3.00/1M tokens」はあくまで入力の価格——小さい方の数字だ。
落とし穴2:Context膨張の計算式
マルチターン会話では、毎回のAPIコールに全会話履歴が含まれる。会話が長くなるほど毎回のcontextが大きくなり、コストが線形に増加する。
シンプルな計算式:
第N回目のコスト ≈ 基本コスト x (1 + N x 1回あたりの増分 / 初期context)
実際に計算してみよう。system prompt 1,000 tokens、毎回200 tokens(ユーザー)+ 600 tokens(AI応答)が加わると仮定:
| 往復数 | Contextサイズ | 入力コスト(Sonnet) | その回の合計コスト(出力 600 tokens を含む) |
|---|---|---|---|
| 1回目 | 1,200 tokens | $0.0036 | $0.0126 |
| 5回目 | 4,400 tokens | $0.0132 | $0.0222 |
| 10回目 | 8,400 tokens | $0.0252 | $0.0342 |
10 回目の1 回あたりの入力コストは初回の 7 倍。毎回 600 tokens の出力を加えると、その回の合計は初回の約 2.7 倍になる。10 回分の累計は約 $0.234 で、初回コストを単純に 10 倍した $0.126 では約 46% 過小評価する。
開発者コミュニティでよく聞く声:「contextが膨らむと毎回のコールでお金が燃える感覚。最初は気づかず大損した。」
落とし穴3:System Promptの隠れコスト
prompt cachingを使わない場合、毎回のAPIコールでsystem promptが再送信される。1,000 tokensのsystem promptを1日1,000回呼び出すと、1日あたり1M tokensの「隠れた入力」になる。Sonnet 4.6で計算すると、1日$3、月に$90——同じテキストを繰り返し送るだけで。
コスト段階フレームワーク:今どの段階にいる?
「どのAPIが最安か」を問う前に、まず「月間使用量はどのくらいか」を確認しよう。規模によって最適なAPIは異なり、切り替えの明確なトリガーポイントがある。
Stage 0:$10/月未満(MVP / プロトタイプ)
アイデアを検証する段階で、使用量は極めて少ない。
| 推薦 | 理由 |
|---|---|
| GPT-4o mini ($0.15/$0.60) | 最安の商用品質API、1日1,000回の簡単なコール ≈ $11.7/月 |
| Gemini 2.5 Flash-Lite ($0.10/$0.40) | Googleの最安プラン、超軽量プロトタイプに最適 |
| Groq GPT-OSS 20B ($0.075/$0.30) | 単価は低いが、品質と rate limit の検証が必要 |
注意:2026年4月1日よりGoogleは無料プランを縮小——Gemini Proシリーズ(3.1 Pro、2.5 Pro)は全面有料化。Gemini 3.5 FlashなどFlashシリーズは引き続き無料枠があるものの、配分は縮小されています。新プロジェクトは最初から有料プランを想定して計画し、配分不足によるサービス停止を避けることをお勧めします。
切り替えトリガー:より高い応答品質が必要(GPT-4o miniは複雑な推論に限界がある)、または安定したSLAが必要な場合。
Stage 1:$10〜50/月(初期プロダクト、DAU 500未満)
プロダクトに最初のユーザーはいるが、規模はまだ小さい。
| 推薦 | 理由 |
|---|---|
| Groq GPT-OSS 20B + GPT-5.6 Luna | 定型処理を低単価で実行し、別モデルを fallback にする |
| Gemini 3.7 Flash ($0.75/$3.75、2026 年の促銷) | multimodal と Google 連携を使う workflow 向け |
| xAI Grok 4.3 ($1.25/$2.50) | short context で出力単価を抑えたい場合の候補 |
切り替えトリガー:実測 RPM/TPM が上限に近づく、429 が増える、または品質要件を満たさない場合。
Stage 2:$50〜200/月(成長期、DAU 500〜5,000)
コストが運営費の中で目に見える割合を占め始める。最も重要な段階だ。
| 推薦 | 理由 |
|---|---|
| Claude Haiku 4.5 ($1.00/$5.00) | 品質とコストの最適バランス、1,000回/日のチャットボット ≈ $96/月 |
| OpenAI GPT-5.6 Luna ($0.20/$1.20) | OpenAI の低価格 tier。long context と他の service tier は別料金 |
Haiku 4.5 と GPT-5.6 Luna は単価差が大きくなったが、価格だけで品質は判断できない。実際の入力を 20〜50 件使い、成功率、retry、遅延、確認工数、総出力コストを比較する。
切り替えトリガー:SonnetまたはTerraレベルの品質が必要になった場合、または月額が$200を超えた場合。
Stage 3:$200/月超(安定プロダクト)
安定したユーザーベースと予測可能な使用量がある段階。
| 推薦 | 理由 |
|---|---|
| Claude Sonnet 5 + Prompt Caching | $2/$10、cache hit は標準入力料金の 10% |
| OpenAI GPT-5.6 Terra ($2/$12) | OpenAI 連携がある場合の候補。context と service tier を確認 |
| マルチプロバイダールーティング(Groq + Haiku fallback) | 削減率は route 比率と実際の token 分布次第 |
切り替えトリガー:同じ実負荷で API と self-host の TCO を比較できるほど利用量が安定した段階。
Groq + GPT-OSS:低単価の利用境界
Groq の production models には GPT-OSS 20B と 120B があり、料金は $0.075/$0.30 と $0.15/$0.60。Llama 4 Maverick と Scout は廃止済みで、旧 model ID を新規製品の依存先にはできない。
しかし、SaaS全体を移行する前に、3つの厳しい制約を把握しておく必要がある。
制約1:Rate Limitは本物の壁
Groq が公開する GPT-OSS 20B/120B の無料枠は 30 RPM、8,000 TPM、1,000 RPD。Developer Plan は上限が高いが、最終的には account の Limits ページを確認する。
RPM だけでなく、長い入力では TPM を先に使い切る。peak traffic を load test し、429 の backoff と fallback を用意する。ユーザー数だけでは容量を判断できない。
prototype が動くことと production capacity は別問題だ。RPM、TPM、RPD、error rate を測る。
制約2:モデルバージョンと機能サポート
Groq は GPT-OSS 20B/120B を production models とし、tool use、JSON mode、reasoning を案内している。ただし context、tools、output 上限は model page で個別に確認する。
制約3:Cachingメカニズムがない
Groq は GPT-OSS 20B/120B に自動 prompt caching を提供し、hit 時の入力料金は半額になる。設定は不要だが hit は保証されない。繰り返し context が多い場合は Anthropic の 10% cache-read 価格とも比較する。
Groqが適しているシナリオ:バッチ記事要約、データ分類、キーワード抽出、シングルユーザーツール、非リアルタイムタスク。
導入前に load test が必要なシナリオ:peak の大きい chat、特定の multimodal 機能や複雑な tool use、契約 SLA が必要な B2B 製品。
Prompt Cache + Batch API:節約の切り札か、見せかけの特典か?
Prompt Caching(Anthropic)
Anthropicのprompt cachingは、固定の system prompt や長い context を再利用する。現在は automatic caching と明示的 breakpoint の両方がある。
Sonnet 5 の例:
- 標準入力:$2.00/1M tokens
- 5分 Cache write:$2.50/1M tokens(標準の 1.25 倍)
- Cache read:$0.20/1M tokens(標準の 10%)
- TTL:5分(タイムアウト後は再writeが必要)
節約できる条件:
- 後続リクエストが同じ長い prefix を再利用する
- 5分 TTL 内に少なくとも 1 回 cache read がある。現行料金なら同じ入力を標準料金で 2 回送るより安い
- usage data で creation/read tokens を確認できる
節約を前提にできない条件:
- 次の request が期限後に来る
- prefix が毎回変わる
- 実際の hit を追跡していない
固定の DAU 閾値はない。重要なのは TTL 内に同じ prefix が何回再利用されるかだ。まず 1 週間の usage を測る。
Batch API(Anthropic / OpenAI)
タスクがリアルタイムの応答を必要としない場合——記事要約、データ分類、レポート生成——Batch APIで自動的に半額になる。
非同期処理を許容できるなら、Batch は試しやすい削減手段だ。記事ごとの長さが同じとは限らないため、実際の input/output tokens から再計算する。
マルチプロバイダールーティング:2026年のコスパ最良アーキテクチャ
APIを単一プロバイダーに全て依存するのはリスクが高い——値上げ時に逃げ場がなく、障害時のフォールバックもなく、rate limitに当たったら待つしかない。
検証しやすい構成の一つが Groq primary + Haiku 4.5 fallback:
- 日常タスクは Groq GPT-OSS 120B($0.15/$0.60)で処理
- Rate limitに到達、またはサービス異常時には自動的にHaiku 4.5($1/$5)に切り替え
- 削減率は実際の input/output tokens、retry、fallback 比率で計算する
OpenRouter vs 自前ルーティング
OpenRouter:ゼロコードのマルチプロバイダールーティング。1つのAPIキーで複数プロバイダーを切り替え、自動フォールバック、リアルタイム価格比較が可能。
- 適している:プロトタイプ段階、技術リソースが限られている、素早く試したい場合
- 代償:provider、policy、latency の差が増える。markup と機能は現行 OpenRouter model page で確認する
自前ルーティングは fallback 条件、observability、provider policy を自分で管理したい場合に検討する。retry だけでなく idempotency、rate limit、timeout、output schema、cost logging が必要になる。
海外開発者向けAPI決済ガイド
決済可否は supported country、請求先住所、card network、発行会社の risk control、3-D Secure に左右される。一般化できる成功率はなく、以前の版にあった特定カードや Wise をほぼ確実とする記述は公式保証がないため削除した。
決済が弾かれた場合の対処
請求国と住所を確認し、provider から decline code を受け取り、発行会社に海外 online/recurring payment が有効か確認する。短時間に再試行を繰り返さず、コミュニティの一例を長期保証として扱わない。
API選択の意思決定ツリー:3ステップで最適なAPIを選ぶ
ここまで情報量が多かった。3ステップに圧縮しよう。
Step 1:月額費用を計算する
月額費用 = (input_tokens x 入力単価 + output_tokens x 出力単価) / 1,000,000 x 月間コール回数
token分布が不明?まず1:3(input:output)を仮定し、1日あたりの推定コール数で月間の概算を出す。リリース後はAPIのusage dashboardで実データに置き換える。
Step 2:コスト段階と照合する
| 月額 | シンプルなタスク | 高品質な推論が必要 |
|---|---|---|
| < $10 | GPT-5.6 Luna / GPT-4o mini | Gemini 3.7 Flash |
| $10〜50 | Groq GPT-OSS 20B / 120B | Haiku 4.5 |
| $50〜200 | Haiku 4.5 | Haiku 4.5 |
| > $200 | Groq + Haiku routing | Sonnet 5 + Cache |
Step 3:制約条件を確認する
- visionやfunction callingが必要?→ 一部のGroqモデルを除外
- peak traffic が RPM/TPM に近い?→ capacity を上げるか fallback を追加
- バッチ処理可能なタスク?→ Batch APIで即座に半額
- 繰り返しのsystem promptがある?→ Anthropicのcachingを評価
open model の自前ホスティングを検討するタイミング
APIの月額が膨らんで自前ホスティングを考え始めたら、まずTCO計算をしよう。
self-host の費用は項目別に見積もる:
- model size、quantization、peak throughput、latency target に合う GPU 見積もりを取る
- 実 traffic で utilization を推定する。idle GPU にも費用はかかる
- monitoring、scaling、failover、security update、data governance、on-call を含める
- 同じ 1 週間または 1 か月の workload を API と proof of concept で比較する
| 状況 | 推薦 |
|---|---|
| 低用量または burst が大きい | まず API で token と retry cost を測る |
| 安定 traffic、data/latency の特殊要件 | GPU と運用費を見積もり、小規模 proof of concept を行う |
| platform team と高 utilization がある | 長期 self-host を評価できるが、自動的に安いわけではない |
self-host は token 単価を GPU 時給に置き換えるだけではない。人件費、failover、低 utilization を除くと過度に楽観的になる。
リスク開示
料金は常に変動する:2026 年 8 月 30 日時点で、GPT-5.6 Sol の 8 月変更、Gemini 3.7 Flash の促銷価格、Groq Llama 4 の廃止を反映した。導入前に各社公式料金ページを再確認する。
試算は仮定に基づく:本記事のコスト計算は「入力200 tokens + 出力600 tokens」という典型的なチャットボットパターンを前提としている。実際のtoken分布は大きく異なる可能性がある——リリース後にまずすべきことは、API dashboardで実数値を計測し、見積もりを修正することだ。
プロバイダーロックインのリスク:特定プロバイダー固有の機能(Anthropicのcaching、OpenAIのfunction calling構文)にプロダクトを深く結合すると、将来の切り替えコストが増大する。APIコールに抽象化レイヤーを挟み、プロバイダー切り替えの柔軟性を確保することをお勧めする。
まとめ
AI API 料金で見落としやすいのは、output tokens、増え続ける context、retry、tool charge、繰り返し送る system prompt だ。
コスト段階フレームワークで候補を絞り、実際の input/output 分布、成功率、retry、latency を benchmark する。Batch と multi-provider routing は workload が条件に合うときだけ節約になる。
今すぐ始めよう:上記の計算式で推定月額を算出し、段階フレームワークと照合し、最初のAPIを選ぶ。リリース後は実際のtoken分布を計測し、毎月切り替えの必要性をチェックする。料金競争はさらに加速しており、今日の最適解が3ヶ月後には変わっているかもしれない。
FAQ
Claude のサブスクリプションと API はどちらが得ですか?
用途が異なります。サブスクリプションは個人の対話利用向け、API は製品向けの token 従量課金です。サブスクリプション枠を API の代わりにはできないため、input、output、cache、tool use の実測値で製品コストを見積もってください。
Groq で Llama 4 Scout や Maverick はまだ使えますか?
一般の developer tier では使えません。Groq は Maverick を 2026 年 3 月 9 日、Scout を 7 月 17 日に停止し、openai/gpt-oss-120b または qwen/qwen3.6-27b への移行を案内しています。
海外カードは AI API 各社で必ず使えますか?
プロバイダー、請求国、発行会社の審査をまたいで必ず通るカードはありません。各社の決済画面を確認し、拒否時はプロバイダーと発行会社に問い合わせてください。コミュニティの個別事例は保証になりません。
オープンモデルのセルフホストを検討するタイミングは?
一つの月額ラインでは決められません。実際の API トラフィックと、GPU 見積もり、利用率、ピーク容量、監視、セキュリティ更新、当番対応、開発時間を含む TCO を比較してください。
この記事は役に立ちましたか?



