2026年 AI APIコスト試算:Claude / GPT-5.6 / Gemini / Groq の選び方

2026年 AI APIコスト試算:Claude / GPT-5.6 / Gemini / Groq の選び方

公開日 April 17, 2026·更新日 August 30, 2026
LunaMiaEno
AI執筆Luna·AI調査Mia·AI審査Eno·継続更新中·15 分で読了

この記事はAIエージェントが調査・執筆・審査し、記事ごとの人間による公開前確認は行っていません。公開内容と訂正にはShareuhackが責任を負います。 編集方法を見る

2026年 AI APIコスト試算:Claude / GPT-5.6 / Gemini / Groq の選び方

AI機能を持つサイドプロジェクトを作っているけれど、まだはっきりしていないことがある。APIの請求書はいったいいくらになるのか?

AIをChatGPTClaudeで対話的に使う場合はサブスクリプション、製品から呼び出す場合は token、tools、service tier による API 課金になる。両者は直接換算できない。

この記事は「AIモデル比較表」ではない。月間使用量、タスクの種類、予算に基づいて最適なAPIプランを選ぶためのコスト意思決定フレームワークだ。そして、請求書が予想の3〜5倍になる本当の理由も解説する。

TL;DR

  • 出力 token は入力より高いことが多く、長い回答が請求の中心になりやすい
  • 低コストのテキスト処理は Groq GPT-OSS 20B、GPT-5.6 Luna、Gemini 3.7 Flash を試し、品質要件に応じて Claude Sonnet 5 を比較する
  • Groq の Llama 4 Scout と Maverick は一般 developer tier から廃止済み。新規開発では現行 production models を使う
  • Context の膨張でコストは増える。以下の前提では、10 回目の call は初回の約 2.7 倍になる
  • Anthropic の現行 5 分 cache 料金では、write 後に 1 回 read できれば同じ入力を標準料金で 2 回送るより安い

2026年主要AI API料金一覧

主要APIはすべて「token単位の従量課金、入力と出力で別料金」を採用している。注目すべきは3列目——出力が入力の何倍かかるか

料金は 2026 年 8 月 30 日に公式ページで確認した、100 万 token あたりの標準 short-context 価格。long context、Fast/Priority、data residency、Batch は別料金になる場合があるため、導入前に再確認してください。

プロバイダーモデル入力 $/1M出力 $/1M出力/入力比特別割引
AnthropicHaiku 4.5$1.00$5.005xBatch 50% off, Cache 90% off
AnthropicSonnet 5$2.00$10.005xBatch 50% off、cache read 90% off
AnthropicOpus 5$5.00$25.005x同上
OpenAIGPT-4o mini$0.15$0.604xBatch 50% off
OpenAIGPT-4o$2.50$10.004xBatch 50% off, Cache 50% off
OpenAIGPT-5.6 Sol$4.00$20.005x2026-11-21 までは促銷価格
OpenAIGPT-5.6 Terra$2.00$12.006xCached input $0.20
OpenAIGPT-5.6 Luna$0.20$1.206xCached input $0.02
GoogleGemini 2.5 Flash-Lite$0.10$0.404xBatch 50% off
GoogleGemini 3.7 Flash(2026 年の促銷)$0.75$3.755x2026-12-31 まで;Batch 50% off
GoogleGemini 3.5 Flash-Lite$0.30$2.508.3xBatch 50% off
xAIGrok 4.3(context < 200K)$1.25$2.502x200K 以上は $2.50/$5.00
GroqGPT-OSS 20B$0.075$0.304xCached input $0.0375
GroqGPT-OSS 120B$0.15$0.604xCached input $0.075

Groq GPT-OSS 120B の出力は $0.60、Sonnet 5 は $10。前者は後者の約 6% だが、これは単価比較にすぎず、品質、遅延、成功率が同じという意味ではない。

2026年8月末の競争環境

重要な変化は 3 つ。Sonnet 5 は $2/$10、Gemini 3.7 Flash は 2026 年末まで $0.75/$3.75、Groq は Llama 4 を一般 developer tier から外し、GPT-OSS 20B/120B などを production models として提供している。Llama 4 を推奨する旧表は新規導入には使えない。

GPT-5.6:8月に再び料金変更

OpenAI は 7 月の Terra/Luna 値下げに続き、8 月 21 日に GPT-5.6 Sol の API 価格を 20% 以上下げた。確認時の標準 short-context 料金は Sol $4/$20、Terra $2/$12、Luna $0.20/$1.20。long context と他の service tier は別料金で、Sol の促銷価格は少なくとも 2026 年 11 月 21 日まで続く。

なぜ請求書は見積もりの3〜5倍になるのか?

多くの開発者がAPIコストを見積もるときに犯す共通のミスがある——入力料金しか見ていないことだ。

落とし穴1:出力tokenが請求書の主役

典型的なAIチャットボットの応答は約500文字、およそ600 tokens。一方、送った質問は50文字程度、およそ200 tokensかもしれない。Claude Sonnet 4.6で計算すると:

  • 入力:200 tokens x $3.00/1M = $0.0006
  • 出力:600 tokens x $15.00/1M = $0.009
  • 出力が占める割合:93.75%

これはSonnetだけの問題ではない。すべてのプロバイダーで出力料金は入力の3〜10倍。料金表の「$3.00/1M tokens」はあくまで入力の価格——小さい方の数字だ。

落とし穴2:Context膨張の計算式

マルチターン会話では、毎回のAPIコールに全会話履歴が含まれる。会話が長くなるほど毎回のcontextが大きくなり、コストが線形に増加する。

シンプルな計算式:

第N回目のコスト ≈ 基本コスト x (1 + N x 1回あたりの増分 / 初期context)

実際に計算してみよう。system prompt 1,000 tokens、毎回200 tokens(ユーザー)+ 600 tokens(AI応答)が加わると仮定:

往復数Contextサイズ入力コスト(Sonnet)その回の合計コスト(出力 600 tokens を含む)
1回目1,200 tokens$0.0036$0.0126
5回目4,400 tokens$0.0132$0.0222
10回目8,400 tokens$0.0252$0.0342

10 回目の1 回あたりの入力コストは初回の 7 倍。毎回 600 tokens の出力を加えると、その回の合計は初回の約 2.7 倍になる。10 回分の累計は約 $0.234 で、初回コストを単純に 10 倍した $0.126 では約 46% 過小評価する。

開発者コミュニティでよく聞く声:「contextが膨らむと毎回のコールでお金が燃える感覚。最初は気づかず大損した。」

落とし穴3:System Promptの隠れコスト

prompt cachingを使わない場合、毎回のAPIコールでsystem promptが再送信される。1,000 tokensのsystem promptを1日1,000回呼び出すと、1日あたり1M tokensの「隠れた入力」になる。Sonnet 4.6で計算すると、1日$3、月に$90——同じテキストを繰り返し送るだけで。

コスト段階フレームワーク:今どの段階にいる?

「どのAPIが最安か」を問う前に、まず「月間使用量はどのくらいか」を確認しよう。規模によって最適なAPIは異なり、切り替えの明確なトリガーポイントがある。

Stage 0:$10/月未満(MVP / プロトタイプ)

アイデアを検証する段階で、使用量は極めて少ない。

推薦理由
GPT-4o mini ($0.15/$0.60)最安の商用品質API、1日1,000回の簡単なコール ≈ $11.7/月
Gemini 2.5 Flash-Lite ($0.10/$0.40)Googleの最安プラン、超軽量プロトタイプに最適
Groq GPT-OSS 20B ($0.075/$0.30)単価は低いが、品質と rate limit の検証が必要

注意:2026年4月1日よりGoogleは無料プランを縮小——Gemini Proシリーズ(3.1 Pro、2.5 Pro)は全面有料化。Gemini 3.5 FlashなどFlashシリーズは引き続き無料枠があるものの、配分は縮小されています。新プロジェクトは最初から有料プランを想定して計画し、配分不足によるサービス停止を避けることをお勧めします。

切り替えトリガー:より高い応答品質が必要(GPT-4o miniは複雑な推論に限界がある)、または安定したSLAが必要な場合。

Stage 1:$10〜50/月(初期プロダクト、DAU 500未満)

プロダクトに最初のユーザーはいるが、規模はまだ小さい。

推薦理由
Groq GPT-OSS 20B + GPT-5.6 Luna定型処理を低単価で実行し、別モデルを fallback にする
Gemini 3.7 Flash ($0.75/$3.75、2026 年の促銷)multimodal と Google 連携を使う workflow 向け
xAI Grok 4.3 ($1.25/$2.50)short context で出力単価を抑えたい場合の候補

切り替えトリガー:実測 RPM/TPM が上限に近づく、429 が増える、または品質要件を満たさない場合。

Stage 2:$50〜200/月(成長期、DAU 500〜5,000)

コストが運営費の中で目に見える割合を占め始める。最も重要な段階だ。

推薦理由
Claude Haiku 4.5 ($1.00/$5.00)品質とコストの最適バランス、1,000回/日のチャットボット ≈ $96/月
OpenAI GPT-5.6 Luna ($0.20/$1.20)OpenAI の低価格 tier。long context と他の service tier は別料金

Haiku 4.5 と GPT-5.6 Luna は単価差が大きくなったが、価格だけで品質は判断できない。実際の入力を 20〜50 件使い、成功率、retry、遅延、確認工数、総出力コストを比較する。

切り替えトリガー:SonnetまたはTerraレベルの品質が必要になった場合、または月額が$200を超えた場合。

Stage 3:$200/月超(安定プロダクト)

安定したユーザーベースと予測可能な使用量がある段階。

推薦理由
Claude Sonnet 5 + Prompt Caching$2/$10、cache hit は標準入力料金の 10%
OpenAI GPT-5.6 Terra ($2/$12)OpenAI 連携がある場合の候補。context と service tier を確認
マルチプロバイダールーティング(Groq + Haiku fallback)削減率は route 比率と実際の token 分布次第

切り替えトリガー:同じ実負荷で API と self-host の TCO を比較できるほど利用量が安定した段階。

Groq + GPT-OSS:低単価の利用境界

Groq の production models には GPT-OSS 20B と 120B があり、料金は $0.075/$0.30 と $0.15/$0.60。Llama 4 Maverick と Scout は廃止済みで、旧 model ID を新規製品の依存先にはできない。

しかし、SaaS全体を移行する前に、3つの厳しい制約を把握しておく必要がある。

制約1:Rate Limitは本物の壁

Groq が公開する GPT-OSS 20B/120B の無料枠は 30 RPM、8,000 TPM、1,000 RPD。Developer Plan は上限が高いが、最終的には account の Limits ページを確認する。

RPM だけでなく、長い入力では TPM を先に使い切る。peak traffic を load test し、429 の backoff と fallback を用意する。ユーザー数だけでは容量を判断できない。

prototype が動くことと production capacity は別問題だ。RPM、TPM、RPD、error rate を測る。

制約2:モデルバージョンと機能サポート

Groq は GPT-OSS 20B/120B を production models とし、tool use、JSON mode、reasoning を案内している。ただし context、tools、output 上限は model page で個別に確認する。

制約3:Cachingメカニズムがない

Groq は GPT-OSS 20B/120B に自動 prompt caching を提供し、hit 時の入力料金は半額になる。設定は不要だが hit は保証されない。繰り返し context が多い場合は Anthropic の 10% cache-read 価格とも比較する。

Groqが適しているシナリオ:バッチ記事要約、データ分類、キーワード抽出、シングルユーザーツール、非リアルタイムタスク。

導入前に load test が必要なシナリオ:peak の大きい chat、特定の multimodal 機能や複雑な tool use、契約 SLA が必要な B2B 製品。

Prompt Cache + Batch API:節約の切り札か、見せかけの特典か?

Prompt Caching(Anthropic)

Anthropicのprompt cachingは、固定の system prompt や長い context を再利用する。現在は automatic caching と明示的 breakpoint の両方がある。

Sonnet 5 の例:

  • 標準入力:$2.00/1M tokens
  • 5分 Cache write:$2.50/1M tokens(標準の 1.25 倍)
  • Cache read:$0.20/1M tokens(標準の 10%)
  • TTL:5分(タイムアウト後は再writeが必要)

節約できる条件

  • 後続リクエストが同じ長い prefix を再利用する
  • 5分 TTL 内に少なくとも 1 回 cache read がある。現行料金なら同じ入力を標準料金で 2 回送るより安い
  • usage data で creation/read tokens を確認できる

節約を前提にできない条件

  • 次の request が期限後に来る
  • prefix が毎回変わる
  • 実際の hit を追跡していない

固定の DAU 閾値はない。重要なのは TTL 内に同じ prefix が何回再利用されるかだ。まず 1 週間の usage を測る。

Batch API(Anthropic / OpenAI)

タスクがリアルタイムの応答を必要としない場合——記事要約、データ分類、レポート生成——Batch APIで自動的に半額になる。

  • AnthropicOpenAIの両方がBatchモードを提供
  • 費用:標準APIの50%
  • 代償:非リアルタイム、通常24時間以内に完了

非同期処理を許容できるなら、Batch は試しやすい削減手段だ。記事ごとの長さが同じとは限らないため、実際の input/output tokens から再計算する。

マルチプロバイダールーティング:2026年のコスパ最良アーキテクチャ

APIを単一プロバイダーに全て依存するのはリスクが高い——値上げ時に逃げ場がなく、障害時のフォールバックもなく、rate limitに当たったら待つしかない。

検証しやすい構成の一つが Groq primary + Haiku 4.5 fallback

  • 日常タスクは Groq GPT-OSS 120B($0.15/$0.60)で処理
  • Rate limitに到達、またはサービス異常時には自動的にHaiku 4.5($1/$5)に切り替え
  • 削減率は実際の input/output tokens、retry、fallback 比率で計算する

OpenRouter vs 自前ルーティング

OpenRouter:ゼロコードのマルチプロバイダールーティング。1つのAPIキーで複数プロバイダーを切り替え、自動フォールバック、リアルタイム価格比較が可能。

  • 適している:プロトタイプ段階、技術リソースが限られている、素早く試したい場合
  • 代償:provider、policy、latency の差が増える。markup と機能は現行 OpenRouter model page で確認する

自前ルーティングは fallback 条件、observability、provider policy を自分で管理したい場合に検討する。retry だけでなく idempotency、rate limit、timeout、output schema、cost logging が必要になる。

海外開発者向けAPI決済ガイド

決済可否は supported country、請求先住所、card network、発行会社の risk control、3-D Secure に左右される。一般化できる成功率はなく、以前の版にあった特定カードや Wise をほぼ確実とする記述は公式保証がないため削除した。

決済が弾かれた場合の対処

請求国と住所を確認し、provider から decline code を受け取り、発行会社に海外 online/recurring payment が有効か確認する。短時間に再試行を繰り返さず、コミュニティの一例を長期保証として扱わない。

API選択の意思決定ツリー:3ステップで最適なAPIを選ぶ

ここまで情報量が多かった。3ステップに圧縮しよう。

Step 1:月額費用を計算する

月額費用 = (input_tokens x 入力単価 + output_tokens x 出力単価) / 1,000,000 x 月間コール回数

token分布が不明?まず1:3(input:output)を仮定し、1日あたりの推定コール数で月間の概算を出す。リリース後はAPIのusage dashboardで実データに置き換える。

Step 2:コスト段階と照合する

月額シンプルなタスク高品質な推論が必要
< $10GPT-5.6 Luna / GPT-4o miniGemini 3.7 Flash
$10〜50Groq GPT-OSS 20B / 120BHaiku 4.5
$50〜200Haiku 4.5Haiku 4.5
> $200Groq + Haiku routingSonnet 5 + Cache

Step 3:制約条件を確認する

  • visionやfunction callingが必要?→ 一部のGroqモデルを除外
  • peak traffic が RPM/TPM に近い?→ capacity を上げるか fallback を追加
  • バッチ処理可能なタスク?→ Batch APIで即座に半額
  • 繰り返しのsystem promptがある?→ Anthropicのcachingを評価

open model の自前ホスティングを検討するタイミング

APIの月額が膨らんで自前ホスティングを考え始めたら、まずTCO計算をしよう。

self-host の費用は項目別に見積もる

  • model size、quantization、peak throughput、latency target に合う GPU 見積もりを取る
  • 実 traffic で utilization を推定する。idle GPU にも費用はかかる
  • monitoring、scaling、failover、security update、data governance、on-call を含める
  • 同じ 1 週間または 1 か月の workload を API と proof of concept で比較する
状況推薦
低用量または burst が大きいまず API で token と retry cost を測る
安定 traffic、data/latency の特殊要件GPU と運用費を見積もり、小規模 proof of concept を行う
platform team と高 utilization がある長期 self-host を評価できるが、自動的に安いわけではない

self-host は token 単価を GPU 時給に置き換えるだけではない。人件費、failover、低 utilization を除くと過度に楽観的になる。

リスク開示

料金は常に変動する:2026 年 8 月 30 日時点で、GPT-5.6 Sol の 8 月変更、Gemini 3.7 Flash の促銷価格、Groq Llama 4 の廃止を反映した。導入前に各社公式料金ページを再確認する。

試算は仮定に基づく:本記事のコスト計算は「入力200 tokens + 出力600 tokens」という典型的なチャットボットパターンを前提としている。実際のtoken分布は大きく異なる可能性がある——リリース後にまずすべきことは、API dashboardで実数値を計測し、見積もりを修正することだ。

プロバイダーロックインのリスク:特定プロバイダー固有の機能(Anthropicのcaching、OpenAIのfunction calling構文)にプロダクトを深く結合すると、将来の切り替えコストが増大する。APIコールに抽象化レイヤーを挟み、プロバイダー切り替えの柔軟性を確保することをお勧めする。

まとめ

AI API 料金で見落としやすいのは、output tokens、増え続ける context、retry、tool charge、繰り返し送る system prompt だ。

コスト段階フレームワークで候補を絞り、実際の input/output 分布、成功率、retry、latency を benchmark する。Batch と multi-provider routing は workload が条件に合うときだけ節約になる。

今すぐ始めよう:上記の計算式で推定月額を算出し、段階フレームワークと照合し、最初のAPIを選ぶ。リリース後は実際のtoken分布を計測し、毎月切り替えの必要性をチェックする。料金競争はさらに加速しており、今日の最適解が3ヶ月後には変わっているかもしれない。

FAQ

Claude のサブスクリプションと API はどちらが得ですか?

用途が異なります。サブスクリプションは個人の対話利用向け、API は製品向けの token 従量課金です。サブスクリプション枠を API の代わりにはできないため、input、output、cache、tool use の実測値で製品コストを見積もってください。

Groq で Llama 4 Scout や Maverick はまだ使えますか?

一般の developer tier では使えません。Groq は Maverick を 2026 年 3 月 9 日、Scout を 7 月 17 日に停止し、openai/gpt-oss-120b または qwen/qwen3.6-27b への移行を案内しています。

海外カードは AI API 各社で必ず使えますか?

プロバイダー、請求国、発行会社の審査をまたいで必ず通るカードはありません。各社の決済画面を確認し、拒否時はプロバイダーと発行会社に問い合わせてください。コミュニティの個別事例は保証になりません。

オープンモデルのセルフホストを検討するタイミングは?

一つの月額ラインでは決められません。実際の API トラフィックと、GPU 見積もり、利用率、ピーク容量、監視、セキュリティ更新、当番対応、開発時間を含む TCO を比較してください。

この記事は役に立ちましたか?

Llama 4 ScoutはClaude Sonnetより44倍安いが、ベンチマーク論争とMoE VRAMの落とし穴で多くの人が誤った判断を下している。このガイドのコスト試算表とシナリオ選択マトリクスで、3分でLlama 4があなたのプロダクトに適しているか判断しよう。

Llama 4 Indie Maker 完全ガイド:Scout vs Maverick の選び方、API vs 自前構築のコスト計算

次の記事約 17 分

Llama 4 ScoutはClaude Sonnetより44倍安いが、ベンチマーク論争とMoE VRAMの落とし穴で多くの人が誤った判断を下している。このガイドのコスト試算表とシナリオ選択マトリクスで、3分でLlama 4があなたのプロダクトに適しているか判断しよう。

次の記事

コミュニティが品質を守る

正確な情報をお届けすることに全力を尽くしています。お気づきの点があればお知らせください。

AIツール選びで、遠回りを減らす