2026 AI API 成本完整試算:Claude / GPT-5.6 / Gemini / Groq,Indie Maker 怎麼選最省?
建一個有 AI 功能的 Side Project,得先知道 API 帳單會是多少。
如果只是透過 ChatGPT 或 Claude 使用 AI,你面對的是訂閱方案;產品讓使用者呼叫 API 時,則按 token、工具與服務級別計費,兩者不能直接換算。
這篇文章提供一套費用決策框架,讓你依月用量、任務類型和預算選擇 API 方案,也會拆解帳單可能比預期高 3-5 倍的原因。
TL;DR
- 輸出 token 單價通常高於輸入,長輸出很容易成為主要成本
- 低成本文字任務可先測 Groq GPT-OSS 20B、GPT-5.6 Luna 或 Gemini 3.7 Flash;品質敏感任務再測 Claude Sonnet 5
- Groq 已下架 Llama 4 Scout 與 Maverick;新專案應改看 GPT-OSS 或官方目前列出的 production models
- Context 膨脹會增加成本——以下方假設計算,第 10 輪的單次 call 成本約是第 1 輪的 2.7 倍
- Anthropic 5 分鐘 cache write 在第一次 cache read 後就開始比重送標準輸入便宜;是否值得仍取決於可快取內容長度與命中率
2026 主流 AI API 定價全覽
所有主流 API 都採「按 token 計費,輸入/輸出分開定價」。關鍵在第三欄——輸出比輸入貴多少倍。
本表數據查核於 2026 年 8 月 30 日,皆為官方標準短 context 價格(每 1M tokens)。長 context、Fast/Priority、資料落地區域與 Batch 可能採不同費率,下決策前請再開官方定價頁確認。
| 供應商 | 模型 | 輸入 $/1M | 輸出 $/1M | 輸出/輸入比 | 特殊折扣 |
|---|---|---|---|---|---|
| Anthropic | Haiku 4.5 | $1.00 | $5.00 | 5x | Batch 50% off, Cache 90% off |
| Anthropic | Sonnet 5 | $2.00 | $10.00 | 5x | Batch 50% off, Cache read 90% off |
| Anthropic | Opus 5 | $5.00 | $25.00 | 5x | 同上 |
| OpenAI | GPT-4o mini | $0.15 | $0.60 | 4x | Batch 50% off |
| OpenAI | GPT-4o | $2.50 | $10.00 | 4x | Batch 50% off, Cache 50% off |
| OpenAI | GPT-5.6 Sol | $4.00 | $20.00 | 5x | Sol 促銷價至少至 2026-11-21 |
| OpenAI | GPT-5.6 Terra | $2.00 | $12.00 | 6x | Cached input $0.20 |
| OpenAI | GPT-5.6 Luna | $0.20 | $1.20 | 6x | Cached input $0.02 |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | 4x | Batch 50% off | |
| Gemini 3.7 Flash(2026 年促銷) | $0.75 | $3.75 | 5x | 促銷至 2026-12-31;Batch 50% off | |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 8.3x | Batch 50% off | |
| xAI | Grok 4.3(< 200K context) | $1.25 | $2.50 | 2x | ≥ 200K context 為 $2.50/$5.00 |
| Groq | GPT-OSS 20B | $0.075 | $0.30 | 4x | Cached input $0.0375 |
| Groq | GPT-OSS 120B | $0.15 | $0.60 | 4x | Cached input $0.075 |
Groq GPT-OSS 120B 的輸出定價($0.60)約是 Claude Sonnet 5($10.00)的 6%。不過,這只是單價比較,不代表兩個模型在你的任務上有相同品質、延遲或成功率。
2026 年 8 月底的競爭格局
目前最大的變化有三個:Claude Sonnet 5 的標準價是 $2/$10;Gemini 3.7 Flash 在 2026 年底前採 $0.75/$3.75 促銷價;Groq 的 Llama 4 系列已退出一般 developer tier,由 GPT-OSS 20B/120B 等 production models 接手。舊比較表若仍列 Llama 4,已不能拿來做新專案選型。
GPT-5.6:8 月再次調價
OpenAI 在 7 月調降 Terra 與 Luna 後,又於 8 月 21 日把 GPT-5.6 Sol API 價格下調超過 20%。截至本文查核日,標準短 context 價格為 Sol $4/$20、Terra $2/$12、Luna $0.20/$1.20;長 context 與其他 service tier 另計。Sol 的促銷價官方承諾至少維持到 2026 年 11 月 21 日。
為什麼你的帳單比你算的貴 3-5 倍?
估算 API 成本時,最常漏掉的是輸出費用,只看輸入定價會低估帳單。
陷阱 1:輸出 token 才是帳單主角
一個典型的 AI chatbot 回應大約 500 字 ≈ 600 tokens。而你送出的問題可能只有 50 字 ≈ 200 tokens。用 Claude Sonnet 4.6 算一次:
- 輸入:200 tokens × $3.00/1M = $0.0006
- 輸出:600 tokens × $15.00/1M = $0.009
- 輸出佔比:93.75%
本表的輸出單價約為輸入的 2 至 8.3 倍。看模型時要同時帶入 input 與 output token 分布,不能只比較較低的輸入價。
陷阱 2:Context 膨脹公式
多輪對話的每次 API call 都帶著全部歷史訊息。你的 chatbot 對話越長,每次 call 的 context 就越大,費用線性增長。
簡單公式:
第 N 輪成本 ≈ 基礎成本 × (1 + N × 每輪增量 / 初始 context)
實際算一下。假設 system prompt 1000 tokens,每輪新增 200 tokens(用戶)+ 600 tokens(AI 回應):
| 輪數 | Context 大小 | 輸入成本(Sonnet) | 當輪總成本(含 600 tokens 輸出) |
|---|---|---|---|
| 第 1 輪 | 1,200 tokens | $0.0036 | $0.0126 |
| 第 5 輪 | 4,400 tokens | $0.0132 | $0.0222 |
| 第 10 輪 | 8,400 tokens | $0.0252 | $0.0342 |
第 10 輪的單次輸入成本是第 1 輪的 7 倍;算入每輪 600 tokens 的輸出後,當輪總成本約是第 1 輪的 2.7 倍。完整 10 輪累計約 $0.234,而把第 1 輪成本直接乘以 10 只會得到 $0.126,低估約 46%。
社群裡一個常見的抱怨是:「Context 一膨脹,每次 call 都在燒鈔票,初期不知道就虧爛。」
陷阱 3:System Prompt 稅
如果你沒開 prompt caching,每次 API call 都會重新傳送 system prompt。一個 1000 tokens 的 system prompt,每天 1000 次呼叫 = 每天 1M tokens 的「隱形輸入」。用 Sonnet 4.6 算,每天就是 $3,一個月 $90——光在重複傳送同一段文字。
費用階段梯:你現在在哪個階段?
選擇 API 前,先確認月用量落在哪個區間。不同規模適合不同 API,也有各自的切換觸發點。
Stage 0:< $10/月(MVP / Prototype)
你只是在驗證 idea,用量極低。
| 推薦 | 理由 |
|---|---|
| GPT-4o mini ($0.15/$0.60) | 最便宜的商業品質 API,每天 1000 次簡單呼叫 ≈ $11.7/月 |
| Gemini 2.5 Flash-Lite ($0.10/$0.40) | Google 最便宜方案,適合極輕量原型 |
| Groq GPT-OSS 20B ($0.075/$0.30) | 單價低,但要先驗證品質與 rate limit |
注意:Google Gemini API 的免費 tier 有嚴格的 rate limit(RPM / TPM 上限較低),適合原型測試但不適合 production。Gemini 2.5 Pro 和 Flash 系列目前仍提供免費 tier,但配額有限。如果你的產品有穩定用量,建議直接規劃付費方案,避免配額不足導致服務中斷。
觸發切換事件:需要更高的回應品質(GPT-4o mini 在複雜推理上的表現有限),或需要穩定的 SLA。
Stage 1:$10-50/月(早期產品,< 500 DAU)
你的產品有了第一批用戶,但規模還小。
| 推薦 | 理由 |
|---|---|
| Groq GPT-OSS 20B + GPT-5.6 Luna 混合 | 非關鍵任務走 Groq,需要不同能力時 fallback |
| Gemini 3.7 Flash ($0.75/$3.75,2026 促銷) | 適合需要多模態與 Google 工具的工作流 |
| xAI Grok 4.3 ($1.25/$2.50) | short context 下輸出單價較低;超過 200K context 另計 |
觸發切換事件:實測 RPM/TPM 接近帳戶上限、429 增加,或任務品質未達標。
Stage 2:$50-200/月(成長期,500-5000 DAU)
費用開始佔營運成本的可見比例,這個階段尤其關鍵。
| 推薦 | 理由 |
|---|---|
| Claude Haiku 4.5 ($1.00/$5.00) | 最佳品質/成本平衡,1000 次/天 chatbot ≈ $96/月 |
| OpenAI GPT-5.6 Luna ($0.20/$1.20) | OpenAI 的低成本級距;長 context 與其他 service tier 另計 |
Haiku 4.5 與 GPT-5.6 Luna 的單價差距已經拉大,但價格不能替代任務測試。先挑 20 至 50 筆真實輸入,同時比較成功率、重試次數、延遲與完整輸出成本,再決定主力模型。
觸發切換事件:低成本模型的重試與人工修正成本開始抵銷單價優勢。
Stage 3:> $200/月(穩定產品)
你有穩定的用戶基礎和可預測的用量。
| 推薦 | 理由 |
|---|---|
| Claude Sonnet 5 + Prompt Caching | $2/$10;cache hit 為標準輸入價的 10% |
| OpenAI GPT-5.6 Terra ($2/$12) | 適合既有 OpenAI 整合;先確認 context 與 service tier |
| 多供應商路由(Groq + Haiku fallback) | 降幅取決於實際路由比例與 token 分布 |
觸發切換事件:用量已穩定到能用真實流量比較 API 與自架 TCO,而不是只看單月帳單。
Groq + GPT-OSS:低單價的使用邊界
Groq 的 production models 目前包含 GPT-OSS 20B 與 120B,標準價格分別是 $0.075/$0.30 與 $0.15/$0.60。Llama 4 Maverick 與 Scout 已下架,舊 model ID 不能再當作新產品依賴。
把整個 SaaS 搬上去之前,先確認三個限制。
限制 1:Rate Limit 是真正的牆
Groq 免費層對 GPT-OSS 20B/120B 的公開限制為 30 RPM、8,000 TPM、1,000 RPD;Developer Plan 上限較高,實際值仍以帳戶 Limits 頁為準。
30 RPM 只是其中一個限制,長輸入通常會先撞 TPM。部署前應用尖峰流量壓測,並對 429 做退避與 fallback;不能用「同時幾個人」直接推算是否安全。
原型能跑不代表 production 容量足夠,真正要看 RPM、TPM、RPD 與錯誤率。
限制 2:模型版本與功能
Groq 將 GPT-OSS 20B/120B 列為 production models,支援 tool use、JSON mode 與 reasoning;但每個模型的 context、工具與輸出上限不同,仍要依官方 model page 逐項確認。
限制 3:Caching 折扣有限
Groq 對 GPT-OSS 20B/120B 提供自動 prompt caching,命中輸入的價格減半,無需額外設定;cache hit 不保證發生。如果重複 context 是成本主體,也要和 Anthropic 10% cache-read 價格一起試算。
可以用 Groq 的場景:批量文章摘要、資料分類、關鍵字提取、單用戶工具、非即時任務。
要先壓測再用的場景:高尖峰即時聊天、依賴特定多模態能力、複雜 tool use,或需要合約 SLA 的 B2B 產品。
Prompt Cache + Batch API:省錢神器還是假福利?
Prompt Caching(Anthropic)
Anthropic 的 prompt caching 會重用固定的 system prompt 或長文 context。官方目前支援自動 caching 與明確 breakpoint 兩種方式。
以 Sonnet 5 為例:
- 標準輸入:$2.00/1M tokens
- 5 分鐘 Cache write:$2.50/1M tokens(標準價的 1.25 倍)
- Cache read(命中):$0.20/1M tokens(標準價的 10%)
- TTL:5 分鐘(超時需重新 write)
適合使用的條件:
- 可快取的前綴夠長,且後續請求會重用相同內容
- 5 分鐘 TTL 內至少會有一次 cache read;官方價格下,一次 read 後就比兩次標準輸入便宜
- 能從 usage 回傳值確認實際命中,而不是假設有 cache
不適合直接假設會省的情況:
- 低頻請求在下一次使用前已過期
- 每次請求前綴都變動,無法命中
- 只看設定、不追蹤 cache creation/read tokens
是否省錢和 DAU 沒有固定門檻,關鍵是相同前綴在 TTL 內的重用次數。先用一週 usage log 計算命中率再決定。
Batch API(Anthropic / OpenAI)
如果你的任務不需要即時回應——文章摘要、資料分類、報告生成——Batch API 直接半價。
實際計算:用 Haiku 4.5 批量處理 1000 篇文章摘要,即時 API 約 $96,Batch 模式只要 $48。如果你的工作流容許非同步處理,這是最簡單的省錢方法。
多供應商路由:2026 性價比最高的架構
單一 API 供應商有三項風險:漲價時沒有替代方案、服務中斷時沒有 fallback,遇到 rate limit 也只能等待。
一個可測試的架構是 Groq primary + Haiku 4.5 fallback:
- 日常任務走 Groq GPT-OSS 120B($0.15/$0.60)
- Rate limit 撞牆或服務異常時自動切 Haiku 4.5($1/$5)
- 真正節省幅度要用各路徑的 input/output tokens、重試與 fallback 比例計算
OpenRouter vs 自建路由
OpenRouter:零程式碼多供應商路由。一個 API key 切換多家,自動 fallback,即時比價。
- 適合:Prototype 階段、技術能力有限、想快速實驗
- 代價:多一層供應商、政策與延遲差異;markup 與功能支援以 OpenRouter 當下 model page 為準
自建路由:當你需要掌握 fallback 條件、觀測性與供應商政策時再投資。除了 retry,還要處理 idempotency、rate limit、timeout、輸出格式差異與成本記錄。
台灣開發者 API 支付指南
支付成功與否會同時受到供應商支援國家、帳單地址、卡組織、發卡行風控與 3-D Secure 影響,無法用單一「成功率」代表。本文先前列出的特定銀行與 Wise 成功率沒有官方保證,因此移除。
遇到拒付怎麼辦?
先確認平台帳單國家與地址是否正確,再向供應商查詢 decline code,並請發卡行確認海外網路交易與定期扣款是否開放。不要反覆大量重刷,也不要把社群中的單次成功案例當作長期可用承諾。
選型決策樹:3 步驟選出你的 API
可以把選擇流程整理成三步:
Step 1:算月費
月費 = (input_tokens × 輸入單價 + output_tokens × 輸出單價) / 1,000,000 × 月調用次數
不知道你的 token 分佈?先假設 1:3(input:output),用你預估的每日調用次數算一個月的大概數字。上線後用 API 的 usage dashboard 替換成真實數據。
Step 2:比對費用階段
| 月費 | 簡單任務 | 需要高品質推理 |
|---|---|---|
| < $10 | GPT-5.6 Luna / GPT-4o mini | Gemini 3.7 Flash |
| $10-50 | Groq GPT-OSS 20B / 120B | Haiku 4.5 |
| $50-200 | Haiku 4.5 | Haiku 4.5 |
| > $200 | Groq + Haiku 路由 | Sonnet 4.6 + Cache |
Step 3:確認限制條件
- 需要 vision 或 function calling?→ 排除 Groq 某些模型
- 尖峰流量接近 RPM/TPM?→ 升級額度或加入 fallback
- 任務可批量?→ 用 Batch API 直接半價
- 有重複 system prompt?→ 評估 Anthropic caching
什麼時候應該考慮自架開源模型?
考慮自架前,先計算總持有成本(TCO)。
自架成本要逐項報價:
- 依模型大小、量化方式、峰值吞吐與延遲目標取得 GPU 報價
- 用實際流量估算利用率;閒置 GPU 仍會產生成本
- 加入監控、擴縮、故障備援、安全更新、資料治理與工程值班時間
- 用相同的一週或一個月流量,同時跑 API 與自架 proof of concept 比較 TCO
| 狀況 | 建議 |
|---|---|
| 用量低或波動大 | API 通常較容易控制風險,先量測真實 token 與重試成本 |
| 流量穩定、資料或延遲有特殊要求 | 取得 GPU 與維運報價,做小規模 proof of concept |
| 已有平台團隊與高利用率工作負載 | 才有足夠條件評估長期自架,不代表一定比較便宜 |
自架不是單純把 API 單價換成 GPU 時租。若沒有把人力、備援與低利用率算進去,試算通常會過度樂觀。
風險揭露
定價隨時變化:本文價格查核至 2026 年 8 月 30 日,已納入 GPT-5.6 Sol 的 8 月調價、Gemini 3.7 Flash 促銷價與 Groq Llama 4 下架。下決策前,務必再確認各供應商官方定價頁。
試算基於假設:本文的費用計算基於「input 200 tokens + output 600 tokens」的典型 chatbot 假設。你的實際 token 分佈可能差異極大——上線後的第一件事是從 API dashboard 測量真實數字,再調整估算。
供應商鎖定風險:把所有產品綁在單一供應商的專屬功能上(如 Anthropic caching、OpenAI function calling 語法),會增加未來切換的成本。建議用抽象層隔離 API 呼叫,保持供應商切換的彈性。
結論
AI API 的實際成本還包括容易漏算的項目:輸出 token 佔 80% 成本、context 膨脹讓對話越長越貴,system prompt 也會在每次呼叫時重複計費。
選對方案可以省下不少支出。用費用階段梯框架縮小候選範圍,再用自己的 input/output 分布、成功率、重試與延遲實測;Batch API 和多供應商路由只有在工作負載符合條件時才會真正省錢。
先用上面的公式估算月費,再比對階段梯表選擇 API。上線後測量實際 token 分佈,每月檢查一次是否需要切換;定價仍在快速變動,目前的選擇三個月後可能就不再適合。
FAQ
Claude 訂閱和 Claude API 哪個比較划算?
兩者用途不同。訂閱方案供個人互動使用,API 則供產品按 token 呼叫,不能直接用訂閱額度替代。若要做產品,請以真實 input、output、cache 與 tool use 用量估算 API 成本。
Groq 還能使用 Llama 4 Scout 或 Maverick 嗎?
一般 developer tier 已不能使用。Groq 分別在 2026 年 3 月 9 日與 7 月 17 日關閉 Llama 4 Maverick 與 Scout,官方建議改用 openai/gpt-oss-120b 或 qwen/qwen3.6-27b。
台灣信用卡一定能刷 Anthropic、OpenAI 或 Google AI 嗎?
沒有跨平台、跨發卡行都保證成功的答案。支付支援會隨供應商、帳單國家與發卡行風控變動;請以各平台結帳頁為準,遇到拒付時先向供應商與發卡行確認,不要把社群個案當成保證。
什麼時候應該評估自架開源模型?
不要用單一月費門檻判斷。把 GPU 報價、利用率、峰值容量、監控、安全更新、值班與工程時間都放進 TCO,再與同一批真實流量的 API 帳單比較。
這篇文章對你有幫助嗎?



