AI 費用要先分成「聊天訂閱」與「API 用量」兩本帳。 個人使用者常浪費在功能重疊的月費;開發團隊的主要成本則來自重複輸入、過長輸出、所有任務都用大模型,以及沒有配額的 Agent 工具呼叫。
我的建議很直接:先記錄一週實際使用,再砍訂閱或改架構。看不到「哪個功能、哪類請求、每位使用者」花了多少錢時,任何省費比例都只是猜測。
ChatGPT、Claude 月費和 API 費用要分開算
OpenAI 說明指出 ChatGPT 訂閱與 API 分開計費;Anthropic 也把 Claude 付費聊天方案與 Console API 視為不同產品。因此,訂了聊天方案後用 API,仍會產生另一筆帳單。
選擇時可用這個判斷:
| 需求 | 較合適的付費方式 | 注意事項 |
|---|---|---|
| 自己聊天、寫作、研究 | 固定月費聊天方案 | 檢查不同工具是否功能重複 |
| 網站或內部系統呼叫模型 | API 按量計費 | 要記錄 Token、工具與每位使用者成本 |
| 大量離線摘要、分類、翻譯 | Batch API | 接受延遲,換取較低單價 |
| 敏感資料且已有合適硬體 | 本地模型 | 還有硬體、電力、維護與人力成本 |
我不建議用個人聊天帳號共用或模擬網頁操作來支撐正式產品。帳號權限、穩定性與資料治理都很難管理,API 才是可監控的產品介面。
API 帳單怎麼算?先抓四個數字
每月模型費用可用這個公式估算:
月費 = 請求數 ×(平均輸入 Token × 輸入單價
+ 平均快取 Token × 快取單價
+ 平均輸出 Token × 輸出單價)
+ 搜尋、圖片、語音、程式執行等工具費
單價通常以每百萬 Token 標示。假設某模型輸入每百萬 Token 收 1 美元、輸出收 6 美元,一個月用了 200 萬輸入 Token 與 50 萬輸出 Token,純文字模型費就是 5 美元。這是示範公式,實際費率請回到 OpenAI API Pricing、Claude API Pricing或所用供應商頁面核對。
別只看總 Token。輸出單價經常高於輸入,Agent 還可能另計網路搜尋、程式執行或其他伺服器工具。每筆紀錄至少保留模型、輸入、快取輸入、輸出、工具次數、使用者與功能名稱。不了解 Token 的讀者可先看 Token 計算入門。
六個省費槓桿,照這個順序做
1. 刪除沒有產生價值的請求
先找重試迴圈、重複摘要、機器人流量、測試環境與沒人使用的功能。一次不該發生的請求,再便宜也比優化後的必要請求貴。開發與正式環境應分開 API 專案與金鑰,才看得出錢花在哪裡。
2. 控制輸出長度
提示模型「簡短回答」不夠穩。摘要要限制欄位與字數,資料擷取可用 Structured Output固定 Schema;不需要推理過程或長篇解釋時,不要要求模型輸出。先從輸出 Token 最高的功能下手,通常最快看到差異。
3. 讓模型分流,但以品質門檻決定
分類、格式轉換與簡短摘要先用低成本模型;複雜判斷再升級。路由規則要用真實測試集驗證,不能只用提示詞長度猜難度。若便宜模型讓人工返工增加,帳面 Token 下降也不算節省。
4. 減少每輪重送的上下文
長對話會反覆帶入歷史訊息、工具結果與文件。保留任務需要的狀態,移除已完成的中間結果;大型知識庫使用 RAG檢索相關段落。更完整的取捨可看 Context Window 管理。
5. 重複前綴才使用 Prompt Caching
Prompt Caching 適合固定 System Prompt、工具定義、範例或長文件被多次重用的情境。OpenAI 的 Prompt Caching 文件與 Claude 定價文件都把快取輸入分開計價;Claude 官方目前列出的快取讀取費率是基礎輸入價格的 0.1 倍,首次寫入則會加價。
快取不會自動讓整張帳單少九成。每次輸入都不同、請求間隔超過有效期,或成本主要在輸出與工具時,收益會很小。上線前要看實際快取命中 Token,別拿供應商的最高折扣直接當成預估節省。
6. 可等待的工作改用 Batch
夜間摘要、資料分類、評測與批次產生內容不需要即時回覆。OpenAI Batch API提供獨立批次額度與非同步處理;Claude 官方定價列出 Batch 的輸入、輸出 Token 均享 50% 折扣,Google 的 Gemini API Pricing也分列標準與 Batch 費率。
Batch 要處理排程、失敗重送與結果對應。使用者正在畫面前等待的請求,不適合為了折扣硬改成批次。
預算警報不等於硬上限
OpenAI 專案可以設定月預算與通知門檻,但官方專案管理說明明確表示這是軟性門檻,超過後 API 請求仍會繼續。這個細節非常重要。
正式服務應在自己的後端再做四層限制:單次輸入與輸出上限、每位使用者每日配額、工具呼叫次數上限、全站異常時的停用開關。警報用來通知人,程式限制才負責止血。
每週追蹤這四個指標就夠用:每次成功任務成本、每位活躍使用者成本、快取命中 Token 占比、各模型的品質通過率。只看月總額,無法判斷成長帶來的合理支出與系統浪費。
Ollama 是免費的嗎?
Ollama 官方定價列有免費、Pro、Max 與團隊方案;在自己的硬體執行模型可不限本地用量,雲端模型則依方案有不同額度。把 Ollama 說成「完全免費」會漏掉顯示卡、記憶體、電力、部署與維護時間。
本地模型適合資料不能離開設備、已有閒置硬體,或固定批次工作能穩定跑小模型的情況。若只是偶爾使用,為了省幾美元 API 費購買顯示卡,總持有成本可能更高。安裝與硬體判斷可參考 Ollama 本地模型指南。
Ollama 是執行工具,不代表每個模型都能自由商用。下載前要核對模型參數規模、記憶體需求與授權條款;同一套硬體能順跑的小模型,換成更大參數模型後可能變慢或無法載入。
常見問題
API 一定比 AI 月費訂閱便宜嗎?
不一定。API 適合程式化、按量使用與精確監控;聊天訂閱通常還含網頁介面、檔案、語音或其他功能。先比較自己的實際用途,不要只比較 Token 單價。
Prompt Caching 真的能省 90% 嗎?
某些供應商的「快取讀取 Token」單價可低到一般輸入的十分之一,但只套用在命中的重複前綴。整體帳單還包含首次寫入、未快取輸入、輸出與工具費,所以實際降幅要看用量紀錄。
什麼工作最適合 Batch API?
適合不需即時回覆的大量分類、摘要、翻譯、評測與資料補全。客服對話、互動式搜尋和使用者正在等待的操作,通常仍要走即時 API。
如何避免 Agent 意外燒掉 API 預算?
限制每次迴圈與工具呼叫次數,對每位使用者設每日配額,並在後端設定可真正拒絕請求的總額開關。供應商的預算通知可能只是警報,不能視為唯一防線。
Ollama Pro 是必要訂閱嗎?
在自己硬體執行公開模型不需要 Pro;Pro 主要增加雲端模型用量、並行數與私人模型等能力。是否需要取決於你使用本地算力或 Ollama Cloud,兩者成本結構不同。