如果你搜尋「Gemini 3.6 Flash 價格」或「Gemini 模型怎麼選」,先記住一個簡單結論:大量日常任務先測 3.6 Flash,極度重視成本才測 3.5 Flash-Lite,真正困難的推理再用 3.1 Pro Preview 做對照。 這三款面向不同工作,選型重點是每一件成功任務究竟花多少錢、要不要人工重做。
本文以 2026 年 8 月 13 日可查到的 Gemini API 型號 與最新規格為準。費率、限額與版本狀態可能變動,正式導入前要再核對一次。
Gemini 3.6 Flash、3.5 Flash-Lite、3.1 Pro 快速比較
| 模型 | 適合任務 | 選它的理由 | 導入時要注意 |
|---|---|---|---|
| Gemini 3.6 Flash | 客服、抽取、多模態分析、一般 Agent、程式輔助 | 速度、能力與成本較均衡,支援 100 萬 token 脈絡窗 | 新模型仍要用自己的資料驗證指令遵循與工具呼叫 |
| Gemini 3.5 Flash-Lite | 分類、標記、短摘要、批次資料處理 | 官方定位偏低成本與高吞吐量 | 複雜任務可能增加重試與人工修正,便宜單價不等於低總成本 |
| Gemini 3.1 Pro Preview | 複雜規劃、困難程式、長鏈推理、高價值分析 | 適合拿來測試更高推理上限 | Preview 可能調整版本、配額與行為,正式流程要保留退路 |
官方最新模型頁列出的參考價格中,Gemini 3.6 Flash 為每百萬輸入 token 1.50 美元、輸出 token 7.50 美元;Gemini 3.5 Flash-Lite 為輸入 0.30 美元、輸出 2.50 美元。兩者都提供 100 萬 token 脈絡窗與最高 64K 輸出。實際帳單還會受到快取、批次處理、工具呼叫、思考 token 與不同平台計價影響,不能只拿兩個掛牌數字相乘。
先用任務風險選模型
選 Gemini 3.6 Flash:大多數產品的起點
3.6 Flash 適合當成新專案的預設基線。它能處理文字、圖片、音訊與影片,也能支援長文件和工具呼叫。常見情境包括:
- 從合約、報表或客服紀錄抽取結構化欄位。
- 先理解圖片或影片,再產生摘要與標記。
- 需要兩到五步工具呼叫的 Agent 工作流。
- 產生程式碼、測試案例或一般技術說明。
但「100 萬 token 放得下」不代表每次都該塞滿。脈絡越長,成本與延遲通常越高,模型也可能忽略埋在中段的關鍵條件。產品端應先做檢索、去重與內容分段,只把回答需要的材料送進模型。
選 Gemini 3.5 Flash-Lite:量大而且規則清楚
Flash-Lite 的價值在吞吐量。每天處理數萬筆商品標籤、意圖分類、敏感內容初篩或短文字摘要時,較低單價很有吸引力。適合它的任務通常有三個特徵:答案格式固定、錯誤容易偵測、失敗後可以重跑。
不要把它直接放進高風險判斷,例如合約責任、醫療建議或不可逆的帳號處置。模型若讓人工覆核時間增加,省下的 token 費很快會被吃掉。更實際的指標是「每 1,000 筆資料有幾筆要人工修正」,而非單看每百萬 token 價格。
選 Gemini 3.1 Pro Preview:先當能力上限測試組
遇到跨檔案程式修改、複雜規劃或多重限制推理,可以把 Pro Preview 納入比較。做法是讓它和 3.6 Flash 跑同一批案例,確認成功率提升是否足以抵銷延遲、價格與 Preview 風險。
Preview 最需要防的是版本漂移。請把模型 ID 放在設定層,保存測試輸入與預期輸出,並設好可切回 Flash 或其他供應商的開關。若流程涉及 Agent,也可搭配 Gemini Interactions API 與 Managed Agents 指南 檢查狀態保存、工具權限與失敗恢復方式。
Gemini 3.6 Flash 遷移測試怎麼做
不要用五個隨手 prompt 判斷模型。從正式流量抽出 30 到 100 筆案例,至少保留正常、邊界與曾經失敗的三類資料,再比較以下指標:
- 任務完成率:輸出是否真的能進入下一個系統,而非只看文字是否流暢。
- 人工修正時間:記錄修正秒數;模型少錯一點,常比 token 便宜一點更有價值。
- 每件成功任務成本:把失敗重跑、思考 token、工具呼叫和人工成本都算進去。
- P50 與 P95 延遲:平均很快不夠,尖峰時的等待才會影響使用者。
- 格式與工具成功率:JSON schema、函式參數、引用和拒答行為都應個別統計。
先把舊模型當控制組,不要同時改模型、system prompt、檢索資料與溫度。一次只改一項,才能知道改善來自哪裡。需要控制預算時,可再參考 AI API 成本優化指南 設計快取、路由與用量告警。
三個常見的選型錯誤
第一,只看 benchmark。 公開跑分能排除明顯不合格的模型,卻無法代表你的欄位、語言、工具或錯誤成本。中文客服、台灣法規文件與英文程式庫會得到完全不同的結果。
第二,只看每百萬 token 單價。 較便宜的模型如果輸出更長、重試更多,總成本可能更高。請用「完成一件可交付任務」作為分母。
第三,把 Preview 當永久型號。 預覽模型適合探索,不適合沒有回歸測試與替代路徑的關鍵流程。正式環境至少要記錄模型 ID、提示版本、錯誤率與切換日期。
我的建議
新專案先以 Gemini 3.6 Flash 建立品質與延遲基線,再拿 3.5 Flash-Lite 挑戰成本底線,最後用 Pro Preview 測試最難的 10% 任務。這樣能把模型分層:便宜模型吃大量簡單工作,均衡模型處理主流請求,高能力模型只接真正值得的案例。
若你正在比較不同供應商,請用同一份案例集閱讀 GPT、Claude、Gemini 實測比較方法。模型名稱每幾個月就會換,自己的測試資料與決策門檻才是能長期沿用的資產。
常見問題
Gemini 3.6 Flash 的 API 價格是多少?
依 Google 2026 年 8 月 13 日官方最新模型頁,參考價為每百萬輸入 token 1.50 美元、輸出 token 7.50 美元。快取、批次、思考 token 與平台方案可能採不同計價,部署前請再查官方定價頁。
Gemini 3.6 Flash 和 3.5 Flash-Lite 哪個比較好?
一般產品先測 3.6 Flash;大量分類、標記與短摘要才優先測 3.5 Flash-Lite。最後應比較成功率、人工修正、延遲與每件成功任務成本,不能只比 token 單價。
需要等 Gemini 3.5 Pro 嗎?
不用把專案押在尚未列入官方模型清單的名稱上。現在可用 3.6 Flash 建立基線,困難任務則測試目前列出的 Pro Preview。關於 3.5 Pro 的最新狀態,可看 Gemini 3.5 Pro 上線了嗎。
舊模型要立刻遷移到 Gemini 3.6 Flash 嗎?
先確認官方生命週期與停用日期,再用真實案例做影子測試。若品質、P95 延遲和每件成功任務成本都達標,才逐步切流量;不要只因為型號較新就一次全換。