回到頂部
深色工作台上三顆代表 Gemini 模型等級的發光運算核心,旁邊排列成本、速度與推理能力指標

Gemini 3.6 Flash 價格與選型:和 3.5 Flash-Lite、3.1 Pro 怎麼選?

整理 Gemini 3.6 Flash、3.5 Flash-Lite 與 3.1 Pro 的價格、脈絡窗與適用任務,附遷移測試清單,幫你選對 Google AI 模型。

內容查核: 來源查核:

如果你搜尋「Gemini 3.6 Flash 價格」或「Gemini 模型怎麼選」,先記住一個簡單結論:大量日常任務先測 3.6 Flash,極度重視成本才測 3.5 Flash-Lite,真正困難的推理再用 3.1 Pro Preview 做對照。 這三款面向不同工作,選型重點是每一件成功任務究竟花多少錢、要不要人工重做。

本文以 2026 年 8 月 13 日可查到的 Gemini API 型號最新規格為準。費率、限額與版本狀態可能變動,正式導入前要再核對一次。

Gemini 3.6 Flash、3.5 Flash-Lite、3.1 Pro 快速比較

模型適合任務選它的理由導入時要注意
Gemini 3.6 Flash客服、抽取、多模態分析、一般 Agent、程式輔助速度、能力與成本較均衡,支援 100 萬 token 脈絡窗新模型仍要用自己的資料驗證指令遵循與工具呼叫
Gemini 3.5 Flash-Lite分類、標記、短摘要、批次資料處理官方定位偏低成本與高吞吐量複雜任務可能增加重試與人工修正,便宜單價不等於低總成本
Gemini 3.1 Pro Preview複雜規劃、困難程式、長鏈推理、高價值分析適合拿來測試更高推理上限Preview 可能調整版本、配額與行為,正式流程要保留退路

官方最新模型頁列出的參考價格中,Gemini 3.6 Flash 為每百萬輸入 token 1.50 美元、輸出 token 7.50 美元;Gemini 3.5 Flash-Lite 為輸入 0.30 美元、輸出 2.50 美元。兩者都提供 100 萬 token 脈絡窗與最高 64K 輸出。實際帳單還會受到快取、批次處理、工具呼叫、思考 token 與不同平台計價影響,不能只拿兩個掛牌數字相乘。

先用任務風險選模型

選 Gemini 3.6 Flash:大多數產品的起點

3.6 Flash 適合當成新專案的預設基線。它能處理文字、圖片、音訊與影片,也能支援長文件和工具呼叫。常見情境包括:

  • 從合約、報表或客服紀錄抽取結構化欄位。
  • 先理解圖片或影片,再產生摘要與標記。
  • 需要兩到五步工具呼叫的 Agent 工作流。
  • 產生程式碼、測試案例或一般技術說明。

但「100 萬 token 放得下」不代表每次都該塞滿。脈絡越長,成本與延遲通常越高,模型也可能忽略埋在中段的關鍵條件。產品端應先做檢索、去重與內容分段,只把回答需要的材料送進模型。

選 Gemini 3.5 Flash-Lite:量大而且規則清楚

Flash-Lite 的價值在吞吐量。每天處理數萬筆商品標籤、意圖分類、敏感內容初篩或短文字摘要時,較低單價很有吸引力。適合它的任務通常有三個特徵:答案格式固定、錯誤容易偵測、失敗後可以重跑。

不要把它直接放進高風險判斷,例如合約責任、醫療建議或不可逆的帳號處置。模型若讓人工覆核時間增加,省下的 token 費很快會被吃掉。更實際的指標是「每 1,000 筆資料有幾筆要人工修正」,而非單看每百萬 token 價格。

選 Gemini 3.1 Pro Preview:先當能力上限測試組

遇到跨檔案程式修改、複雜規劃或多重限制推理,可以把 Pro Preview 納入比較。做法是讓它和 3.6 Flash 跑同一批案例,確認成功率提升是否足以抵銷延遲、價格與 Preview 風險。

Preview 最需要防的是版本漂移。請把模型 ID 放在設定層,保存測試輸入與預期輸出,並設好可切回 Flash 或其他供應商的開關。若流程涉及 Agent,也可搭配 Gemini Interactions API 與 Managed Agents 指南 檢查狀態保存、工具權限與失敗恢復方式。

Gemini 3.6 Flash 遷移測試怎麼做

不要用五個隨手 prompt 判斷模型。從正式流量抽出 30 到 100 筆案例,至少保留正常、邊界與曾經失敗的三類資料,再比較以下指標:

  1. 任務完成率:輸出是否真的能進入下一個系統,而非只看文字是否流暢。
  2. 人工修正時間:記錄修正秒數;模型少錯一點,常比 token 便宜一點更有價值。
  3. 每件成功任務成本:把失敗重跑、思考 token、工具呼叫和人工成本都算進去。
  4. P50 與 P95 延遲:平均很快不夠,尖峰時的等待才會影響使用者。
  5. 格式與工具成功率:JSON schema、函式參數、引用和拒答行為都應個別統計。

先把舊模型當控制組,不要同時改模型、system prompt、檢索資料與溫度。一次只改一項,才能知道改善來自哪裡。需要控制預算時,可再參考 AI API 成本優化指南 設計快取、路由與用量告警。

三個常見的選型錯誤

第一,只看 benchmark。 公開跑分能排除明顯不合格的模型,卻無法代表你的欄位、語言、工具或錯誤成本。中文客服、台灣法規文件與英文程式庫會得到完全不同的結果。

第二,只看每百萬 token 單價。 較便宜的模型如果輸出更長、重試更多,總成本可能更高。請用「完成一件可交付任務」作為分母。

第三,把 Preview 當永久型號。 預覽模型適合探索,不適合沒有回歸測試與替代路徑的關鍵流程。正式環境至少要記錄模型 ID、提示版本、錯誤率與切換日期。

我的建議

新專案先以 Gemini 3.6 Flash 建立品質與延遲基線,再拿 3.5 Flash-Lite 挑戰成本底線,最後用 Pro Preview 測試最難的 10% 任務。這樣能把模型分層:便宜模型吃大量簡單工作,均衡模型處理主流請求,高能力模型只接真正值得的案例。

若你正在比較不同供應商,請用同一份案例集閱讀 GPT、Claude、Gemini 實測比較方法。模型名稱每幾個月就會換,自己的測試資料與決策門檻才是能長期沿用的資產。

常見問題

Gemini 3.6 Flash 的 API 價格是多少?

依 Google 2026 年 8 月 13 日官方最新模型頁,參考價為每百萬輸入 token 1.50 美元、輸出 token 7.50 美元。快取、批次、思考 token 與平台方案可能採不同計價,部署前請再查官方定價頁。

Gemini 3.6 Flash 和 3.5 Flash-Lite 哪個比較好?

一般產品先測 3.6 Flash;大量分類、標記與短摘要才優先測 3.5 Flash-Lite。最後應比較成功率、人工修正、延遲與每件成功任務成本,不能只比 token 單價。

需要等 Gemini 3.5 Pro 嗎?

不用把專案押在尚未列入官方模型清單的名稱上。現在可用 3.6 Flash 建立基線,困難任務則測試目前列出的 Pro Preview。關於 3.5 Pro 的最新狀態,可看 Gemini 3.5 Pro 上線了嗎

舊模型要立刻遷移到 Gemini 3.6 Flash 嗎?

先確認官方生命週期與停用日期,再用真實案例做影子測試。若品質、P95 延遲和每件成功任務成本都達標,才逐步切流量;不要只因為型號較新就一次全換。

參考來源

№ · further reading

延伸閱讀