打開 ChatGPT、Gemini 或 Claude,看到一排看不懂的型號名稱不知道該點哪一個時,先記住這句話:先問「這件事錯了會怎樣」。錯了頂多重做一次,就用便宜的;錯了會影響決策或要拿出去給別人看,就用最強的,而且自己再看過一遍。
這一句能解掉八成的選擇困難。你不需要背規格、不需要看跑分,也不需要記住每一顆模型叫什麼名字——你只需要知道,這些等級之所以存在,是因為大部分任務根本不需要最強的那一顆。
先講結論:等級不是「好壞」,是「拿多少換多少」
很多人把這三個等級理解成「高級版、普通版、陽春版」,然後預設自己該用最貴的那個。這是最貴的一個誤會。
正確的理解是:這不是品質分級,是取捨分級。推理深度、速度、價格三件事互相拉扯——要它想得深,你就得接受慢一點、貴一點;要它快、要它便宜,思考深度就得讓一點。沒有哪一顆是全贏。
為什麼同一家公司要同時推好幾款模型
這是現在的常態,不是個案。OpenAI 的模型列表、Anthropic 的模型總覽、Google 的 Gemini 模型頁,三家官方文件都是一整排分層擺著給你挑(連結見文末)。
原因很現實:最強的模型跑起來很貴,而多數任務用不上那個強度。 把一封信改順、把錄音整理成條列、翻譯一段產品說明——這些事情輕量級做出來的品質跟旗艦差不多,但快上好幾倍、成本可能差一個級距。廠商如果只賣旗艦,等於逼所有人用大砲打蚊子。
所以廠商會一邊推新旗艦、一邊拚命把中階與輕量做強做便宜。像 OpenAI 大砍 API 價格那次,降最兇的就是最小那一款;Google 一次推出三款 Gemini 時,主力也不是旗艦。這不是產品線很亂,是刻意分層。
三個等級大概對應什麼
不用記型號,記「三種角色」就好。
旗艦級:想得最深,但慢、也最貴。 適合需要多步推理的事——複雜分析、讀完長文件再給結論、程式除錯。它的價值在「難題答得對」,不在「答得快」。
中階級:大部分工作的預設值。 速度和品質都在中間,是你不確定時最不會出錯的選擇。日常寫作、整理、摘要、一般問答,中階都扛得住——很多人其實整天都待在這一層。
輕量級:快、便宜,適合簡單又量大。 分類、抽取欄位、格式轉換、簡短回覆、把一段話換個說法——這種「規則清楚、答案不需要創意」的事,輕量級不但夠用,而且因為快,體驗反而更好。
一個常被忽略的重點:輕量級不是「笨版旗艦」。 它在簡單任務上和旗艦的差距很小,你多付的錢買到的是「難題的正確率」,不是「所有事情都變好」。
一般人怎麼判斷該用哪一級
兩層判斷,照著問就好。
第一層:這件事錯了會怎樣
這是最有效的一個問題,因為它問的不是模型,是風險。
- 錯了頂多重做一次、沒有實質損失 → 用便宜的。想標題、擬草稿、腦力激盪、把資料排成表格、翻譯自己要看的東西。錯了你一眼看得出來,重跑一次的成本趨近於零。
- 錯了會影響決策,或要對外 → 用最強的,而且人工覆核。合約條款的解讀、財務或法規相關的判斷、要寄給客戶的內容、要放上官網的文案、要拿去跟老闆報告的分析。這種時候省下的那點錢,跟出錯的代價完全不成比例。
請注意後半句:「用旗艦」不等於「可以不檢查」。 等級高只是讓它更少出錯,不是讓它不會出錯——它一樣可能產生看起來很合理的錯誤資訊。真正的保險是你自己看過,不是模型名稱。
第二層:這件事會做很多次,還是只做一次
第一層判完,再補問這一句。
- 量大、重複、規則清楚的事 → 往輕量級靠。一天要跑一百次的事,速度和成本會被放大一百倍;而這類任務通常也最單純,正好是輕量級的強項。
- 一次性、但很重要的事 → 直接用旗艦,別省。一年寫一次的年度計畫、一個決定要不要投資的分析、一份要簽的合約——只做一次的事,用最好的模型多花的那點成本,換算下來根本是零頭。
兩層合起來,你會得到一個很順的直覺:重複的事往下走,重要的事往上走。 多數人的日常會落在中階,再往兩個方向各分出去一小塊。
免費版、付費版怎麼對應到等級
一般人其實不太會主動去「選模型」,多半是被免費版和付費版被動決定的。大致的對應是:免費版通常給你中階或輕量,旗艦多半鎖在付費裡,或只讓你試用幾次。
所以「該不該付費」和「該用哪一級」是同一個問題的兩面:常常落在「錯了會影響決策」那一格,你就是需要旗艦,付費才划算;整天都在做重做一次也沒差的事,免費版的中階就很夠。完整的付費判斷法見 AI 免費版 vs 付費版差在哪,這裡不重複。
最容易踩的三個坑
坑一:以為越貴越好。 這是最普遍的浪費。有些人所有事情都開旗艦,包括「幫我把這段話改短」。結果是更慢、更花錢,品質卻沒有肉眼可見的差別。旗艦是解難題用的,不是預設值。
坑二:以為便宜的都不能用。 反過來的偏見一樣傷。日常八成的任務——摘要、改寫、翻譯、分類、抓重點——輕量級都做得好。因為「便宜的一定爛」而全程開旗艦,等於一直在為用不到的能力付錢,還順便讓自己每次都多等。
坑三:只看跑分。 評測榜單有兩個問題:一是絕大多數是廠商自己宣稱的成績,二是它測的不是你的任務。榜上贏個兩分,跟你手上這份中文合約讀不讀得懂幾乎沒有關係。與其看榜,不如拿你真實的三個任務,同一題丟給不同等級各跑一次,看哪一級的結果「不用改就能用」——那才是你的答案。
我們的立場:該量的不是單價,是「做對一件事的成本」
該量的不是「每百萬字多少錢」,是「完成一件正確的事花多少錢」。
一個便宜的模型,如果讓你來回重問三次、還要自己動手改一輪,它其實比旗艦貴——因為你的時間才是最貴的那一項。反過來,旗艦模型被拿去做「改標點符號」這種事,再強也是浪費。
所以我們的建議很直接:別問「哪一顆最強」,問「這件事值得花多少」。 平常待在中階,簡單重複的往下丟,重要不可逆的往上調,然後不管用哪一級,重要的東西都自己看過一遍。這套習慣,比追最新的型號名稱有用得多。
想更有系統地依公司與工作情境挑工具,可以接著看 ChatGPT vs Claude vs Gemini:中小企業怎麼選。
常見問題
我不知道自己現在用的是哪一級模型,怎麼辦?
多數聊天介面會在輸入框附近放一個模型選單,點開就看得到目前選的是哪一款;沒有選單的通常代表你在免費版、由系統自動幫你配。不必太糾結——先照「錯了會怎樣」判斷這件事需要哪一級,真的需要強的再去找哪裡可以切換。
平常就固定用最強的模型,不行嗎?
可以,但會多付兩種成本:等待時間和金錢。你如果是輕度使用者、又是包月吃到飽,影響不大;但只要量開始變大或走 API 計費,「什麼都開旗艦」很快會變成一筆莫名其妙的支出。更常見的困擾是慢——簡單的事等三十秒,體驗其實更差。
輕量級模型是不是比較容易亂編?
一般來說,能力越弱的模型在需要推理的難題上越容易出錯,但在簡單任務上差距很小。關鍵不是等級,是任務難度和你有沒有給足資料。與其急著升級模型,不如先把資料貼齊、把問題問清楚,這對正確率的幫助往往更大。
模型名稱一直換,我要一直跟著學嗎?
不用。型號會一直改,但「旗艦/中階/輕量」這個分層結構很穩定,各家長得也差不多。你只要看得懂「這一款在它自己家裡屬於哪一級」,換誰家、換到第幾代,都能用同一套判斷。