打開新聞看到「某某模型在某榜單登頂」,先記住一句話:跑分(benchmark)回答的是「它在那一組題目上考得如何」,不是「它對你的工作好不好用」。 這兩件事之間的距離,比多數人以為的遠得多。
這篇不列榜單、不比分數——那些三個月就過期。這篇只教你讀懂新聞裡那個數字:它從哪裡來、能推論到什麼、什麼時候可以直接略過。
先講結論:跑分是「考試成績」,不是「工作表現」
把跑分當成升學考試就對了。考高分的人通常不會太差,但你要找的是一個能處理你手上這份中文合約、寫得出你要的語氣、整理得出你要的格式的人。而考卷上沒有這些題目。
所以跑分能回答的是「這顆模型的能力大概在什麼水位」,不能回答「它適不適合我」。看到「登頂」兩個字,正確的反應不是急著換工具,是先問一句:它到底在考什麼。
跑分大致三類,先分清楚你看到的是哪一種
一、固定題庫、自動評分。 最常見的一種:一份寫死的考卷,機器對答案。好處是可以重複跑、大家用同一份卷子,比較起來公平。壞處也很直接——題目公開久了,模型在訓練時可能早就「見過考古題」,分數繼續漲,真實能力不一定跟著漲。這類數字適合看大方向,不適合看小差距。
二、真人兩兩投票。 同一個問題給出兩個匿名回答,讓人選比較好的那一個,累積成排名。它比較接近一般人的體感,因為評分的是真人不是程式。但有兩個看不見的變數:投票的人問了什麼題目、以及投票的人是誰。如果多數參與者是工程師、問的多半是程式和英文,那個排名就不太能代表「一個台灣行政人員用起來順不順」。
三、特定任務評測。 寫程式、解數學、讀長文件、操作軟體——題目本身就是一件具體的事,所以最接近實用。但限制也寫在名字裡:它只代表那一項。 程式評測拿第一,跟中文寫作好不好,是完全分開的兩件事。
讀跑分時要問的四個問題
看到任何一個分數,照這四題問一遍,大部分的誤讀都會被擋下來。
一、誰做的測試?
廠商自己測自己的,要打折看。這不是說廠商造假,而是發表方永遠握有選擇權:挑哪些項目呈現、跟誰比、用什麼設定跑。本站寫新模型時固定標「官方宣稱」,像 Anthropic 推 Claude Opus 5 與 Kimi K3 宣稱史上最大開源模型 這兩篇,講的就是同一件事:官方數字可以參考,但在獨立第三方驗證之前,不該當成結論。
二、測的是什麼題目?
這是四題裡最重要的一題。把榜單的題型跟你真正要做的事對一次。 你要它讀中文合約,那一個英文常識問答的名次對你幾乎沒有意義。跨語言尤其要小心:多數評測以英文為主,中文表現不一定同步。
三、差距有多大?
差一兩分,用起來通常感覺不出來。評測本身有誤差、題目抽樣有隨機性,前幾名往往落在「實質上分不出高下」的範圍。真正值得注意的是拉開一個級距的差距,不是名次的先後。
四、什麼時候測的?
模型改版很快,同一個名字背後的東西過幾個月就換一次。三個月前的評測,測的可能是另一個版本。看到沒有標日期的比較表,當背景資訊看看就好。
為什麼「第一名」老是換人
因為第一名本來就不是同一種東西。各家用不同題庫、更新頻率也不同,換一份考卷就換一個冠軍,這很正常。
還有一個更該知道的機制:廠商會針對知名榜單優化。 榜單有名氣、上榜有商業價值,投入資源把那幾項做好是完全理性的行為——這不是作弊,但結果是榜單分數會系統性地高於你的真實體感。 新聞上看到的進步幅度,通常大於你自己用起來感覺到的進步幅度。
順帶一提,評測專案自己也會老。連 Stanford 的 HELM 這種指標性的公開評測框架,都在 2026 年 6 月進入維護模式(見文末來源)。榜單不是一把永恆的尺,它也是會過期的東西。
一般人與小公司該怎麼做:拿你自己的三個任務去試
我要下的判斷很直接:與其研究榜單,不如花二十分鐘做一次自己的測試。
做法簡單到不需要任何工具。從你真實的工作裡挑三件最常做的事——例如「把會議錄音整理成待辦清單」「把產品說明改寫成客戶看得懂的版本」「讀一份中文文件然後回答問題」。同一個題目、同一份資料,丟給兩三個模型,然後只看一件事:
哪一個的答案,你比較不用改。
這個標準比任何跑分都準,因為它直接量到你真正在意的成本——你的時間。一個名次很前面、但每次都要你重寫兩段的模型,對你來說就是比較差的模型。「你要重寫幾次」比任何跑分都準。
而且這個測試還有一個跑分永遠給不了的好處:它會順便告訴你「這件事到底適不適合交給 AI」。如果三個模型都改到讓你很煩,答案往往不是換模型,是這件事現在還不該外包出去。
至於要不要為此升級到更貴的等級,那是另一個問題,判斷方式見 AI 模型為什麼分等級——那篇談「該用哪一級」,這篇談「別人給你的分數怎麼讀」。
我們的立場:跑分是篩選器,不是答案
跑分不是沒有用。它很適合做一件事:在一堆選項裡快速刷掉明顯不合適的,把清單縮短到兩三個。 縮短之後的決定,只能靠你自己的任務。
所以我們的建議很簡單:新聞上的排名看過就好,別拿它當採購決策的最後一步。 也記住,模型再強都可能給你看起來很合理的錯誤答案,榜單分數不會替你承擔那個風險。
如果你是要把 AI 放進產品或內部流程、需要一套可重跑的評估方法,那是另一個層次的題目,可以接著看技術向的 LLM 評估指南。一般使用者停在這裡就夠了:看得懂那個數字在說什麼,然後回去用自己的題目測一次。
常見問題
榜單第一名的模型,是不是就是最強的?
只能說它在那一份考卷上考得最好。換一份題庫、換一種評分方式,冠軍常常就換人。更實際的問題不是「誰最強」,而是「誰在我要做的事情上最少出錯」——這件事只有你自己測得出來。
為什麼新聞說進步很多,我用起來卻感覺差不多?
有三個常見原因:一是廠商會針對知名榜單特別優化,榜上的漲幅會大於日常體感;二是評測題目和你的任務差很遠,尤其中文和英文的落差;三是你原本做的事情本來就不難,難題的能力提升,在簡單任務上看不出來。
廠商公布的跑分是不是完全不能信?
不用到完全不信,但要當成「官方宣稱」看待,等獨立第三方驗證出來再調整看法。廠商不必造假就能讓數字好看——挑對比對象、挑對呈現項目、挑對測試設定就夠了。看到官方數據,先看它有沒有標清楚測試條件。
我想自己測,要準備幾題、怎麼比才公平?
三題就夠了,重點是必須是你每週真的會做的事,而且要用真實資料,不要用臨時編的例子。同一個問題、同樣的說明,分別丟給兩三個模型,然後只記錄一件事:每個答案你動手改了幾個地方。改得最少的那個就是你的答案。