回到頂部
四個看起來合理其實沒用的 AI 成效指標:使用率、省下的工時總和、主觀滿意度、產出量

AI 導入的成效怎麼量?四個看起來合理、其實沒用的指標

導入後大家都說有用,卻說不出有用在哪?問題通常不是沒量,是量錯了。拆解四個會騙你的指標,並給三個真正值得量的替代方案。

導入 AI 之後最常見的窘境不是沒效果,是大家都覺得有用,卻沒有人說得出有用在哪。

追問下去只會得到「感覺快很多」「大家用得滿順的」。多數公司其實有量——帳號數、使用次數、滿意度問卷——問題是量錯了東西:這些數字都會漲,卻跟「事情有沒有做得更好」關係很淡。

💡 本篇定位 這篇談「該量哪些指標、哪些會騙你」。「值不值得做、多久回本」是另一題,試算在AI 導入 ROI 怎麼算;沒有驗收標準會怎麼拖垮專案,在AI 導入為什麼失敗的原因 5,本篇是它的展開。


先講前提:量錯指標,比不量更危險

不量,至少你知道自己不知道。量錯的殺傷力在於它給你一個看起來有憑有據的錯誤結論——數字漂亮,於是沒人再問「實際上到底有沒有比較好」。

據 Fortune 報導,MIT NANDA 盤點三百多個企業案例後發現,約 95% 的生成式 AI 試辦專案在損益表上看不到可衡量的影響。單一研究不必當定論,但它點出「大家都在用」和「公司有變好」之間斷掉的環節比想像中多。Google Cloud 的 DORA 團隊講得更直接:AI 不會修好一個團隊,只會放大團隊原本的樣子


四個看起來合理、其實沒用的指標

指標一:使用率/使用次數

為什麼會騙你:用得多不等於用得好。一個人一天問三十次,可能是幫上很多忙,也可能是每次都問不到答案、來回改了三十輪——兩者在使用次數上長得一模一樣。

更麻煩的是,一旦變成被檢視的數字,它就會被灌水:把已經寫完的東西丟給 AI 潤一次、把三句話問完的事拆成五次提問。你拿到的不是使用行為,是應付量測的行為。

該量什麼取代:不要問「用了幾次」,問「同一件工作有沒有變快或變準」,範圍縮到具體一件事:同一份報價單、同一種客訴回覆。

指標二:省下的工時(總和)

為什麼會騙你:「全公司一年省下上千小時」是簡報上最好看、也最經不起追問的一行。追問只需一句:那些小時後來去哪了?

答案若是「大家比較不用加班」,是好事,但不是效益;若是「多接了兩個案子」,那才是。省下的時間沒被拿去做別的事,它就只是消散掉了。

該量什麼取代:把「省了多少」改成「省下的時間流向哪裡」,指定一兩個具體去向,事後檢查那件事有沒有真的多做。講不出去向的節省,先別寫進成效報告。

指標三:主觀滿意度

為什麼會騙你:「覺得好用」和「實際上比較好」可以完全脫鉤。

研究機構 METR 在 2025 年做過一個對照實驗,讓有經驗的開源開發者在有/沒有 AI 輔助下工作。結果是使用 AI 時完成時間反而多了 19%,受試者事後卻仍認為 AI 讓自己快了 20%論文全文)。這是特定情境的小樣本研究,套不到行政或客服工作,但足以撐起一個警告:滿意度量到的是體驗,不是效能。

該量什麼取代:與其問「好不好用」,不如量依賴度——拿掉它會怎樣。問一個更難敷衍的問題:「如果明天這個工具停用,你的工作會受什麼影響?」答得出具體影響的,是真的嵌進流程了;答「應該還好」的,它只是玩具。

指標四:產出量

為什麼會騙你:AI 最擅長的就是把產出量拉高——文案一次生十版、貼文從一週三則變成一天三則。但做得更多不等於做得更好,對外的內容尤其如此。產出會漲是因為生成的邊際成本趨近於零——真正稀缺的是看得完、審得完的人力

該量什麼取代:量返工率與錯誤率。同一批產出,多少可以直接用、多少要整段重寫?產出量往上、返工率同時往上,那不是進步,是把成本從生產端搬到校對端。


真正值得量的三件事

這四個替代方案可以收斂成三件。都比較難量,但都誠實。

一、完成一件事的實際時間。 關鍵在「實際」:多數人只量 AI 生成那一段,真正該量的是從開始到可以交出去的全程,提示詞來回、抓錯、改寫都要算。生成那段永遠會變快,整體變不變快,取決於後面的覆核與返工吃掉多少

二、返工率。 這是最誠實的一個,因為幾乎沒辦法作弊:使用次數可以刷、滿意度可以客氣,但「這份東西改了幾次才能用」很難自欺。返工率不動,代表你只是把「寫」換成了「改」。

三、有沒有做成以前做不了的事。 把舊的事做快,天花板就是原本那件事的成本;開始做以前根本不會做的事才是新增出來的。這類效益不會出現在「省了幾小時」的表格上,因為以前的答案是零,所以要主動列出來。


量測本身的兩個陷阱

陷阱一:沒有導入前的基準,就沒有比較的基礎。 事後回想的「以前大概花兩小時吧」不可信——記憶會被結果污染,已經知道現在很快,回想以前就會自動變慢。基準必須在開始用之前量。麻煩的是它得發生在大家最想趕快開始用的那一刻,錯過就補不回來。基準該在選題階段一起排進去,第一個 AI 專案該挑什麼講的是那一步。

陷阱二:只量會被獎勵的東西。 這是古德哈特定律的日常版——Marilyn Strathern 在 1997 年濃縮成一句:當一個量測變成目標,它就不再是一個好的量測。人會朝著被看的指標優化,這是理性反應。指標選錯,你得到的不只是錯誤的數據,而是你不想要的行為。選指標時多問一句:如果所有人都全力衝這個數字,公司會變成什麼樣子?


我不建議的兩件事

第一,不建議把 AI 使用率放進考績。 這是製造假數據最快的方法:員工一知道使用次數會影響考績,數字當天就開始漲,從此再也反映不了真實情況。更糟的是你會失去唯一的診斷工具:使用率原本能告訴你「哪個部門完全沒動」,變成考績項目後每個部門都很漂亮。推動採用有別的路,員工為什麼抵抗 AI談的就是那條。

第二,不建議只用「省多少錢」向老闆報告。 省錢的數字最容易被質疑,因為省下的工時通常沒有真的變成現金——追問三句就會回到「所以人力有減少嗎?」,答案通常是沒有。不必放棄講省錢,但要同時報「以前做不到、現在做得到」的事:後者沒有舊基準可以被挑戰,也回答了老闆真正在意的問題——這筆錢買到什麼新能力。


坦白說:有些效益本來就量不出來

決策品質變好、心理負擔下降、新人上手變快——這些是真的,只是量不出來。量不出來不代表沒有效果。

但這句話有個常見的濫用方式,我要明講:它不能拿來當所有數字都難看時的擋箭牌。 可量的指標大致成立,再補一句「而且大家的負擔也輕了」,是合理的加分;可量的指標全部不動,唯一撐著的理由是「但士氣有提升」,那不是量測方法的問題,是這個導入案真的沒效

導入之後說不出有用在哪,多半不是沒有效果,是量錯了東西。先把指標換對,再回頭看數字。


常見問題

已經導入半年了,當初沒量基準,現在還救得回來嗎?

救得回來,但別再回想。挑同類型的一件事,現在完整量一次全程時間與返工次數當成新起點,往後每月跟自己對照。你放棄的只是「跟導入前比」這一題。

返工率要怎麼開始量?會不會很花時間?

不需要系統,一張表就夠:挑一種產出,每份記直接可用、小修可用、整段重寫三欄,連記兩週就有輪廓。別一次全公司開量,鋪太大就沒人填。

老闆只想看省了多少錢,我該怎麼報告?

照報,但別只報那一項。給三欄:省下的時間、這些時間流向哪裡、「以前做不到、現在做得到」的清單。第一欄被質疑很正常,第二欄是防守,第三欄是攻勢。

那使用率完全不用看了嗎?

還是可以看,但只當診斷訊號。它能回答「哪個部門完全沒動」,不能回答「有沒有變好」。關鍵是別讓它跟獎懲掛鉤,一掛鉤連診斷功能都會失效。


參考來源

№ · further reading

延伸閱讀