AI 試點的目的是取得一個決策,不是取得一次體驗。 跑完你要能講出「所以我們繼續」或「所以我們停」,講不出來的試點,等於沒跑。
多數試點講不出來,不是效果不好,是開跑那天就沒有人定義過:什麼結果代表該繼續、什麼代表該停。 少了這條線,期末你只會收到一堆感想——「還不錯」「不過還是要改」——每一句都是真的,合起來什麼都決定不了。
💡 本篇定位 「第一個 AI 專案該挑什麼?」處理挑哪個題目,這篇處理題目挑好之後,試點怎麼設計才問得出答案。
五個要素,決定你問不問得出答案
一、一個明確的問題
「試試看 AI 好不好用」不是問題,是一種心情。問題要窄到一句話寫得完,而且同時要有動作、量、以及不能犧牲的東西:
這件事能不能從平均 X 小時降到 Y 小時,而且被退回重做的比例不上升?
三段缺一不可:只寫時間,你會做出一個很快但要全部重看的流程;只寫品質,你會得到一個很準但比人工還慢的做法。檢查方式:這句話拿給沒參與的人看,他能不能只憑數字判斷成功或失敗? 不能,就還不夠明確。
二、一個對照基準
沒有基準就沒有結論。 開跑前先量現況:同一件事現在平均花多久、錯多少、要幾個人經手。 這一步最常被跳過,因為大家都覺得「現況我心裡有數」。
心裡有數不夠——事後回想一定會被美化,而且每個人美化的方向不一樣:主管記得最順的那次,實際做的人記得最痛的那次。量基準的成本其實很低:三個人、各記十個工作天、每天多花五分鐘,合計約兩個半小時,通常比一個月訂閱費還便宜。它也是你算AI 導入 ROI 唯一可信的起點。
三、一個夠短、但夠長的期間
太短看不出穩定度:第一週的數字特別好看,因為大家還新鮮、挑最順手的案例、怪狀況先跳過。太長會耗掉支持:老闆的注意力與員工嘗新的額度都是有限存量。
判準不是週數,是週期。期間要涵蓋至少一個完整的業務週期——有月結就跨過月結,有輪班就讓每一班輪過;AI 出包通常出在例外的那幾天,而例外有週期性。實務上多數題目落在四到八週,跨月結的要六週以上。完整週期就是一季的,就承認它要一季,別壓成四週假裝結論有效。
四、一個負責的人
不是「大家一起試」,是一個名字。他要做的事不多,但缺一不可:每週看一次數字、決定要不要調整、記錄調整了什麼。 第三項最常被漏掉——沒有記錄,期末沒人講得出中間改過什麼。
「大家一起試」為什麼一定出事?因為它讓每個人都以為別人在盯。沒有人負責的試點不會失敗,它會無限期停在「還在試」,直到有人發現訂閱費還在扣。這跟AI 導入為什麼失敗講的「沒有人真的負責」是同一個病,只是更難察覺。
五、一個事先講好的停止條件
開跑前寫下來:什麼情況下我們會喊停。 例如省下的時間不到目標的一半、錯誤率高過基準而且連兩次調整都壓不下來、或負責人連續幾週排不出時間。
為什麼一定要事先寫?因為事後沒有人有立場喊停——那時已經有人投入大量時間、報告過進度,要喊停等於承認自己這幾個月做白工。於是試點一延再延,變成既沒有結束、也沒有成果的常態。事先寫下來,就把喊停從某個人的失敗,變成大家當初同意的規則。停止條件不是拿來預測失敗的,是拿來保護那個必須說出結論的人。
兩個最常見的設計錯誤
一、只讓最有興趣的人參與。 熱情的同事配合度高、卡住會自己想辦法,於是你拿到一份過度樂觀的數字。不是造假,是他們願意額外花時間讓這件事成功——而那些時間不會出現在報表上,推開後也不會出現在別人身上。名單裡至少要放一個本來就不看好的人——一個不願意多花力氣的人用起來會怎樣,那才是推開後的真實情況。抗拒怎麼處理,我寫在員工為什麼抵抗 AI。
二、試點期間偷偷改題目。 本來要驗 A,第三週發現效果普通,大家覺得拿它做 B 不錯,重心就移過去,期末報告寫「它在 B 上很有價值」。聽起來像意外收穫,實際上你交出的是一份沒有基準、沒有期間的觀察心得,而 A 行不行這輪也沒驗完。改題目可以,但要當成一次正式的重新開始:重寫問題、重量基準、重設期間。
驗收時該問的三個問題
期末不要問「大家覺得有沒有比較好用」,問這三題:
一、省下的時間是誰的? 常見的失敗長相是:主管的審閱時間少一半,基層卻多了「把 AI 產出改到能用」的新工作——總量可能還變多,只是換了個人扛。這不叫效益,叫成本轉移,幾個月後會以「大家不太願意用」回來找你。
二、返工率有沒有變? 要量 AI 的產出平均要改幾次、多久才能用。這比「省了多少時間」誠實,因為它抓得到「初稿三秒就好、但改了四十分鐘」的假效率。
三、不用它會怎樣? 試點結束後停掉一週,看有沒有人來問。沒有人有感覺,代表它還沒真的被需要——不管前面數字多好看。會來問的人數是最誠實的採用指標,不需要填問卷,也騙不了人。
三件我不建議的事
一、不建議把試點做成「展示」。 挑最漂亮的案例、最配合的同事、最理想的資料跑一輪,成果很好看,全面推開就破功。展示型試點在設計上只會產生一種結果:它證明「在最好的條件下它可以」,你需要知道的卻是「在一般條件下它行不行」。你要的是平均值,不是最佳值。
二、不建議在試點期間同時換流程。 兩個變數一起動,期末你不會知道變好或變差是哪一個造成的,而「要不要推開」完全取決於這個歸因。要動就分開動:先在既有流程上試 AI,或先把流程改完再試。慢一輪,換一個講得清楚的結論,划算。 廠商做的概念驗證最難守這條,該問哪些問題,AI 廠商評估清單有一份。
三、坦白一個保留:試點成功不代表推得開。 它只證明「在這個規模、這些人、這些案子上,它可以」。中間至少還有三道關:
- 規模:十個人用得順,一百個人不一定順,資料量、權限與成本結構都會變。
- 跨部門:試點多在單一部門內完成,推開會撞到「上游不配合、下游不接受」。
- 例外處理:試點期間的怪案例多半被負責的人默默手動吃掉;推開後沒有那個人,例外就變成客訴。
所以正確的結論不是「成功,全面推開」,而是「成功,可以開始規劃推開——而推開是另一個要重新設計的專案」。
常見問題
AI 試點要跑多久才夠?
看週期,不看週數。期間至少要涵蓋一個完整的業務週期,否則你只看得到平常日的表現——有月結就跨過月結,有輪班就讓每一班輪過。實務上多數中小企業落在四到八週。
沒時間量基準,可以先開始試再說嗎?
不建議。沒有基準的試點只能產生感想,不能產生決策,你等於花幾週換一場吵不出結果的會議。量基準沒那麼貴,幾個人記十來個工作天就有雛形;連這點時間都排不出來,通常代表這題排不進優先序。
試點結果好壞參半,該怎麼下結論?
先分清楚是「哪一類案子好、哪一類壞」,還是「同一類案子時好時壞」。前者是好消息,代表你找到了適用範圍,縮小再推就好;後者通常代表流程或資料本身不穩定,換工具幫不上忙。老實說這題沒有通則。
廠商說可以免費做概念驗證,要不要接?
可以接,但四件事要先講好:問題由你定義、基準由你量、期間由你定、驗收數字你看得到原始紀錄。免費的概念驗證天生會往「證明產品有用」的方向設計,指標讓對方訂,你拿到的是銷售材料。