回到頂部
AI 查資料的三種模式,以及搜尋型 AI 在來源品質、摘要語氣與引註之間出現的三處落差

AI 幫你查資料,錯在哪?搜尋摘要與深度研究的可信度

AI 附了來源連結,就代表它查證過嗎?不一定。這篇拆解 AI 查資料的三種模式:純憑記憶、即時搜尋摘要、深度研究,可信度差在哪,以及搜尋型 AI 特有的三個坑與三個檢查習慣。

內容查核: 來源查核:

現在的 AI 大多會邊查邊答,答案底下掛著一排來源連結,看起來很有交代。但這裡有一個落差多數人沒想過:附了連結,不代表它查證過。 連結存在只證明那個網頁存在,不證明它支持 AI 寫的那句話。

這篇不談怎麼逐項核對——那是 AI 事實查核 SOP 的工作。這篇談更前面一層:AI 幫你查資料這件事本身,有哪些結構性的問題。

AI 查資料有三種模式,可信度完全不同

很多人把「問 AI」當成同一件事,其實它至少有三種模式,出錯方式差很多。

模式它實際在做什麼最常見的錯法
純憑記憶回答不連網,只根據訓練時看過的東西作答捏造來源、用過時資料、細節張冠李戴
即時搜尋後摘要當場搜幾個網頁,讀完壓成一段話挑到爛來源、把原文語氣讀強
深度研究先擬計畫,多輪搜尋、邊查邊調整,產出長報告錯得更隱蔽:報告太完整,沒人想回頭抽查

第一種最容易編。 它沒有外部資料可以對,答案完全來自模型內部的統計傾向,典型災情就是生出格式完美卻不存在的論文(成因見 AI 幻覺是什麼)。

第二種只是把風險換了位置。 它確實去看了網頁,不太會憑空捏造;但挑到的是不是好來源、有沒有讀懂,是另一回事。Google 自己在 AI 摘要的說明頁就寫得很直白:AI 回覆可能有錯,重要資訊請在不只一個地方查證,並點開底下的連結

第三種最微妙。 以 Gemini 的深度研究為例,它會先擬一份多步驟的研究計畫,再一邊搜尋、一邊根據查到的東西展開新的搜尋,最後產出一份附來源的報告。多輪查找確實比單次搜尋紮實,但它同時製造了新問題:報告越完整、越有結構,人越不會回頭驗。

我要下的判斷是:深度研究提高的是「找得夠不夠廣」,不是「每一句都對」。 值得多等那幾分鐘,也值得多花時間抽查——不然只是把一份可能錯的東西,包裝得更像成品。

搜尋型 AI 特有的三個坑

這三個坑和幻覺不一樣:幻覺是憑空生出不存在的東西,這三個是來源真的存在、連結真的打得開,結論還是錯的

坑一:它不分來源好壞

AI 搜尋抓的是「排在前面、看起來相關」的頁面,沒有可靠機制分辨那是原始出處、內容農場、抄襲站,還是另一台 AI 生出來的頁面。

哥倫比亞新聞評論的 Tow 數位新聞中心在 2025 年 3 月 6 日發表過一次測試:八套 AI 搜尋工具、1,600 次查詢,要它們指認一段引文出自哪篇報導,逾六成的回答是錯的,而且經常連到轉載版,而不是原始報導。那次測的是當時的模型版本,數字今天一定不一樣;但「分不清原文與轉載」是機制問題。

連學術來源也不保證乾淨。我們寫過一項用 AI 掃描癌症論文、標記出逾 25 萬篇疑似「論文工廠」產物的研究——從資料庫撈到一篇論文,不代表那篇論文可信。

坑二:摘要的時候,把語氣讀強了

這是最安靜的一個坑。來源沒錯、連結沒錯,錯在中間那一道翻譯。

原文寫「研究觀察到兩者可能有關聯」,摘要變成「研究證實有效」;原文寫「部分受測者出現改善」,摘要變成「使用者普遍改善」;原文寫「預計逐步開放」,摘要變成「已經上線」。

保留語氣是研究者最貴的資產,卻是摘要時最先被壓掉的東西。因為摘要的任務就是把話講短、講得肯定——模糊的、有條件的句子天生不適合被壓縮。你讀到的那句斬釘截鐵,很可能是壓縮的副產品,不是原文的態度。

坑三:看到引註,就以為它查過了

附連結不等於那個連結支持這句話。 這是搜尋型 AI 最大的錯覺來源,也最多人忽略。

引註長得像「已完成查證」的勾勾,實際上只表示「這段話大致從這一區來的」。常見三種落差:頁面主題相同,但沒有那個數字;數字在,但講的是另一年、另一個地區;或那句話是模型整合幾個來源後的推論,任何單一來源都沒這樣說。

這件事的份量已經寫進監理決定。德國媒體監理機構裁定 Google 的 AI 摘要與 Perplexity 產出的內容屬於「業者自己產製的內容」,要為正確性負責(業者上訴中、尚未定讞),理由正是:AI 摘要不是單純轉述第三方,是重寫過的新東西,不能靠底下那排連結免責。

你也一樣。把 AI 摘要貼進報告裡,那句話就是你寫的,不是那個連結寫的。

怎麼用才對:當成起點,不是結論

心態只有一句:AI 幫你把「該讀哪些東西」的清單縮短了,但它沒有幫你讀。

這已經很有價值:以前要翻好幾頁才找得到的原始報告,現在幾十秒就在眼前。但「找到候選來源」和「它真的這樣說嗎」中間還有一段路,只能你自己走。三個檢查習慣,通常花不到兩分鐘:

一、先看時間對不對。 頁面日期、資料涵蓋期間、事件發生日常常是三個不同的東西。價格、方案、法規尤其吃這一點:三年前正確的頁面,今天可能整段作廢。

二、看來源是誰。 是官方公告、原始研究、主管機關,還是一篇轉述的部落格?轉述可以幫你理解,要當證據就往上追到原始出處。

三、點開連結,用關鍵字找那句話。 直接搜尋那個數字或那個詞,看它有沒有出現、前後文在講什麼。找不到,就當那句話沒有來源。

順序有意義:時間不對,後面兩個做得再仔細都是白工。至於「請 AI 只根據我給的文件回答」(也就是 RAG 的基本想法),能收窄範圍,但換掉的是問題的形狀,不是難度:檢索抓錯段落、文件過期,一樣會錯。

這些場合,不要只信 AI 查來的

  • 醫療:適用族群、劑量、禁忌與更新日期都是細節,而摘要最容易壓掉細節。個人決策請問醫療專業人員。
  • 法律:法域、條文版本、生效日、判例效力,錯一個結論就不同。個案請律師判斷。
  • 財務:回到原始財報與公開資訊,不要拿摘要直接做決定。
  • 任何你要對外負責的內容:客戶簡報、公司文件、學校報告都算。判準很簡單——出錯時是你被追究,還是 AI 被追究? 答案是你,就自己點進去看。

這不是說 AI 不能碰這些題目。它很適合幫你把不熟的領域快速攤開。只是最後那一哩——確認、署名、負責——不能外包。

常見問題

AI 搜尋和自己用 Google 搜尋,哪個比較可信?

差別不在可信度高低,而在誰做取捨。自己搜尋時,你看得到一排結果,由你決定點哪個、信哪個;AI 搜尋是幫你挑完、讀完、壓成一段話,你看到的是結論,看不到它捨棄了什麼。它省時間,但也把「判斷來源」這一步藏了起來。

深度研究模式比較慢也比較貴,值得用嗎?

值得,但要用在對的地方。它適合「我對這個領域不熟,需要先攤開有哪些面向、哪些機構、哪些爭點」的場合,多輪搜尋確實找得比較廣。不適合的是「我要一個可以直接貼進報告的結論」——報告越完整,越容易讓人省略抽查,錯誤反而更難被發現。

AI 附的連結打得開,是不是就代表查證過了?

不是。連結打得開只證明那個網頁存在,不證明那個網頁支持 AI 寫的那句話。常見情況是頁面主題相符、但沒有那個數字,或數字講的是另一年、另一個地區。要確認,就打開頁面用關鍵字搜尋那句話,看它是否真的出現在裡面。

有沒有哪一套 AI 搜尋工具比較不會出錯?

各家表現會隨模型版本、題目領域與資料新舊改變,任何「某某最準」的排名都很快過期,不值得當成選擇依據。比較實用的判準是好不好查證:引註有沒有標到句子層級、點進去能不能直接找到那段原文、時間與來源有沒有標清楚。

參考來源

№ · further reading

延伸閱讀