回到頂部
一份網站頁面連接三條 AI 爬蟲路徑,分別呈現放行、檢查與阻擋狀態

AI 爬蟲要放行還是封鎖?Cloudflare Bot Preference Sync 指南

Cloudflare Bot Preference Sync 可同步 Search、Agent、Training 政策與 robots.txt。整理 SEO 影響、設定順序與不該直接全封的情境。

內容查核: 來源查核:

想保留搜尋曝光、又不想把全文送去訓練,現在可以把這兩件事分開設定。 Cloudflare 8 月 21 日公布 Bot Preference Sync,會依網站對 Search、Agent、Training 三類機器流量的選擇,自動在 robots.txt 前端加入相符規則。它解決的是「公開聲明與實際政策互相矛盾」,不是保證排名,也不是一張開關就能處理所有爬蟲。

對依靠 Google 流量、又希望被 AI 搜尋引用的內容站,我的建議很明確:先不要全封。 初始政策可設為 Search 允許、Training 禁止,Agent 則依是否接受使用者代理讀取內容決定。改完後觀察索引、AI referral 與伺服器日誌,再逐類調整。

三類流量不是同一件事

Cloudflare 的 Verified bot 分類把 Search 定義為建立搜尋索引或 RAG 資料庫,Agent 是代表使用者造訪,Training 才是訓練或微調模型。三者可能由同一個業者營運,卻對網站帶來不同交換價值。

類別網站可能得到什麼主要代價內容站起始建議
Search傳統搜尋或 AI 搜尋曝光摘要可能降低點擊通常允許
Agent使用者委託的即時讀取或操作流量未必進入一般分析視內容與服務模式決定
Training未來模型能力可能使用內容幾乎沒有可追蹤的即時回流多數出版內容可禁止

Google 也把不同用途拆成不同 crawler。官方爬蟲總覽提醒,個別 token 的用途與 robots.txt 行為要分開看;因此不要看到同一家公司名稱,就把所有 user-agent 一起封鎖。先確認用途,再下規則,才不會順手傷到正常索引。

若你還在規劃 AI 可讀內容,可先看 llms.txt 的角色與限制;它是內容導覽,不是權限機制,也不能取代 robots.txt 或防火牆。

同步的是聲明,阻擋要看另一層

Bot Preference Sync 開啟後,Cloudflare 會把管理的片段加在原有 robots.txt 前面,原本的 Disallow 仍保留。官方robots.txt 設定文件同時把「向爬蟲表達偏好」與「在 Cloudflare 邊緣執行政策」分開說明。守規矩的 bot 會讀檔案,不守規矩的抓取程式不會因為看到文字就自動離開。

所以驗收不能只開 https://你的網域/robots.txt 看幾行字。還要在安全事件或日誌確認對應 bot 是放行、挑戰還是阻擋,並檢查來源頁是否仍可被 Googlebot 取得。若只改聲明、沒有執行規則,就不能宣稱已防止抓取。

BotBase可查看 Cloudflare 對 bot 的分類、請求結果與 detection ID;不過完整控制台能力依方案而異。這也是為什麼小站不該照抄企業教學:先用公開目錄與自己的日誌查到實際流量,再決定是否需要細粒度規則。

上線前做四項檢查

先把目前 robots.txt 留存,尤其確認 sitemap、後台、搜尋參數與既有 SEO 規則。接著在控制台逐類選擇政策,不要同時再建立一套相反的自訂規則。Cloudflare 說明,此同步功能採類別層級,不會讀懂你針對單一業者寫的複雜例外;有合作白名單時,應先關閉類別同步或重新整理規則優先序。

發布後直接抓取 robots.txt,確認 Cloudflare 區塊出現、原規則沒有消失。再用 Search Console 的網址檢查與伺服器日誌驗證重要頁仍能被搜尋爬蟲讀取。最後才比較數週的收錄、曝光、點擊與 AI 來源,不要因一天波動回滾。

若你的營收依賴廣告頁瀏覽,我不建議允許所有 Agent 無限制取全文;但也不建議把 Search 一併封掉。先閱讀零點擊搜尋的取捨,再以「哪些流量能帶來發現、哪些只消耗內容」逐層處理,比全開或全關可靠。

常見問題

Cloudflare Bot Preference Sync 會影響 Google SEO 嗎?

取決於你對 Search 類別與既有規則的設定。若誤擋搜尋爬蟲,收錄可能受影響;只禁止 Training 不等於自動封鎖 Googlebot,改完仍要用 Search Console 驗證。

robots.txt 可以阻止 AI 拿內容訓練嗎?

它能表達網站偏好,但不是身分驗證或強制存取控制。需要真正阻擋時,還要使用 Cloudflare 的 AI bot policy、安全規則或其他邊緣控制,並以日誌確認生效。

內容網站該封鎖 Search、Agent 還是 Training?

沒有單一答案。依賴曝光的網站通常先保留 Search;Training 可先禁止;Agent 是否開放,則看使用者代理能否帶來引用、轉換或服務價值。

參考來源

№ · further reading

延伸閱讀