想保留搜尋曝光、又不想把全文送去訓練,現在可以把這兩件事分開設定。 Cloudflare 8 月 21 日公布 Bot Preference Sync,會依網站對 Search、Agent、Training 三類機器流量的選擇,自動在 robots.txt 前端加入相符規則。它解決的是「公開聲明與實際政策互相矛盾」,不是保證排名,也不是一張開關就能處理所有爬蟲。
對依靠 Google 流量、又希望被 AI 搜尋引用的內容站,我的建議很明確:先不要全封。 初始政策可設為 Search 允許、Training 禁止,Agent 則依是否接受使用者代理讀取內容決定。改完後觀察索引、AI referral 與伺服器日誌,再逐類調整。
三類流量不是同一件事
Cloudflare 的 Verified bot 分類把 Search 定義為建立搜尋索引或 RAG 資料庫,Agent 是代表使用者造訪,Training 才是訓練或微調模型。三者可能由同一個業者營運,卻對網站帶來不同交換價值。
| 類別 | 網站可能得到什麼 | 主要代價 | 內容站起始建議 |
|---|---|---|---|
| Search | 傳統搜尋或 AI 搜尋曝光 | 摘要可能降低點擊 | 通常允許 |
| Agent | 使用者委託的即時讀取或操作 | 流量未必進入一般分析 | 視內容與服務模式決定 |
| Training | 未來模型能力可能使用內容 | 幾乎沒有可追蹤的即時回流 | 多數出版內容可禁止 |
Google 也把不同用途拆成不同 crawler。官方爬蟲總覽提醒,個別 token 的用途與 robots.txt 行為要分開看;因此不要看到同一家公司名稱,就把所有 user-agent 一起封鎖。先確認用途,再下規則,才不會順手傷到正常索引。
若你還在規劃 AI 可讀內容,可先看 llms.txt 的角色與限制;它是內容導覽,不是權限機制,也不能取代 robots.txt 或防火牆。
同步的是聲明,阻擋要看另一層
Bot Preference Sync 開啟後,Cloudflare 會把管理的片段加在原有 robots.txt 前面,原本的 Disallow 仍保留。官方robots.txt 設定文件同時把「向爬蟲表達偏好」與「在 Cloudflare 邊緣執行政策」分開說明。守規矩的 bot 會讀檔案,不守規矩的抓取程式不會因為看到文字就自動離開。
所以驗收不能只開 https://你的網域/robots.txt 看幾行字。還要在安全事件或日誌確認對應 bot 是放行、挑戰還是阻擋,並檢查來源頁是否仍可被 Googlebot 取得。若只改聲明、沒有執行規則,就不能宣稱已防止抓取。
BotBase可查看 Cloudflare 對 bot 的分類、請求結果與 detection ID;不過完整控制台能力依方案而異。這也是為什麼小站不該照抄企業教學:先用公開目錄與自己的日誌查到實際流量,再決定是否需要細粒度規則。
上線前做四項檢查
先把目前 robots.txt 留存,尤其確認 sitemap、後台、搜尋參數與既有 SEO 規則。接著在控制台逐類選擇政策,不要同時再建立一套相反的自訂規則。Cloudflare 說明,此同步功能採類別層級,不會讀懂你針對單一業者寫的複雜例外;有合作白名單時,應先關閉類別同步或重新整理規則優先序。
發布後直接抓取 robots.txt,確認 Cloudflare 區塊出現、原規則沒有消失。再用 Search Console 的網址檢查與伺服器日誌驗證重要頁仍能被搜尋爬蟲讀取。最後才比較數週的收錄、曝光、點擊與 AI 來源,不要因一天波動回滾。
若你的營收依賴廣告頁瀏覽,我不建議允許所有 Agent 無限制取全文;但也不建議把 Search 一併封掉。先閱讀零點擊搜尋的取捨,再以「哪些流量能帶來發現、哪些只消耗內容」逐層處理,比全開或全關可靠。
常見問題
Cloudflare Bot Preference Sync 會影響 Google SEO 嗎?
取決於你對 Search 類別與既有規則的設定。若誤擋搜尋爬蟲,收錄可能受影響;只禁止 Training 不等於自動封鎖 Googlebot,改完仍要用 Search Console 驗證。
robots.txt 可以阻止 AI 拿內容訓練嗎?
它能表達網站偏好,但不是身分驗證或強制存取控制。需要真正阻擋時,還要使用 Cloudflare 的 AI bot policy、安全規則或其他邊緣控制,並以日誌確認生效。
內容網站該封鎖 Search、Agent 還是 Training?
沒有單一答案。依賴曝光的網站通常先保留 Search;Training 可先禁止;Agent 是否開放,則看使用者代理能否帶來引用、轉換或服務價值。