回到頂部
概念插畫:公開展示的書本保持可讀,旁邊的複製裝置由獨立閘門隔開,呈現查閱與再利用可以分開管理

Applebot-Extended 要擋嗎?拒絕 AI 訓練與搜尋曝光的差別

Apple 說明 Applebot-Extended 規則不列入搜尋排名。整理拒絕 AI 訓練、限制回答引用與退出索引的差異,並比較 Google-Extended,幫內容站避免誤擋搜尋爬蟲。

內容查核: 來源查核:

只想拒絕 Apple 拿內容訓練模型,不需要把搜尋入口一起關掉。 Apple 在 9 月 4 日更新的 Applebot 文件明確表示,Applebot-Extended 規則不列入 Apple 搜尋排名。這是控制範圍的說明,不能解讀成「加上規則就會增加曝光」。

Applebot 與 Applebot-Extended 差在哪?

Applebot 負責抓網頁;Applebot-Extended 本身不抓取,只管理抓到的資料能否用來訓練 Apple 基礎模型。若還想限制內容成為 AI 回答的上下文,要另看 nosnippet;它也會讓該頁的搜尋建議只剩標題。noindex 則是不要建立索引。

對站主而言,先選目標,再請維護網站的人選規則:

你的目標要核對的控制不該順手做的事
保留被發現的機會,拒絕訓練Applebot-Extended把 Applebot 一起全站封鎖
不提供回答上下文nosnippet假設搜尋摘要仍會照常出現
不要進入搜尋索引noindex用來處理單純的訓練偏好

我不建議把網路上的「封鎖全部 AI」範本直接套上正式站。公開教學、商品介紹與會員資料的目的不同;先列出哪些頁面需要被找到,會比先蒐集一長串爬蟲名稱更有用。跨平台的分類,可接著看 AI 爬蟲放行與封鎖指南。

Google-Extended 可以照抄同一套理解嗎?

名稱相近,但管理範圍要分別查。Google 在 2023 年 9 月 28 日推出 Google-Extended,提供網站對生成式 AI 用途的選擇權。今天判斷用途,仍應以現行爬蟲文件為準:它涵蓋指定 Gemini 產品的模型訓練,也涵蓋部分回答時取用搜尋索引內容的用途。

Google 同樣說明,這個控制不影響一般 Google 搜尋收錄或排名。因此,不能只看名字裡有 Extended,就認為它與 Apple 的所有細節一致;更不能把它當成停用 Google 搜尋所有 AI 功能的總開關。

分清資料用途,才能避免「以為只拒絕訓練,實際限制了其他展示方式」。 若委託外包修改,請對方把平台、控制項、預期保留的入口與預期限制的用途寫在同一張變更單上。只交付一句「AI 都擋好了」,日後很難追查。

最容易出事的是把抓取、索引和權限混在一起

robots.txt 不是登入保護。Cloudflare 的 Bot Preference Sync 公告特別區分「表達偏好」與「實際阻擋」,並讓網站的分類政策同步反映到規則檔。若你的站已使用代管功能,要先確認目前對外送出的內容,不能只看程式庫裡那份檔案。

另一個常見誤會,是把 noindex 寫進 robots.txt,以為搜尋引擎就會移除頁面。Google 早在 2019 年的規則說明便交代,這種未支援用法不能取代網頁標籤或 HTTP 回應標頭中的索引控制;爬蟲還必須能讀到相關指示。

要保護客戶名單、未公開文件或付費下載,應先檢查登入與存取權限。爬蟲政策只是公開內容治理的一部分。若已接上 Cloudflare,可看 Bot Preference Sync 的檢查重點;不要讓邊緣服務與原站各說各話。

台灣內容站,先確認這次到底要改善什麼

如果你靠教學內容接案,公開服務介紹與可查證案例有被找到的價值;若你靠付費研究報告維生,全文再利用的條件就值得另外討論。這是經營選擇,沒有一個適合所有站的答案。

我的建議是先留下變更前的規則與重要頁面清單,之後分開看:爬蟲是否仍能讀公開頁、讀者是否能正常進站,以及詢問或訂閱有沒有變化。不要只看一天的點擊漲跌,就替這次設定下結論。 同時改標題、改網址、改爬蟲政策,幾乎無法辨認是哪一項造成差異。

Google 給網站經營者的 AI 搜尋建議仍把原創價值、可抓取性與閱讀體驗放在重點。把頁面放行,只代表技術上留有機會,不代表內容一定值得被引用。如果文章答非所問,新增一份 llms.txt 索引也不會自動補上讀者缺少的答案。

常見問題

封鎖 Applebot-Extended,網站就不會被任何 AI 使用嗎?

不會。它只管理 Apple 指定的模型訓練用途;其他平台與回答時的內容使用,需要各自確認。不要把一個平台的規則當成全網授權管理。

規則改完後,可以用 GSC 判斷 Apple 曝光有沒有下降嗎?

不能直接這樣判斷。Google Search Console 的搜尋成效不是 Apple 搜尋成效報表。請把不同來源的流量與網站存取紀錄分開看,也不要把 Google 的短期波動歸因於 Apple 設定。

網站才剛起步,有必要現在就全面封鎖 AI 嗎?

我不建議在尚未分清公開內容與敏感資料前全面封鎖。先保護不能公開的資料、保留需要被找到的頁面,再決定哪些再利用用途不接受。這樣日後調整政策時,也比較知道自己改了什麼。

參考來源

№ · further reading

延伸閱讀