全部文章

Cloudflare 預設攔截 AI 爬蟲:這對你的網站意味著什麼

Cloudflare 於 2025 年 7 月將 AI 爬蟲改為預設拒絕,並將於 2026 年 9 月 15 日對含廣告的頁面啟用新的預設值。本文整理事件時序、它在 AI 引用上的隱形代價,以及如何按名稱放行並驗證你真正想要的爬蟲。

2026年8月12日閱讀約 13 分鐘

若你的網域是在 2025 年 7 月 1 日之後接入 Cloudflare,AI 爬蟲很可能早已被攔截,而且從未有人通知你。 Cloudflare 在該日將新網域切換為預設拒絕,2025 年 9 月為內容用途補上一套 robots.txt 詞彙,並自 2026 年 9 月 15 日起在含廣告的頁面上預設攔截訓練與 agent 流量。正確的回應並非把所有開關撥回原位, 而是按名稱挑選你想要的爬蟲,再核實那些頂著這些名稱的請求是否屬實。

Cloudflare 究竟改動了什麼,以及何時改動

2025 年 7 月 1 日。 Cloudflare 發起 Content Independence Day,成為首家預設攔截 AI 爬蟲的大型基礎 設施供應商。當日的新聞稿說明得相當直接:網絡中的新網域拒絕 AI 爬蟲存取,除非擁有者明確開啟。模式由 opt-out 轉為 opt-in。Cloudflare 自陳承載約 20% 的網絡流量,因此單次預設值調整便一次撼動了相當大的 一片網絡。自 2024 年 9 月起,已有超過一百萬名現有客戶主動按下該一鍵攔截。同時推出的還有測試階段的 Pay Per Crawl,讓擁有者能以 HTTP 402 Payment Required 回應爬蟲,而非交出內容。

Cloudflare 提出的理據是一個比值。以 2025 年 6 月的流量計算,抓取與回流的比值在 OpenAI 為 1,700:1, 在 Anthropic 為 73,000:1,而 Google 搜尋為 14:1。抓取量極大,回流卻極少。

2025 年 8 月 28 日。 AI Audit 測試版更名為 AI Crawl Control 並正式推出:可按爬蟲查看誰抓走了什麼, 按營運方逐一設定 allow 與 block,付費方案更可自訂 402 回應內容。

2025 年 9 月 24 日。 Cloudflare 以 CC0 授權發布 Content Signals Policy,並於 ContentSignals.org 提供產生器。它在 robots.txt 中新增一行,說明內容在被抓取之後可以如何使用,而這是 robots.txt 從未 涵蓋的範圍。三個訊號,各自取值 yes、no 或留空:

User-Agent: *
Content-Signal: search=yes, ai-train=no
Allow: /

Cloudflare 將這項政策寫入超過 380 萬個網域的託管 robots.txt。在原本已攔截訓練的站點上,它所寫下的 預設值為 search=yes, ai-train=no,而 ai-input 是刻意留空,而非設為拒絕。

2026 年 7 月 1 日。 Cloudflare 將機器人行為劃分為三類,並向包括免費方案在內的所有客戶開放: Search(收集並索引內容,以便日後回答問題)、Agent(實時代表某人執行操作),以及 Training(取走內容 用於訓練或微調模型)。同時亦訂下日期。自 2026 年 9 月 15 日起,Search 仍預設放行,而 Training 與 Agent 在展示廣告的頁面上預設被攔截。該預設值適用於新客戶、現有客戶新增的站點,以及在限期前未更改 設定的免費方案帳戶。若某爬蟲混合多種用途而不加區分,則按適用於其任一行為的最嚴格規則處理。Content Signals 新增第四個參數 use=,取值為 immediatereferencefull。而 Pay Per Crawl 亦演變為 Pay Per Use,改為在內容確實出現於回答中時付費,而非在機器人抓取頁面時付費,首批合作方為 Ceramic.ai 與 You.com。

控制項位置實際作用
託管 robots.txtCloudflare 控制台,免費發布一項請求。守規矩的爬蟲會遵守,其他則無視
Content Signals(searchai-inputai-trainuserobots.txt 中的一行聲明抓取後允許的用途。仍屬請求,並非攔截
Block AI Bots 開關安全設定邊緣強制執行。範圍廣泛,亦相當粗略
AI Crawl Control獨立控制台按爬蟲設定 allow、block 或 402,於來源伺服器看到請求之前生效
Search / Agent / Training 預設值2026 年 9 月 15 日起適用按類別強制執行,先由廣告頁面開始
Pay Per Use自願加入的計劃內容出現於回答中時付費

那筆永遠不會出現在分析後台的成本

被攔截的爬蟲不會產生任何你會去查看的錯誤頁。沒有跳出,沒有 500,沒有支援工單。助手只是改用了別人的 頁面作答,而你要到數個月後看見競爭對手被引用時才會察覺。

此事的分量逐季加重。Cloudflare 自身於 2026 年 8 月 6 日關於 answer engine optimisation 的文章指出, 現時來自真人的 HTML 頁面請求已不足一半。若檢索類機器人無法抵達你的技術文件、定價頁或比較內容,你便 缺席於回答引擎所倚賴的來源集合。在控制台上,攔截訓練爬蟲與攔截檢索爬蟲看似同一個開關。兩者並非同一 個決定,而其中只有一個真正保護了你在意的東西。

值得記住的分別在於:訓練爬蟲把你的內容取走一次,每次請求並不回饋任何東西。檢索與 agent 流量則是一 位此刻帶著問題上門的讀者。GPTBot 負責訓練。OAI-SearchBot 為回答建立索引。ChatGPT-User 抓取某個頁 面,是因為三十秒前有人問起它。同一家公司,三個 token,三宗截然不同的交易。

robots.txt 是請求,邊緣才是決定

這條界線正是多數站點擁有者模糊掉的地方。robots.txt 中的 Disallow: / 是貼在門上的告示。正經的營運 方讀過便會掉頭離開。其餘的人把它當作一份有趣路徑清單,或者根本不讀。Content Signals 屬於同一範疇: 一份清晰、可供機器讀取的意圖聲明,其價值更多在法律與社會層面,而非技術層面。

Cloudflare 的控制則位於下一層。請求在邊緣即被拒絕,你的來源伺服器根本無從得知,無論客戶端如何看待 robots.txt。這確實有用,也正因如此,預設值才如此關鍵。一項你從未表達過的偏好,如今正以你的名義被 強制執行。

由此帶來的實際要求是:你的 robots.txt 與邊緣規則必須說同一件事。一個對 PerplexityBot 公布 Allow: /、卻在邊緣將其攔下的站點,等於向一個正在衡量合規情況的營運方發出自相矛盾的訊息。

查詢某個爬蟲 IP 究竟屬於哪個網絡

以精確 token 放行你想要的爬蟲

不要比對子字串 "bot",也不要比對 "GPT"。放行具體的 token,因為 token 承載著用途:

爬蟲用途如何驗證在 9 月 15 日廣告頁預設值下
GPTBot為 OpenAI 訓練模型公布的 IP 範圍檔案Training 行為,於廣告頁被攔截
OAI-SearchBot為 ChatGPT 搜尋結果建立索引公布的 IP 範圍檔案Search 行為,仍獲放行
ChatGPT-User由使用者提示觸發的即時抓取公布的 IP 範圍檔案Agent 行為,於廣告頁被攔截
PerplexityBot為 Perplexity 的回答建立索引公布的 IP 範圍檔案Search 行為,仍獲放行
Perplexity-User代表某人執行的即時抓取公布的 IP 範圍檔案Agent 行為,於廣告頁被攔截
ClaudeBot為 Anthropic 訓練模型公布的 IP 範圍檔案Training 行為,於廣告頁被攔截
Google-Extended僅供訓練退出使用的 token,從不抓取robots.txt token,本身並無流量控制訓練用途,並非控制存取
CCBotCommon Crawl 的資料集採集未公布 IP 範圍,亦無 DNS 慣例Training 行為,於廣告頁被攔截
BytespiderByteDance 的採集未公布任何驗證方法Training 行為,於廣告頁被攔截

真正驅動 Cloudflare 強制執行的是它自身的逐一機器人分類,因此在假定對應關係之前,請先查看 AI Crawl Control。我們的 AI 爬蟲目錄 收錄 150 個 agent 的精確 User-Agent token、營運方、公布的 IP 範圍檔案與 robots.txt 行為,這正是你撰寫規則、避免誤傷其他機器人所需的資料。

Google-Extended 是 token 為何重要的最清晰例子。它從不發出請求,存在的唯一目的是讓你能拒絕訓練用途, 同時 Googlebot 照常為你建立索引。在邊緣攔截它毫無作用,因為那裡根本沒有東西可攔。

然後,驗證真正抵達的是什麼

按 User-Agent 放行 GPTBot,等同放行任何在請求標頭中輸入 GPTBot 的東西。爬取程式早已明白這一點, 建立在字串之上的白名單是一份邀請函。每一條 allow 規則背後,都需要一個驗證步驟。

多數主要 AI 營運方現時都會公布 JSON 格式的 IP 範圍檔案,較早期的搜尋爬蟲則支援正向確認的反向 DNS。 方法因營運方而異,麻煩之處正在於此:Googlebot 與 Bingbot 可以解析驗證,GPTBot 與 PerplexityBot 公布 IP 範圍,Bytespider 與 CCBot 則沒有任何可供核對的資料。反向 DNS 的具體做法可參閱 驗證 Googlebot

當一個自稱的爬蟲無法通過驗證時,可退而依靠的仍是那幾項一般訊號:該位址是否屬於一段並不歸其所聲稱 營運方所有的資料中心 IP 範圍、TLS 指紋是否與其所聲稱的客戶端 相符、請求標頭是否一致。Agentscan 在單次請求內完成這些工作:對已驗證爬蟲做正向確認、 比對公布的 IP 範圍,並將 IP 來源與 JA4 及無頭瀏覽器特徵結合,判定為真人、已知機器人、AI agent 或 惡意自動化。判定結果會被快取,重複查詢可於 50ms 內返回。

小結

Cloudflare 已兩度移動預設值,第二次落在 2026 年 9 月 15 日。請實際核對你的 zone 目前的設定,而非 憑印象假定。就訓練、檢索與 agent 流量分別作出決定,因為把三者壓成單一開關,正是讓你在無聲無息之間 從 AI 回答中消失的原因。以 Content Signals 在 robots.txt 中公布你的意圖,在邊緣執行與之一致的政策, 以精確 token 放行你想要的爬蟲,並以公布的 IP 範圍或反向 DNS 逐一驗證,而非信任一個任何人都能輸入的 請求標頭。

常見問題

常見問題解答

對新網域會。Cloudflare 於 2025 年 7 月 1 日宣布,新接入的網域預設拒絕 AI 爬蟲存取,除非站點擁有者主動開啟,使全球最大的 CDN 由 opt-out 轉為 opt-in。第二次變更落在 2026 年 9 月 15 日:在展示廣告的頁面上,訓練與 agent 流量將被預設攔截,適用於新客戶,以及未調整該設定的免費方案帳戶。

相關文章