如何偵測並封鎖網頁爬蟲
爬蟲通常隱藏在代理伺服器背後,大規模盜取內容、價格及數據。了解如何透過 IP 及行為特徵偵測爬蟲,並在不損害 SEO 的前提下將其封鎖。
2026年4月13日閱讀約 3 分鐘
爬取是一種工業規模的複製行為,針對的是你的內容、價格及商品目錄,過程通常經過自動化並加以偽裝。 好消息是:大部分爬取活動都依賴可被偵測的基礎設施,因此 IP 偵測能夠攔截當中相當大的一部分。
現代爬蟲的運作方式
正規的爬取行動會產生龐大的請求量,因此需要藏身於代理伺服器之後,以規避限速機制:
檢測某個爬蟲 IP 是否屬於代理
透過 IP 偵測爬蟲
為隱蔽的爬蟲加入行為訊號
最難應付的爬蟲會使用住宅代理,並放慢節奏以偽裝成人類。可在 IP 分析之上疊加行為訊號:
- 請求的頻率與廣度(按次序存取每一個產品頁面)。
- 缺漏或不一致的請求標頭,以及未有執行 JS。
- 任何人類都不會產生的工作階段模式。
住宅代理訊號加上機器化行為,即可得出可靠的爬蟲判定。
封鎖但不損害 SEO
黃金原則:不要封鎖你想要的爬蟲。
| 流量類別 | 處理方式 |
|---|---|
| 已驗證的搜尋引擎爬蟲 | 按已公布/已驗證的 IP 範圍加入許可名單 |
| 資料中心代理請求 | 嚴格限速或直接封鎖 |
| 住宅代理 + 機械人行為 | 發出驗證挑戰或封鎖 |
| 正常使用者 | 放行 |
實施方式
在容易被爬取的端點(搜尋、列表、價格、API)上,於伺服器端檢測 IP 並評分,再套用上表的規則。 由於 IP 會輪換,應同時配合按帳戶或按權杖設定的限制一併使用。
總結
爬蟲會躲藏在輪換的資料中心代理及住宅代理背後,因此應先偵測代理基礎設施,再為隱蔽的住宅代理爬蟲 加入行為訊號。將真正的搜尋引擎爬蟲加入許可名單,其餘流量則按評分判定進行限速或封鎖。
常見問題
常見問題解答
它們會在資料中心代理及住宅代理池之間輪換,令請求來自大量不同的 IP,使按 IP 限速失效。相較於逐一追查個別位址,直接偵測代理基礎設施更為有效。