全部文章

如何偵測並封鎖網頁爬蟲

爬蟲通常隱藏在代理伺服器背後,大規模盜取內容、價格及數據。了解如何透過 IP 及行為特徵偵測爬蟲,並在不損害 SEO 的前提下將其封鎖。

2026年4月13日閱讀約 3 分鐘

爬取是一種工業規模的複製行為,針對的是你的內容、價格及商品目錄,過程通常經過自動化並加以偽裝。 好消息是:大部分爬取活動都依賴可被偵測的基礎設施,因此 IP 偵測能夠攔截當中相當大的一部分。

現代爬蟲的運作方式

正規的爬取行動會產生龐大的請求量,因此需要藏身於代理伺服器之後,以規避限速機制:

檢測某個爬蟲 IP 是否屬於代理

透過 IP 偵測爬蟲

  1. 代理偵測:透過代理偵測 API標記資料中心代理及住宅代理。
  2. 主機來源:大規模爬取偏好使用雲端伺服器; 資料中心代理偵測可透過 ASN 識別它們。
  3. 信譽記錄:屢次犯案者會留下歷史紀錄。

為隱蔽的爬蟲加入行為訊號

最難應付的爬蟲會使用住宅代理,並放慢節奏以偽裝成人類。可在 IP 分析之上疊加行為訊號:

  • 請求的頻率與廣度(按次序存取每一個產品頁面)。
  • 缺漏或不一致的請求標頭,以及未有執行 JS。
  • 任何人類都不會產生的工作階段模式

住宅代理訊號加上機器化行為,即可得出可靠的爬蟲判定。

封鎖但不損害 SEO

黃金原則:不要封鎖你想要的爬蟲。

流量類別處理方式
已驗證的搜尋引擎爬蟲按已公布/已驗證的 IP 範圍加入許可名單
資料中心代理請求嚴格限速或直接封鎖
住宅代理 + 機械人行為發出驗證挑戰或封鎖
正常使用者放行

實施方式

在容易被爬取的端點(搜尋、列表、價格、API)上,於伺服器端檢測 IP 並評分,再套用上表的規則。 由於 IP 會輪換,應同時配合按帳戶或按權杖設定的限制一併使用。

總結

爬蟲會躲藏在輪換的資料中心代理及住宅代理背後,因此應先偵測代理基礎設施,再為隱蔽的住宅代理爬蟲 加入行為訊號。將真正的搜尋引擎爬蟲加入許可名單,其餘流量則按評分判定進行限速或封鎖。

常見問題

常見問題解答

它們會在資料中心代理及住宅代理池之間輪換,令請求來自大量不同的 IP,使按 IP 限速失效。相較於逐一追查個別位址,直接偵測代理基礎設施更為有效。

相關文章