Alle artikelen

Webscrapers detecteren en blokkeren

Scrapers stelen op grote schaal content, prijzen en data, meestal achter proxy's. Leer hoe je scraping herkent op basis van IP en gedrag, en hoe je het blokkeert zonder je SEO te schaden.

13 april 20262 min leestijd

Scraping is grootschalig kopiëren, van je content, je prijzen, je hele catalogus, en gebeurt meestal geautomatiseerd en verhuld. Het goede nieuws: het meeste scraping loopt over detecteerbare infrastructuur, dus IP-detectie stopt een groot deel ervan.

Hoe moderne scrapers te werk gaan

Serieuze scraping-operaties genereren enorme aantallen verzoeken en schuilen daarom achter proxy's om rate limits te ontwijken:

Controleren of een scraping-IP een proxy is

Scrapers detecteren via IP

  1. Proxydetectie: datacenter- en residentiële proxy's markeren via de proxydetectie-API.
  2. Hosting-herkomst: massascraping draait graag op cloudservers; datacenterproxy-detectie herkent ze via het ASN.
  3. Reputatie: herhaalde overtreders hebben een geschiedenis.

Gedrag toevoegen voor de stiekeme gevallen

De lastigste scrapers gebruiken residentiële proxy's en temperen hun tempo om menselijk te lijken. Voeg gedragssignalen toe bovenop de IP-analyse:

  • Snelheid en breedte van verzoeken (elke productpagina op volgorde bezoeken).
  • Ontbrekende of inconsistente headers en het uitblijven van JS-uitvoering.
  • Sessieverloop dat geen mens zou produceren.

Een residentieel-proxysignaal plus machinaal gedrag geeft een betrouwbare scraper-conclusie.

Blokkeren zonder je SEO te schaden

De gouden regel: blokkeer niet de crawlers die je wél wilt.

VerkeerAanpak
Geverifieerde zoekmachine-crawlersAllowlist op basis van gepubliceerde/geverifieerde bereiken
Verzoeken via datacenterproxy'sStreng rate-limiten of blokkeren
Residentiële proxy + botgedragUitdagen of blokkeren
Normale gebruikersToestaan

Implementatie

Controleer het IP-adres serverside op scraping-gevoelige endpoints (zoeken, listings, prijzen, API's), ken er een score aan toe en pas de tabel toe. Combineer dit met limieten per account/token, aangezien IP's rouleren.

Kortom

Scrapers verschuilen zich achter roulerende datacenter- en residentiële proxy's, dus detecteer eerst de proxy-infrastructuur en voeg daarna gedragssignalen toe voor de stiekeme residentiële gevallen. Zet echte zoekmachine-crawlers op een allowlist en rate-limit of blokkeer de rest op basis van een score.

FAQ

Veelgestelde vragen

Ze rouleren door pools van datacenter- en residentiële proxy's, zodat verzoeken van veel verschillende IP's komen en rate limits per IP geen effect hebben. De proxy-infrastructuur zelf detecteren werkt beter dan jacht maken op individuele adressen.

Gerelateerde artikelen