Webscrapers detecteren en blokkeren
Scrapers stelen op grote schaal content, prijzen en data, meestal achter proxy's. Leer hoe je scraping herkent op basis van IP en gedrag, en hoe je het blokkeert zonder je SEO te schaden.
Scraping is grootschalig kopiëren, van je content, je prijzen, je hele catalogus, en gebeurt meestal geautomatiseerd en verhuld. Het goede nieuws: het meeste scraping loopt over detecteerbare infrastructuur, dus IP-detectie stopt een groot deel ervan.
Hoe moderne scrapers te werk gaan
Serieuze scraping-operaties genereren enorme aantallen verzoeken en schuilen daarom achter proxy's om rate limits te ontwijken:
- Datacenterproxy's voor goedkope, snelle massaverzoeken, zie wat is een datacenterproxy.
- Residentiële proxy's wanneer ze op echte shoppers moeten lijken, zie wat is een residentiële proxy.
- Rotatie over duizenden IP's om limieten per IP te omzeilen.
Controleren of een scraping-IP een proxy is
Scrapers detecteren via IP
- Proxydetectie: datacenter- en residentiële proxy's markeren via de proxydetectie-API.
- Hosting-herkomst: massascraping draait graag op cloudservers; datacenterproxy-detectie herkent ze via het ASN.
- Reputatie: herhaalde overtreders hebben een geschiedenis.
Gedrag toevoegen voor de stiekeme gevallen
De lastigste scrapers gebruiken residentiële proxy's en temperen hun tempo om menselijk te lijken. Voeg gedragssignalen toe bovenop de IP-analyse:
- Snelheid en breedte van verzoeken (elke productpagina op volgorde bezoeken).
- Ontbrekende of inconsistente headers en het uitblijven van JS-uitvoering.
- Sessieverloop dat geen mens zou produceren.
Een residentieel-proxysignaal plus machinaal gedrag geeft een betrouwbare scraper-conclusie.
Blokkeren zonder je SEO te schaden
De gouden regel: blokkeer niet de crawlers die je wél wilt.
| Verkeer | Aanpak |
|---|---|
| Geverifieerde zoekmachine-crawlers | Allowlist op basis van gepubliceerde/geverifieerde bereiken |
| Verzoeken via datacenterproxy's | Streng rate-limiten of blokkeren |
| Residentiële proxy + botgedrag | Uitdagen of blokkeren |
| Normale gebruikers | Toestaan |
Implementatie
Controleer het IP-adres serverside op scraping-gevoelige endpoints (zoeken, listings, prijzen, API's), ken er een score aan toe en pas de tabel toe. Combineer dit met limieten per account/token, aangezien IP's rouleren.
Kortom
Scrapers verschuilen zich achter roulerende datacenter- en residentiële proxy's, dus detecteer eerst de proxy-infrastructuur en voeg daarna gedragssignalen toe voor de stiekeme residentiële gevallen. Zet echte zoekmachine-crawlers op een allowlist en rate-limit of blokkeer de rest op basis van een score.