Web-Crawler
Was ist ein Web-Crawler?
Ein Web-Crawler (auch Spider oder Bot) ist ein Programm, das Websites systematisch durchläuft, indem es Links von Seite zu Seite folgt und so Inhalte entdeckt. Die bekanntesten Crawler betreiben Suchmaschinen wie Google, doch Crawler treiben ebenso die E-Commerce-Datenerhebung, Website-Audits und Archivierung an.
Crawling und Scraping sind verwandte, aber getrennte Schritte: Der Crawler ermittelt, welche URLs existieren – etwa jede Produktseite in einem Kategoriebaum –, während der Scraper aus diesen Seiten strukturierte Daten extrahiert. In einer E-Commerce-Pipeline kartiert ein Crawler nachts den vollständigen Katalog eines Händlers, und der Scraper erhebt danach Preis und Verfügbarkeit je gefundenem Produkt.
Gut erzogene Crawler weisen sich über einen User-Agent aus, respektieren die Vorgaben der robots.txt und drosseln ihre Anfragerate so, dass sie die Leistung der Zielseite nie beeinträchtigen.
Verwandte Begriffe
- Web ScrapingDas automatisierte Erheben öffentlich verfügbarer Daten von Websites im großen Maßstab.
- Daten-ParsingDas Extrahieren und Umwandeln roher HTML- oder JSON-Daten in ein strukturiertes Format.
- Rate LimitingDie Begrenzung, wie viele Anfragen ein Client in einem Zeitfenster an einen Server stellen darf.