Web Scraping
Was ist Web Scraping?
Web Scraping ist das automatisierte Erheben öffentlich verfügbarer Daten von Websites im großen Maßstab. Ein Scraper ruft Webseiten so ab, wie es ein Browser tut, extrahiert anschließend gezielte Felder – Preise, Produkttitel, Bewertungen, Verfügbarkeit – und speichert sie in einem strukturierten Format wie JSON oder CSV zur Auswertung.
Modernes Web Scraping kombiniert mehrere Techniken: HTTP-Clients für einfache Seiten, Headless Browser für JavaScript-gerenderte Inhalte, Proxy-Netzwerke zur Verteilung der Anfragen und Parser, die Website-Relaunches überstehen. Die Ergebnisse tragen Anwendungsfälle von der Wettbewerbspreisüberwachung über Digital-Shelf-Analytik bis zur Marktforschung und zu Trainingsdaten für KI-Modelle.
Das Scraping öffentlicher Daten ist bei verantwortungsvollem Vorgehen grundsätzlich zulässig – also unter Wahrung der Website-Stabilität, ohne personenbezogene Daten und im Einklang mit geltendem Recht wie der DSGVO. Es trägt große Teile der kommerziellen Datenwirtschaft, einschließlich Preisvergleich und Reisepreis-Aggregation.
Verwandte Begriffe
- Web-CrawlerEin Bot, der Websites systematisch durchläuft und über Links neue Seiten entdeckt.
- Preis-ScrapingDas automatisierte Auslesen öffentlich angezeigter Preise von Websites, Marktplätzen und Apps.
- Headless BrowserEin Webbrowser ohne grafische Oberfläche, der für automatisiertes Web Scraping eingesetzt wird.
- Scraper-APIEine verwaltete API, die strukturierte Daten von Zielwebsites liefert, ohne eigene Scraping-Infrastruktur.