Daten-Crawling
Was ist Daten-Crawling?
Daten-Crawling ist das automatisierte Auffinden von Seiten auf einer Website oder im gesamten Web: Ein Crawler startet bei einer Menge von Seed-URLs, folgt den gefundenen Links und erstellt eine Karte dessen, was existiert. Im E-Commerce ist diese Karte meist der vollständige Katalog eines Händlers – jede Kategorie, jede paginierte Liste, jede Produkt-URL – und wird planmäßig aktualisiert, damit neue und ausgelistete Artikel erfasst werden.
Daten-Crawling und Daten-Scraping. Beide Begriffe werden oft synonym verwendet, benennen aber zwei Hälften derselben Pipeline. Crawling beantwortet, welche Seiten existieren; Scraping beantwortet, was auf ihnen steht. Ein Preismonitoring-Lauf crawlt zuerst den Kategoriebaum eines Wettbewerbers und findet 40.000 Produkt-URLs, danach scrapt er aus jeder einzelnen Preis, Verfügbarkeit und Aktionen. Ohne den Crawl werden nur die Produkte überwacht, die ohnehin schon bekannt waren.
Im großen Maßstab ist Daten-Crawling vor allem eine Übung in Zurückhaltung und Buchführung: robots.txt beachten, die Anfragerate so drosseln, dass die Zielseite nie beeinträchtigt wird, URLs entdoppeln, die sich nur im Tracking-Parameter unterscheiden, Paginierung und Infinite Scroll behandeln und festhalten, welche Seiten sich seit dem letzten Durchlauf geändert haben, damit der nächste Lauf sie priorisieren kann.