LLM-Trainingsdaten
Was sind LLM-Trainingsdaten?
LLM-Trainingsdaten sind die Sammlung von Texten und strukturierten Datensätzen, mit denen große Sprachmodelle trainiert oder feinabgestimmt werden. Allzweckmodelle lernen auf breiten Web-Korpora; Domänenmodelle und Fine-Tunes ergänzen kuratierte, aufgabenspezifische Datensätze – im Handel also Produktkataloge, Preishistorien, Bewertungen und zugeordnete Wettbewerbsangebote.
Die Datenqualität begrenzt die Modellqualität unmittelbar. Für E-Commerce-KI zählen vor allem Struktur (saubere Felder statt rohem HTML), Aktualität (Preise und Verfügbarkeiten mit Datum und Version), Abdeckung (relevante Marktplätze, Regionen und Kategorien) und eindeutige Lizenzierung. Deduplizierung und korrektes Produkt-Matching verhindern, dass ein Modell widersprüchliche Fakten über denselben Artikel lernt.
Teams kombinieren typischerweise beide Wege: Fine-Tuning auf historischen Handelsdatensätzen vermittelt dem Modell die Muster der Domäne, während RAG über einen Live-Datenfeed die aktuellen Fakten zum Abfragezeitpunkt liefert.
Verwandte Begriffe
- RAG (Retrieval-Augmented Generation)Eine KI-Architektur, bei der ein Sprachmodell vor der Antwort aktuelle externe Daten abruft.
- Daten-FeedEine strukturierte, regelmäßig aktualisierte Datenlieferung vom Anbieter in die Systeme des Abnehmers.
- Web ScrapingDas automatisierte Erheben öffentlich verfügbarer Daten von Websites im großen Maßstab.