Entdecken Sie unsere neue Funktion:Entdecken Sie AI Price Intelligence

Zurück zum Glossar

LLM-Trainingsdaten

Was sind LLM-Trainingsdaten?
LLM-Trainingsdaten sind die Sammlung von Texten und strukturierten Datensätzen, mit denen große Sprachmodelle trainiert oder feinabgestimmt werden. Allzweckmodelle lernen auf breiten Web-Korpora; Domänenmodelle und Fine-Tunes ergänzen kuratierte, aufgabenspezifische Datensätze – im Handel also Produktkataloge, Preishistorien, Bewertungen und zugeordnete Wettbewerbsangebote.

Die Datenqualität begrenzt die Modellqualität unmittelbar. Für E-Commerce-KI zählen vor allem Struktur (saubere Felder statt rohem HTML), Aktualität (Preise und Verfügbarkeiten mit Datum und Version), Abdeckung (relevante Marktplätze, Regionen und Kategorien) und eindeutige Lizenzierung. Deduplizierung und korrektes Produkt-Matching verhindern, dass ein Modell widersprüchliche Fakten über denselben Artikel lernt.

Teams kombinieren typischerweise beide Wege: Fine-Tuning auf historischen Handelsdatensätzen vermittelt dem Modell die Muster der Domäne, während RAG über einen Live-Datenfeed die aktuellen Fakten zum Abfragezeitpunkt liefert.