Datenkontamination (oder Data Contamination) tritt auf, wenn Beispiele aus den Evaluierungsdatensätzen ganz oder teilweise in den Trainingsdaten eines Modells enthalten sind. Dies hebt die notwendige Trennung zwischen dem, was das Modell lernt, und dem, woran dessen Leistung gemessen wird, auf. Infolgedessen zeigt das Modell keine echte Generalisierungsfähigkeit, sondern hat die korrekten Antworten lediglich „auswendig gelernt“.
Die Bedeutung ist kritisch, da dies die Benchmark-Ergebnisse entwertet: Die Genauigkeitswerte werden künstlich erhöht und spiegeln nicht mehr das tatsächliche Verhalten des Modells gegenüber neuen Daten wider. Dies erschwert einen fairen Vergleich von Systemen und kann zu Fehlentscheidungen in der Forschung oder Produktion führen.
Dies ist ein besonders häufiges Problem bei großen Sprachmodellen, die mit riesigen, aus dem Internet extrahierten Textmengen trainiert werden, in die Folgendes einfließen kann:
- Fragen und Lösungen aus veröffentlichten akademischen Tests.
- Offene Evaluierungsdatensätze wie MMLU oder GSM8K.
- Repositories mit Übungen und deren Antworten.
Zur Minderung werden Techniken der Dekontamination eingesetzt, die Überschneidungen vor dem Training oder der Evaluierung erkennen und entfernen.