La contaminació de dades (o data contamination) es produeix quan exemples dels conjunts d'avaluació acaben presents, totalment o parcialment, en les dades d'entrenament d'un model. Això trenca la separació que hauria d'existir entre el que el model aprèn i allò amb què es mesura el seu rendiment. Com a conseqüència, el model no demostra capacitat real de generalització, sinó que ha "memoritzat" les respostes correctes.
La seva rellevància és crítica perquè invalida els resultats dels benchmarks: les xifres de precisió queden inflades i deixen de reflectir el comportament del model davant de dades noves. Això dificulta comparar sistemes de forma justa i pot portar a decisions equivocades en recerca o producció.
És un problema especialment comú en els grans models de llenguatge, entrenats amb enormes volums de text extret d'internet, on es poden col·lar:
- Preguntes i solucions de tests acadèmics publicats.
- Conjunts d'avaluació oberts com MMLU o GSM8K.
- Repositoris amb exercicis i les seves respostes.
Per mitigar-ho s'apliquen tècniques de descontaminació, que detecten i eliminen encavalcaments abans d'entrenar o avaluar.