La contamination des données (ou data contamination) se produit lorsque des exemples issus des ensembles d'évaluation se retrouvent présents, totalement ou partiellement, dans les données d'entraînement d'un modèle. Cela rompt la séparation qui devrait exister entre ce que le modèle apprend et ce avec quoi sa performance est mesurée. En conséquence, le modèle ne démontre pas de réelle capacité de généralisation, mais a plutôt « mémorisé » les bonnes réponses.
Sa pertinence est critique car elle invalide les résultats des benchmarks : les chiffres de précision se retrouvent gonflés et ne reflètent plus le comportement du modèle face à de nouvelles données. Cela rend difficile la comparaison équitable des systèmes et peut conduire à des décisions erronées en recherche ou en production.
C'est un problème particulièrement courant dans les grands modèles de langage, entraînés avec d'énormes volumes de textes extraits d'Internet, où peuvent se glisser :
- Des questions et solutions de tests académiques publiés.
- Des ensembles d'évaluation ouverts tels que MMLU ou GSM8K.
- Des répertoires contenant des exercices et leurs réponses.
Pour y remédier, des techniques de décontamination sont appliquées afin de détecter et d'éliminer les chevauchements avant l'entraînement ou l'évaluation.