A contaminación de datos (ou data contamination) prodúcese cando exemplos dos conxuntos de avaliación acaban presentes, total ou parcialmente, nos datos de adestramento dun modelo. Isto rompe a separación que debería existir entre o que o modelo aprende e aquilo co que se mide o seu rendemento. Como consecuencia, o modelo non demostra capacidade real de xeneralización, senón que "memorizou" as respostas correctas.
A súa relevancia é crítica porque invalida os resultados dos benchmarks: as cifras de precisión quedan infladas e deixan de reflectir o comportamento do modelo ante datos novos. Isto dificulta comparar sistemas de forma xusta e pode levar a decisións equivocadas en investigación ou produción.
É un problema especialmente común nos grandes modelos de linguaxe, adestrados con enormes volumes de texto extraído de internet, onde se poden colar:
- Preguntas e solucións de probas académicas publicadas.
- Conxuntos de avaliación abertos como MMLU ou GSM8K.
- Repositorios con exercicios e as súas respostas.
Para mitigalo aplícanse técnicas de descontaminación, que detectan e eliminan solapamentos antes de adestrar ou avaliar.