NAiOS Wiki

Contaminación de datos

También: Contaminación de datos · Data Leakage · Fuga de datos · Benchmark contamination

Cando os datos de avaliación se filtran ao adestramento, sesgando os benchmarks

1 min de lectura

A contaminación de datos (ou data contamination) prodúcese cando exemplos dos conxuntos de avaliación acaban presentes, total ou parcialmente, nos datos de adestramento dun modelo. Isto rompe a separación que debería existir entre o que o modelo aprende e aquilo co que se mide o seu rendemento. Como consecuencia, o modelo non demostra capacidade real de xeneralización, senón que "memorizou" as respostas correctas.

A súa relevancia é crítica porque invalida os resultados dos benchmarks: as cifras de precisión quedan infladas e deixan de reflectir o comportamento do modelo ante datos novos. Isto dificulta comparar sistemas de forma xusta e pode levar a decisións equivocadas en investigación ou produción.

É un problema especialmente común nos grandes modelos de linguaxe, adestrados con enormes volumes de texto extraído de internet, onde se poden colar:

  • Preguntas e solucións de probas académicas publicadas.
  • Conxuntos de avaliación abertos como MMLU ou GSM8K.
  • Repositorios con exercicios e as súas respostas.

Para mitigalo aplícanse técnicas de descontaminación, que detectan e eliminan solapamentos antes de adestrar ou avaliar.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog