NAiOS IconNAiOS Logo
NAiOS Wiki

Contaminació de dades

También: Contaminació de dades · Data Leakage · Fuga de dades · Contaminació de benchmarks

Quan les dades d'avaluació es filtren a l'entrenament, esbiaixant els benchmarks

1 min de lectura

La contaminació de dades (o data contamination) es produeix quan exemples dels conjunts d'avaluació acaben presents, totalment o parcialment, en les dades d'entrenament d'un model. Això trenca la separació que hauria d'existir entre el que el model aprèn i allò amb què es mesura el seu rendiment. Com a conseqüència, el model no demostra capacitat real de generalització, sinó que ha "memoritzat" les respostes correctes.

La seva rellevància és crítica perquè invalida els resultats dels benchmarks: les xifres de precisió queden inflades i deixen de reflectir el comportament del model davant de dades noves. Això dificulta comparar sistemes de forma justa i pot portar a decisions equivocades en recerca o producció.

És un problema especialment comú en els grans models de llenguatge, entrenats amb enormes volums de text extret d'internet, on es poden col·lar:

  • Preguntes i solucions de tests acadèmics publicats.
  • Conjunts d'avaluació oberts com MMLU o GSM8K.
  • Repositoris amb exercicis i les seves respostes.

Per mitigar-ho s'apliquen tècniques de descontaminació, que detecten i eliminen encavalcaments abans d'entrenar o avaluar.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog