Os datos sintéticos son exemplos xerados de forma artificial, normalmente mediante algoritmos ou modelos de IA, en lugar de recollerse do mundo real. Poden imitar as propiedades estatísticas dun conxunto de datos auténtico ou crearse desde cero para cubrir situacións concretas, e empréganse para adestrar, validar ou ampliar modelos de aprendizaxe automática.
A súa importancia cresceu por varias razóns prácticas:
- Privacidade: permiten traballar sen expor datos persoais reais, útil en sanidade ou finanzas.
- Escaseza: cobren casos raros ou difíciles de obter, como fallos pouco frecuentes ou situacións perigosas.
- Custo: resultan máis baratos que recompilar e etiquetar grandes volumes de información real.
Un exemplo habitual é o uso de simuladores para adestrar coches autónomos con millóns de quilómetros virtuais. Convén ter presente un matiz: se os datos sintéticos non reflicten ben a realidade, o modelo aprenderá patróns enganosos. Por iso adoitan combinarse con datos reais e validarse coidadosamente para evitar sesgos ou un rendemento que só funcione "sobre o papel".