Les données synthétiques sont des exemples générés de manière artificielle, généralement au moyen d'algorithmes ou de modèles d'IA, au lieu d'être collectés dans le monde réel. Elles peuvent imiter les propriétés statistiques d'un ensemble de données authentiques ou être créées de toutes pièces pour couvrir des situations concrètes, et sont utilisées pour entraîner, valider ou étendre des modèles d'apprentissage automatique.
Leur importance a crû pour plusieurs raisons pratiques :
- Confidentialité : elles permettent de travailler sans exposer de données personnelles réelles, ce qui est utile dans la santé ou la finance.
- Rareté : elles couvrent des cas rares ou difficiles à obtenir, tels que des défaillances peu fréquentes ou des situations dangereuses.
- Coût : elles s'avèrent moins onéreuses que la collecte et l'étiquetage de grands volumes d'informations réelles.
Un exemple courant est l'utilisation de simulateurs pour entraîner des voitures autonomes avec des millions de kilomètres virtuels. Il convient de garder une nuance à l'esprit : si les données synthétiques ne reflètent pas bien la réalité, le modèle apprendra des schémas trompeurs. C'est pourquoi elles sont généralement combinées avec des données réelles et validées avec soin afin d'éviter les biais ou une performance qui ne fonctionnerait que « sur le papier ».