Synthetische Daten sind künstlich generierte Beispiele, die in der Regel durch Algorithmen oder KI-Modelle erstellt werden, anstatt aus der realen Welt erhoben zu werden. Sie können die statistischen Eigenschaften eines authentischen Datensatzes imitieren oder von Grund auf neu erstellt werden, um konkrete Situationen abzudecken, und werden zum Trainieren, Validieren oder Erweitern von Modellen für maschinelles Lernen eingesetzt.
Ihre Bedeutung ist aus mehreren praktischen Gründen gewachsen:
- Datenschutz: Sie ermöglichen das Arbeiten ohne die Offenlegung realer personenbezogener Daten, was im Gesundheitswesen oder Finanzsektor nützlich ist.
- Knappheit: Sie decken seltene oder schwer zu beschaffende Fälle ab, wie etwa seltene Fehler oder gefährliche Situationen.
- Kosten: Sie sind kostengünstiger als das Sammeln und Etikettieren großer Mengen realer Informationen.
Ein gängiges Beispiel ist der Einsatz von Simulatoren zum Trainieren autonomer Fahrzeuge mit Millionen von virtuellen Kilometern. Dabei sollte ein Aspekt beachtet werden: Wenn synthetische Daten die Realität nicht korrekt widerspiegeln, lernt das Modell irreführende Muster. Daher werden sie meist mit realen Daten kombiniert und sorgfältig validiert, um Verzerrungen oder eine Leistung zu vermeiden, die nur „auf dem Papier“ funktioniert.