Synthetische Daten sind künstlich erzeugte Daten, die reale Daten nachbilden, ohne echte Einzelinformationen zu enthalten. Sie werden von Algorithmen so generiert, dass sie die statistischen Eigenschaften eines echten Datensatzes widerspiegeln. Genutzt werden sie unter anderem, um KI-Modelle zu trainieren, wenn echte Daten knapp, sensibel oder datenschutzrechtlich problematisch sind.

Was sind synthetische Daten?
Synthetische Daten sind künstlich erzeugte Datensätze, die reale Daten nachbilden, ohne echte Einzelinformationen zu enthalten. Ein Algorithmus lernt die statistischen Muster und Verteilungen eines realen Datenbestands und erzeugt daraus neue, künstliche Datenpunkte, die sich in ihrer Struktur wie die Originale verhalten – aber keine tatsächlich existierende Person, Transaktion oder Beobachtung abbilden. Das Spektrum reicht von Tabellen über Bilder bis zu Texten. Ziel ist es, mit realistisch wirkenden Daten arbeiten zu können, wenn echte Daten knapp, teuer, sensibel oder aus Datenschutzgründen nicht nutzbar sind. Eine kompakte Definition liefert der Wikipedia-Artikel zu synthetischen Daten.
Abzugrenzen sind synthetische Daten von einfacher Anonymisierung: Beim Anonymisieren verändert man vorhandene reale Datensätze so, dass sie keiner Person mehr zuzuordnen sind; bei synthetischen Daten entstehen dagegen völlig neue Datenpunkte. Sauber erzeugt, enthalten sie im Idealfall keine Eins-zu-eins-Kopie eines realen Datensatzes und lassen deshalb keinen direkten Rückschluss auf einzelne personenbezogene Daten zu. Genau diese Eigenschaft macht sie für datenschutzsensible Anwendungen attraktiv, wie auch der englische Wikipedia-Artikel zu Synthetic Data ausführt.
Wie werden synthetische Daten erzeugt?
Die einfachste Form beruht auf statistischen Verfahren: Man misst die Verteilung realer Merkmale und zieht daraus neue Zufallswerte, die dieselben Kennzahlen aufweisen. Anspruchsvoller wird es mit generativen KI-Modellen, die komplexe Zusammenhänge zwischen vielen Merkmalen lernen. Für Bilder kommen häufig ein Diffusionsmodell oder verwandte generative Ansätze zum Einsatz, wie sie auch aus der KI-Bildgenerierung bekannt sind. Für tabellarische Daten existieren spezialisierte Modelle, die Korrelationen zwischen Spalten bewahren, damit die künstlichen Zeilen nicht nur einzeln, sondern im Zusammenspiel realistisch bleiben.
Entscheidend ist die Balance zwischen zwei Zielen: Die synthetischen Daten sollen realistisch genug sein, um nützlich zu sein, dürfen aber keine Rückschlüsse auf einzelne reale Datensätze zulassen. Kippt diese Balance zur Realitätsnähe, kann ein Modell reale Ausreißer nahezu unverändert reproduzieren – der Datenschutzvorteil wäre verloren. Kippt sie zur Sicherheit, verlieren die Daten an Aussagekraft. Gute Verfahren messen deshalb sowohl die Ähnlichkeit zur Realität als auch das Risiko der Wiedererkennung. Einen anwendungsnahen Überblick gibt die Google-Cloud-Erklärung zu synthetischen Daten.
Warum sind synthetische Daten wichtig?
Leistungsfähige KI-Systeme brauchen große Mengen an Trainingsdaten, doch echte Daten sind oft knapp, teuer in der Beschaffung oder rechtlich heikel. Personenbezogene Informationen unterliegen strengen Vorgaben der DSGVO, und viele Unternehmen dürfen sensible Bestände nicht ohne Weiteres für Test und Entwicklung nutzen. Synthetische Daten bieten hier einen Ausweg: Sie ermöglichen Training, Tests und Analysen, ohne echte personenbezogene Daten offenzulegen, und lassen sich zudem freier weitergeben – etwa an externe Entwickler oder in eine gemeinsame Datenstrategie mehrerer Abteilungen.
Ein zweiter Nutzen liegt im gezielten Auffüllen: Seltene Fälle, die in echten Daten kaum vorkommen – ungewöhnliche Betrugsmuster, seltene Krankheitsbilder, extreme Randsituationen –, lassen sich synthetisch verstärken, damit ein Modell auch für diese Fälle robust wird. Ebenso lassen sich Ungleichgewichte ausgleichen, die sonst zu KI-Bias führen könnten. Voraussetzung ist allerdings eine hohe Datenqualität der zugrunde liegenden Realdaten, denn ein Modell kann nur die Muster nachbilden, die es zuvor gesehen hat – Fehler und Verzerrungen im Original wandern sonst in die synthetischen Daten weiter.
Synthetische Daten in der Praxis
In der Praxis werden synthetische Daten vor allem in drei Situationen eingesetzt. Erstens in der Softwareentwicklung, wo Testumgebungen realistische, aber unbedenkliche Datensätze brauchen, statt mit echten Kundendaten zu hantieren. Zweitens im Training von KI-Modellen, wenn reale Beispiele fehlen oder gesetzlich geschützt sind. Drittens beim Teilen von Daten über Organisationsgrenzen hinweg, etwa in der Forschung, wo echte Bestände nicht herausgegeben werden dürfen. In allen Fällen ersetzen sie nicht die Realdaten vollständig, sondern erweitern den Spielraum, in dem gearbeitet werden darf.
Ein bewährtes Muster ist die Kombination: Ein Modell wird zunächst auf reichlich synthetischen Daten vortrainiert und anschließend mit einer kleineren Menge echter Daten feinjustiert. So nutzt man die Menge der künstlichen Beispiele und die Genauigkeit der wenigen realen. Wichtig bleibt die Dokumentation – welche Verfahren, welche Ausgangsdaten, welche Prüfungen –, damit die Herkunft nachvollziehbar bleibt und die Ergebnisse überprüfbar sind. Der Umgang mit KI-Werkzeugen sollte dabei stets im Rahmen einer klaren Datenschutz-Governance für KI-Tools erfolgen.
Auch außerhalb der KI-Entwicklung sind synthetische Daten nützlich: Für Demonstrationen, Schulungen und Vertriebspräsentationen lassen sich realistische, aber unbedenkliche Beispieldatensätze erzeugen, die keine echten Kundeninformationen preisgeben. In der Praxis empfiehlt es sich, den Realitätsgrad bewusst zu wählen – für eine reine Layout-Demonstration genügen grob plausible Werte, für ein belastbares Modelltraining müssen die statistischen Eigenschaften dagegen sorgfältig erhalten bleiben. Ein weiterer verbreiteter Anwendungsfall ist das Testen von Grenzfällen: Systeme lassen sich mit gezielt konstruierten Extremwerten prüfen, die in echten Daten zu selten auftreten, um sie zuverlässig abzudecken. Eine anwendungsnahe Übersicht bietet die IBM-Erklärung zu synthetischen Daten.
Grenzen, Risiken und Kritik
Synthetische Daten sind kein Freifahrtschein. Das größte Risiko ist die trügerische Sicherheit: Wird ein Generator zu genau, kann er reale Einzelfälle so eng nachbilden, dass eine Wiedererkennung möglich wird. Dann greift der Datenschutz erneut, und die vermeintlich unbedenklichen Daten sind es nicht mehr. Ob synthetische Daten tatsächlich außerhalb des Personenbezugs liegen, ist deshalb eine Einzelfallfrage, die eine sorgfältige Prüfung und mitunter eine Datenschutz-Folgenabschätzung erfordert.
Ein zweites Problem ist die Qualität: Synthetische Daten spiegeln nur, was das Modell gelernt hat. Fehlt ein Muster im Original, fehlt es auch im Ergebnis; ist das Original verzerrt, verstärkt die Synthese die Verzerrung womöglich noch. Modelle, die überwiegend auf künstlichen Daten trainiert werden, können mit der Zeit an Vielfalt verlieren – ein Effekt, vor dem Fachleute im Zusammenhang mit generativer KI warnen. Synthetische Daten ergänzen echte Daten also, ersetzen sie aber nur selten vollständig und nie ohne Kontrolle.
Wer synthetische Daten produktiv nutzt, sollte deshalb feste Prüfschritte vorsehen: einen Abgleich der statistischen Eigenschaften mit den Realdaten, eine Kontrolle auf zu genaue Nachbildungen einzelner Fälle und eine abschließende fachliche Bewertung, ob die Daten für den geplanten Zweck überhaupt geeignet sind.
Einordnung und rechtlicher Rahmen
Im größeren Bild sind synthetische Daten ein Baustein einer verantwortungsvollen KI-Governance: Sie helfen, Innovation und Datenschutz zu versöhnen, ersetzen aber weder rechtliche Prüfung noch ethische Abwägung. Aufsichtsbehörden wie die im Bundesbeauftragten für den Datenschutz gebündelte Praxis betonen, dass die Bewertung immer am konkreten Verfahren ansetzen muss – ein pauschales Unbedenklichkeitssiegel für synthetische Daten gibt es nicht. Der Text der Verordnung selbst ist über das Portal dsgvo-gesetz.de zugänglich.
Für Unternehmen, die KI-gestützte Prozesse aufbauen – von der Analyse bis zur Erstellung von KI-Content –, sind synthetische Daten ein Weg, sensible Bestände zu schonen und trotzdem datengetrieben zu arbeiten. Werden die Ergebnisdaten wiederum in Vektorform gespeichert und durchsucht, kommt häufig eine Vektordatenbank ins Spiel. Entscheidend bleibt: Wer synthetische Daten einsetzt, muss ihre Herkunft, ihre Qualität und ihr Restrisiko kennen und dokumentieren – nur dann sind sie ein Gewinn und keine verdeckte Haftungsquelle.