Künstliche Intelligenz

Was sind synthetische Daten? Künstlich erzeugte Daten in der KI

Talha Aslan 16 Minuten Lesezeit 2 Aufrufe

Was sind synthetische Daten?

Synthetische Daten sind künstliche Daten, die ein Algorithmus, eine Simulation oder ein generatives KI Modell erzeugt. Sie ahmen die statistischen Muster echter Datensätze nach, ohne diese zu kopieren. Zudem gibt es sie als Tabellen, Texte, Bilder oder Zeitreihen. Ziel ist es, Modelle zu trainieren, Software zu testen und Analysen durchzuführen, ohne echte Personen offenzulegen.

Stellen Sie sich einen Flugsimulator vor. Dort üben Piloten Notfälle, ohne einen echten Absturz zu erleben. Somit sind synthetische Daten der Simulator der Datenwelt. Sie lassen Ihre Systeme mit realistischen Datensätzen laufen und fassen dabei keine echten Kundendaten an.

Daher sollten Sie den Begriff nicht mit Fake Daten verwechseln. Fake Daten sind zufällig und bedeutungslos, synthetische Daten behalten dagegen bewusst die Struktur des Originals. Allerdings ersetzt kein Simulator die Wirklichkeit vollständig. In diesem Beitrag erklären wir den Begriff auf Konzeptebene: wie Teams solche Daten erzeugen, wo sie helfen und wo sie riskant werden.

Wie erzeugt man synthetische Daten?

Die Verfahren reichen von einfach bis komplex. Allerdings haben sie eine Idee gemeinsam: Regeln von Fachleuten oder Muster aus echten Daten steuern die Erzeugung neuer, unabhängiger Datensätze.

  • Regelbasierte Erzeugung: Ein Fachexperte schreibt die Regeln. Zum Beispiel darf ein Bestelldatum nicht nach dem Lieferdatum liegen. Das Ergebnis ist daher vorhersehbar, aber eng.
  • Statistische Modellierung: Sie leiten Verteilungen und Beziehungen zwischen Spalten aus echten Daten ab und ziehen daraus neue Datensätze.
  • Generative Modelle: GANs (generative adversarische Netze), VAEs (variationale Autoencoder), Diffusionsmodelle und große Sprachmodelle liefern realistische Beispiele.
  • Simulation: Sie bauen Szenen in einer Physik oder Spiele Engine, und die Labels entstehen automatisch.

Welches Verfahren passt, hängt vom Datentyp ab und davon, wie realistisch das Ergebnis sein muss. Allerdings steigt mit der Stärke des Generators auch der Prüfaufwand. Denn ein Modell kann Datensätze erfinden, die plausibel wirken, aber nie existiert haben.

In der Praxis kombinieren Teams oft mehrere Verfahren. Regeln sorgen beispielsweise für Konsistenz, während ein generatives Modell Vielfalt beisteuert.

Was sind synthetische Daten und welche Arten gibt es?

Zunächst fallen nach Format drei Hauptarten auf. Außerdem gibt es Zeitreihen und Audio. Dennoch begegnen Unternehmen am häufigsten Tabellen, Texten und Bildern.

ArtBeispielinhaltTypische Nutzung
TabellenKunden, Bestell und LagerzeilenSoftwaretests, Analysen, Prognosemodelle
TextSupport Gespräche, Produktbewertungen, Fragen mit passenden AntwortenTraining von Chatbots und Klassifizierern, Testsätze
BilderSimulierte Produktfotos, Aufnahmen defekter TeileTraining von Bilderkennung
ZeitreihenSensormessungen, VerkehrsdichteAnomalieerkennung, Kapazitätstests

Wählen Sie die Art erst nach der Zielsetzung. Eine Lagerverwaltung braucht Tabellen. Ein Support Bot braucht Text.

Manche Projekte kombinieren die Arten. Ein multimodales System, das Produktfotos mit Beschreibungen verknüpft, braucht zum Beispiel Bilder und Text.

Wie funktionieren synthetische Tabellendaten?

Bei Tabellendaten lernt das Modell, wie jede Spalte verteilt ist und wie die Spalten zusammenhängen. Konkret erfasst es den Zusammenhang zwischen Warenkorbwert und Artikelanzahl. Danach erzeugt es neue Zeilen, die keiner echten Zeile entsprechen.

Zwei Maßstäbe zählen gleichzeitig. Erstens die statistische Ähnlichkeit: Mittelwerte, Anteile und Beziehungen sollten nah an der Realität liegen. Zweitens der Datenschutz: Eine erzeugte Zeile darf keiner Person aus den Quelldaten zu stark ähneln.

Diese Ziele stehen manchmal im Konflikt. Zwar sind sehr ähnliche Daten nützlich, doch sie bergen aber ein Leckrisiko. Sehr unterschiedliche Daten sind sicher, taugen dann aber womöglich nicht mehr. Deshalb stellen Sie die Balance durch Messung ein.

Auch Konsistenzregeln spielen eine Rolle. Ein Lieferdatum liegt nie vor dem Bestelldatum, und ein Rabatt übersteigt nie hundert Prozent. Daher empfehlen wir nach der Erzeugung einen Prüfschritt, der solche Regeln kontrolliert.

Wofür taugen synthetische Texte und Bilder?

Bei Texten schreibt ein großes Sprachmodell (LLM) Beispielgespräche, Fragen mit Antworten oder Sätze mit Labels für ein bestimmtes Szenario. Sie können zum Beispiel abwechslungsreiche Beispiele für Rückgaben, Versandfragen und Beschwerden erzeugen lassen. Unser Beitrag über große Sprachmodelle erklärt das Konzept.

Bei Bildern gibt es dagegen zwei Wege. Generative Modelle zeichnen neue Bilder. Simulationsumgebungen verändern dagegen Licht, Winkel und Hintergrund und erzeugen so viele Varianten desselben Objekts. Der große Vorteil der Simulation: Die Labels sind automatisch und korrekt.

Für beide gilt dieselbe Warnung. Erzeugte Beispiele spiegeln die Sprache und die Bildbedingungen echter Nutzer womöglich nicht ausreichend wider. Deshalb raten wir, ein kleines Validierungsset aus echten Beispielen zurückzuhalten.

Bei Texten kommt zudem mangelnde Vielfalt hinzu. Das Modell wiederholt gern dieselben Muster, daher sollten Sie ähnliche Sätze nach der Erzeugung herausfiltern.

Wo setzen Teams synthetische Daten in der Praxis ein?

Zunächst gehören synthetische Daten nicht zu einer einzigen Branche. Denn sie tauchen überall dort auf, wo der Datenzugang schwierig ist oder seltene Ereignisse zählen. Die Liste enthält Beispielszenarien und keine Kundenergebnisse.

  • E-Commerce: Testdatenbanken mit Bestellungen und Retouren sowie Beispielnachrichten für die Support Klassifizierung.
  • Logistik: Bilder beschädigter Pakete und simulierte Routen oder Lieferverzögerungen.
  • Fertigung: Fotos defekter Teile und Reihen von Sensorausfällen.
  • Forschung zum autonomen Fahren: Seltene Verkehrslagen, die man in der Simulation nachstellt.
  • Softwareteams: Datensätze ohne echte Identitäten für Entwicklungs und Testumgebungen.
  • Lehre und Forschung: Beispieldatensätze, die Studierende teilen dürfen, ohne dass echte Personen darin vorkommen.

Gemeinsam ist diesen Fällen: Echte Daten sind knapp, riskant oder teuer. Somit entschärfen synthetische Daten mindestens eines dieser drei Probleme.

Auch kleine Unternehmen können beginnen. Wählen Sie zunächst einen engen Anwendungsfall, etwa Testdaten oder die Klassifizierung von Support Nachrichten. Prüfen Sie das Ergebnis dann mit echten Beispielen, bevor Sie erweitern.

Warum sind synthetische Daten wichtig?

Zunächst sind Daten der gemeinsame Engpass von KI und Softwareprojekten. Sie sind knapp, teuer oder gesperrt, weil sie personenbezogene Informationen enthalten. Synthetische Daten können alle drei Probleme gleichzeitig entschärfen.

  • Zugang: Teammitglieder und externe Entwickler arbeiten, ohne echte Kundendatensätze zu berühren.
  • Tempo: Sie bauen Prototypen, ohne auf Datenerhebung und Labeling zu warten.
  • Abdeckung: Sie können Situationen, die selten vorkommen, gezielt vervielfachen.
  • Datenschutz: Der Bereich mit Personenbezug schrumpft, somit sinkt die Angriffsfläche.

Auch die Kosten zählen. Denn echte Daten zu sammeln, zu bereinigen und zu labeln kostet das Team Wochen. Die synthetische Erzeugung automatisiert einen Teil dieser Arbeit, daher verkürzt sich Ihr Experimentzyklus. So testen Sie eine Idee früh und verwerfen schwache Ansätze günstig.

Dennoch stellen sich diese Vorteile nicht automatisch ein. Qualität und Datenschutz müssen Sie daher getrennt nachweisen.

Wie nutzt man synthetische Daten beim Modelltraining?

Zunächst verbessern sich Modelle des maschinellen Lernens durch Beispiele. Reichen die echten Beispiele nicht, ergänzen synthetische den Trainingssatz. Ein kleines Modell, das Rückgabegründe in einem Shop einordnet, kann zum Beispiel zusätzliche Beispiele für seltene Gründe erhalten.

Ein praktischer Ansatz sieht so aus. Behalten Sie alle echten Daten und fügen Sie synthetische Beispiele nur hinzu, um fehlende Klassen auszugleichen. Danach prüfen Sie das Modell an einem getrennten Test, der nur aus echten Datensätzen besteht. So sehen Sie, ob die synthetischen Daten wirklich geholfen haben.

Auch bei Sprachmodellen gibt es eine ähnliche Idee. Ein starkes Modell erzeugt Beispiele, mit denen Sie ein kleineres trainieren. Dieses Thema behandeln wir im Beitrag über Knowledge Distillation, daher wiederholen wir es hier nicht.

Wie arbeiten synthetische Daten und große Sprachmodelle zusammen?

Zunächst sind große Sprachmodelle das häufigste Werkzeug für synthetische Texte. Sie geben dem Modell in einem Prompt eine Rolle, ein Szenario und ein Ausgabeformat vor. Das Modell schreibt dann in diesem Rahmen Dutzende Beispiele. Danach filtern und labeln Sie diese.

Ein weiterer Einsatz sind Testsätze. Um einen Assistenten zu prüfen, der aus Firmendokumenten antwortet, können Sie aus diesen Dokumenten Fragen mit Antworten erzeugen. Wie so ein Assistent funktioniert, zeigt unser Beitrag über RAG.

Allerdings wiederholt ein Generator auch seine eigenen Fehler. Kontrollieren Sie daher einen Teil der erzeugten Paare von Hand. Außerdem kann dasselbe Modell, das Fragen schreibt und Antworten bewertet, die eigene Verzerrung verstärken.

Warum helfen synthetische Daten bei Softwaretests?

Echte Kundendaten in eine Testumgebung zu kopieren ist für Sicherheit und Compliance riskant. Daher lösen synthetische Daten dieses Problem an der Wurzel. Es gibt keine echten Identitäten, doch Feldformate, Längen und Beziehungen wirken realistisch.

Beispielszenario: Sie testen eine Bestellverwaltung. Der synthetische Satz enthält bewusst lange Adressen, Namen mit Sonderzeichen, stornierte Bestellungen und leere Felder. Somit prüfen Sie die Maske auch an Randfällen, die in echten Daten selten vorkommen.

Bei individuellen Projekten hält dieser Ansatz Entwicklungs und Testumgebungen sicher. In unserer individuellen Softwareentwicklung empfehlen wir, die Testdaten von Anfang an zu planen.

Wie nutzen Sie synthetische Daten für seltene Szenarien?

Manche Ereignisse sind sehr selten, und Ihr System muss sie trotzdem korrekt behandeln. Eine Lagerkamera muss ein beschädigtes Paket erkennen. Eine Anomaliewarnung muss ungewöhnliches Verhalten erfassen. Beides sind gute Beispiele.

Zunächst gilt: Gibt es nur wenige echte Beispiele, erfasst das Modell diese Fälle schlecht. Stattdessen vervielfachen Sie sie mit Simulation oder einem generativen Modell. Bilder eines beschädigten Pakets aus verschiedenen Winkeln und bei unterschiedlichem Licht sind ein gutes Beispiel.

Es gibt jedoch eine Falle. Denn beschreiben Sie den seltenen Fall falsch, lernt das Modell die falsche Lehre. Definieren Sie die Szenarien deshalb gemeinsam mit einem Fachexperten und vergleichen Sie sie mit mindestens einem echten Beispiel. Ein Lagerteam weiß, wie ein Schaden wirklich aussieht, und dieses Wissen fließt in Ihre Einstellungen ein.

Schützen synthetische Daten die Privatsphäre wirklich?

Die kurze Antwort lautet: nicht immer. Zwar stärken richtig erzeugte synthetische Daten den Datenschutz. Falsch erzeugt können sie dagegen Details über Personen aus dem Trainingssatz preisgeben. Hat ein Modell einen seltenen, markanten Datensatz auswendig gelernt, kann die Ausgabe ihm stark ähneln.

Mathematische Verfahren wie Differential Privacy verringern dieses Risiko. Sie fügen dem Prozess kontrolliertes Rauschen hinzu, sodass eine einzelne Person das Ergebnis nicht sichtbar verändert. Die US Behörde NIST hat dazu Leitlinien zur Bewertung von Differential Privacy veröffentlicht.

Denken Sie auch wie ein Angreifer. Bei einem Membership Inference Angriff versucht jemand herauszufinden, ob eine bestimmte Person in den Trainingsdaten war. Denn je näher die Ausgabe an der Quelle liegt, desto leichter gelingt diese Vermutung. Daher spielen Datenschutztests genau diese Szenarien durch.

Die praktische Regel ist einfach: Akzeptieren Sie nie eine Datenschutzbehauptung ohne Messung. Prüfen Sie, wie nah erzeugte Datensätze an den Quelldatensätzen liegen, und holen Sie bei hohem Einsatz eine unabhängige Prüfung ein.

Was sind synthetische Daten nach DSGVO?

Was sind synthetische Daten aus Sicht des Datenschutzes? Kein Freifahrtschein, wie die folgenden Absätze zeigen. Dieser Abschnitt ist eine allgemeine Information und keine Rechtsberatung. Zunächst erfasst das Datenschutzrecht Informationen über eine identifizierte oder identifizierbare Person. Wirklich anonyme Daten können außerhalb dieses Rahmens liegen, aber den Nachweis müssen Sie führen.

Das Etikett synthetisch macht Daten nicht automatisch nicht personenbezogen. Bei der Erzeugung nutzen Sie echte personenbezogene Daten, daher kann schon die Verarbeitung eine rechtliche Prüfung erfordern. Lässt sich die Ausgabe außerdem auf eine Quellperson zurückführen, zählt sie womöglich weiterhin als personenbezogen, und die Pflichten bleiben bestehen.

Der Europäische Datenschutzbeauftragte (EDPS) sieht synthetische Daten als Chance für Privatsphäre und Fairness, warnt aber zugleich vor der Verzerrung des Originals. Details finden Sie auf der EDPS Seite zu synthetischen Daten.

Dokumentation hilft in der Praxis. Konkret halten Sie fest, welche Quelldaten Sie wofür und mit welchem Verfahren genutzt haben. Bewahren Sie außerdem Testergebnisse auf, die zeigen, dass sich die Ausgabe nicht auf Quellpersonen zurückführen lässt. Für die Compliance Ihrer Website liefert unser Leitfaden zur datenschutzkonformen Website weiteren Kontext. Treffen Sie die endgültige Entscheidung stets mit Ihrer Rechtsberatung.

Wie unterscheiden sich synthetische, echte und anonymisierte Daten?

Die drei Ansätze werden oft verwechselt. Deshalb stellt die Tabelle Stärken und Schwächen nebeneinander. Die Werte zeigen allgemeine Tendenzen, und das reale Ergebnis hängt vom Verfahren und von den Daten ab.

KriteriumEchte DatenAnonymisierte DatenSynthetische Daten
QuelleDirekt erhobene DatensätzeEchte Datensätze ohne IdentitätsfelderMit Modell oder Regeln neu erzeugte Datensätze
RealismusAm höchstenHoch, sinkt aber bei eingeschränkten FeldernAbhängig vom Verfahren, meist unter dem Original
DatenschutzrisikoHochRisiko erneuter Identifizierung kann bleibenNiedrig bis mittel, je nach Qualität der Erzeugung
Seltene FälleNur das ErlebteNur das ErlebteGezielt vervielfachbar
VerzerrungEntsteht durch die ErhebungWird unverändert übernommenKann sie verstärken oder korrigieren
Rechtlicher StatusVoll im AnwendungsbereichBeweislast liegt bei IhnenFallabhängig, Beratung nötig

Was sind synthetische Daten also in dieser Tabelle? Sie sind ein Mittelweg. Somit senken sie die Datenschutzprobleme echter Daten, verlangen aber zusätzliche Prüfungen auf Realismus und Verzerrung.

Kurz gesagt ersetzen synthetische Daten die Anonymisierung nicht blind. Beide dienen unterschiedlichen Zielen. Für Analysen wählen Sie zum Beispiel anonymisierte Daten, für eine Entwicklungsumgebung synthetische.

Wie verstärken synthetische Daten Verzerrungen?

Ein Modell, das auf Quelldaten trainiert, erzeugt die synthetischen Daten. Zunächst gilt: Ist eine Gruppe in der Quelle unterrepräsentiert, bleibt sie es auch in der Ausgabe. Außerdem kann das Modell sogar zum Mehrheitsmuster tendieren und die Lücke vergrößern. Dieser Effekt bleibt still, bis die Ergebnisse ihn offenlegen.

Beispielszenario: Ein Paketdienst hat Support Datensätze, in denen Adressen aus Großstädten dominieren. Die erzeugten Adressen driften dann ebenfalls Richtung Großstadt. Ein System, das darauf trainiert, bedient Kunden in kleinen Orten womöglich schlechter.

Die gute Nachricht: Sie können synthetische Daten bewusst ausbalancieren. Dazu erhöhen Sie den Anteil unterrepräsentierter Gruppen und korrigieren die Verteilung. Dafür müssen Sie die Verzerrung allerdings zuerst messen, denn was Sie nicht messen, korrigieren Sie nicht.

  • Ermitteln Sie die Gruppenverteilung der Quelldaten vor der Erzeugung.
  • Messen Sie dieselbe Verteilung nach der Erzeugung erneut und vergleichen Sie.
  • Erzeugen Sie zusätzliche Beispiele für unterrepräsentierte Gruppen und kennzeichnen Sie diese separat.
  • Testen Sie das Endergebnis für jede Gruppe einzeln.

Was ist Modellkollaps und wie hängt er mit synthetischen Daten zusammen?

Modellkollaps (Model Collapse) bezeichnet den schleichenden Verlust von Vielfalt und Qualität der Ausgaben, wenn Modelle wiederholt mit Daten trainieren, die selbst von Modellen stammen. Zuerst verschwinden seltene Beispiele. Danach werden die Ausgaben einförmig.

Eine wissenschaftliche Arbeit in Nature, AI models collapse when trained on recursively generated data, untersucht dieses Konzept. Ihre Kernbotschaft lautet allerdings, dass echte menschliche Daten beim Training wertvoll bleiben.

Stellen Sie sich den Mechanismus so vor. Zunächst gibt ein Modell sehr seltene Beispiele etwas schlechter wieder. Dann trainiert das nächste Modell auf dieser schwächeren Ausgabe und sieht diese Beispiele noch seltener. Nach einigen Runden verschwinden die Ränder der Verteilung, und nur Durchschnittsbeispiele bleiben. Eine Fotokopie einer Fotokopie verfällt also ähnlich.

Die praktische Lehre ist klar. Ersetzen Sie echte Daten nicht durch synthetische, sondern nutzen Sie diese ergänzend. Fügen Sie in jeder Runde frische echte Beispiele hinzu und messen Sie die Qualität regelmäßig.

Wie schwächt mangelnder Realismus synthetische Daten?

Erzeugte Daten wirken auf den ersten Blick plausibel, aber ihnen fehlen die Ecken und Kanten des echten Lebens. Zum Beispiel fehlen Tippfehler, ungewöhnliche Formate, überraschende Kombinationen und sich wandelndes Nutzerverhalten fehlen oft.

Deshalb glänzt ein Modell, das Sie auf synthetischen Daten trainieren und testen, im Labor. Bei echten Nutzern scheitert es dann auf unerwartete Weise. Das gleicht einem Fahrer, der den Simulator beherrscht und auf echter Straße ins Straucheln gerät.

Das Gegenmittel ist einfach: Machen Sie die Abschlussprüfung immer mit echten, zurückgehaltenen Daten. Denken Sie außerdem daran, dass Generatoren Details erfinden können, was man Halluzination nennt. Unser Beitrag über KI Halluzination erklärt das.

  • Vergleichen Sie echte und synthetische Beispiele nebeneinander mit eigenen Augen.
  • Suchen Sie den echten Anteil an Ausreißern und leeren Feldern auch im synthetischen Satz.
  • Nehmen Sie Verhalten auf, das sich über die Zeit ändert, etwa Saisons und Aktionen.
  • Fügen Sie Tippfehler und Unebenheiten bewusst hinzu.

Wie messen Sie die Qualität synthetischer Daten?

Zunächst gilt: Keine einzelne Zahl drückt Qualität aus. In der Praxis betrachten Sie drei Dimensionen und entscheiden, welche für Sie am wichtigsten ist.

  • Treue: Liegt die statistische Struktur nah genug an der Realität? Vergleichen Sie Mittelwerte, Verteilungen und Spaltenbeziehungen.
  • Nutzen: Schneidet ein Modell, das Sie mit synthetischen Daten trainieren, an einem echten Testsatz akzeptabel ab?
  • Datenschutz: Kommen erzeugte Datensätze den Quelldatensätzen gefährlich nahe? Prüfen Sie zuerst Ausreißer und seltene Datensätze.

Diese drei Größen ziehen oft in verschiedene Richtungen. Denn höhere Treue kann das Datenschutzrisiko steigern. Halten Sie deshalb zuerst Ihr Ziel fest: Nutzen Sie die Daten nur für Tests oder für das Modelltraining? Ihre Antwort legt die Akzeptanzschwelle fest. Bei Testdaten steht zum Beispiel die Treue im Vordergrund, bei Daten zum Teilen der Datenschutz.

Welche Fehler machen Teams beim Erzeugen synthetischer Daten?

Zu wissen, was synthetische Daten sind, reicht nicht. Außerdem sollten Sie die Fallen kennen. Nach unserer Erfahrung stolpern Teams an einigen Stellen.

  • Validierung überspringen: Die Daten sehen gut aus, also trainieren Sie darauf, und das Modell scheitert bei echten Nutzern.
  • Datenschutz annehmen: Sie halten die Daten für sicher, weil sie künstlich sind, doch das Modell kann einen Datensatz auswendig gelernt haben.
  • Auf eine Quelle setzen: Wer nur mit der Ausgabe eines Modells trainiert, verengt die Vielfalt.
  • Quellqualität ignorieren: Fehlerhafte Quelldaten werden zu fehlerhaften synthetischen Daten.
  • Dokumentation auslassen: Nach sechs Monaten weiß niemand mehr, wie die Daten entstanden sind.

Allerdings ist keiner dieser Fehler technisch schwer. Alle verlangen Disziplin. Daher ist eine schriftliche Checkliste die günstigste Absicherung. Halten Sie außerdem das erste Projekt klein, damit Sie aus Fehlern zu geringen Kosten lernen.

Wie gewichten Sie synthetische und echte Daten?

Deshalb ist es am gesündesten, beide als Partner zu sehen und nicht als Rivalen. Echte Daten sichern die Genauigkeit. Dagegen erweitern synthetische Daten Abdeckung und Sicherheit. Statt einer festen Mischregel stellen Sie das Verhältnis durch Messung ein.

  • Kern aus echten Daten: Das Rückgrat von Training und besonders Test sollte aus echten Beispielen bestehen.
  • Synthetische Ergänzung: Stützen Sie fehlende Klassen, seltene Fälle und Randszenarien mit synthetischen Beispielen.
  • Getrennter Testsatz: Lassen Sie synthetische Daten nie in den Testsatz gelangen.
  • Schrittweise Steigerung: Erhöhen Sie den synthetischen Anteil langsam und beobachten Sie bei jedem Schritt das echte Testergebnis.

Sinkt das Ergebnis, nehmen Sie den Anteil zurück, denn jeder Datensatz hat seinen eigenen Sweet Spot. So finden Sie den Punkt, an dem synthetische Daten helfen, und den, an dem sie zu schaden beginnen.

Wann sollten Sie auf synthetische Daten verzichten?

Allerdings lösen synthetische Daten nicht jedes Problem. In den folgenden Fällen ist es gesünder, zu echten Daten zurückzukehren oder ein anderes Verfahren zu wählen.

  • Sie wollen echtes Verhalten selbst messen, etwa worauf Nutzer tatsächlich klicken.
  • Ihnen fehlen selbst genug solide echte Beispiele, die der Generator nachbilden könnte, denn das Modell weiß nicht, was es vervielfachen soll.
  • Ihre Quelldaten sind schlecht oder falsch, denn Fehler vervielfachen sich unverändert.
  • Entscheidungen betreffen Menschen direkt, und Sie können die Ergebnisse nicht validieren.

Erwägen Sie in solchen Fällen bessere Datenerhebung, Umfragen, kontrollierte Experimente oder eine Beschränkung der echten Daten auf die nötigen Felder.

Wie grenzen Sie synthetische Daten von verwandten Begriffen ab?

Synthetische Daten werden oft mit ähnlichen Begriffen verwechselt. Daher zeigt die Tabelle, was jeder Begriff leistet und wie er zu synthetischen Daten steht.

BegriffWas er leistetBeziehung zu synthetischen Daten
DatenaugmentierungVervielfacht ein vorhandenes Beispiel mit kleinen Änderungen, etwa durch Spiegeln eines BildesEinfacher Verwandter; sie erzeugt Varianten, keine neuen Beispiele
SimulationModelliert eine Umgebung und rendert SzenenEines der Erzeugungsverfahren
Knowledge DistillationÜberträgt Wissen von einem großen auf ein kleines ModellAusgaben des großen Modells können als synthetische Trainingsdaten dienen
Entfernen von IdentitätsfeldernLöscht Identitätsfelder aus einem echten DatensatzDer echte Datensatz bleibt; bei synthetischen Daten nicht
GuardrailsKontrollieren Ein und Ausgabe eines ModellsSynthetische Daten liefern Testszenarien, die sie fordern

Guardrails haben wir im Beitrag über KI Guardrails behandelt. Synthetische Daten helfen zudem, Testszenarien zu erzeugen, die diese Schutzplanken belasten.

Wie sieht die Checkliste für synthetische Daten aus?

Beantworten Sie nach der Frage, was synthetische Daten sind, vor dem Projektstart die folgenden Fragen einzeln. Also deutet eine fehlende Antwort meist auf eine Annahme, die später teuer wird.

  • Habe ich Zweck und Beweisziel aufgeschrieben?
  • Kenne ich die sensiblen Felder und Quellen von Verzerrung in den Quelldaten?
  • Besitze ich einen Validierungssatz, den ich von den echten Daten getrennt halte?
  • Habe ich einen Datenschutztest gemacht, der die Nähe zu den Quelldatensätzen misst?
  • Nutze ich synthetische Daten ergänzend und nicht als Ersatz für echte Daten?
  • Hat ein Experte die rechtliche Seite geprüft?
  • Habe ich Verfahren und Version der Erzeugung dokumentiert?

Ist auch nur eine der sieben Fragen offen, klären Sie sie vor dem nächsten Schritt. Denn eine kleine Investition schützt Sie vor einem großen Missverständnis. Teilen Sie die Liste außerdem mit Ihrem Team, damit alle mit denselben Erwartungen arbeiten.

Wo sollte ein kleines Unternehmen mit synthetischen Daten beginnen?

Beispielszenario: Ein kleiner Onlineshop will ein Werkzeug testen, das Support Nachrichten einordnet. Er möchte echte Gespräche allerdings nicht mit einem externen Entwickler teilen.

  1. Halten Sie das Ziel fest: nur ein Test der Themenklassifizierung.
  2. Trennen Sie Identitätsangaben von den echten Nachrichten und behalten Sie nur die Themen.
  3. Lassen Sie ein Sprachmodell für jedes Thema abwechslungsreiche Beispiele schreiben.
  4. Filtern Sie ähnliche und zu schematische Sätze heraus.
  5. Messen Sie das Ergebnis an zurückgehaltenen echten Beispielen und dokumentieren Sie die Version.

Dieser Ansatz ist daher schnell und hält personenbezogene Daten im Haus. Den endgültigen Erfolg messen Sie jedoch an den echten Beispielen, die Sie zurückgehalten haben. Möchten Sie den Prozess gemeinsam mit einem Team aufsetzen, schauen Sie sich unsere KI Automatisierung an. Außerdem bietet unser Beitrag zur Datenanalyse mit KI eine ergänzende Sicht.

Was sind synthetische Daten also im Geschäftsalltag? Kurz gesagt ein Helfer, mit dem Sie experimentieren, ohne echte Daten zu gefährden, sofern Sie ihn validieren.

Häufig gestellte Fragen

Sind synthetische Daten dasselbe wie anonymisierte Daten?
Nein, sie unterscheiden sich. Anonymisierte Daten sind echte Datensätze ohne Identitätsfelder, und ein Risiko erneuter Identifizierung kann bleiben. Synthetische Daten entstehen dagegen neu aus Mustern, die ein Modell in echten Daten gelernt hat. Beide dienen unterschiedlichen Zielen, daher ist die Kombination je nach Projekt und Risiko oft am besten.
Fallen synthetische Daten aus der DSGVO heraus?
Nicht automatisch. Nutzen Sie bei der Erzeugung echte personenbezogene Daten, kann schon die Verarbeitung eine rechtliche Prüfung erfordern. Lässt sich die Ausgabe außerdem auf eine Person zurückführen, kann sie weiterhin personenbezogen sein. Das ist keine Rechtsberatung, deshalb entscheiden Sie gemeinsam mit Ihrer Rechtsberatung und dokumentieren Ihren Erzeugungsprozess.
Kann man ein KI Modell mit synthetischen Daten trainieren?
Ja, das ist möglich, aber meist sicherer, wenn synthetische Daten die echten ergänzen und nicht ersetzen. Synthetische Beispiele können fehlende Klassen ausgleichen. Messen Sie das Modell trotzdem immer an einem echten, zurückgehaltenen Testsatz, denn synthetische Daten können die Ecken und Kanten der Realität auslassen und Ergebnisse beschönigen.
Was ist Modellkollaps und wie hängt er mit synthetischen Daten zusammen?
Modellkollaps bezeichnet den Rückgang von Vielfalt und Qualität der Ausgaben, wenn Modelle wiederholt mit maschinell erzeugten Daten trainieren. Das Risiko wächst, wenn synthetische Daten die echten vollständig ersetzen, weil seltene Beispiele verblassen. Fügen Sie daher regelmäßig frische echte Daten hinzu und messen Sie die Qualität in jeder Runde.
Woran erkenne ich die Qualität synthetischer Daten?
Betrachten Sie drei Dimensionen: Treue, Nutzen und Datenschutz. Die Treue misst statistische Ähnlichkeit, der Nutzen die Leistung eines Modells an echten Tests, der Datenschutz die Nähe zu den Quelldatensätzen. Legen Sie zuerst Ihr Ziel fest, denn die Akzeptanzschwelle ändert sich mit dem Einsatzzweck. Bei Testdaten steht etwa die Treue im Vordergrund.
Sollten kleine Unternehmen synthetische Daten nutzen?
Das kommt darauf an. Sie helfen beim Aufbau einer Testumgebung oder bei der Arbeit mit externen Entwicklern, weil Sie keine echten Kundendaten weitergeben. Wollen Sie echtes Nutzerverhalten messen, brauchen Sie weiterhin echte Daten. Ein kleiner Versuch, der an echten Beispielen geprüft wird, ist ein vernünftiger und risikoarmer Einstieg.
  • synthetische Daten
  • künstliche Intelligenz
  • Modelltraining
  • Datenschutz
  • DSGVO
  • Modellkollaps
  • Testdaten
Teilen:
Talha Aslan

Google Partner und Experte für digitales Marketing. Seit 2012 praktisch in SEO, Google Ads, Webdesign und E-Commerce Projekten; jeder Beitrag hier stammt aus dieser Erfahrung.

Nächstes Projekt

Sprechen wir über Ihr Projekt.

Ihre Anfrage geht direkt an Talha Aslan und Team: Strategie von Talha, Umsetzung durch ein erfahrenes Team. Das Erstgespräch ist kostenlos, wir hören zu und melden uns mit einer klaren Roadmap.