Künstliche Intelligenz

Was ist Federated Learning? Modelle trainieren ohne Daten zu teilen

Talha Aslan 19 Minuten Lesezeit 4 Aufrufe

Was ist Federated Learning?

Federated Learning (föderiertes Lernen) ist ein Verfahren, um ein KI Modell zu trainieren, ohne die Rohdaten an einen zentralen Ort zu bringen. Das heißt, die Daten bleiben auf dem Gerät oder in der Organisation. Nur die gelernten Änderungen des Modells gehen an einen Server, der sie zu einem gemeinsamen Modell zusammenführt.

Im klassischen Ansatz sammeln Sie zuerst alle Daten in einem großen Pool und trainieren das Modell dort. Federated Learning dreht diese Reihenfolge also um. Das Modell reist zu den Daten, die Daten reisen nicht zum Modell.

Bekannt wurde die Idee durch die arXiv Veröffentlichung von McMahan und Kollegen. Die Autoren schlagen vor, auf Daten zu trainieren, die über Mobilgeräte verteilt liegen, und die Ergebnisse durch wiederholtes Mitteln des Modells zusammenzuführen.

Die kurze Antwort auf die Frage lautet also: Sie lernen aus Daten, ohne sie in Ihre Obhut zu nehmen. In der Praxis stecken hinter diesem Satz allerdings Fragen zu Datenschutz und Technik.

Dieser Beitrag behandelt genau einen Begriff. Wir erklären zunächst, wie er funktioniert, warum er wichtig ist, welchen Schutz er wirklich bietet und wo er endet.

Was ist Federated Learning in einfachen Worten, mit einer Analogie?

Stellen Sie sich ein Klassenzimmer vor, in dem jeder Schüler private Notizen in einem Heft führt. Die Lehrerin sammelt die Hefte nicht ein. Stattdessen gibt sie allen dieselbe Zusammenfassungskarte. Jeder Schüler verbessert die Karte mit seinen eigenen Notizen und gibt nur die Änderungen zurück.

Die Lehrerin führt alle Änderungen zusammen und bereitet eine bessere Karte für alle vor. Somit gibt niemand sein Heft ab, und trotzdem lernt die gemeinsame Karte aus der Erfahrung aller.

In dieser Analogie sind die Hefte die Rohdaten und die Karte ist das Modell. Die Änderungen sind die Modell Updates, und die Lehrerin ist der zentrale Server. In der Praxis sind echte Systeme komplexer, aber die Grundidee bleibt gleich.

Die Analogie hat auch eine Schwachstelle. Wer die Änderungen genau studiert, kann eventuell trotzdem etwas über das Heft erraten. Auf dieses Risiko kommen wir deshalb weiter unten zurück.

Außerdem muss die Lehrerin kein einzelner Punkt sein. Manche Architekturen verteilen das Zusammenführen stattdessen auf mehrere Parteien.

Was ist Federated Learning in einer Trainingsrunde konkret?

Federated Learning läuft in wiederholten Schleifen, die man Runden nennt. In jeder Runde wählt der Server einige Teilnehmer aus und schickt ihnen das aktuelle Modell. Ein Teilnehmer kann ein Smartphone sein, aber auch der Server einer Organisation.

  1. Der Server schickt das aktuelle gemeinsame Modell an die ausgewählten Teilnehmer.
  2. Jeder Teilnehmer trainiert das Modell kurz mit seinen lokalen Daten.
  3. Jeder Teilnehmer schickt nur die Modelländerung zurück, niemals die Rohdaten.
  4. Der Server führt die eingehenden Änderungen zu einem neuen gemeinsamen Modell zusammen.
  5. Das neue Modell geht wieder hinaus, und die Schleife läuft weiter, bis das Ziel erreicht ist.

Diese Schleife kann viele Runden dauern, bis das Modell gut genug ist. Die Anzahl der Runden, die Zahl der Teilnehmer pro Runde und die Dauer des lokalen Trainings sind Designentscheidungen. Daher unterscheiden sie sich von Projekt zu Projekt.

Zum Beispiel können sich Geräte auseinanderentwickeln, wenn das lokale Training zu lange dauert. Dauert es zu kurz, verschwenden Sie Netzwerkverkehr. Daher stellen Sie dieses Gleichgewicht durch Experimente ein.

Wie führt der Server die Updates zusammen?

Die bekannteste Methode heißt Federated Averaging. Der Server bildet einen gewichteten Mittelwert der Änderungen, die die Teilnehmer schicken. Konkret bekommt ein Teilnehmer mit mehr Trainingsdaten in der Regel ein größeres Gewicht.

Die Arbeit von McMahan und Kollegen zeigt, dass dieses Mitteln die Zahl der Kommunikationsrunden deutlich senken kann. Der Grund ist praktisch, denn in Mobilfunknetzen ist die Datenübertragung der Engpass, nicht die Rechenleistung.

Das Mitteln klingt einfach, doch echte Teilnehmer besitzen selten ähnliche Daten. Ein Nutzer tippt den ganzen Tag Fachbegriffe, ein anderer schreibt lockere Chats. Dieser Unterschied macht das Zusammenführen daher schwieriger.

Wenn Sie wissen möchten, wie Produktivsysteme arbeiten, ist das Papier zum Systemdesign des Google Teams eine gute Quelle. Es beschreibt, wie Geräte ausfallen, wie der Server sie auswählt und wie die Runden koordiniert bleiben.

Kurz gesagt ist das Zusammenführen nicht nur Mathematik. Es ist auch ein Problem der Systemtechnik.

Warum ist Federated Learning wichtig?

Viele wertvolle Daten dürfen aus rechtlichen oder geschäftlichen Gründen nicht wandern. Private Nachrichten, interne Unterlagen von Organisationen und Nutzungsgewohnheiten auf dem Gerät gehören dazu. Federated Learning zeigt einen Weg, den Wert dieser Daten trotzdem zu nutzen.

Der zweite Vorteil ist eine geringere Übertragungslast. Einen riesigen Datensatz an einen Ort zu bringen, kostet Geld und vergrößert zudem die Angriffsfläche. Nur Updates zu übertragen ist andererseits meist deutlich leichter.

Der dritte Vorteil ist Vertrauen. Wissen Nutzer, dass ihre Daten das Gerät nie verlassen, machen sie bereitwilliger mit. Deshalb kann Federated Learning aus technischen Gründen und aus Gründen der Reputation eine kluge Wahl sein.

Ein vierter Vorteil betrifft das Eigentum an den Daten. Organisationen können zu einem gemeinsamen Modell beitragen, ohne ihre eigenen Daten herzugeben. So können Parteien zusammenarbeiten, die ähnliche Daten besitzen, aber nicht konkurrieren.

Ein fünfter Vorteil ist die Personalisierung. Weil das Modell aus Mustern auf dem Gerät lernt, passt es besser zu lokalen Gewohnheiten. Ein rein zentrales Modell neigt dagegen zum Durchschnitt.

Trotzdem ist das Verfahren kein magischer Datenschutzschild. Sie müssen Nutzen und Grenzen gemeinsam sehen.

Was unterscheidet geräteübergreifendes von organisationsübergreifendem Federated Learning?

In der Fachliteratur unterscheidet man zwei Hauptszenarien. Das erste ist geräteübergreifend: Sehr viele kleine Geräte nehmen teil. Ein Tastaturmodell, das über tausende Smartphones trainiert, ist zum Beispiel der klassische Fall.

Das zweite ist organisationsübergreifend: Wenige, aber starke Teilnehmer machen mit. Eine Handvoll Organisationen trainiert auf den eigenen Servern und teilt Updates. Das ist der typische Fall.

  • Beim geräteübergreifenden Szenario sind die Teilnehmer zahlreich, aber jedes Gerät ist schwach und unzuverlässig.
  • Beim organisationsübergreifenden Szenario sind die Teilnehmer wenige, aber jeder besitzt eine stabile und leistungsstarke Infrastruktur.
  • Im ersten Fall brechen Geräte oft mitten in der Runde ab. Im zweiten Fall sind Vertrauen und Verträge zwischen den Organisationen das eigentliche Thema.

Welches Szenario vorliegt, prägt jede Architekturentscheidung. Geräteübergreifend zählen dann Robustheit und Skalierung. Organisationsübergreifend zählen Datenkompatibilität und Governance.

Außerdem sieht Erfolg jeweils anders aus. Das eine Szenario will einen kleinen Gewinn für Millionen Nutzer. Das andere will ein verlässliches, konsistentes Modell, dem wenige Organisationen vertrauen können.

Klären Sie diese Frage deshalb zuerst, bevor Sie etwas anderes entwerfen.

Was ist Federated Learning wert für reale Anwendungen?

Federated Learning glänzt dort, wo Daten verstreut und sensibel sind. Die meisten Einsätze fallen in drei Gruppen.

  • Personalisierung auf Mobilgeräten, zum Beispiel Tastaturvorschläge, Spracherkennung und die Vorhersage des nächsten Wortes.
  • Zusammenarbeit zwischen Organisationen, bei der mehrere Parteien ein gemeinsames Modell bauen, ohne ihre Datensätze zu teilen.
  • Geräte am Netzwerkrand, etwa Sensoren, Kameras oder Industrieanlagen, deren Daten Sie am besten vor Ort verarbeiten.

In der Praxis ist der gemeinsame Nenner, dass die Daten entweder nicht wandern können oder nicht wandern sollen. Liegen Ihre Daten ohnehin an einem Ort und dürfen Sie sie frei nutzen, bringt Federated Learning oft nur unnötige Komplexität.

Außerdem braucht nicht jede KI Aufgabe ein eigenes Training. Viele Aufgaben laufen gut mit einem vorhandenen Modell, das Sie sauber einrichten. Prüfen Sie daher zuerst, ob Sie wirklich trainieren müssen.

Verwechseln Sie das Verfahren nicht mit KI, die auf dem Gerät läuft. Dieses Thema haben wir im Beitrag Was ist Edge AI behandelt.

Wie funktioniert Federated Learning bei Tastaturvorschlägen?

Google erklärt die Idee am häufigsten mit Tastaturvorschlägen. Auch die offizielle Google Seite zu Federated Learning nennt dieses Beispiel. Der Text, den eine Person tippt, bleibt auf dem Smartphone, und das Modell lernt die Vorhersage des nächsten Wortes genau dort.

Gehen wir ein Beispielszenario durch. Ein App Entwickler möchte die Vorschlagsfunktion einer Messenger App verbessern. Der Text der Nutzer soll also nie auf den Server der App gelangen.

Solange das Smartphone lädt und verbunden ist, erzeugt das Modell aus den Tippmustern des Tages ein kleines Update. Das Update geht an den Server, verschmilzt dort mit tausenden ähnlichen Updates, und das neue Modell kehrt zu allen zurück.

Am Ende werden die Vorschläge mit der Zeit besser, doch niemandes Nachrichten sammeln sich an einem zentralen Ort. Das ist das klarste und meistzitierte Beispiel für das Verfahren.

Es zeigt auch, warum die Idee in der mobilen Welt entstand. Smartphones enthalten viel privaten Text, und Nutzer wollen ihn nicht auf einem Server sehen. Das Verfahren antwortet somit genau auf diese Spannung.

Beachten Sie außerdem, dass das Gerät nur unter passenden Bedingungen teilnimmt. Akkulaufzeit und Nutzererlebnis zählen in solchen Systemen ebenso viel wie der Datenschutz.

Wie nutzen Organisationen Federated Learning für die Zusammenarbeit?

Mehrere Organisationen können dieselbe Art sensibler Unterlagen besitzen und dürfen sie trotzdem nicht öffnen. Jede hat allein zu wenig Daten, daher bleibt ihr Modell begrenzt. Gemeinsames Training kann ein stärkeres Modell liefern.

Als Beispielszenario denken Sie an Bilddaten, die an verschiedenen Einrichtungen liegen. Das Gesundheitswesen gilt hier als Lehrbuchfall, wir halten das Thema an dieser Stelle aber allgemein. Jede Einrichtung trainiert das Modell dann im eigenen System und teilt nur das Update.

Auf diese Weise bleiben die Datensätze innerhalb der Grenzen jeder Organisation. Allerdings zählen Vertrauen, kompatible Datenformate und Vertragsregeln ebenso viel wie die Technik.

Zum Beispiel lernt das gemeinsame Modell verwirrt, wenn eine Organisation Datensätze anders beschriftet. Ein gemeinsamer Standard für Beschriftungen gehört deshalb zu den ersten Dingen, die Sie vor dem Training klären.

Ein weiteres Thema ist die Verlässlichkeit der Updates jeder Organisation. Trainiert eine auf fehlerhaften Daten, leidet folglich das gemeinsame Modell. Sie müssen daher Teilnahmeregeln und Qualitätskontrollen vorab festlegen.

Ein solches Projekt ist ebenso Governance Arbeit wie Softwareeinrichtung. Für die rechtliche Seite sprechen Sie deshalb mit den Beratern Ihrer Organisation.

Ist der Datenschutz vollständig gesichert, wenn die Daten auf dem Gerät bleiben?

Nein, vollständig gesichert ist er nicht. Federated Learning verringert die Datensammlung, löst das Datenschutzproblem allerdings nicht von selbst. Der Grund ist, dass auch Modell Updates Informationen über die Trainingsdaten tragen.

Deshalb führt der Satz "Die Daten sind privat" in die Irre. Richtig lautet er: Die Rohdaten erreichen das Zentrum nicht, aber ungeschützte Updates können indirekt Informationen verraten.

Zudem sind auch die Teilnehmer nicht immer vertrauenswürdig. Ein fehlerhafter oder böswilliger Teilnehmer kann Updates schicken, die das gemeinsame Modell beschädigen.

Auch die Partei, die den Server betreibt, ist ein Vertrauenspunkt. Sieht der Server jedes Update einzeln, dann bleibt ein Teil des Leckrisikos bestehen.

Datenschutz entsteht also durch Schichten, nicht durch eine einzelne Technik. Diese Schichten schauen wir uns in den nächsten Abschnitten der Reihe nach an.

Wie können Modell Updates Informationen preisgeben?

Forscher haben gezeigt, dass man aus geteilten Gradienten manchmal Trainingsdaten zurückgewinnen kann. Gradienten sind Zahlen, die die Lernrichtung eines Modells anzeigen. Eine bekannte Studie trägt den Titel Deep Leakage from Gradients.

Die Arbeit berichtet konkret, dass unter bestimmten Bedingungen private Daten wie Bilder und Texte aus geteilten Gradienten zurückkehren können. Die Autoren vergleichen außerdem einige Schutzmethoden.

Dieser Befund schwächt die Annahme, Updates seien bloß bedeutungslose Zahlen. Das Leckrisiko hängt konkret von der Modellstruktur, der Größe des Updates und dem Wissen des Angreifers ab.

Daher braucht jedes föderierte System ein eigenes Bedrohungsmodell. Anders gesagt halten Sie vorab schriftlich fest, wer was sehen kann und wer böswillig handeln könnte.

Diese Studien machen Federated Learning nicht wertlos. Im Gegenteil, sie zeigen, dass das Verfahren allein nicht reicht und zusätzlichen Schutz braucht.

Die Lehre für die Praxis ist also einfach. Stapeln Sie keine rohen Updates auf einem Server, und planen Sie Schutzschichten von Anfang an ein.

Wofür sind Differential Privacy und sichere Aggregation gut?

Gegen dieses Leck gibt es zwei verbreitete Schutzmaßnahmen. Die erste ist Differential Privacy. Sie begrenzt, wie viel ein einzelner Teilnehmer beitragen darf, und fügt den Updates kontrolliertes Rauschen hinzu. Dadurch fällt es dem Modell schwerer, die Daten einer einzelnen Person auswendig zu lernen.

Die zweite ist sichere Aggregation (secure aggregation). Die Updates reisen verschlüsselt, und der Server kann nur die Summe entschlüsseln. Den Beitrag eines einzelnen Teilnehmers sieht der Server somit nicht.

Die offizielle Seite von Google nennt beide Mechanismen zusammen. Allerdings haben beide ihren Preis: Rauschen kann die Genauigkeit senken, und Verschlüsselung kann die Kommunikationslast erhöhen.

Ein Alltagsbeispiel hilft. Wenn Sie die durchschnittliche Körpergröße einer Menschenmenge nennen, verraten Sie niemandes genaues Maß. Differential Privacy versucht ähnlich, das Muster einer Gruppe zu teilen, ohne eine einzelne Person preiszugeben.

Sie suchen also ein Gleichgewicht zwischen Datenschutz und Modellqualität. Wo es liegt, hängt davon ab, wie sensibel die Daten sind.

Prüfen Sie deshalb aktuelle Methodendetails in den einschlägigen Papieren und in der offiziellen Dokumentation der Anbieter. Das Feld entwickelt sich schnell, und dauerhaft gültig sind hier daher nur die Konzepte.

Welche Grenzen und Herausforderungen hat Federated Learning?

Federated Learning verlangt mehr Technik als zentrales Training. Das sind die wichtigsten Herausforderungen.

  • Heterogene Daten: Die Daten jedes Teilnehmers folgen einer anderen Verteilung, was das Zusammenführen erschwert.
  • Kommunikationskosten: Netzlast und Wartezeit wachsen mit jeder weiteren Runde.
  • Geräteausfälle: Teilnehmer können mitten in einer Runde die Verbindung verlieren.
  • Schwierige Fehlersuche: Weil Sie Rohdaten nicht sehen, ist es hart, die Ursache eines Modellfehlers zu finden.
  • Sicherheit: Böswillige Teilnehmer können versuchen, das Modell zu verderben.

Folglich ist Federated Learning keine Methode für jedes Projekt. Wählen Sie sie daher nur, wenn der Bedarf echt ist.

Projekte mit wenigen Trainingsdaten haben außerdem das Risiko, auswendig zu lernen statt zu verstehen. Dazu lesen Sie unseren Beitrag Was ist Overfitting.

Die meisten dieser Grenzen stammen aus der Natur der Arbeit mit verstreuten Daten, nicht aus dem Verfahren selbst. Wer sie früh kennt, plant das Projekt also realistischer.

Wie messen Sie die Modellqualität bei Federated Learning?

Weil Sie Rohdaten nicht sehen, ist auch die Auswertung verstreut. Ein Validierungsset im Zentrum ist der einfachste Weg, doch ein solches Set existiert nicht immer.

Als Alternative können Sie die Auswertung ebenfalls föderiert ausführen. Der Server schickt das Modell an die Teilnehmer, diese messen es auf ihren eigenen Daten und senden nur zusammenfassende Kennzahlen zurück.

Dieser Ansatz zeigt, wie sich das Modell in verschiedenen Teilnehmergruppen verhält. Selbst wenn der Durchschnitt hoch aussieht, kann das Modell dennoch für eine Gruppe schlecht arbeiten.

Schauen Sie deshalb nicht auf eine einzige Durchschnittszahl. Prüfen Sie Ergebnisse je Gruppe, und achten Sie auch auf Fairness und Konsistenz.

Auch die Messung selbst kann zudem ein Datenschutzrisiko tragen. Zu detaillierte Kennzahlen verraten vor allem bei kleinen Gruppen Hinweise, deshalb entscheiden Sie sorgfältig, welche Zusammenfassungen Sie teilen.

Was unterscheidet zentrales Training von Federated Learning?

Beide Verfahren nebeneinander zu stellen, zeigt leichter, wann welches passt. Die folgende Tabelle ist ein begrifflicher Vergleich, und die Details unterscheiden sich von Projekt zu Projekt.

KriteriumZentrales TrainingFederated Learning
Wo liegen die Daten?An einem Ort gesammeltBleiben auf dem Gerät oder in der Organisation
Was erreicht den Server?RohdatenModell Updates
Komplexität des AufbausGeringerHöher
Datenschutz LageDaten sammeln sich im ZentrumDaten bleiben lokal, zusätzlicher Schutz nötig
FehlersucheSie prüfen die Daten direktRohdaten bleiben unsichtbar
Beste EignungDaten dürfen frei gesammelt werdenDaten können oder sollen nicht wandern

Kurz gesagt ersetzt Federated Learning das zentrale Training nicht. Es springt stattdessen ein, wenn Daten nicht wandern können. Dürfen Sie Daten frei sammeln, ist zentrales Training meist einfacher und günstiger.

Die Zeile "Beste Eignung" zählt am meisten. Bei den meisten Projekten lautet die eigentliche Frage nicht "Was ist moderner?", sondern "Können meine Daten wirklich nicht wandern?"

Welche Begriffe verwechselt man oft mit Federated Learning?

Benachbarte Konzepte werden ständig vermischt. Die folgende Tabelle trennt, was jedes davon löst.

BegriffWas er tutBeziehung zu Federated Learning
Edge AIFührt das Modell auf dem Gerät ausBeschreibt, wo die Inferenz läuft, nicht wie das Training abläuft
Synthetische DatenErzeugen realistische künstliche DatenEine Alternative zum Datenteilen, beides lässt sich kombinieren
Differential PrivacyVerbirgt einzelne Beiträge durch RauschenEine Schutzschicht, die Sie zu Federated Learning hinzufügen
AnonymisierungEntfernt die Identität aus DatenSie teilen die Daten weiterhin, Federated Learning teilt keine

Edge AI sagt Ihnen, wo die Inferenz läuft. Federated Learning sagt Ihnen, wie das Training abläuft. Folglich können Sie beides im selben Projekt sehen.

Jeder dieser Begriffe verdient einen eigenen Beitrag. Deshalb halten wir sie hier kurz, um nur den Unterschied zu zeigen.

Welche verbreiteten Irrtümer gibt es zu Federated Learning?

Seit das Thema populär ist, kursieren ein paar Schlagworte. Wir stellen die häufigsten richtig.

  • "Die Daten verlassen das Gerät nie, also sind Lecks unmöglich." Updates können Informationen tragen.
  • "Federated Learning ist immer sicherer." Es ist nur mit den richtigen Schutzschichten sicherer.
  • "Federated Learning verkleinert das Modell." Nein, die Modellgröße ist ein eigenes Thema.
  • "Es sichert die rechtliche Konformität automatisch." Nein, Ihre Pflichten bleiben bestehen.
  • "Es macht die Arbeit der Organisation leichter." Im Gegenteil, der betriebliche Aufwand wächst.

Die meisten dieser Irrtümer stammen von den kurzen Sätzen, mit denen man das Verfahren bewirbt. Ein kurzer Satz bleibt im Gedächtnis, versteckt aber das Detail.

Gehen Sie daher bei Ihrer Entscheidung ins Detail, und holen Sie sich bei Bedarf Expertenhilfe.

Denken Sie außerdem daran, dass Federated Learning kein Produktname ist. Es ist ein Ansatz, den Sie mit verschiedenen Werkzeugen und Aufbauten umsetzen können.

Warum sind heterogene Daten ein so großes Problem?

Beim zentralen Training können Sie die Daten mischen und in ausgewogene Stücke teilen. Bei Federated Learning haben Sie diesen Luxus nicht, denn die Daten bleiben bei den Teilnehmern, wie sie sind. Jeder Teilnehmer besitzt eine andere Verteilung, und man nennt das heterogene Daten.

Die Arbeit von McMahan und Kollegen nimmt unausgewogene und nicht unabhängige Datenverteilungen ausdrücklich ins Visier. Das Problem gehört also seit dem ersten Tag zum Verfahren.

Ein Beispielszenario: In einem Tastaturmodell schreibt ein Nutzer nur geschäftliche Briefe, ein anderer nur kurze, lockere Nachrichten. Ihre Updates können das Modell somit in entgegengesetzte Richtungen ziehen.

In diesem Fall passt das gemittelte Modell dann vielleicht zu keinem der beiden gut. Man versucht es mit gruppenspezifischem Feintuning, sorgfältigerer Gewichtung und mehr Runden.

Merken Sie sich auf der Ebene des Konzepts: Je vielfältiger Ihre Daten sind, desto schwerer wird das Zusammenführen.

Lernen Sie deshalb die Daten der Teilnehmer kennen, bevor Sie beginnen. Finden Sie heraus, in welche Gruppen sie zerfallen, welche Klassen selten sind und welche Teilnehmer weit mehr Daten besitzen. Dieses Wissen prägt Ihre Gewichtung direkt.

Wie schützen Sie sich vor böswilligen Teilnehmern?

In einem offenen föderierten System können Sie nicht jedem Teilnehmer vertrauen. Ein Teilnehmer kann absichtlich ein kaputtes Update senden und das gemeinsame Modell vom Kurs abbringen. Man nennt das einen Angriff durch Modellvergiftung.

Die erste Verteidigung ist, Teilnehmer zu identifizieren und zu autorisieren. Das ist beim organisationsübergreifenden Szenario leicht. Beim geräteübergreifenden Szenario ist es schwieriger, weil viele anonyme Geräte teilnehmen.

Die zweite Verteidigung ist, den Zusammenführungsschritt robust zu machen. Der Server kann den Einfluss von Updates begrenzen, die sich stark vom Rest unterscheiden. Anders gesagt übernimmt er Ausreißer nicht ungeprüft.

Die dritte Verteidigung ist Überwachung mit Rückabwicklung. Fällt die Modellqualität unerwartet, dann müssen Sie zu einer früheren Version zurückkehren können.

Auch eine Obergrenze für die Größe jedes Updates ist ein einfacher, aber wirksamer Schritt. Kann ein Teilnehmer das Modell nicht zu stark beeinflussen, bleibt der Schaden eines schlechten Updates klein.

Keine Verteidigung bietet absolute Sicherheit. Schreiben Sie das Bedrohungsmodell daher passend zum Umfang Ihres Projekts auf, und prüfen Sie es regelmäßig neu.

Was bedeutet Federated Learning für die DSGVO?

Daten nicht in ein Zentrum zu bringen passt zu einem Kernprinzip des Datenschutzes: Sammeln Sie nicht mehr, als Sie brauchen. In diesem Sinn kann Federated Learning die Datenminimierung unterstützen.

Allerdings macht die Nutzung von Federated Learning Sie nicht automatisch konform mit der DSGVO. Weil Updates Informationen verraten können, müssen Sie weiterhin prüfen, welche Daten als personenbezogen gelten.

Pflichten wie Transparenz, Rechtsgrundlage, Speicherdauer und Betroffenenrechte bleiben ebenfalls bestehen. Einen allgemeinen Rahmen finden Sie in unserem Leitfaden zur datenschutzkonformen Website.

Hinweis: Dieser Beitrag ist keine Rechtsberatung. Für die rechtliche Lage Ihres Projekts sprechen Sie mit der Rechtsberatung Ihrer Organisation.

Was sollte ein Unternehmen prüfen, bevor es mit Federated Learning beginnt?

Sie kennen jetzt die Antwort auf "Was ist Federated Learning?" und die Kosten. Die folgende Checkliste hilft Ihnen, das Projekt auf realistischen Boden zu stellen.

  • Können Ihre Daten wirklich nicht wandern, oder ist das Verschieben nur lästig?
  • Kennen Sie Zahl und Art der Teilnehmer: viele Geräte oder wenige Organisationen?
  • Wie ähnlich sind sich die Daten der Teilnehmer?
  • Haben Sie Schutz wie Differential Privacy und sichere Aggregation eingeplant?
  • Gibt es einen Weg, fehlerhafte oder böswillige Teilnehmer zu erkennen?
  • Haben Sie festgelegt, wie Sie den Modellerfolg ohne Rohdaten messen?
  • Haben Sie die rechtliche Bewertung mit Fachleuten vorgenommen?

Können Sie mehrere dieser Fragen nicht klar beantworten, ist ein einfacheres Verfahren zum Start vielleicht klüger. Wenn Sie neu im Feld sind, ist unser Einstieg in Machine Learning für Anfänger ein guter erster Schritt.

Wo passt Federated Learning in KI Projekte eines Unternehmens?

Die meisten Unternehmen müssen kein föderiertes System von Grund auf bauen. Zunächst sollten Sie verstehen, wo Ihre Daten liegen, wer darauf zugreifen kann und welche Risiken sie tragen. Mitarbeiter, die Daten in nicht freigegebene KI Werkzeuge einfügen, gehören zu diesem Bild. Wir haben das in Was ist Shadow AI behandelt.

Bei der Datensicherheit kommen Grundlagen wie Verschlüsselung und Zugriffskontrolle zunächst an die Reihe. Dazu lesen Sie unseren Leitfaden zur Datensicherheit.

Wir, Talha Aslan und unser Team, klären gemeinsam mit Ihnen, welche Daten eine KI Idee nutzt, welche Architektur sie braucht und welche Grenzen gelten. Wenn Sie Unterstützung wünschen, schauen Sie sich unsere Seite zur KI Beratung an.

Ebenso entscheiden wir mit Ihnen, ob ein fortgeschrittenes Verfahren überhaupt nötig ist. Oft genügt eine einfachere Lösung, und das offen zu sagen gehört zu unserer Arbeit.

Wie lässt sich Federated Learning kurz zusammenfassen?

Wenn Sie sich eine Antwort auf die Frage "Was ist Federated Learning?" merken wollen, dann diese: Es ist ein Trainingsansatz, der das Modell zu den Daten bringt, statt die Daten zum Modell zu holen. Rohdaten bleiben auf dem Gerät oder in der Organisation, nur Updates wandern, und der Server führt sie zusammen.

Der Nutzen liegt also darin, dass sich der Bedarf an Datenverschiebung verringert und das Vertrauen der Teilnehmer wachsen kann. Die Grenzen sind aufwendige Technik, heterogene Daten und die Informationen, die Updates verraten können.

Deshalb sollten Sie Schichten wie Differential Privacy und sichere Aggregation von Anfang an einplanen. Die rechtliche Seite bewerten Sie außerdem mit qualifizierten Fachleuten.

Wenn Sie verwandte Begriffe erkunden möchten, ergänzen unsere Schwesterbeiträge das Bild. Zum Betrieb auf dem Gerät lesen Sie Was ist Edge AI. Zum Auswendiglernen statt Verstehen lesen Sie Was ist Overfitting.

Methoden und Werkzeuge ändern sich schnell, prüfen Sie daher vor dem Aufbau die offizielle Dokumentation des Anbieters.

Häufig gestellte Fragen

Was ist Federated Learning und schützt es meine Daten wirklich?
Federated Learning ist ein Trainingsverfahren, bei dem die Rohdaten auf dem Gerät oder in der Organisation bleiben und nur Modell Updates zum Zusammenführen ins Zentrum gehen. Es senkt das Risiko, weil Rohdaten nicht wandern. Updates können jedoch indirekt Informationen verraten, deshalb sollten Sie Schutz wie Differential Privacy und sichere Aggregation von Anfang an einplanen.
Was ist der größte Unterschied zwischen zentralem Training und Federated Learning?
Der größte Unterschied ist der Ort der Daten. Beim zentralen Training sammeln Sie alle Daten an einem Ort und trainieren dort das Modell. Bei Federated Learning bleiben die Daten, wo sie sind, das Modell geht zu den Daten, und nur Updates kehren zum Server zurück. Der Preis sind aufwendigere Technik, ein längerer Aufbau und mehr Kommunikationslast.
Wann sollten Sie Federated Learning wählen?
Erwägen Sie Federated Learning, wenn rechtliche, geschäftliche oder technische Gründe das Verschieben der Daten verhindern. Typische Beispiele sind Personalisierung auf Mobilgeräten und die Zusammenarbeit zwischen Organisationen. Dürfen Sie Ihre Daten bereits frei sammeln, ist zentrales Training meist einfacher, günstiger und leichter zu betreiben. Starten Sie dort und wechseln Sie nur, wenn es nötig ist.
Was bewirkt Differential Privacy bei Federated Learning?
Differential Privacy begrenzt, wie stark die Daten einer einzelnen Person das Modell beeinflussen, und fügt den Updates kontrolliertes Rauschen hinzu. Dadurch fällt es dem Modell schwerer, einzelne Datensätze auswendig zu lernen, und es wird schwieriger, aus Updates persönliche Angaben zu gewinnen. Dafür kann die Genauigkeit etwas sinken, also stimmen Sie das Gleichgewicht auf die Sensibilität Ihrer Daten ab.
Macht Federated Learning automatisch konform mit der DSGVO?
Nein, das tut es nicht. Daten nicht auf einem zentralen Server zu sammeln kann die Datenminimierung unterstützen, doch Pflichten wie Transparenz, Rechtsgrundlage und Betroffenenrechte bleiben bestehen. Weil Updates Informationen verraten können, brauchen Sie außerdem eine Bewertung der personenbezogenen Daten. Dieser Beitrag ist keine Rechtsberatung, sprechen Sie bitte mit Ihrer Rechtsberatung.
Ist Federated Learning dasselbe wie Edge AI?
Nein, beides ist verschieden. Edge AI beschreibt, dass ein Modell auf dem Gerät läuft, es geht also um den Ort der Inferenz. Federated Learning beschreibt, wie ein Modell auf verstreuten Daten trainiert. Beides kann im selben Projekt vorkommen: Das Modell läuft auf dem Gerät und verbessert sich weiter durch föderiertes Training mit den Daten desselben Geräts.
  • federated learning
  • was ist federated learning
  • maschinelles Lernen
  • Datenschutz
  • differential privacy
  • KI Training
  • DSGVO
Teilen:
Talha Aslan

Google Partner und Experte für digitales Marketing. Seit 2012 praktisch in SEO, Google Ads, Webdesign und E-Commerce Projekten; jeder Beitrag hier stammt aus dieser Erfahrung.

Nächstes Projekt

Sprechen wir über Ihr Projekt.

Ihre Anfrage geht direkt an Talha Aslan und Team: Strategie von Talha, Umsetzung durch ein erfahrenes Team. Das Erstgespräch ist kostenlos, wir hören zu und melden uns mit einer klaren Roadmap.