Was ist Overfitting? Überanpassung einfach erklärt

Was ist Overfitting im maschinellen Lernen?
Overfitting (Überanpassung) bedeutet, dass ein Modell des maschinellen Lernens seine Trainingsdaten auswendig lernt, statt das allgemeine Muster zu erfassen. Es liefert dann bei bekannten Beispielen sehr gute Ergebnisse und bei neuen Daten schlechte. Im Test wirkt es stark, im echten Einsatz enttäuscht es.
Das ist also eines der häufigsten Probleme in KI Projekten. Viele stellen die Frage, was ist Overfitting, erst nach einem missglückten Start. Während des Trainings sieht alles gut aus, deshalb zeigt sich der Fehler erst nach dem Start. In diesem Leitfaden erklären wir daher den Begriff in einfacher Sprache und zeigen Ursachen, Warnzeichen und Gegenmaßnahmen.
Der Machine Learning Crash Course von Google zum Thema Overfitting beschreibt es ähnlich: Ein Modell passt sich dem Trainingsdatensatz so stark an, dass es bei neuen Daten keine korrekten Vorhersagen mehr trifft. Die Quellen finden Sie über die Links in diesem Artikel.
Was ist Overfitting? Ein einfaches Prüfungsbeispiel
Stellen Sie sich einen Schüler vor, der sich auf eine Prüfung vorbereitet. Zunächst lernt er die Antworten aller früheren Aufgaben Wort für Wort auswendig. Kommen dieselben Fragen dran, erreicht er dann die volle Punktzahl. Ändert sich eine Frage allerdings nur leicht, weiß er nicht weiter, denn er hat Antworten gelernt und nicht den Stoff.
Ein überangepasstes Modell verhält sich also genauso. Es hält deshalb zufällige Details, Rauschen und Ausnahmen in den Trainingsdaten für echte Regeln. Die kürzeste Antwort auf die Frage, was ist Overfitting, lautet deshalb: ein Modell, das auswendig lernt.
Ein Schüler, der den Stoff wirklich versteht, arbeitet anders. Bei einer neuen Aufgabe wendet er dann die zugrunde liegenden Prinzipien an. Ein gutes Modell macht dasselbe: Es leitet aus den Trainingsdaten die allgemeine Regel ab und überträgt sie auf unbekannte Beispiele. Diese Fähigkeit nennen wir also Generalisierung.
Warum beginnt ein Modell, auswendig zu lernen?
Beim Training verfolgt ein Modell nur ein Ziel: den Fehler auf den Trainingsdaten zu senken. Hat das Modell eine hohe Kapazität, also viele einstellbare Teile, dann ist der einfachste Weg dorthin das Auswendiglernen einzelner Beispiele. Statt die allgemeine Regel zu suchen, speichert es für jedes Beispiel also eine eigene Antwort.
Zunächst erfasst das Modell die großen, allgemeinen Muster. Danach versucht es, auch den kleinen Restfehler zu drücken. In dieser Phase passt es sich also dem Rauschen an. Der Trainingsfehler sinkt weiter, die Leistung bei neuen Daten wird allerdings schlechter.
Kurz gesagt: Das Auswendiglernen entsteht nicht aus böser Absicht, sondern aus der Natur der Optimierung. Außerdem versucht das Modell, die Trainingsdaten möglichst perfekt nachzubilden, wenn Sie keine Schutzmaßnahmen einbauen. Deshalb gehört die Vermeidung von Overfitting zum Design des Trainingsprozesses. Damit ist die Frage, was ist Overfitting, im Kern beantwortet: Es ist die Folge eines Trainings, das Rauschen mit Regeln verwechselt.
Der Vergleich mit dem Arbeitsalltag liegt nahe. Zum Beispiel tut sich ein Mitarbeiter mit einem neuen Bericht schwer, wenn Sie ihn nur mit den Antworten alter Berichte schulen. Von einem Modell dürfen Sie also nichts anderes erwarten.
Was verraten Trainingsfehler und Validierungsfehler?
Erstens zeigt der Trainingsfehler den Verlust auf den Daten, aus denen das Modell gelernt hat. Zweitens zeigt der Validierungsfehler den Verlust auf einem getrennten Datenstück, das das Modell nie gesehen hat. Wenn Sie beide nebeneinander beobachten, erkennen Sie also, ob das Modell wirklich lernt.
In der Praxis sinken bei gesundem Training beide Kurven gemeinsam. Das heißt, mit jedem neuen Muster werden beide Fehler kleiner. Beginnt das Overfitting, gehen die Kurven auseinander: Der Trainingsfehler sinkt weiter, während der Validierungsfehler stagniert und dann steigt.
Der Machine Learning Crash Course von Google erklärt diese Trennung anhand von Verlustkurven. Driften die Kurven auseinander, merkt sich das Modell also wahrscheinlich den Trainingsdatensatz. Daher empfehlen wir, in jedem Trainingslauf beide Kurven zu zeichnen.
Außerdem sollten Sie die Kurven am Gesamttrend ablesen und nicht an einem einzelnen Punkt. Der Validierungsfehler kann kurz schwanken, denn ein Ausschlag ist noch kein Alarm. Steigt er aber über mehrere Runden, während der Trainingsfehler weiter fällt, liegt echtes Overfitting vor.
- Beide Fehler niedrig: Das Modell generalisiert, ein gutes Zeichen.
- Trainingsfehler niedrig, Validierungsfehler hoch: das klassische Zeichen für Overfitting.
- Beide Fehler hoch: ein Zeichen für Unteranpassung.
Was ist Overfitting, und wie erkennen Sie es im Unternehmen?
Einige Anzeichen sehen Sie also auch ohne technisches Team. Das deutlichste ist zunächst ein Modell, das im Test glänzte und im Livebetrieb enttäuscht. Die Genauigkeit im Bericht ist hoch, die echten Entscheidungen erfüllen die Erwartung allerdings nicht.
Zweitens reagiert das Modell zu empfindlich auf kleine Änderungen der Daten. Schwanken die Vorhersagen stark, sobald Sie ein paar neue Beispiele hinzufügen, klammert sich das Modell womöglich ans Rauschen. Drittens sinkt die Leistung mit der Zeit schnell ab.
- Fordern Sie Trainings- und Validierungsergebnisse getrennt an.
- Prüfen Sie, ob der Abstand zwischen beiden groß ist.
- Testen Sie das Modell mit völlig neuen Daten, die es nie gesehen hat.
- Beobachten Sie die Leistung im Livebetrieb in regelmäßigen Abständen.
Ist der Abstand zwischen Trainingsergebnis und Ergebnis auf neuen Daten groß, dann stellt sich die Frage, was ist Overfitting, auch in Ihrem Projekt. In diesem Fall prüfen Sie zuerst die Daten und die Modellkomplexität.
Was ist Unteranpassung (Underfitting)?
Kurz gesagt: Unteranpassung bedeutet, dass das Modell aus den Daten nicht genug lernt. Es ist so einfach oder so kurz trainiert, dass es sowohl bei den Trainingsdaten als auch bei neuen Daten schlecht abschneidet. Sie ist das Gegenteil von Overfitting.
Zurück zum Prüfungsbeispiel: Ein Schüler, der nie gelernt hat, löst weder die alten noch die neuen Aufgaben. Der Fehler ist überall hoch. Weil schon der Trainingsfehler hoch bleibt, fällt dieses Problem meist früher auf.
Typische Ursachen sind in der Praxis ein Modell, das einfacher ist als die Aufgabe verlangt, ein zu früh beendetes Training, wichtige Eingaben, die das Modell nie erreichen, und eine zu starke Regularisierung. Die Lösung besteht daher oft darin, dem Modell mehr Kapazität, aussagekräftigere Eingaben und längeres Training zu geben.
Seien Sie dabei vorsichtig. Wer Unteranpassung behebt, rutscht dann leicht ins Overfitting. Wer verstehen will, was ist Overfitting, sollte also auch sein Gegenteil kennen. Vergrößern Sie das Modell deshalb nicht auf einmal, sondern Schritt für Schritt, und prüfen Sie nach jedem Schritt die Validierungsergebnisse. So verpassen Sie die ausgewogene Zone zwischen beiden Extremen nicht.
Was ist Generalisierung, und warum ist sie das eigentliche Ziel?
Generalisierung ist die Fähigkeit eines Modells, auch bei neuen Beispielen korrekt vorherzusagen, die es im Training nicht gesehen hat. Wertvoll macht ein Modell nicht seine Punktzahl auf den Trainingsdaten, sondern genau diese Fähigkeit. Denn im Geschäftsalltag entscheidet ein Modell immer über Kunden, Produkte oder Zeiträume, die es noch nie kannte.
Der Machine Learning Crash Course von Google nennt zunächst einige Annahmen für gute Generalisierung. Die Beispiele sollten unabhängig gezogen sein, die Daten sollten sich über die Zeit nicht ändern, und Trainings-, Validierungs- und Testdaten sollten aus ähnlichen Verteilungen stammen. Brechen diese Annahmen, hat selbst ein gutes Modell in der Praxis Mühe.
Zum Beispiel kann ein Modell, das mit den Daten des letzten Monats trainiert wurde, nach einer Verhaltensänderung der Kunden schlechter arbeiten. Das ist zwar kein klassisches Overfitting, das Symptom ähnelt ihm allerdings. Deshalb sollten Sie die Leistung regelmäßig messen und nicht nur einmal.
Warum teilen Sie die Daten in Training, Validierung und Test?
Um Overfitting zu messen, brauchen Sie Daten, die das Modell nicht kennt. Deshalb teilen Sie Ihre Daten in der Regel in drei Teile. Zunächst ist der Trainingsdatensatz das, woraus das Modell lernt. Mit dem Validierungsdatensatz probieren Sie dann während der Entwicklung Einstellungen aus. Der Testdatensatz bleibt schließlich als einzige, unvoreingenommene Prüfung unberührt.
Der Machine Learning Crash Course von Google warnt davor, den Testdatensatz zu oft zu verwenden. Je häufiger Sie am selben Testdatensatz experimentieren, desto stärker passt sich das Modell also an ihn an. Somit entsteht ein "Lernen für den Test", und die Messung verliert ihre Aussagekraft.
- Trainingsdaten: die Beispiele, aus denen das Modell seine Parameter lernt.
- Validierungsdaten: die Beispiele für Feinabstimmung und Modellauswahl.
- Testdaten: die Beispiele, die Sie vor der Entscheidung nur einmal ansehen.
Die Aufteilung hängt vom Projekt ab. Außerdem dürfen im Testdatensatz keine Kopien von Trainingsbeispielen stecken. Duplikate lassen das Ergebnis daher besser aussehen, als es ist, und führen Sie in die Irre.
Was sind die Ursachen von Overfitting?
Nach den Unterlagen von Google hat Overfitting zwei Hauptwurzeln. Erstens bilden die Trainingsdaten die reale Welt nicht ab. Zweitens ist das Modell komplexer, als das Problem es verlangt. In der Praxis wirken beide Ursachen oft zusammen.
- Zu wenige Daten: Das Modell findet keine allgemeine Regel und lernt Beispiele auswendig.
- Verrauschte Daten: Falsche Labels und zufällige Fehler sehen wie Muster aus.
- Zu komplexes Modell: Zu viele Parameter machen Auswendiglernen leicht.
- Zu langes Training: Das Modell passt sich irgendwann sogar dem Rauschen an.
- Nicht repräsentative Beispiele: Die Trainingsdaten bilden echte Nutzer nicht ab.
- Datenleck: Testinformationen gelangen unbemerkt ins Training.
Jede Ursache braucht ein anderes Mittel. Fehlen Daten, sammeln oder erweitern Sie sie. Ist das Modell zu komplex, vereinfachen oder begrenzen Sie es. Dauert das Training zu lange, nutzen Sie dann frühzeitigen Abbruch. Ein Mittel zu wählen, bevor Sie die Ursache kennen, kostet daher nur Zeit.
Wie senkt Datenaugmentierung das Overfitting Risiko?
Datenaugmentierung erzeugt aus vorhandenen Beispielen sinnvolle neue Varianten. Zeigen Sie dem Modell mehr und vielfältigere Beispiele, wird das Auswendiglernen also schwerer und das Lernen der allgemeinen Regel leichter. In Bildprojekten ist das leichte Drehen, Zuschneiden oder Aufhellen eines Fotos ein typischer Fall.
Bei Text- und Tabellendaten gilt eine ähnliche Idee, hier brauchen Sie allerdings mehr Sorgfalt. Stellt ein erzeugtes Beispiel eine Situation dar, die es im echten Leben nicht gibt, schadet es dem Modell. Stellen Sie deshalb sicher, dass das Label nach der Änderung gültig bleibt.
Datenaugmentierung ist allerdings kein Wundermittel. Die eigentliche Lösung bleibt daher, echte und repräsentative Daten zu sammeln. Ist das Sammeln teuer, hilft die Augmentierung trotzdem gut. Die Grundlagen der Datenvorbereitung finden Sie in unserem Leitfaden zur Datenanalyse mit KI.
Wie verhindert Regularisierung das Overfitting?
Regularisierung ist eine Technik, die beim Training die Komplexität des Modells bestraft. Das Modell versucht dann nicht mehr nur, den Fehler zu senken. Gleichzeitig zahlt es einen Preis für sehr große Gewichte. Folglich neigt es zu einfacheren Lösungen, und die Gefahr des Auswendiglernens sinkt.
Der Machine Learning Crash Course von Google stellt die L2 Regularisierung als beliebtestes Beispiel vor. Sie zieht Gewichte Richtung null, setzt aber keines exakt auf null. Die L1 Regularisierung kann andererseits manche Gewichte ganz auf null bringen und so unnötige Eingaben entfernen.
Ein einzelner Koeffizient bestimmt die Stärke der Regularisierung. Ist er hoch, wird das Modell also zu stark eingeschränkt, und Unteranpassung wird wahrscheinlicher. Ist er andererseits niedrig, bleibt die Einschränkung schwach, und das Overfitting Risiko besteht weiter. Diese Balance stellen Sie daher anhand der Validierungsergebnisse ein.
Auch im Deep Learning nutzen Sie also ähnliche Techniken, zum Beispiel Dropout. Wenn Sie die Grundlagen neuronaler Netze interessieren, ist unser Artikel Was ist Deep Learning ein guter Einstieg.
Wann hilft frühzeitiger Abbruch (Early Stopping)?
Beim frühzeitigen Abbruch beenden Sie das Training, sobald der Validierungsfehler zu steigen beginnt. Selbst wenn der Trainingsfehler noch sinkt, markiert der Richtungswechsel des Validierungsfehlers den Moment, in dem das Modell auswendig zu lernen beginnt. Hören Sie dort auf, verhindern Sie somit das Overfitting, bevor es entsteht.
Der Reiz der Methode liegt in ihrer Einfachheit. Sie entwerfen also keinen zusätzlichen Strafterm, sondern beobachten nur die Validierungskurve. Der Machine Learning Crash Course von Google nennt den Ansatz einfach, hält aber fest, dass er selten so gut ist wie eine Regularisierung, die die Komplexität direkt begrenzt.
In der Praxis lohnt es sich, beides zu kombinieren. Die Regularisierung hält das Modell von Anfang an schlicht, und der frühzeitige Abbruch fängt auf, was dennoch durchrutscht. Weil der Validierungsfehler schwanken kann, definieren Sie lieber eine geduldige Schwelle als den Abbruch beim ersten Anstieg.
Warum liefert die Kreuzvalidierung eine verlässlichere Messung?
Bei der Kreuzvalidierung teilen Sie die Daten in mehrere Teile und nutzen in jeder Runde einen anderen Teil zur Validierung. Sie testen das Modell also jedes Mal an neuen Daten und mitteln danach die Ergebnisse. Folglich sinkt der Einfluss einer glücklichen oder unglücklichen Aufteilung.
Vor allem bei wenig Daten ist die Methode wertvoll. Zum Beispiel kann ein kleiner Validierungsdatensatz zufällig schwanken und Sie täuschen. Mehrere Runden zeigen Ihnen sowohl die durchschnittliche Leistung als auch die Stabilität der Ergebnisse.
Eine Warnung gilt für zeitlich geordnete Daten, zum Beispiel monatliche Umsätze: Mischen Sie sie nicht zufällig. Fließen Informationen aus der Zukunft in die Vergangenheit, sehen die Ergebnisse dann besser aus, als sie sind. Trainieren Sie stattdessen mit früheren Zeiträumen und validieren Sie mit späteren.
Die Kreuzvalidierung erhöht den Rechenaufwand, trotzdem lohnt er sich für eine verlässliche Entscheidung meistens.
Wie stellen Sie die Modellkomplexität richtig ein?
Die Komplexität bestimmt, wie flexible Muster das Modell lernen kann. Ein zu einfaches Modell passt sich also zu wenig an, ein zu komplexes passt sich zu stark an. Ziel ist der Mittelweg, der genau so viel Flexibilität bietet, wie Ihr Problem braucht.
In der Praxis ist es üblich, einfach zu starten und kontrolliert zu wachsen. Zunächst bauen Sie ein einfaches Basismodell. Danach erhöhen Sie die Komplexität schrittweise und vergleichen bei jedem Schritt Trainings- und Validierungsergebnisse. Verbessert sich die Validierung nicht mehr, hören Sie dann auf.
- Bauen Sie ein einfaches Basismodell und notieren Sie das Ergebnis.
- Erhöhen Sie die Komplexität um einen Schritt und messen Sie beide Fehler erneut.
- Verbessert sich der Validierungsfehler, machen Sie weiter.
- Sinkt der Trainingsfehler, während der Validierungsfehler steigt, gehen Sie einen Schritt zurück.
- Ergänzen Sie schließlich Regularisierung und frühzeitigen Abbruch als letzte Sicherung.
Sie brauchen allerdings nicht immer das stärkste Modell. Ein einfaches Modell lässt sich leichter erklären und günstiger pflegen. Bei ähnlichem Validierungsergebnis empfehlen wir daher das einfachere.
Wie sieht Overfitting bei einer Umsatzprognose aus?
Stellen Sie sich einen Onlinehändler vor, der den Monatsumsatz prognostizieren will. Das ist ein Beispielszenario und kein echter Kunde. Zunächst gibt das Team zwei Jahre Verlauf in ein sehr komplexes Modell.
Dann sagt das Modell vergangene Monate fast perfekt voraus. Es hat sich nämlich eine Aktionswoche, einen Feiertagseffekt und sogar einen vorübergehenden Einbruch durch eine Systemstörung gemerkt. Seine Prognose für den nächsten Monat verfehlt jedoch das Ziel, weil sich die gemerkten Ereignisse nicht wiederholten.
Im besseren Vorgehen legt das Team die jüngsten Zeiträume für die Validierung beiseite. Es trainiert das Modell dann nur mit früheren Daten und testet es am zurückgehaltenen Zeitraum. Ist der Abstand zwischen Training und Validierung groß, vereinfacht das Team das Modell, behält sinnvolle Eingaben wie die Saisonalität und markiert einmalige Ereignisse, damit sie keine falschen Regeln lehren.
Entscheidend ist hier, dass die Bewertung die Zukunft nachahmt. Das heißt, der Validierungszeitraum liegt nach dem Trainingszeitraum. Eine zufällig gemischte Aufteilung lässt also die Zukunft in die Vergangenheit sickern und führt zu einer zu optimistischen Messung.
Am Ende wählt das Unternehmen also nicht das Modell, das die Vergangenheit perfekt erklärt, sondern das, das die Zukunft vernünftig vorhersagt. Ob Livetests aussagekräftig sind, prüfen Sie zusätzlich mit unserem Rechner für A/B Tests.
Wie hängen Bias und Varianz mit Overfitting zusammen?
Im maschinellen Lernen stammt der Fehler aus zwei Quellen: einem zu einfachen Modell und einem Modell, das zu empfindlich auf die Daten reagiert. In der Statistik heißt das erste Verzerrung (Bias), das zweite Varianz. Wir meinen hier also ein rein statistisches Konzept und nicht die gesellschaftliche Voreingenommenheit von KI Systemen.
Ein sehr einfaches Modell hat zum Beispiel eine hohe Verzerrung. Egal, wie Sie die Daten ändern, es macht denselben Fehler, es passt sich also zu wenig an. Ein sehr komplexes Modell hat andererseits eine hohe Varianz. Schon eine winzige Änderung der Trainingsdaten verschiebt die Vorhersagen stark, es passt sich also zu stark an.
Zwischen beiden Extremen liegt ein Gleichgewicht. Mit steigender Komplexität sinkt die Verzerrung, während die Varianz wächst. Ihre Aufgabe ist es daher, anhand der Validierungsergebnisse den Bereich mit dem geringsten Gesamtfehler zu finden. Diese Intuition steckt hinter jeder Entscheidung zu Regularisierung und Vereinfachung.
Die gesellschaftliche Voreingenommenheit ist allerdings ein anderes Thema. Wir behandeln sie im Artikel Was ist KI Bias und wiederholen sie hier nicht. Wir bitten Sie deshalb lediglich, beide Begriffe nicht zu vermischen.
Wie erzeugt ein Datenleck die Illusion von Erfolg?
Von einem Datenleck sprechen wir, wenn das Modell im Training Informationen sieht, die es im echten Einsatz nicht haben wird. Zum Beispiel rutschen manchmal Testbeispiele in den Trainingsdatensatz. Manchmal verrät eine Spalte die Antwort direkt. In beiden Fällen wirkt das Modell spektakulär, doch der Erfolg ist falsch.
Ein Datenleck erzeugt allerdings das umgekehrte Bild wie Overfitting. Trainings- und Validierungsergebnisse sind beide großartig, und danach bricht das Modell im Betrieb ein. Stellen Sie sich daher vor dem Jubel über ein tolles Ergebnis eine Frage: Kennen wir diese Information zum Zeitpunkt der Vorhersage wirklich?
- Datensätze desselben Kunden liegen sowohl im Trainings als auch im Testdatensatz.
- Eine Spalte, die das Ergebnis indirekt enthält, dient als Eingabe.
- Bei zeitlich geordneten Daten sagen Sie die Vergangenheit mit Datensätzen aus der Zukunft voraus.
- Bereinigungsschritte laufen über alle Daten, bevor Sie sie aufteilen.
Die Lösung ist einfach, verlangt allerdings Disziplin. Teilen Sie die Daten zuerst auf, und lernen Sie jede Umwandlung nur aus dem Trainingsteil. Öffnen Sie außerdem den Testdatensatz erst ganz am Ende und nur einmal. So bleibt Ihre Messung realistisch.
Wie zeigt sich Overfitting in Marketingprojekten?
Im Marketing sind Prognosemodelle verbreitet: Welcher Lead kauft, welcher Nutzer kündigt, welche Anzeigenzielgruppe konvertiert. Alle teilen dieselbe Falle. Ein Modell, das perfekt zu einer vergangenen Kampagne passt, liefert in der nächsten womöglich nicht das erwartete Ergebnis.
Denken Sie als Beispielszenario an ein Modell, das Leads bewertet. Einige ungewöhnliche Kampagnen im Verlauf werden dann in den Augen des Modells zu festen Regeln. Zum Beispiel gelten Kunden, die nur in einer Rabattphase kamen, als die wertvollsten. Endet die Phase, bevorzugt das Modell dann die falschen Personen.
Um das zu verhindern, gehen Sie beim Aufteilen der Kampagnenzeiträume sorgfältig vor. Trainieren Sie zunächst mit älteren Zeiträumen und validieren Sie danach mit neueren. Vergleichen Sie das Modell außerdem immer mit einer einfachen Regel. Schlägt das Modell die einfache Regel nicht, bringt Ihnen die zusätzliche Komplexität somit nichts.
Die statistische Aussagekraft von Ergebnissen auf der Anzeigenseite sollten Sie zusätzlich prüfen. Dabei hilft Ihnen unser Rechner für A/B Tests.
Wie überwachen Sie ein Modell nach dem Start?
Mit dem Start eines Modells endet die Arbeit nicht. Die Welt ändert sich, das Kundenverhalten ändert sich, und die Datenverteilung verschiebt sich. Daher kann selbst ein Modell, das im Training gut generalisierte, mit der Zeit schwächer werden. Das ist kein klassisches Overfitting, endet aber in derselben Enttäuschung.
Für die Überwachung genügen drei einfache Gewohnheiten. Erstens vergleichen Sie das Modell in regelmäßigen Abständen mit den echten Ergebnissen. Zweitens prüfen Sie, ob die eingehenden Daten dem Trainingszeitraum noch ähneln. Drittens richten Sie eine Warnung ein, falls die Leistung unter eine Schwelle fällt.
Treffen Sie die Entscheidung über ein neues Training anhand von Messwerten und nicht anhand des Kalenders. Bleibt die Leistung stabil, ändern Sie also nichts. Sinkt sie, trainieren Sie dann mit frischen Daten und wiederholen Validierung und Test von Anfang an. Setzen Sie ein neues Modell erst ein, wenn Sie im selben Testaufbau gezeigt haben, dass es das alte schlägt.
Was unterscheidet Overfitting, Unteranpassung und gute Anpassung?
Der Vergleich der drei Situationen erleichtert daher die Diagnose. Die folgende Tabelle fasst Trainings- und Validierungsverhalten, typische Ursachen und die erste Maßnahme zusammen.
| Situation | Trainingsfehler | Validierungsfehler | Typische Ursache | Erste Maßnahme |
|---|---|---|---|---|
| Overfitting (Überanpassung) | Niedrig | Hoch | Wenig Daten, Rauschen, zu komplexes Modell | Daten ergänzen, regularisieren, früh abbrechen |
| Unteranpassung | Hoch | Hoch | Zu einfaches Modell, zu kurzes Training | Kapazität erhöhen, aussagekräftigere Eingaben |
| Gute Anpassung (gute Generalisierung) | Niedrig | Niedrig und nah beieinander | Ausgewogenes Modell, repräsentative Daten | Weiter beobachten |
Die Tabelle ist ein Diagnoseraster und keine starre Regel. In echten Projekten verschwimmen allerdings die Grenzen. Dennoch finden Sie die richtige Richtung meist schnell, wenn Sie Trainings- und Validierungsergebnisse nebeneinander lesen.
Welche Begriffe werden mit Overfitting verwechselt?
Im KI Glossar liegen mehrere Begriffe nah beieinander. Jeder beschreibt ein anderes Problem, deshalb führt eine Verwechslung zur falschen Lösung. Die folgende Tabelle hält die Unterschiede kurz. Details finden Sie in den verwandten Artikeln.
| Begriff | Was er beschreibt | Bezug zu Overfitting |
|---|---|---|
| Overfitting | Auswendiglernen der Trainingsdaten und Versagen bei neuen Daten | Thema dieses Artikels |
| Datenleck | Testinformationen gelangen ins Training | Lässt Ergebnisse zu gut aussehen und kann ein echtes Problem verdecken |
| KI Bias | Systematische Ungleichbehandlung in Daten oder Design | Ein eigenes Problem, auch wenn nicht repräsentative Daten beide nähren |
| Federated Learning | Modelltraining über Geräte hinweg ohne Weitergabe der Rohdaten | Ein Datenschutzansatz und kein Mittel gegen Overfitting |
| Halluzination | Ein generatives Modell erfindet falsche Inhalte | Anderer Mechanismus mit ähnlichem Gefühl der Unzuverlässigkeit |
Wenn Sie Fairness vertiefen möchten, lesen Sie unseren Artikel Was ist KI Bias. Für einen datenschutzorientierten Trainingsansatz empfehlen wir Was ist Federated Learning.
Ist Overfitting im Deep Learning und bei großen Sprachmodellen dasselbe?
Das Konzept ist dasselbe, nur die Größenordnung unterscheidet sich. Sehr große neuronale Netze haben also genug Kapazität zum Auswendiglernen. Auch in Deep Learning Projekten müssen Sie daher Trainings- und Validierungsverlust beobachten, Regularisierung nutzen und die Daten sorgfältig aufteilen.
Auch wenn Sie ein fertiges Modell mit eigenen Daten anpassen, besteht ein Risiko. Stimmen Sie es mit einem sehr kleinen und engen Datensatz fein ab, kann es sich zu stark auf diese Beispiele stützen. Folglich schwächt sich die allgemeine Fähigkeit ab, und es funktioniert nur bei Eingaben, die Ihren Trainingssätzen ähneln.
Hier gilt daher die offizielle Dokumentation des Anbieters. Modellnamen, Größen und Einstellungen ändern sich schnell, prüfen Sie aktuelle Empfehlungen also immer in den Unterlagen des Anbieters selbst. Kennen Sie das Konzept, wissen Sie also auch, welche Frage Sie stellen müssen.
Wie sieht eine praktische Checkliste gegen Overfitting aus?
Wenn Sie ein KI- oder Prognoseprojekt abnehmen, empfehlen wir die folgenden Fragen. Sie können sie Ihrem technischen Team oder Ihrem Dienstleister stellen. Die Antworten zeigen Ihnen also schnell, wie verlässlich das Modell ist.
- Haben Sie Trainings-, Validierungs- und Testergebnisse getrennt berichtet?
- Haben Sie den Testdatensatz während der Entwicklung unberührt gelassen?
- Bilden die Trainingsdaten echte Nutzer und echte Zeiträume ab?
- Haben Sie bei zeitlich geordneten Daten sichergestellt, dass die Zukunft nicht in die Vergangenheit sickert?
- Haben Sie Schutzmaßnahmen wie Regularisierung oder frühzeitigen Abbruch eingesetzt?
- Beobachten Sie die Leistung nach dem Start regelmäßig?
- Haben Sie das Modell mit einem einfachen Basismodell verglichen?
Je mehr Antworten "nein" lauten, desto höher ist somit das Risiko. Das ist keine Rechts- oder Finanzberatung, sondern nur ein Ausgangsrahmen für die Qualitätskontrolle.
Welchen Lernweg gehen Sie nach der Frage "Was ist Overfitting"?
Am besten verankern Sie den Begriff mit einem kleinen Projekt. Nehmen Sie zunächst einen kleinen Datensatz, trainieren Sie dann ein Modell und zeichnen Sie die Verlustkurven selbst. Den Moment zu sehen, in dem die Kurven auseinandergehen, lehrt mehr als hundert Sätze.
Starten Sie bei null, helfen Ihnen unser Leitfaden Machine Learning lernen und unsere Roadmap für KI mit Python Schritt für Schritt weiter.
Möchten Sie für ein Geschäftsprojekt Modellwahl, Datenvorbereitung und Überwachung gemeinsam planen, unterstützt Sie unsere KI Beratung. Bei Talha Aslan und Team sprechen wir zuerst über Ihr Geschäftsziel, dann über Ihre Daten und erst zum Schluss über das Modell.



