Künstliche Intelligenz

Was ist Knowledge Distillation? So lernt ein kleines KI Modell von einem großen

Talha Aslan 19 Minuten Lesezeit 2 Aufrufe

Was ist Knowledge Distillation?

Knowledge Distillation, auf Deutsch Wissensdestillation, ist ein Verfahren, bei dem ein kleines Modell (der Schüler) das Verhalten eines größeren, stärkeren Modells (des Lehrers) nachahmt. Der Schüler übernimmt nicht nur die endgültigen Antworten, sondern auch die Wahrscheinlichkeiten des Lehrers. So erreicht er mit deutlich weniger Rechenaufwand eine ähnliche Qualität.

Stellen Sie sich einen erfahrenen Koch und seinen Lehrling vor. Der Koch schreibt nicht jedes Rezept auf. Stattdessen steht der Lehrling neben ihm und übernimmt Timing, Geschmack und Handgriffe. Allerdings besitzt er nicht die gesamte Erfahrung des Kochs. Dennoch bereitet er eine enge Speisekarte viel schneller und günstiger zu.

Dieser Artikel behandelt genau einen Begriff. Benachbarte Konzepte erwähnen wir nur in der Vergleichstabelle und in kurzen Einschüben, und wir verweisen dafür auf eigene Ratgeber.

Was sagt der Vergleich mit Lehrer und Schüler aus?

Gehen wir den Vergleich genauer durch. Das Lehrermodell ist groß, teuer und langsam. Es kann Milliarden von Parametern haben. Genaue Zahlen lassen wir bewusst weg, denn aktuelle Werte ändern sich, und Sie sollten sie in der offiziellen Dokumentation des Anbieters prüfen. Der Schüler muss dieselbe Aufgabe mit viel weniger Rechenleistung lösen.

Ein guter Lehrer sagt im Unterricht nie nur: "Die Antwort ist B." Stattdessen sagt er: "Ich denke B, C ist plausibel, A ist klar falsch." Genau diese feine Abstufung gewinnt der Schüler.

Der Vergleich hat allerdings Grenzen. Ein Schüler kann kein Thema lernen, das der Lehrer nie behandelt hat. Zudem übernimmt er die Fehler des Lehrers sehr leicht. Kurz gesagt: Destillation ist keine magische Kompression, sondern eine gezielte Wissensübertragung.

Das Wort stammt ursprünglich aus der Chemie. Dort trennt die Destillation den Kern eines Gemischs in eine konzentrierte Form. Hier ist das Gemisch das Wissen des großen Modells, und der Kern ist das Verhalten, das Sie in das kleine Modell übertragen.

Was sagt das Originalpapier zur Destillation?

Die bekannteste Quelle ist das Papier "Distilling the Knowledge in a Neural Network" von Geoffrey Hinton, Oriol Vinyals und Jeff Dean. Zunächst geht es von einem praktischen Problem aus: Ein ganzes Ensemble von Modellen für jede Vorhersage zu befragen, ist umständlich und kann zu teuer sein. Die vorgeschlagene Lösung komprimiert das Wissen des Ensembles in ein einziges Modell, das sich leichter einsetzen lässt.

Die Zusammenfassung nennt drei Kernideen:

  • Der Schüler lernt aus den weichen Wahrscheinlichkeiten des Lehrers und zusätzlich aus den harten Labels.
  • Ein Parameter namens Temperatur steuert, wie weich diese Wahrscheinlichkeiten ausfallen.
  • Spezialisierte Modelle können feine Klassen trennen, die allgemeine Modelle verwechseln.

Außerdem finden Sie den vollständigen Text auf der arXiv Seite. Wir übernehmen hier nur das Konzept und kopieren keine Zahlen aus den Experimenten.

Danach wanderte die Idee in die Sprachmodelle. Das Team von Hugging Face stellte im DistilBERT Papier eine destillierte Version des Sprachmodells BERT vor. Es zeigte, dass Destillation auch beim Sprachverständnis funktioniert und nicht nur bei der Klassifikation. Die genauen Ergebnisse lesen Sie bitte in der Quelle nach.

Wie funktioniert Knowledge Distillation Schritt für Schritt?

Der Ablauf besteht konzeptionell aus vier Schritten. Wir halten jeden Schritt einfach, weil die Details von Framework zu Framework variieren.

  1. Zunächst wählen Sie ein starkes Lehrermodell aus oder trainieren es selbst.
  2. Danach zeigen Sie dem Lehrer viele Beispieleingaben und speichern seine Ausgaben.
  3. Dann trainieren Sie den kleinen Schüler so, dass er sowohl die echten Labels als auch die Ausgaben des Lehrers nachahmt.
  4. Schließlich testen Sie den Schüler an echten Aufgabendaten und vergleichen ihn mit dem Lehrer.

Der Kern ist: Das Ziel des Schülers ist nicht nur die "richtige Klasse". Er versucht, die gesamte Wahrscheinlichkeitsverteilung des Lehrers zu erfassen. Folglich lernt er aus viel mehr Signal als aus einer einzelnen Antwort.

Konkret besteht der Trainingsverlust meist aus zwei Teilen. Ein Teil misst die Übereinstimmung mit dem echten Label. Der andere misst die Übereinstimmung mit dem Lehrer. Ihr Team stimmt die Gewichtung beider Teile ab, und die beste Balance hängt von der Aufgabe ab.

Außerdem spielt die Transfermenge eine Rolle. Die Beispiele, die Sie dem Schüler zeigen, müssen die echte Nutzung abbilden. Sind sie zu eng oder einseitig, dann lernt der Schüler nur diese enge Welt. Bauen Sie den Beispielpool deshalb aus echten Eingaben auf und nehmen Sie auch seltene Fälle auf.

Was ist ein Soft Label und warum enthält es mehr Information als ein hartes Label?

Ein hartes Label nennt die einzige richtige Klasse eines Beispiels. Bei einem Foto ist "Katze" ein hartes Label. Ein Soft Label dagegen ist die Wahrscheinlichkeit, die das Modell jeder Klasse zuweist: hoch für Katze, mittel für Hund, sehr niedrig für Lastwagen.

Warum ist das wichtig? Weil es Ähnlichkeiten zwischen den Klassen zeigt. Sagt der Lehrer "diese Katze sieht ein bisschen nach Hund aus", erfasst der Schüler auch, wie nah beide Tiere beieinanderliegen. Ein hartes Label löscht diese Information vollständig.

Ein kleines Rechenbeispiel zeigt das. Angenommen, der Lehrer gibt der Katze 0,90, dem Hund 0,09 und dem Lastwagen 0,01. Das harte Label sagt nur "Katze". Das Soft Label verrät zusätzlich, dass eine Katze einem Hund viel näher ist als einem Lastwagen. Diese Zahlen dienen nur der Veranschaulichung und sind keine echten Messwerte.

In der Praxis bringen Soft Labels drei Vorteile:

  • Das Modell verallgemeinert besser, auch mit weniger Beispielen.
  • Der Schüler erkennt die Grenzfälle, bei denen der Lehrer zögert.
  • Das Training des kleinen Modells verläuft stabiler, weil das Signal reicher ist.

In der Fachliteratur heißt das zum Beispiel manchmal "dunkles Wissen". Der Ausdruck ist bildlich gemeint. Dahinter steckt nichts Geheimnisvolles, sondern nur die feinen Unterschiede zwischen Wahrscheinlichkeiten.

Welche Rolle spielt die Temperatur bei der Destillation?

Die Temperatur ist ein Parameter, der steuert, wie scharf oder weich eine Wahrscheinlichkeitsverteilung ausfällt. Bei niedriger Temperatur legt sich das Modell fast nur auf eine Wahl fest. Bei hoher Temperatur rücken die Wahrscheinlichkeiten näher zusammen, und das Signal der zweiten und dritten Wahl wird sichtbar.

Denken Sie zum Beispiel an ein Foto. Auf einem harten Foto sehen Sie nur den hellsten Punkt. Auf einem weichen Foto erscheinen auch die Details im Schatten. Die Temperatur wirkt wie ein Dimmer, der diese Schatten ausleuchtet. So sieht der Schüler, wie der Lehrer seine Alternativen gewichtet.

Also nutzt der ursprüngliche Ansatz diese Abschwächung nur während des Trainings. Nach dem Training kehrt die Temperatur zum Normalwert zurück.

Die Einstellung `temperature`, die Sie beim Erzeugen von Text verändern, dient einem anderen Zweck: Sie steuert die Vielfalt der Ausgabe. Beide beruhen auf derselben mathematischen Idee, ihre Aufgaben unterscheiden sich jedoch. Die Erzeugungsseite behandeln wir in unserem Ratgeber zu Temperature und Top p.

Wie destillieren Sie ein großes Sprachmodell mit synthetischen Ausgaben?

Bei großen Sprachmodellen sieht das Bild etwas anders aus. Oft haben Sie allerdings keinen Zugriff auf die internen Wahrscheinlichkeiten des Lehrers, sondern erhalten nur Text. Der übliche Weg ist dann einfach: Sie geben dem Lehrer eine Liste von Aufgaben, sammeln seine Antworten und nutzen diese als Trainingsdaten für das kleine Modell.

Hier ahmt der Schüler den geschriebenen Text des Lehrers nach. Die "synthetische Ausgabe" tritt also an die Stelle des Soft Labels. Wie künstliche Trainingsdaten allgemein funktionieren, besprechen wir im Beitrag über synthetische Daten, deshalb wiederholen wir es hier nicht.

Stark ist dieser Ansatz durch seine Einfachheit. Schwach ist er, weil Fehler, Stil und Vorurteile des Lehrers gehen auf den Schüler über. Außerdem verliert ein kleines Modell schnell an Qualität, sobald es den Bereich verlässt, den der Lehrer abgedeckt hat.

Die Vielfalt der Daten entscheidet viel. Bereiten Sie Aufgaben aus vielen Themen, Längen und Schwierigkeitsgraden vor, statt hundert ähnliche Fragen zu stellen. Entfernen Sie dann Dubletten. Behandeln Sie außerdem Fälle, die der Lehrer abgelehnt oder nicht beantwortet hat, als eigene Klasse, denn der Schüler muss auch diese Grenzen kennen.

Daher ist es eine gute Gewohnheit, die Ausgaben des Lehrers vor dem Training zu filtern. Streichen Sie zum Beispiel falsche, widersprüchliche oder unnötig lange Antworten.

Welche Arten der Destillation gibt es?

Sie können Destillation danach gruppieren, was der Schüler nachahmt. Die Einteilung ist konzeptionell, und Frameworks nutzen teils andere Namen.

  • Antwortbasierte Destillation: Der Schüler ahmt die endgültige Ausgabe oder die Wahrscheinlichkeiten des Lehrers nach. Das ist der klassische Ansatz aus dem Hinton Papier.
  • Destillation über Zwischenschichten: Der Schüler versucht zusätzlich, die inneren Darstellungen der Lehrerschichten zu treffen. Dieser Weg verlangt Zugriff auf das Innenleben des Lehrers.
  • Destillation auf Sequenzebene: Der Schüler nimmt ganze Sätze oder Antworten des Lehrers als Beispiele. Das Training mit synthetischen Ausgaben bei Sprachmodellen liegt nahe an dieser Gruppe.

Welche Variante Sie wählen, hängt also davon ab, wie viel Zugriff Sie auf den Lehrer haben. Erhalten Sie von einer geschlossenen API nur Text, ist der erste Weg oft nicht möglich. Mit einem Modell mit offenen Gewichten können Sie alle drei erwägen.

Die Einteilung berührt zudem Berechtigungen. Das Destillieren aus einem Modell, dessen Gewichte Ihnen gehören, unterscheidet sich technisch und rechtlich vom Destillieren aus der Ausgabe einer fremden API. Auf die Lizenzfrage kommen wir weiter unten in einem eigenen Abschnitt zurück.

Was ist Knowledge Distillation und warum hat sie sich so verbreitet?

Die kurze Antwort lautet: Kosten, Geschwindigkeit und Standort. Große Modelle sind leistungsstark, doch jede Anfrage braucht viel Rechenleistung. Wächst der Verkehr, dann wächst auch die Rechnung, und die Antwortzeit verlängert sich. Ein großes Sprachmodell für jede kleine Aufgabe einzusetzen, ist oft verschwenderisch.

Die Destillation verschiebt dieses Gleichgewicht. Trainieren Sie ein kleines Modell für eine enge Aufgabe, gewinnen Sie:

  • Geringere Latenz: Die Antworten kommen schneller.
  • Geringere Stückkosten: Dieselbe Hardware bedient mehr Anfragen.
  • Weniger Speicher: Das Modell läuft auch auf begrenzten Geräten wie Handys oder Browsern.
  • Mehr Kontrolle: Sie können das Modell in Ihrer eigenen Umgebung betreiben.

Einen Zahlenvergleich geben wir deshalb bewusst nicht. Der Gewinn unterscheidet sich von Aufgabe zu Aufgabe, und Sie müssen ihn in jedem Projekt neu messen. Wollen Sie die tokenbasierte Preislogik verstehen, lesen Sie unseren Ratgeber zu Tokens und API Kosten.

Auch der Produktzyklus spielt mit. Teams bauen zunächst mit einem großen Modell schnell einen Prototyp. Sobald die Nutzung klar ist, verlagern sie die häufigsten Aufgaben auf kleine Modelle. Das teure Modell arbeitet dann nur noch bei den schweren Fällen, die es wirklich braucht.

Wo hilft Knowledge Distillation am meisten?

Anwendungsfälle entstehen überall dort, wo Sie sagen: "Das große Modell ist zu schwer." Hier einige typische Beispiele.

  • KI direkt auf dem Gerät: Tastaturvorschläge, Offline Übersetzung oder Sprachbefehle im Kopfhörer brauchen kleine Modelle.
  • Echtzeitsysteme: Bei Live Chat, Suchvorschlägen und Sprachassistenten bestimmt die Latenz direkt das Nutzererlebnis.
  • Klassifikation mit hohem Volumen: Für das Verschlagworten von Supportanfragen oder das Sortieren von Bewertungen eignet sich ein kleines Modell bei Tausenden wiederkehrender Aufgaben pro Tag.
  • Lokale Installationen: Organisationen, die Daten nicht aus dem Netzwerk lassen wollen, betreiben kleine Modelle auf eigenen Servern.

Stellen Sie sich bei der Auswahl eine Frage: Wiederholt sich diese Aufgabe sehr oft, und ist das Antwortformat vorhersehbar? Lautet beide Male die Antwort ja, ist Destillation ein starker Kandidat. Sind die Antworten jedes Mal offen und kreativ, somit stößt ein kleines Modell schneller an seine Grenze.

Was ist Knowledge Distillation in einem Unternehmensszenario?

Das Folgende ist ein Beispielszenario und kein echtes Kundenergebnis. Stellen Sie sich einen Onlineshop vor. Er möchte Kundennachrichten in "Versand", "Rückgabe", "Produktfrage" und "Beschwerde" einsortieren.

Zunächst nutzt das Unternehmen dafür ein großes Modell. Die Ergebnisse sind gut, doch es zahlt für jede Nachricht und wartet auf jede Antwort. Steigt das Nachrichtenvolumen, steigen auch die Kosten.

An diesem Punkt könnte das Team so vorgehen:

  1. Zunächst baut es aus echten Nachrichten einen Beispielpool auf, nachdem es persönliche Angaben entfernt hat.
  2. Danach sammelt es die Labels, die das große Modell für diese Beispiele vergibt.
  3. Außerdem prüft es einen Teil von Hand und korrigiert falsche Labels.
  4. Dann trainiert es ein kleines Modell mit diesen Labels.
  5. Schließlich vergleicht es das kleine Modell mit dem großen an einer Testmenge, die vom Training getrennt bleibt.

Reicht das Ergebnis aus, dann übernimmt das kleine Modell die tägliche Last. Unklare Nachrichten gehen an das große Modell oder an einen Menschen. So bleiben Qualität und Kosten im Gleichgewicht. Für solche Aufbauten finden Sie auf unserer Seite zur KI Beratung mehr.

Mit dem Start ist die Arbeit allerdings nicht erledigt. Verschieben sich die eingehenden Nachrichten, zum Beispiel weil eine neue Kampagne neue Fragen bringt, sollten Sie die Sicherheit des kleinen Modells beobachten. Antworten mit geringer Sicherheit an das große Modell zu leiten, ist ein gutes Sicherheitsventil. Diese Fälle bilden zudem einen wertvollen Pool für die nächste Trainingsrunde.

Worin unterscheiden sich Destillation, Quantisierung und Pruning?

Alle drei Verfahren machen ein Modell leichter, gehen aber unterschiedliche Wege, und sie werden oft verwechselt. Die Quantisierung speichert die Zahlen eines Modells mit weniger Bits. Beim Pruning entfernen Sie Verbindungen, die wenig beitragen. Die folgende Tabelle fasst die Unterschiede zusammen.

VerfahrenWas es tutModellarchitekturZusätzliches Training nötig?Typisches Risiko
DestillationTrainiert einen kleinen Schüler mit den Ausgaben eines großen LehrersNeues, kleineres ModellJa, ein vollständiger TrainingslaufÜbernimmt die Fehler des Lehrers
QuantisierungSenkt die Genauigkeit der ZahlenGleiches Modell, weniger BitsMeist keines oder sehr wenigQualitätsverlust bei empfindlichen Aufgaben
PruningEntfernt unwichtige Verbindungen oder NeuronenGleiches Modell, dünnere StrukturOft eine FeinabstimmungPlötzlicher Qualitätsabfall bei zu viel Pruning
FeinabstimmungPasst ein bestehendes Modell an eine neue Aufgabe anGleiche GrößeJa, aber leichterKann frühere Kenntnisse vergessen

Sie können diese Verfahren zudem kombinieren. Zum Beispiel destillieren Sie zuerst und quantisieren danach. Dann können sich die Gewinne bei Größe und Geschwindigkeit vervielfachen.

Eine grobe Faustregel hilft bei der Wahl. Wollen Sie ein fertiges Modell schnell verkleinern, kostet die Quantisierung den geringsten Aufwand. Wissen Sie, dass viele Verbindungen überflüssig sind, ergibt Pruning Sinn. Für das kleinste und schnellste Modell bei einer engen Aufgabe sticht die Destillation hervor. Weil die Gewinne je nach Aufgabe schwanken, testen Sie jede Option mit Ihren eigenen Daten.

Ist Destillation dasselbe wie Feinabstimmung (Fine Tuning)?

Nein, aber beide sind Nachbarn. Die Feinabstimmung passt ein bestehendes Modell an Ihre Daten an, und die Modellgröße bleibt gleich. Die Destillation trainiert ein anderes, meist kleineres Modell und nutzt den Lehrer als Ziel.

In der Praxis treffen sich beide oft. Sie stimmen zum Beispiel zuerst ein großes Modell auf Ihr Fachgebiet ab. Danach machen Sie dieses Expertenmodell zum Lehrer und destillieren daraus einen kleinen Schüler. Die Grundlagen der Feinabstimmung finden Sie in unserem Ratgeber zu Fine Tuning und LoRA.

Eine einfache Frage hilft bei der Entscheidung: Lautet das Problem "das Modell weiß Falsches" oder "das Modell ist zu schwer"? Im ersten Fall passt die Feinabstimmung besser, im zweiten die Destillation. Bei fehlendem Wissen reicht oft schon die Anbindung an Ihre Dokumente.

Ein weiterer Unterschied liegt im Zielsignal. Bei der Feinabstimmung ist das Ziel meist ein menschliches Label. Bei der Destillation ist das Ziel die Ausgabe des Lehrers. Deshalb kann Destillation selbst dann funktionieren, wenn Sie wenig beschriftete Daten haben, solange Sie der Qualität des Lehrers vertrauen.

In welcher Reihenfolge sollten Sie diese Verfahren ausprobieren?

Für die meisten Projekte lohnt es sich, mit dem günstigsten Weg zu beginnen. Die folgende Reihenfolge ist ein allgemeiner Ansatz aus der Praxis und passt nicht auf jede Aufgabe genau.

  1. Zunächst verbessern Sie den Prompt und fügen einige Beispiele hinzu.
  2. Fehlt Wissen, richten Sie Retrieval Augmented Generation ein, damit das Modell Ihre Dokumente lesen kann.
  3. Bei einem Verhaltens oder Stilproblem erwägen Sie die Feinabstimmung.
  4. Bleibt ein Kosten oder Latenzproblem, prüfen Sie die Destillation.
  5. Schließlich verbessern Sie Größe und Tempo zusätzlich mit Quantisierung.

Diese Reihenfolge ist also ein Spartipp und keine Regel. Die Destillation gehört zu den aufwendigsten Schritten. Springen Sie deshalb nicht dorthin, bevor Sie das Problem gemessen haben. Messen Sie jeden Schritt außerdem mit derselben Testmenge. So sehen Sie, welches Verfahren wirklich einen Unterschied gemacht hat.

Welche Vorteile hat die Destillation?

Die Vorteile zeigen sich klar im passenden Anwendungsfall. Wir fassen sie so zusammen:

  • Tempo: Ein kleines Modell antwortet in kürzerer Zeit.
  • Kosten: Dieselbe Aufgabe braucht weniger Rechenleistung.
  • Portabilität: Das Modell passt auf Geräte am Rand des Netzwerks und auf lokale Server.
  • Datenschutz: Sie können Daten verarbeiten, ohne sie nach außen zu senden.
  • Vorhersagbarkeit: Ein Modell, das auf eine enge Aufgabe trainiert ist, verhält sich oft gleichmäßiger als ein allgemeines.

Zudem hilft die Destillation, ein Produkt reifen zu lassen. Sie bauen den Prototyp mit einem großen Modell, beobachten Verkehr und Bedarf und wechseln dann zu einem kleinen Modell. Anders gesagt: Erst haben Sie ein Produkt, das funktioniert, dann eines, das günstig funktioniert.

Einen Punkt möchten wir betonen: Keiner dieser Vorteile stellt sich automatisch ein. Alle hängen von einem guten Lehrer, sauberen Trainingsdaten und einem soliden Test ab. Fehlt eines davon, wird das kleine Modell schnell, aber unzuverlässig.

Welche Grenzen und Risiken hat die Destillation?

Ehrlich gesagt ist Destillation kein kostenloses Mittagessen. Die wichtigsten Grenzen sind diese:

  • Kapazitätsgrenze: Ein kleines Modell kann nicht die gesamte Fähigkeit des großen tragen. Allgemeinwissen und komplexes Schlussfolgern schwächeln zuerst.
  • Geerbte Fehler: Ist der Lehrer falsch oder voreingenommen, wiederholt der Schüler denselben Fehler.
  • Verschiebung der Verteilung: Kommt eine Eingabe, die der Schüler nie gesehen hat, kann er unerwartet reagieren.
  • Wartungsaufwand: Ändert sich der Lehrer, müssen Sie den Schüler eventuell neu trainieren.
  • Messschwierigkeit: Selbst bei gutem Durchschnittswert können sich in seltenen Fällen ernste Fehler verstecken.

Um diese Risiken zu senken, bereiten Sie eine breite Testmenge vor. Behalten Sie außerdem bei kritischen Entscheidungen die menschliche Kontrolle. Zum Thema falsche Antworten lesen Sie unseren Beitrag zur KI Halluzination.

Ein Beispielszenario macht das greifbar. Ein Schüler, der auf Rechnungsfragen trainiert ist, erhält eines Tages eine Frage zur Rückgabe. Weil er diesen Bereich nie gesehen hat, antwortet er womöglich selbstsicher, aber falsch. Bauen Sie deshalb einen Filter ein, der Eingaben außerhalb des Themas erkennt, und einen Weg zu einem Menschen.

Darf man ein Modell mit der Ausgabe eines anderen Anbieters trainieren?

Diese Frage ist wichtig, denn Destillation stützt sich in der Praxis oft auf die API Ausgabe eines Anbieters. Viele Anbieter dürfen in ihren Nutzungsbedingungen einschränken, dass man ihre Ausgaben zur Entwicklung eines konkurrierenden Modells nutzt. Die Bedingungen unterscheiden sich je nach Anbieter und ändern sich mit der Zeit.

Deshalb empfehlen wir diese Schritte:

  1. Lesen Sie die aktuellen Nutzungsbedingungen und Servicebedingungen Ihres Anbieters.
  2. Klären Sie, ob die Nutzung der Ausgaben zum Training eines anderen Modells erlaubt ist.
  3. Fragen Sie den Anbieter schriftlich, wenn etwas unklar bleibt.
  4. Lesen Sie bei Modellen mit offener Lizenz den Lizenztext zusätzlich, denn manche enthalten eigene Einschränkungen.
  5. Halten Sie Ihre Entscheidung und deren Begründung fest.

Denn falsche Konten anzulegen oder Ihr Vorgehen zu verschleiern, um die Bedingungen zu umgehen, ist keine Lösung. Solche Versuche gelten als Umgehung der Systeme und können zur Sperrung Ihres Kontos führen. Dieser Abschnitt ist keine Rechtsberatung. Ziehen Sie bei kritischen Projekten eine Juristin oder einen Juristen hinzu.

Auch offene Lizenzen sind allerdings nicht einfach. Manche regeln die kommerzielle Nutzung, andere das Training eines weiteren Modells mit der Ausgabe. Prüfen Sie den Lizenztext jedes Mal und kontrollieren Sie ihn erneut, wenn Sie die Version wechseln.

Wann ist ein kleines Modell nicht die richtige Wahl?

Nicht jedes Projekt eignet sich für Destillation. In den folgenden Fällen ist es vielleicht klüger, beim großen Modell zu bleiben.

  • Die Aufgabe ist sehr breit und muss jede Art von Frage beantworten.
  • Der Verkehr ist gering, daher deckt der Kostengewinn den Trainingsaufwand nicht.
  • Sie haben keine Testmenge, der Sie vertrauen können.
  • Niemand in Ihrem Team kann das Modelltraining weiter betreuen.
  • Die Fehlertoleranz ist sehr niedrig, und jede Abweichung hat ernste Folgen.

Versuchen Sie in diesen Fällen zuerst leichtere Lösungen wie bessere Prompts. Oft behebt die Anbindung an Dokumente fehlendes Wissen, die Feinabstimmung fehlendes Verhalten und die Destillation das Kosten und Tempoproblem.

Andererseits gibt es auch einen Mittelweg. Überlassen Sie die schwere Arbeit dem großen Modell und übergeben Sie nur den häufigsten, einfachen Teil an das kleine. Dieser gemischte Aufbau macht es überflüssig, alles zu destillieren. Außerdem verkleinert er das Risiko.

Welche Checkliste sollten Sie vor einem Destillationsprojekt abarbeiten?

Die folgende Liste ist ein praktischer Einstieg für Softwareteams und Unternehmer.

  • Haben Sie die Aufgabe in einem Satz beschrieben?
  • Haben Sie gemessen, dass das große Modell bei dieser Aufgabe gut genug arbeitet?
  • Sehen Sie das aktuelle Kosten und Latenzproblem in konkreten Zahlen?
  • Enthalten die Trainingsdaten persönliche oder vertrauliche Angaben, und haben Sie diese entfernt?
  • Erlauben die Bedingungen des Lehrer Anbieters die Nutzung der Ausgaben?
  • Haben Sie eine getrennte Testmenge und eine Akzeptanzschwelle festgelegt?
  • Gibt es einen Plan, Fälle an das große Modell oder einen Menschen zu leiten, wenn das kleine Modell nicht reicht?
  • Haben Sie aufgeschrieben, wer das Modell wie oft aktualisiert?

Können Sie die meisten Fragen nicht mit ja beantworten, dann erledigen Sie zuerst die Vorarbeit. Behandeln Sie die Liste wie ein Projektdokument: Weisen Sie jeder Frage eine verantwortliche Person zu und schreiben Sie die Antwort auf. Eine Frage ohne Antwort ist der riskanteste Punkt des Projekts.

Brauchen Sie Hilfe beim Aufbau, sehen Sie sich unsere Seite zum lokalen LLM und unsere Ollama Anleitung an.

Wie messen Sie die Qualität eines destillierten Schülers?

Die Messung ist leider der am meisten vernachlässigte Schritt der Destillation. Die durchschnittliche Genauigkeit allein genügt nicht. Wir empfehlen einen Blick auf drei Ebenen.

Erstens die Übereinstimmung mit dem Lehrer: Wie nah liegt der Schüler bei gleichen Eingaben? Zweitens der echte Aufgabenerfolg: Wie schneidet er an einer von Menschen beschrifteten Testmenge ab? Drittens die schwierigen Fälle: Wie reagiert das Modell auf seltene, mehrdeutige oder grenzwertige Eingaben?

Nehmen Sie bewusst knifflige Beispiele in Ihre Testmenge auf. Es überrascht nicht, wenn der Schüler bei leichten Beispielen dem Lehrer gleicht. Der eigentliche Unterschied zeigt sich bei Grenzfällen. Untersuchen Sie deshalb die Fehlerarten einzeln und nicht nur den Durchschnittswert.

Richten Sie außerdem eine laufende Überwachung im Betrieb ein. Verfolgen Sie Beschwerden, den Anteil der an Menschen übergebenen Fälle und die Latenz. So bemerken Sie einen Qualitätsabfall früh.

Bewertungsverfahren ändern sich schnell, daher nennen wir keinen konkreten Wert und keine feste Schwelle. Legen Sie die passende Schwelle für Ihre Aufgabe gemeinsam mit Ihrem Team fest.

Welche Fehler machen Teams am häufigsten?

Diese Fehler sehen wir in der Praxis am häufigsten:

  • Die Ausgaben des Lehrers ohne Filter ins Training geben.
  • Testmenge und Trainingsdaten vermischen und so den Wert aufblähen.
  • Vom kleinen Modell die Fähigkeit des großen erwarten.
  • Ausgaben sammeln, ohne die Nutzungsbedingungen zu lesen.
  • Nach dem Training auf die Überwachung verzichten.

Jede Lösung ist einfach, verlangt aber trotzdem Disziplin. Die Testmenge gleich am Anfang abzutrennen und nie anzufassen, ist die günstigste Versicherung des Projekts.

Auch die Versionsverwaltung ist eine häufige Lücke. Ändert der Anbieter das Lehrermodell, kann der Schüler, den Sie trainiert haben, mit der Zeit veralten. Halten Sie fest, mit welcher Lehrerversion und mit welchen Daten Sie trainiert haben. Dann finden Sie bei einem Problem die Ursache schnell.

Fazit: Was ist Knowledge Distillation und wo beginnen Sie?

Knowledge Distillation überträgt das Wissen eines großen Modells auf ein kleineres, mit dem Ziel, Kosten und Latenz zu senken. Über Soft Labels oder synthetische Ausgaben erfasst der Schüler das Verhalten des Lehrers bei einer engen Aufgabe.

Kurz gesagt lautet die praktische Antwort auf "was ist Knowledge Distillation": dieselbe Aufgabe mit einem kleineren, günstigeren Modell. Klären Sie zunächst die Aufgabe und die aktuellen Kosten. Lesen Sie danach die Bedingungen des Lehrer Anbieters, starten Sie einen kleinen Pilotversuch und messen Sie das Ergebnis an einer getrennten Testmenge. Quantisierung und Pruning ergänzen diesen Weg, sie ersetzen ihn nicht.

Wir von Talha Aslan und Team raten, bei Projekten mit KI zuerst den Bedarf und dann das Werkzeug zu wählen. Einen Überblick finden Sie bei unseren KI Automatisierungsleistungen.

Häufig gestellte Fragen

Ist Knowledge Distillation dasselbe wie Feinabstimmung?
Nein, es sind verschiedene Verfahren. Die Feinabstimmung passt ein bestehendes Modell an Ihre Daten an, und die Größe bleibt meist gleich. Die Destillation überträgt das Verhalten eines großen Lehrers auf ein kleineres Schülermodell. In der Praxis lassen sich beide kombinieren: Sie stimmen zuerst fein ab und nutzen dieses Expertenmodell dann als Lehrer für einen kompakten Schüler.
Ist ein destilliertes Modell immer schlechter als das große?
Bei der allgemeinen Leistung bleibt es meist zurück, bei einer engen Aufgabe kann es dem Lehrer aber nahekommen. Dafür brauchen Sie eine klar definierte Aufgabe und gute Trainingsdaten. Messen Sie vor der Entscheidung an Ihrer eigenen Testmenge, denn die Ergebnisse unterscheiden sich je nach Aufgabe. Bei kritischen Aufgaben behalten Sie außerdem die menschliche Kontrolle.
Darf ich ein kleines Modell mit der Ausgabe eines API Anbieters trainieren?
Das hängt von den Nutzungsbedingungen des Anbieters ab. Viele Anbieter dürfen einschränken, dass man ihre Ausgaben für ein konkurrierendes Modell nutzt. Lesen Sie die aktuellen Bedingungen, fragen Sie bei Unklarheit schriftlich nach und halten Sie Ihre Entscheidung fest. Das ist keine Rechtsberatung, ziehen Sie bei kritischen Projekten Fachleute hinzu und umgehen Sie die Bedingungen nie.
Was ist der wichtigste Unterschied zwischen Destillation und Quantisierung?
Die Destillation trainiert ein neues, kleineres Modell mit den Ausgaben eines Lehrers. Die Quantisierung speichert die Zahlen desselben Modells mit geringerer Genauigkeit und lässt die Architektur unverändert. Das erste Verfahren braucht zusätzliches Training, das zweite meist nicht. Sie können beide auch zusammen nutzen, um Größe und Tempo gleichzeitig zu verbessern.
Sollte ein kleines Unternehmen Knowledge Distillation einsetzen?
Für die meisten kleinen Unternehmen sind ein fertiges kleines Modell oder gut geschriebene Prompts der erste Schritt. Die Destillation lohnt sich, wenn eine häufige, sich wiederholende Aufgabe ein echtes Kosten oder Latenzproblem hat. Messen Sie zuerst Ihren Bedarf und die aktuellen Kosten, und entscheiden Sie nach einem kleinen Pilotversuch.
Was bedeutet Soft Label?
Ein Soft Label ist der Wahrscheinlichkeitswert, den ein Modell jeder Klasse zuweist. Anders als ein hartes Label, das nur eine richtige Antwort nennt, zeigt es auch die Ähnlichkeit zwischen den Klassen. Ein Schüler, der mit diesem reicheren Signal trainiert, verallgemeinert mit weniger Beispielen oft besser. Das Konzept erklärt das ursprüngliche Hinton Papier ausführlich.
  • Knowledge Distillation
  • Wissensdestillation
  • Soft Labels
  • kleine Sprachmodelle
  • Quantisierung
  • Pruning
  • KI Optimierung
Teilen:
Talha Aslan

Google Partner und Experte für digitales Marketing. Seit 2012 praktisch in SEO, Google Ads, Webdesign und E-Commerce Projekten; jeder Beitrag hier stammt aus dieser Erfahrung.

Nächstes Projekt

Sprechen wir über Ihr Projekt.

Ihre Anfrage geht direkt an Talha Aslan und Team: Strategie von Talha, Umsetzung durch ein erfahrenes Team. Das Erstgespräch ist kostenlos, wir hören zu und melden uns mit einer klaren Roadmap.