Was ist Finetuning und LoRA? Leitfaden zur Modellanpassung

Was ist Finetuning?
Finetuning ist das gezielte Weitertrainieren eines bereits vortrainierten KI Modells mit Ihren eigenen Beispielen, damit es eine bestimmte Aufgabe, einen Tonfall oder ein Ausgabeformat zuverlässiger trifft. LoRA (Low Rank Adaptation) ist eine schlankere Variante: Die ursprünglichen Gewichte bleiben eingefroren, und nur kleine Zusatzmatrizen lernen.
Wir behandeln beide Begriffe gemeinsam, weil sie in der Praxis fast immer zusammen auftauchen. Zunächst bauen wir die Idee mit einem einfachen Bild auf. Danach erklären wir die Funktionsweise, den richtigen Zeitpunkt, die Datenvorbereitung, die Risiken und eine Checkliste.
Hinweis: Dieser Leitfaden bleibt auf Konzeptebene. Wir nennen keine Modellnamen, Preise oder Benchmark Werte, denn solche Angaben veralten schnell. Prüfen Sie aktuelle Werte in der offiziellen Dokumentation des Anbieters.
Was ist Finetuning, anschaulich erklärt mit einem Alltagsbild?
Stellen Sie sich ein vortrainiertes Modell wie eine neue Mitarbeiterin mit breiter Ausbildung vor. Sie schreibt gut, denkt logisch und weiß ein wenig über viele Themen, denn sie hat viel gelesen. Allerdings kennt sie weder Ihren Tonfall noch Ihre Formulare oder Ihre interne Fachsprache.
Was ist Finetuning in diesem Bild? Sie zeigen der Mitarbeiterin Hunderte richtige Beispiele aus Ihrer eigenen Arbeit. Dadurch lernt sie keinen neuen Beruf. Stattdessen übernimmt sie lediglich Ihre Gewohnheiten.
Anders gesagt: Finetuning baut kein Modell von Grund auf. Stattdessen lenkt es eine vorhandene Fähigkeit auf Ihre Aufgabe. Dieser Unterschied zählt, denn ein Training von null braucht enorme Daten und Hardware. Finetuning kommt dagegen mit einem deutlich kleineren Datensatz aus.
Was ändert sich beim Finetuning im Modell?
Ein Modell besteht aus sehr vielen Zahlen, den Gewichten. Diese Gewichte legen also fest, wie das Modell aus einer Eingabe eine Ausgabe macht. Im allgemeinen Training stellt der Anbieter sie anhand einer riesigen Textmenge ein.
Beim Finetuning führen Sie dieselbe Trainingsschleife mit einem kleinen, gezielten Datensatz fort. Zunächst rät das Modell bei jedem Beispiel eine Antwort. Das System vergleicht die Antwort mit der richtigen, misst die Abweichung und verschiebt die Gewichte ein wenig.
Diese Schleife läuft daher sehr oft. Schließlich bildet das Modell das Muster Ihrer Beispiele konsistenter nach. Zum Beispiel antwortet es in einer festen Vorlage oder nutzt Ihre Fachbegriffe richtig.
Konkret kann man zwei Phasen trennen. Das Vortraining ist die erste Phase. Der Modellanbieter führt es mit riesigen Datenmengen durch, und dort entsteht die allgemeine Fähigkeit. Das Finetuning ist dann die zweite Phase. Sie oder ein Dienst führen es aus, und das Modell spezialisiert sich.
Hier liegt allerdings der wichtige Unterschied. Finetuning verändert vor allem Verhalten und Format. Somit ist es meist nicht der beste Weg, um eine verlässliche Wissensbibliothek in ein Modell zu laden.
Warum ist vollständiges Finetuning teuer und schwerfällig?
Beim vollständigen Finetuning aktualisieren Sie jedes Gewicht des Modells. Große Sprachmodelle haben deshalb sehr viele davon. Zusätzlich halten Sie beim Training weitere Optimierungsdaten im Speicher, nicht nur die Gewichte.
Daraus entstehen drei praktische Probleme:
- Speicherbedarf: Das Training braucht deutlich mehr GPU Speicher als der reine Betrieb.
- Ablage: Sie müssen für jede Aufgabe eine volle Kopie des Modells aufbewahren.
- Bereitstellung: Mehrere große Dateien für mehrere Aufgaben zu verwalten, wird schnell unübersichtlich.
Das LoRA Paper geht daher genau von diesem Problem aus. Die Autoren halten es für unpraktisch, ein sehr großes Modell für jede Aufgabe komplett neu abzustimmen. Ihre Antwort lautet also, den Großteil der Gewichte einzufrieren.
Die Hardware Seite erklärt unser Ratgeber zum GPU Server mieten.
Was ist LoRA?
LoRA steht also für Low Rank Adaptation. Das LoRA Paper von Hu und Kollegen beschreibt, die Gewichte des vortrainierten Modells einzufrieren und in jede Schicht der Transformer Architektur kleine, trainierbare Rang Zerlegungsmatrizen einzufügen.
Einfach gesagt: Sie fassen das Hauptmodell nicht an. Stattdessen hängen Sie einen kleinen Zusatz an und trainieren nur diesen. Nach dem Training haben Sie das große Basismodell plus eine winzige Anpassungsdatei.
Das Paper berichtet, dass dieser Ansatz die Zahl der trainierbaren Parameter und den GPU Speicherbedarf im Vergleich zum vollständigen Finetuning stark senkt. Außerdem entsteht anders als bei Adapter Methoden keine zusätzliche Verzögerung bei der Inferenz. Genaue Zahlen finden Sie deshalb im Paper selbst.
Wie funktioniert LoRA auf Konzeptebene?
Denken Sie sich eine Gewichtsmatrix als große Tabelle. Vollständiges Finetuning kann zum Beispiel jede Zelle dieser Tabelle ändern. LoRA nimmt dagegen an, dass sich die nützliche Änderung entlang weniger Richtungen beschreiben lässt.
Deshalb stellt LoRA die Änderung als Produkt zweier schmaler Matrizen dar. Zusammen haben diese schmalen Matrizen weit weniger Zellen als die große Tabelle. Die gemeinsame Größe der beiden Matrizen nennt man dann den Rang.
Der Ablauf sieht so aus:
- Sie frieren die Gewichte des Basismodells ein, sie ändern sich also nie.
- Sie hängen kleine LoRA Matrizen an die gewählten Schichten.
- Sie trainieren ausschließlich diese kleinen Matrizen.
- Bei der Inferenz addieren Sie ihren Beitrag zur Ausgabe des Basismodells.
Ein höherer Rang gibt der Anpassung mehr Kapazität, vergrößert aber auch Datei und Speicherbedarf. Daher ist der Rang eine Einstellung, die Sie durch Versuche bestimmen. Details finden Sie in der Hugging Face PEFT Dokumentation.
Was bedeuten Rang und Zielschichten bei LoRA?
Wer mit LoRA arbeitet, begegnet einigen Kerneinstellungen. Die Namen unterscheiden sich leicht je nach Bibliothek, die Ideen bleiben gleich.
- Rang: Die gemeinsame Größe der kleinen Matrizen. Ein höherer Rang bedeutet mehr Anpassungskapazität und eine größere Datei.
- Zielschichten: Die Teile des Modells, an die Sie LoRA Matrizen hängen.
- Skalierungsfaktor: Er steuert, wie stark die Anpassung in die Ausgabe des Basismodells einfließt.
- Dropout: Er schaltet im Training zufällig einzelne Verbindungen ab und senkt so das Risiko von Overfitting.
Einen einzigen richtigen Wert gibt es daher nicht. Zunächst starten Sie mit den Standardwerten der Bibliothek. Danach ändern Sie in kleinen Versuchen Rang oder Zielschichten und vergleichen das Ergebnis auf Ihrem Testdatensatz. Genaue Definitionen finden Sie in der Hugging Face PEFT Dokumentation.
Warum ist LoRA schlanker als vollständiges Finetuning?
Der Grund ist einfach: LoRA trainiert viel weniger Parameter. Weniger Parameter bedeuten weniger Gradienten, weniger Optimierungsdaten und deshalb weniger GPU Speicher. Auf derselben Hardware können Sie deshalb sogar ein größeres Basismodell ausprobieren.
Zudem gewinnen Sie bei der Ablage. Statt eines vollen Modells pro Aufgabe speichern Sie eine kleine Anpassungsdatei. Auf einem Basismodell halten Sie getrennte Anpassungen für Support Antworten, Produktbeschreibungen und Zusammenfassungen bereit.
Die Hugging Face PEFT Dokumentation beschreibt die Idee so: Die Methoden stimmen nur wenige zusätzliche Parameter ab, senken Rechen und Speicherkosten und liefern eine Leistung, die dem vollständigen Finetuning nahekommt. Dadurch sind große Modelle auch auf Standardhardware besser erreichbar.
Varianten wie QLoRA verbinden LoRA mit Quantisierung. Dieses Detail liegt allerdings außerhalb dieses Artikels.
Was unterscheidet Finetuning, RAG, Prompting und Distillation?
Diese vier Begriffe verwechselt man nämlich oft, denn alle zielen auf bessere Ergebnisse. Alle helfen, bessere Ergebnisse aus einem Modell zu holen, doch jeder löst ein anderes Problem. Die folgende Tabelle gibt einen kurzen Vergleich.
| Ansatz | Was er tut | Passt am besten zu | Hauptgrenze |
|---|---|---|---|
| Prompt Engineering | Fügt der Eingabe Anweisungen und Beispiele hinzu | Schnelle Tests, Format und Tonfall | Lange Anweisungen verteuern jeden Aufruf |
| RAG | Holt vor der Antwort passende Dokumentteile | Aufgaben mit aktuellen Fakten und Quellen | Die Suchqualität begrenzt die Antwort |
| Finetuning | Passt Modellgewichte mit Beispielen an | Gleichbleibendes Format und Tonfall, wiederkehrende Aufgaben | Braucht Datenaufbereitung und Bewertung |
| LoRA | Friert das Basismodell ein und trainiert kleine Zusätze | Finetuning auf begrenzter Hardware | Braucht trotzdem gute Daten |
| Distillation | Bringt einem kleinen Modell das Verhalten eines großen bei | Ein schnelles, günstiges kleines Modell | Braucht zuerst ein starkes Lehrermodell |
Die Nachbarthemen behandeln wir in eigenen Artikeln: Was ist RAG, Was ist Knowledge Distillation und Was sind Embeddings. Daher wiederholen wir sie hier nicht.
Was ist Finetuning im Vergleich zu Prompting und RAG, und wann genügen diese?
Für die meisten Unternehmen gilt diese Reihenfolge: zuerst Prompting, bei Bedarf RAG, zuletzt Finetuning. Der Leitfaden zur Modelloptimierung von OpenAI empfiehlt einen ähnlichen Ablauf. Bauen Sie zuerst Evals auf, verbessern Sie dann Ihre Prompts und gehen Sie erst danach zum Finetuning.
Prompting reicht aus, wenn:
- Das Modell die Aufgabe schon richtig löst und Sie nur das Format anpassen.
- Wenige gute Beispiele die Ausgabe korrigieren. Lesen Sie dazu unsere Anleitung zu Few Shot Prompting.
- Ihre Anweisungen kurz bleiben und es nicht stört, sie bei jedem Aufruf mitzusenden.
RAG passt besser, wenn sich Ihre Informationen oft ändern, Sie Quellen nennen müssen oder die Dokumente groß sind. Der Grund: Bei RAG aktualisieren Sie ein Dokument, nicht das Modell.
Daher ist der Wunsch "das Modell soll unser Unternehmen kennen" meist eine RAG Frage. Finetuning betrifft also eher Verhalten als Wissen.
Welche Arten von Finetuning gibt es?
Finetuning ist eine Familie von Methoden, keine einzelne. Deshalb beschreiben die Dokumentationen der Anbieter die Arten getrennt. Zum Beispiel nennt der Leitfaden zur Modelloptimierung von OpenAI überwachtes Finetuning, Finetuning mit Bildern, Direct Preference Optimization und verstärkendes Finetuning.
Auf Konzeptebene genügen drei Ideen:
- Überwachtes Finetuning: Sie zeigen Paare aus Eingabe und Idealantwort. Das Modell lernt, sie nachzuahmen.
- Präferenzbasierte Anpassung: Sie zeigen zusammen eine gute und eine schlechte Antwort. Das Modell lernt, welche man bevorzugt.
- Verstärkende Anpassung: Ein Bewerter vergibt Punkte für Antworten. Das Modell bewegt sich zu Verhalten, das höhere Punkte bringt.
Bei ersten Versuchen nutzen Unternehmen meist das überwachte Finetuning, denn es lässt sich am leichtesten vorbereiten. Welche Art ein Modell anbietet, kann sich allerdings ändern. Prüfen Sie daher die aktuellen Optionen in der offiziellen Dokumentation des Anbieters.
Wann ist Finetuning wirklich sinnvoll?
Wer fragt, was ist Finetuning wert, braucht vor allem ein Entscheidungskriterium. Finetuning lohnt sich, wenn Sie ein wiederkehrendes Verhaltensproblem haben, das Prompting nicht löst. Wenn Sie Hunderte richtiger Beispiele besitzen und Konsistenz zählt, ist es ein starker Kandidat.
Typische gute Einsatzfälle sind:
- Festes Format: Die Ausgabe muss jedes Mal dem gleichen strukturierten Muster folgen.
- Markenstimme: Texte sollen einen bestimmten Ton und eine bestimmte Wortwahl halten.
- Klassifikation mit festen Labels: Sie müssen eingehende Anfragen in feste Kategorien sortieren.
- Kürzere Prompts: Sie wollen Verhalten ins Modell einbauen, statt bei jedem Aufruf lange Anweisungen zu senden.
- Bedarf an kleinerem Modell: Sie wollen ein kleineres Modell auf eine Aufgabe spezialisieren.
Allerdings gehört eine Warnung in die Gegenrichtung dazu. Lautet Ihr Problem "das Modell nennt falsche Fakten", dann löst Finetuning allein es nicht. Wie unser Artikel zur KI Halluzination zeigt, brauchen Sie außerdem Quellen und eine Prüfschicht.
Wie bereiten Sie Daten für das Finetuning vor?
Die Daten sind der wichtigste Teil des Finetunings. Denn das Modell ahmt nach, was Sie ihm zeigen. Fehlerhafte oder widersprüchliche Beispiele erzeugen daher fehlerhaftes und widersprüchliches Verhalten.
Gehen Sie so vor:
- Schreiben Sie das Ziel in einem Satz auf. Was genau soll das Modell besser können?
- Sammeln Sie Beispiele aus echten Eingaben und legen Sie für jede die ideale Antwort fest.
- Vereinheitlichen Sie die Beispiele in einem Format. Anbieter verlangen oft zeilenbasierte Dateien wie JSONL. Das genaue Format steht in der Dokumentation des Anbieters.
- Entfernen oder maskieren Sie personenbezogene Daten.
- Halten Sie einen Teil der Daten für Tests zurück, statt darauf zu trainieren.
Eine genaue Zahl an Beispielen können wir daher nicht nennen. Sie hängt von der Schwierigkeit der Aufgabe und vom Anbieter ab. Starten Sie mit einem kleinen, sauberen Satz und messen Sie, denn das schlägt einen großen, chaotischen Satz. Außerdem lohnt es sich, kleine Stapel von Hand zu prüfen. Das kostet dann viel weniger, als später Fehler zu suchen. Bei knappen Daten sind synthetische Daten eine Option, prüfen Sie sie aber sorgfältig.
Was ist Overfitting und woran erkennen Sie es?
Overfitting heißt, dass das Modell die Trainingsbeispiele auswendig lernt und bei neuen Eingaben versagt. Es gleicht einem Schüler, der alte Prüfungsfragen paukt und bei einer neuen Frage erstarrt.
Beim Finetuning ist dieses Risiko real, denn die Datensätze sind meist klein. Trainieren Sie zu viele Runden, klammert sich das Modell an Ihre Beispiele. Dadurch kann seine allgemeine Fähigkeit nachlassen. Konkret leidet oft die Vielfalt der Antworten.
Achten Sie auf diese Anzeichen:
- Der Fehler auf den Trainingsdaten sinkt, auf zurückgehaltenen Testdaten bleibt er gleich oder steigt.
- Das Modell zwingt das gelernte Muster auf neue und andere Fragen.
- Antworten wirken zu ähnlich, und die Vielfalt verschwindet.
- Die Qualität bei allgemeinen Aufgaben sinkt, die das Modell vorher gut löste.
Zum Beispiel setzt ein Support Modell plötzlich die Begrüßung aus Ihren Trainingsbeispielen an jede Antwort. Das ist ein klassisches Zeichen für Auswendiglernen. Kunden bemerken es nämlich sofort.
Zur Vorbeugung begrenzen Sie die Trainingsrunden, nutzen Validierungsdaten und machen den Datensatz vielfältiger. Halten Sie außerdem die Leistung des Basismodells vor dem Start fest. Somit erkennen Sie jeden Rückschritt.
Wie messen Sie das Ergebnis des Finetunings?
Finetuning ohne Messung gleicht einer Reise ohne Richtung. Zunächst legen Sie fest, was Erfolg bedeutet. Danach lassen Sie denselben Testsatz vor und nach dem Finetuning laufen.
Ein praktischer Messplan sieht so aus:
- Bauen Sie einen Testsatz, der die echte Nutzung abbildet.
- Halten Sie die Ergebnisse des Basismodells und Ihres besten Prompts fest.
- Prüfen Sie das feinabgestimmte Modell mit denselben Tests.
- Ergänzen Sie neben Kennzahlen auch eine menschliche Durchsicht.
- Testen Sie Randfälle und schädliche Ausgaben getrennt.
Beispielszenario: Ein E-Commerce Supportteam möchte ein Modell, das Rückgabeanfragen in Kategorien sortiert. Das Team baut einen kleinen Testsatz mit hundert Beispielanfragen (eine Beispielzahl). Steigt nach dem Finetuning die Quote richtiger Kategorien, hat das Team also einen Beleg für den Gewinn.
Entscheiden Sie also nie anhand weniger schöner Beispiele.
Welche Hardware und Kostenkonzepte sind beim Finetuning wichtig?
Die Kosten setzen sich aus mehreren Posten zusammen: Datenaufbereitung, Rechenleistung fürs Training, Zahl der Versuche und späterer Betrieb des Modells. Konkrete Preise nennen wir hier nicht. Preise ändern sich je nach Anbieter und Zeit, prüfen Sie daher aktuelle Werte auf der offiziellen Preisseite.
Diese Konzepte bestimmen die Hardware Seite:
- GPU Speicher: Modellgröße und Trainingsmethode legen den nötigen Speicher fest. LoRA senkt diesen Bedarf, weil es weniger Parameter trainiert.
- Trainingsdauer: Sie wächst mit Datenmenge und Rundenzahl.
- Zahl der Versuche: Die beste Einstellung finden Sie selten beim ersten Mal.
- Inferenzkosten: Sie zahlen weiter, in Gebühren oder Hardwarenutzung, sobald Sie das trainierte Modell betreiben.
Außerdem können Sie zwischen dem verwalteten Finetuning eines Anbieters und dem Training auf eigenem Server wählen. Wenn Sie lieber selbst betreiben, helfen unser GPU Server Ratgeber und der Artikel zu lokalen Modellen mit Ollama. Wie die nutzungsbasierte Abrechnung funktioniert, lesen Sie unter Was ist ein Token.
Wie schützen Sie beim Finetuning und bei LoRA den Datenschutz?
Finetuning Daten enthalten oft Kundennachrichten, interne Dokumente oder personenbezogene Daten. Laden Sie sie bei einem externen Anbieter hoch, dann müssen Sie wissen, wohin sie gehen, wie lange sie bleiben und ob sie ins Modelltraining einfließen. Prüfen Sie das deshalb in der offiziellen Dokumentation des Anbieters zur Datenverarbeitung.
Die wichtigsten Schutzmaßnahmen:
- Entfernen oder maskieren Sie personenbezogene Daten, bevor sie in den Trainingssatz gelangen.
- Streichen Sie Felder, die Sie nicht brauchen, etwa Telefonnummern, Adressen und Ausweisnummern.
- Protokollieren Sie, wer Daten hochgeladen hat und wer Zugriff besitzt.
- Verhindern Sie, dass Mitarbeitende Daten in unkontrollierte Werkzeuge laden. Unser Artikel zu Shadow AI behandelt dieses Risiko.
- Bei sehr sensiblen Daten prüfen Sie stattdessen eine Lösung auf eigener Infrastruktur.
Noch ein Punkt: Ein feinabgestimmtes Modell kann Muster aus den Trainingsdaten behalten und in der Ausgabe wiederholen. Der sicherste Weg ist daher, vertrauliche Informationen gar nicht erst in den Trainingssatz zu legen.
Hinweis: Dieser Abschnitt ist allgemeine Information und keine Rechtsberatung. Bei Pflichten nach der DSGVO sprechen Sie mit Ihrer Rechtsberatung. Webseitenseitig hilft unser DSGVO Leitfaden für Websites.
Was ist Finetuning und welche Fehler passieren dabei am häufigsten?
In der Praxis entstehen Fehler meist bei der Vorbereitung, nicht in der Technik selbst. Gehen Sie daher diese Liste vor dem Start durch.
- Start ohne Messung: Ohne Erfolgskennzahl erkennen Sie nicht, ob das Finetuning geholfen hat.
- Wissensproblem als Verhaltensproblem gedeutet: Fehlen dem Modell aktuelle Fakten, brauchen Sie RAG statt Finetuning.
- Training mit chaotischen Daten: Antworten in verschiedenen Stilen machen das Modell unstabil.
- Testdaten im Training: Die Ergebnisse sehen dann besser aus, als sie sind.
- Zu langes Training: Mehr Runden bringen nicht immer bessere Ergebnisse.
- Vergessene Pflege: Wenn sich Daten und Basismodell ändern, braucht auch die Anpassung eine Erneuerung.
Die meisten dieser Fehler sind billig, weil Sie sie in einem kleinen Versuch finden. Teuer wird es dagegen, wenn Sie unbemerkt live gehen.
Welche Grenzen und Risiken erschweren das Finetuning?
Finetuning ist allerdings keine Zauberlösung. Wer die Grenzen kennt, spart daher vergeudete Zeit.
Die häufigsten Risiken:
- Schlechte Daten, schlechtes Modell: Falsche Beispiele machen falsches Verhalten dauerhaft.
- Overfitting: Kleine Datensätze bergen ein hohes Risiko des Auswendiglernens.
- Vergessen: Das Modell kann bei manchen früher gut gelösten Aufgaben schlechter werden.
- Veralten: Wissen, das Sie ins Modell trainiert haben, braucht bei Änderungen ein neues Training.
- Pflegeaufwand: Ändert sich das Basismodell, müssen Sie das Finetuning eventuell wiederholen.
- Keine Quellenangabe: Ein feinabgestimmtes Modell kann nicht sagen, aus welchem Dokument ein Fakt stammt.
Außerdem löst Finetuning Sicherheitsprobleme nicht von selbst. Angriffe über Nutzereingaben brauchen eigene Überlegungen, etwa Prompt Injection und Schutzgeländer. Planen Sie Finetuning also zusammen mit Bewertung, Überwachung und Sicherheitsmaßnahmen, nie allein.
Wo setzen Teams Finetuning und LoRA in der Praxis ein?
Die folgenden Szenarien sind Beispielszenarien und keine echten Kundenergebnisse.
Ton der Support Antworten. Ein E-Commerce Unternehmen möchte, dass jede Support Antwort im gleichen höflichen, kurzen Stil kommt. Zudem verteuern lange Anweisungen jeden Aufruf. Das Unternehmen trainiert deshalb eine kleine LoRA Anpassung mit freigegebenen Antworten und kürzt den Prompt.
Anfragen klassifizieren. Ein Softwareteam will eingehende Fehlermeldungen in feste Labels sortieren. Weil beschriftete frühere Meldungen vorliegen, ist Finetuning ein guter Kandidat.
Strukturierte Ausgabe. Ein Betriebsteam möchte aus Freitext jedes Mal eine Zusammenfassung mit denselben Feldern. Finetuning kann hier die Formatkonsistenz erhöhen.
Fachbegriffe. In einer technischen Branche müssen Abkürzungen stimmen. Zum Beispiel hilft Finetuning hier. Kommt es allerdings auf aktuelle technische Dokumente an, ist die Kombination mit RAG oft robuster.
Wer wissen will, was ist Finetuning in der Praxis, findet hier die Antwort. Gemeinsam ist diesen Fällen ein wiederholbares, messbares Verhalten. Dagegen gehören täglich wechselnde Inhalte wie Preislisten oder Aktionsdetails nicht ins Modell. Stattdessen aktualisiert ein Retrieval Aufbau sie viel leichter. Sie können beides kombinieren: Finetuning trägt Format und Ton, RAG trägt die aktuellen Fakten.
Wie nehmen Sie ein feinabgestimmtes Modell in Betrieb und halten es aktuell?
Mit dem Training ist es allerdings nicht getan. Den Betrieb aufzunehmen und den Qualitätsverlust zu verhindern, kostet eigenen Aufwand.
Konkret haben Sie mit LoRA zwei Wege. Entweder lassen Sie die Anpassungsdatei neben dem Basismodell liegen und laden sie zur Laufzeit, oder Sie verschmelzen die Anpassung mit dem Basismodell. Außerdem entsteht laut LoRA Paper bei diesem Ansatz keine zusätzliche Verzögerung bei der Inferenz.
Nach der Einführung tun Sie Folgendes:
- Ziehen Sie regelmäßig Stichproben echter Nutzereingaben und prüfen Sie die Qualität.
- Sammeln Sie falsche Antworten und machen Sie daraus die nächsten Trainingsdaten.
- Versehen Sie Anpassungsdateien mit Versionsnummern, damit Sie zurückgehen können.
- Führen Sie Ihre Tests erneut aus, wenn der Anbieter des Basismodells eine Änderung ankündigt.
Ändern sich Ihre Informationen häufig, erleichtert RAG die Pflege, weil Sie aktuelle Dokumente abrufen, statt Wissen ins Modell zu trainieren.
Welche Checkliste sollten Sie vor dem Finetuning durchgehen?
Prüfen Sie die folgende Liste vor dem Start. Wenn jeder Punkt ein Ja ist, dann ergibt Finetuning Sinn.
- Haben Sie Prompt Engineering und Beispiele im Prompt wirklich ausprobiert?
- Handelt es sich um ein Verhaltens oder Formatproblem und nicht um fehlendes Wissen?
- Besitzen Sie gute Beispiele, die das Zielverhalten zeigen?
- Gibt es einen separaten Testsatz, auf den Sie nicht trainieren?
- Haben Sie die Erfolgskennzahl klar festgelegt?
- Sind personenbezogene und vertrauliche Daten bereinigt?
- Haben Sie die Datennutzungsbedingungen des Anbieters gelesen und dokumentiert?
- Existiert ein Pflegeplan für den Fall, dass sich das Basismodell ändert?
- Haben Sie die Kosten mit aktuellen Werten von der offiziellen Preisseite berechnet?
Lautet eine Antwort nein, lösen Sie das also zuerst. Oft kommt der größte Gewinn aus der Daten und Messarbeit vor dem Finetuning.
Zum Beispiel bringt allein das Ausfüllen dieser Liste manche Teams davon ab, überhaupt zu trainieren. Sie sehen dann, dass das eigentliche Problem ein vager Prompt oder ein dünner Dokumentenbestand war. Somit spart das Zeit und Budget. Außerdem sprechen danach alle im Team über dasselbe Ziel. Kurz gesagt schafft die Liste eine gemeinsame Sprache vor der technischen Entscheidung.
Wie gehen Sie ein Finetuning schrittweise an?
Klein starten und durch Messung wachsen ist daher der sicherste Weg. Denn die Kosten eines Finetunings entstehen meist in wiederholten Versuchen, nicht im ersten.
Wir empfehlen diesen Ablauf:
- Erkundung: Schreiben Sie Problem, aktuelle Antworten und die erwartete Ausgabe auf.
- Basislinie: Messen Sie, was Prompting und bei Bedarf RAG bereits leisten.
- Kleiner Versuch: Probieren Sie eine leichte Methode wie LoRA mit einem sauberen Datensatz.
- Bewertung: Vergleichen Sie anhand des Testsatzes und einer menschlichen Durchsicht.
- Entscheidung: Rechtfertigt der Gewinn die Kosten, machen Sie weiter. Sonst kehren Sie zu Prompting oder RAG zurück.
- Überwachung: Verfolgen Sie nach dem Start Qualität und Rückmeldungen.
Die allgemeine Logik großer Sprachmodelle erklärt der Artikel Was sind große Sprachmodelle. Für die Prompt Seite ist unser Leitfaden zu Prompt Engineering ein guter Einstieg.
Wie unterstützt unser Team bei Finetuning und LoRA?
Als Talha Aslan und Team sehen wir in der Praxis ein klares Bild: Viele Unternehmen erreichen ihr Ziel ohne Finetuning, mit einem gut gebauten Prompt und einer dokumentenbasierten Lösung. Deshalb klären wir zuerst gemeinsam, ob Finetuning wirklich nötig ist.
Ist es nötig, dann planen wir Datenaufbereitung, Bewertungsplan und Anwendungsarchitektur gemeinsam mit Ihnen. Für Lösungen auf eigener Infrastruktur sehen Sie sich unsere Seite zum lokalen LLM an. Den größeren Rahmen zeigt unsere Seite zur KI Automatisierung.
Was ist Finetuning am Ende? Ein Werkzeug mit klarer Antwort, doch ob es passt, entscheiden allein Ihre Daten und Ihr Ziel. Allerdings garantieren wir kein Ergebnis. Deshalb hält ein kleiner Versuch Budget und Erwartungen gesund.



