Künstliche Intelligenz

Was ist Prompt Caching? So senken Sie KI API Kosten und Latenz

Talha Aslan 18 Minuten Lesezeit 2 Aufrufe

Was ist Prompt Caching?

Prompt Caching ist eine Funktion von KI APIs, die den wiederkehrenden Anfang eines Prompts (Systemanweisung, Dokument, Tooldefinitionen) auf der Anbieterseite speichert und bei späteren Anfragen ohne erneute Verarbeitung nutzt. Das Modell liest denselben Text also nicht jedes Mal von vorn, sodass Kosten und Wartezeit sinken, während die Qualität der Antwort gleich bleibt.

Zunächst ein einfacher Vergleich. Stellen Sie sich eine Mitarbeiterin vor, die für jeden neuen Kunden dieselbe lange Arbeitsanweisung erneut liest. Hätte sie die Anweisung einmal gelesen und eine Zusammenfassung auf dem Schreibtisch, bräuchte sie nur noch die neue Frage zu lesen. Prompt Caching ist genau diese Abkürzung.

Allerdings ist ein Detail wichtig. Der Anbieter speichert nicht die Antwort des Modells, sondern den verarbeiteten Zustand des ersten Prompt Teils. Anders gesagt, das Modell schreibt bei jeder Anfrage eine frische Antwort und überspringt nur die wiederholte Lesearbeit.

In diesem Leitfaden beantworten wir, was ist Prompt Caching, auf der Ebene des Konzepts. Außerdem nennen wir bewusst keine Zahlen, die schnell veralten, etwa Modellnamen, Preise oder Zeitgrenzen. Aktuelle Werte prüfen Sie auf den offiziellen Seiten des Anbieters.

Wie funktioniert Prompt Caching?

Ein Sprachmodell zerlegt Text zunächst in Einheiten, die Tokens heißen. Danach berechnet es für jede Einheit Zwischenzustände, die der Aufmerksamkeitsmechanismus später nutzt. Bei einem langen Prompt macht diese Vorverarbeitung den größten Teil des Aufwands aus.

Danach hält der Anbieter diese Zwischenzustände kurze Zeit vor. Beginnt eine neue Anfrage mit demselben Inhalt, berechnet er diesen Teil nicht neu. Stattdessen lädt er den gespeicherten Zustand und verarbeitet nur den neuen Teil. Die Übereinstimmung muss exakt sein, denn schon ein einziges geändertes Zeichen beendet den Treffer an dieser Stelle.

  1. Eine Anfrage kommt an, und der Anbieter vergleicht ihren Anfang mit bereits bekannten Inhalten.
  2. Findet er das längste passende Präfix, nutzt er die gespeicherten Zwischenzustände erneut.
  3. Den restlichen Teil verarbeitet er ganz normal und erzeugt die Antwort.
  4. Bei Bedarf speichert er auch das neue Präfix, damit die nächste Anfrage davon profitiert.

Allerdings ändert sich für die Nutzer bei diesem Ablauf nichts. Dieselbe Anfrage liefert mit oder ohne Cache dieselbe Art von Antwort. Stattdessen sehen Sie den Unterschied nur bei der Rechenlast im Hintergrund und auf Ihrer Rechnung.

Was bedeuten festes Präfix und variabler Suffix?

Erstens können Sie jeden Prompt in zwei Teile gliedern. Der erste Teil bleibt in jeder Anfrage gleich, und wir nennen ihn das feste Präfix. Dazu gehören Systemanweisungen, Rollenbeschreibungen, Regeln, Beispiele, Tooldefinitionen und Referenzdokumente. Der zweite Teil ändert sich bei jeder Anfrage, und wir nennen ihn den variablen Suffix: die Frage des Nutzers, das aktuelle Datum und sitzungsbezogene Daten.

Der Cache greift nur beim gemeinsamen Teil, der ganz am Anfang beginnt. Deshalb ist die Reihenfolge entscheidend. Setzen Sie feste Inhalte nach vorn und variable Inhalte nach hinten. Sonst zerstört eine kleine Änderung am Anfang den Treffer für alles, was danach kommt.

  • Festes Präfix: Markenstimme, Sicherheitsregeln, Ausgabeformat und häufig genutzte Dokumente.
  • Halbfester Teil: Gesprächsverlauf, der während einer Sitzung gleich bleibt.
  • Variabler Suffix: die neue Nutzernachricht und Angaben zum jeweiligen Moment.

Zum Beispiel beginnt jede Anfrage anders, wenn Sie die aktuelle Uhrzeit in die erste Zeile der Systemanweisung schreiben. Verschieben Sie dieselbe Angabe in den Suffix, bleibt das Präfix stabil und der Cache greift.

Was ist Prompt Caching und warum senkt es die Kosten?

Weil KI APIs in der Regel die verarbeiteten Eingabetokens und die erzeugten Ausgabetokens berechnen, kostet Wiederholung Geld. Wenn Sie eine lange Systemanweisung mit jeder Anfrage erneut senden, zahlen Sie immer wieder für dieselben Tokens. Somit senkt ein Cache den Preis dieser Wiederholung.

Bei den meisten Anbietern ist die Logik ähnlich. Das erste Schreiben eines Präfixes in den Cache kann anders berechnet sein als normale Eingabe, während spätere Lesezugriffe deutlich günstiger sind. Folglich hängt Ihr Gewinn davon ab, wie oft Sie dasselbe Präfix wiederverwenden. Bei einer einmaligen Anfrage dürfen Sie keine Ersparnis erwarten.

Rabattsätze und Schreibpreise nennen wir hier bewusst nicht. Sie unterscheiden sich nach Anbieter und Modell, und die Anbieter passen sie im Lauf der Zeit an. Prüfen Sie den aktuellen Satz auf der offiziellen Preisseite des Anbieters.

Um die Ersparnis mit Ihren eigenen Preisdaten zu testen, nutzen Sie unseren Prozentrechner. Tragen Sie zuerst Ihr monatliches Volumen an Eingabetokens ein, danach den Anteil des festen Präfixes. So erhalten Sie einen groben Eindruck vom möglichen Gewinn.

Wie wirkt sich Prompt Caching auf die Antwortzeit aus?

Zudem sinkt neben den Kosten auch die Wartezeit. Muss das Modell ein langes Präfix nicht von Grund auf verarbeiten, beginnt es früher mit dem ersten Token. Konkret erleben Nutzer das als Assistenten, der schneller zu antworten beginnt.

Am stärksten wirkt der Effekt bei Aufgaben mit sehr langer Eingabe und kurzer Ausgabe. Denken Sie zum Beispiel an einen Ablauf, der einen langen Vertrag liest und eine Zusammenfassung in einem Satz zurückgibt. Der größte Teil der Wartezeit entsteht hier beim Verarbeiten der Eingabe, daher macht der Cache einen klaren Unterschied.

Andererseits bleibt der Effekt begrenzt, wenn die Ausgabe sehr lang ist. Das Erzeugen einer Antwort ist eine andere Arbeit als das Lesen der Eingabe, und der Cache beschleunigt nur die Leseseite. Richten Sie Ihre Erwartung also nach der Form Ihrer Last.

Also schätzen Sie den Zeitgewinn nicht, sondern messen Sie ihn. Dieselbe Anfrage zweimal zu senden und beide Antwortzeiten zu vergleichen, ist ein guter erster Schritt.

Wann hilft Prompt Caching?

Kurz gesagt schafft ein Cache überall Nutzen, wo derselbe große Inhalt immer wieder gesendet wird. Das gemeinsame Muster ist einfach: Das Präfix ist lang, die Anfragen kommen dicht nacheinander, und der veränderliche Teil ist klein.

  • Lange Systemanweisungen: Assistenten mit Markenstimme, Richtlinientext und Ausgaberegeln.
  • Feste Dokumente: Abläufe, in denen viele Fragen dasselbe Handbuch, denselben Vertrag oder Produktkatalog betreffen.
  • Mehrstufige Chats: Bots, die den unveränderten Anfang des Verlaufs in jeder Runde erneut senden.
  • Prompts mit vielen Beispielen: Klassifikations und Formatierungsaufgaben mit festen Beispielpaaren.
  • Agenten mit Tools: Schleifen, in denen lange Tooldefinitionen bei jedem Schritt gleich bleiben.

Vor allem bei Agenten ist der Gewinn groß. Ein Agent ruft das Modell für eine einzige Aufgabe viele Male auf und sendet bei jedem Aufruf dieselben Anweisungen und dieselbe Toolliste. Der Cache senkt die Kosten dieser Wiederholung deutlich. Deshalb ist es bei Abläufen mit Function Calling wichtig, die Tooldefinitionen stabil zu halten.

Wann hilft Prompt Caching nicht?

Ein Cache findet nichts, wenn sich der Prompt in jeder Anfrage schon ab dem ersten Token unterscheidet. Einmalige Aufgaben, die für jeden Nutzer einen völlig eigenen Text erzeugen, haben zum Beispiel kein gemeinsames Präfix.

Zweitens ist auch ein kurzer Prompt ein Problem. Anbieter legen eine Mindestlänge für das Caching fest, und Prompts darunter gelangen nie in den Cache. Weil die Schwelle je nach Modell abweicht, prüfen Sie den aktuellen Wert in der offiziellen Dokumentation.

Der dritte Fall ist eine Pause zwischen den Anfragen, die länger als die Lebensdauer des Caches dauert. Läuft der Eintrag ab, schreibt der Anbieter das Präfix neu, und die erste Anfrage kommt wieder zum vollen Preis oder zum Schreibpreis. Bei einer Anwendung mit seltenem Verkehr bleibt der Gewinn daher womöglich gering.

  • Ein kurzes Präfix bringt keinen Gewinn.
  • Ein Präfix, das sich bei jeder Anfrage ändert, trifft nie.
  • Seltene Anfragen lassen den Eintrag ablaufen.
  • Nutzerbezogene Daten ganz oben lassen keinen gemeinsamen Teil übrig.

Wie bieten die großen Anbieter Prompt Caching an?

Die Anbieter unterscheiden sich im Detail, doch es gibt zwei gemeinsame Wege: automatisches Caching und ausdrückliche Steuerung. Zunächst erkennt im automatischen Modus der Anbieter passende Präfixe selbst. Im ausdrücklichen Modus markieren Sie, wo der zwischenspeicherbare Abschnitt endet.

Die Dokumentation von OpenAI empfiehlt, stabile Anweisungen und gemeinsames Referenzmaterial nach vorn und veränderliche Inhalte nach hinten zu setzen. Anthropic beschreibt in der Dokumentation eine Cache Reihenfolge entlang von Tools, System und Nachrichten mit markierten Haltepunkten. Google hält fest, dass implizites Caching standardmäßig läuft, und rät dazu, große gemeinsame Inhalte an den Anfang des Prompts zu setzen.

Diese drei Seiten sind ein guter Einstieg: der Leitfaden zu Prompt Caching von OpenAI, die Dokumentation zu Prompt Caching von Anthropic und die Dokumentation zum Caching bei Google Gemini. Feldnamen und Einstellungen können sich ändern, daher lesen Sie vor dem Bau die aktuellen Fassungen.

Wenn Sie einen allgemeineren Einstieg in die Schnittstelle suchen, lesen Sie unsere Anleitung zur OpenAI API.

Warum sind Lebensdauer und Mindestlänge des Caches wichtig?

Zunächst lebt ein Cache nicht ewig. Der Anbieter hält den Eintrag nur begrenzte Zeit vor, und nutzt eine neue Anfrage in dieser Zeit dasselbe Präfix, verlängert sich die Lebensdauer häufig. Wie lang sie ist, hängt vom Anbieter, vom Modell und von der gewählten Option ab.

In der Praxis heißt das: Bei dichtem Verkehr bleibt der Eintrag frisch, denn er wird oft genutzt. Bei seltenem Verkehr fällt der Eintrag zwischen den Anfragen heraus. Manche Anbieter bieten eine längere Aufbewahrung an; auf der offiziellen Preisseite sehen Sie, ob sie zusätzlich kostet.

Allerdings ist die Mindestlänge ebenso wichtig. Liegt Ihr Präfix unter der Schwelle, entsteht kein Eintrag, auch wenn Sie es markieren. Dann denken Sie womöglich, der Cache sei defekt, dabei ist der Prompt schlicht nicht lang genug.

Schreiben Sie Werte für Lebensdauer und Schwelle nicht fest in Ihre Produktdokumentation. Halten Sie sie stattdessen in einer Konfigurationsnotiz fest und prüfen Sie sie, sobald der Anbieter etwas ändert.

Wie messen Sie Treffer im Cache?

Raten Sie nicht, ob der Cache funktioniert, sondern lesen Sie es aus den Nutzungsfeldern der Antwort. Außerdem melden Anbieter bei jeder Antwort, wie viele Tokens aus dem Cache kamen. Bei OpenAI steht das im Feld `cached_tokens`, bei Anthropic in `cache_read_input_tokens` und `cache_creation_input_tokens`, und bei Google in einem Nutzungsfeld für zwischengespeicherte Tokens.

Allerdings können sich Feldnamen zwischen Versionen ändern. Prüfen Sie daher vor der Integration das offizielle Antwortschema.

Die Trefferquote verfolgen Sie mit einfacher Logik: Teilen Sie die zwischengespeicherten Tokens durch alle Eingabetokens. Ist die Quote niedrig, vermuten Sie, dass sich im Präfix ständig etwas ändert.

  1. Protokollieren Sie die Nutzungsangaben jeder Antwort.
  2. Summieren Sie zwischengespeicherte und neu geschriebene Tokens getrennt.
  3. Beobachten Sie die tägliche oder wöchentliche Trefferquote auf einem Dashboard.
  4. Sinkt die Quote, prüfen Sie die letzte Änderung (Anweisung, Toolliste, Reihenfolge) Schritt für Schritt.

Was ist der Unterschied zwischen Prompt Caching und einem Anwendungscache wie Redis?

Zunächst teilen beide Begriffe ein Wort, arbeiten aber auf verschiedenen Ebenen. Ein Anwendungscache liegt auf Ihrem Server und speichert meist eine Antwort oder ein Datenbankergebnis. Prompt Caching liegt beim Anbieter und speichert den Aufwand für die Verarbeitung der Modelleingabe.

Werkzeuge wie Redis oder Memcached eignen sich ideal, um auf dieselbe Anfrage genau dieselbe Antwort zu liefern. Dieses Thema haben wir im Artikel Caching erklärt mit Redis und Memcached behandelt. Prompt Caching friert dagegen die Antwort nicht ein; es macht nur den wiederholten Teil der Eingabe günstiger.

MerkmalPrompt CachingAnwendungscache (wie Redis)Semantischer Cache
Wo er läuftAuf den Servern des AnbietersIn Ihrer InfrastrukturIn Ihrer Infrastruktur, meist mit Vektorsuche
Was er speichertDen verarbeiteten Zustand des Prompt PräfixesEine fertige Antwort oder ein berechnetes ErgebnisAntworten auf ähnliche Fragen
Art des TreffersExakt dasselbe Präfix ab dem AnfangExakt derselbe SchlüsselEine inhaltlich ähnliche Frage
Ändert sich die AntwortDas Modell erzeugt sie jedes Mal neuDieselbe Antwort kommt zurückEine alte Antwort kann zurückkommen
HauptgewinnEingabekosten und WartezeitModellaufruf entfälltModellaufruf entfällt
HauptrisikoTrefferverlust bei geändertem PräfixVeraltete AntwortenFalsche Zuordnung

Beide ersetzen sich nicht gegenseitig, und sie können zusammenarbeiten. Nutzen Sie den Anwendungscache für häufige, identische Fragen und Prompt Caching für die übrigen Anfragen mit langer fester Anweisung.

Wie hängt Prompt Caching mit Tokens, Kontextfenster und RAG zusammen?

Benachbarte Begriffe verwechselt man leicht, daher zeichnen wir die Beziehung kurz nach. Erstens ist ein Token die Maßeinheit für Rechnung und Grenze. Das Kontextfenster ist die gesamte Textmenge, die das Modell auf einmal sieht. Prompt Caching vergrößert dieses Fenster nicht; es verarbeitet den wiederholten Teil im Fenster günstiger.

RAG findet beim Abruf die nötigen Dokumentteile und fügt sie dem Prompt hinzu. Folglich sind RAG und Cache keine Konkurrenten. Die gemeinsame Anweisung und die Vorlage gehören in den Cache, die abgerufenen Teile zu jeder einzelnen Frage in den Suffix.
BegriffWas er tutBeziehung zu Prompt Caching
TokenMaßeinheit für TextDer Cache senkt die Verarbeitungskosten der Tokens
KontextfensterGrenze für den auf einmal sichtbaren TextÄndert die Grenze nicht, macht den gefüllten Teil günstiger
RAGFindet passende Dokumentteile und fügt sie einFester Teil im Cache, abgerufene Teile im Suffix
Strukturierte AusgabeBringt die Antwort in ein vorgegebenes SchemaDie Schemadefinition kann im festen Präfix stehen
Fine TuningÄndert das Modellverhalten durch TrainingDer Cache ist eine Optimierung zur Laufzeit, kein Training

Wenn Sie die Antwort in einem festen Format möchten, lesen Sie unseren Artikel zu Structured Outputs. Weil das Schema konstant bleibt, steht es oft im Präfix und profitiert vom Cache.

Beispielszenario: Was bringt Prompt Caching einem Kundensupport Assistenten?

Dies ist ein Beispielszenario und kein echtes Kundenergebnis. Denken Sie zum Beispiel an den Support Assistenten eines Shops. Die Systemanweisung enthält also Markenstimme, Rückgaberichtlinie, Versandregeln und Antwortformat. Zudem hängen Sie an jede Anfrage eine Zusammenfassung des Produktkatalogs an.

Ohne Cache liest das Modell diesen langen Text bei jeder Kundennachricht erneut. Folglich erzeugt jede kurze Frage eine lange Eingaberechnung. Mit Cache stehen Anweisung und Katalog im festen Präfix und die Frage des Kunden im Suffix.

  1. Setzen Sie Systemanweisung, Richtlinientext und Katalogzusammenfassung ganz an den Anfang der Anfrage.
  2. Verschieben Sie Variablen wie Kundenname, Bestellnummer und aktuelles Datum ans Ende.
  3. Die erste Anfrage schreibt das Präfix, die späteren Anfragen lesen es.
  4. Verfolgen Sie die Trefferquote anhand der Nutzungsfelder.

Eine Prozentzahl oder Ersparnis nennen wir hier nicht, denn sie hängt von Ihrer Präfixlänge, Ihrem Verkehr und dem aktuellen Preis des Anbieters ab. Die Struktur ist dennoch klar: Je länger das Präfix und je dichter die Anfragen, desto größer der Gewinn.

Möchten Sie einen solchen Assistenten mit Ihren eigenen Firmendokumenten betreiben, beschreibt unsere Lösung KI Wissensassistent diese Architektur.

Ist Prompt Caching sicher, und worauf achten Sie beim Datenschutz?

Die Dokumentation der Anbieter hält fest, dass Caches nicht zwischen Organisationen geteilt sind. Zum Beispiel sagt OpenAI, dass Caches nicht organisationsübergreifend gelten und nicht über regionale Verarbeitungsgrenzen hinweg nutzbar sind. Außerdem schreibt Anthropic, dass Caches nicht zwischen Arbeitsbereichen geteilt sind.

Trotzdem bleibt gute Praxis nötig. Legen Sie keine nutzerbezogenen personenbezogenen Daten ins feste Präfix. Das Präfix ist der gemeinsame Punkt aller Anfragen innerhalb derselben Organisation oder desselben Arbeitsbereichs, daher müssen Sie den Geltungsbereich Ihrer Daten klar kennen.

  • Halten Sie Passwörter, Schlüssel und vertrauliche Dokumente aus dem Präfix heraus.
  • Verschieben Sie personenbezogene Daten möglichst in den Suffix und senden Sie sie nicht ohne Not.
  • Führen Sie die Daten verschiedener Kunden nicht im selben Präfix zusammen.
  • Lesen Sie die Bedingungen zu Speicherung und Verarbeitung in den offiziellen Datendokumenten des Anbieters.

Dieser Abschnitt ist keine Rechtsberatung. Für eine Anwendung unter der DSGVO prüfen Sie die Bedingungen der Datenverarbeitung gemeinsam mit Ihrer Rechtsberatung.

Welche Fehler machen Teams bei Prompt Caching am häufigsten?

Die meisten gescheiterten Versuche gehen also auf wenige gleiche Ursachen zurück. Dabei sind es selten Programmierfehler; meist ändern Teams das Präfix, ohne es zu merken.

  • Einen Zeitstempel oder eine zufällige Kennung an den Anfang der Systemanweisung schreiben.
  • Reihenfolge oder Inhalt der Toolliste bei jeder Anfrage ändern.
  • Nutzerbezogene Daten in das feste Präfix mischen.
  • An eine bestehende Nachricht Inhalt anhängen und den Treffer zerstören.
  • Anfrageeinstellungen wie Denk oder Bildoptionen von Anfrage zu Anfrage wechseln.
  • Das Präfix unter der Schwelle lassen und trotzdem einen Cache erwarten.

Die Dokumentation von Anthropic sagt klar, dass Änderungen an Tooldefinitionen, Systeminhalt und einigen Anfrageeinstellungen den Cache teilweise oder ganz ungültig machen können. Denken Sie daher an die Wirkung auf den Cache, bevor Sie eine Einstellung ändern.

Ein weiterer häufiger Fehler ist, den Gewinn anzunehmen, statt ihn zu messen. Außerdem berechnen manche Anbieter das Schreiben eines Präfixes zusätzlich, sodass das Markieren eines nie wiederverwendeten Präfixes sogar Geld kosten kann.

Welche Missverständnisse zu Prompt Caching sind verbreitet?

Wer fragt, was ist Prompt Caching, trägt oft eines von vier Missverständnissen mit sich. Das erste lautet, der Cache speichere die Antwort und gebe sie erneut aus. Tatsächlich erzeugt das Modell jedes Mal eine neue Antwort, und nur die Verarbeitung der Eingabe wird kürzer.

Das zweite Missverständnis ist, Caching gebe dem Modell ein Gedächtnis. Auch das stimmt nicht. Das Modell erinnert sich nicht an das frühere Gespräch; Sie senden den Verlauf bei jeder Anfrage erneut, und der Anbieter verkürzt die Arbeit am wiederholten Teil.

Das dritte Missverständnis lautet, Caching spare immer Geld. Bei kurzen Prompts, seltenem Verkehr und wechselnden Präfixen gibt es keinen Gewinn. Das vierte betrifft die Ausgabequalität; die Dokumentation stellt Caching jedoch nur als Funktion für mehr Effizienz dar.

Zudem ersetzt Caching nicht die Inferenz. Das Modell läuft weiter; es nutzt nur die Berechnung wieder, die es für den ersten Teil der Eingabe schon geleistet hat.

Was gehört in eine praktische Checkliste für Prompt Caching?

Wenn Sie sich noch fragen, was ist Prompt Caching für Ihr eigenes Produkt wert, gehen Sie vor dem Start einmal die folgende Liste durch. Jeder Punkt ist eine Entscheidung, und die meisten prüfen Sie in einer halben Stunde.

  1. Trennen Sie feste und variable Teile des Prompts und schreiben Sie beide auf.
  2. Setzen Sie feste Inhalte nach vorn und variable Inhalte nach hinten.
  3. Frieren Sie Reihenfolge und Text der Tooldefinitionen ein.
  4. Stellen Sie sicher, dass das Präfix über der Mindestlänge des Anbieters liegt.
  5. Prüfen Sie, ob Ihre Anfragefrequenz zur Lebensdauer des Caches passt.
  6. Protokollieren Sie Treffer aus den Nutzungsfeldern und beobachten Sie sie auf einem Dashboard.
  7. Nehmen Sie personenbezogene Daten und Geheimnisse aus dem Präfix.
  8. Lesen Sie den aktuellen Rabatt und Schreibpreis auf der offiziellen Preisseite.

Die Liste taugt für Entwickler und Verantwortliche gleichermaßen. Verantwortliche achten auf den ersten und letzten Punkt, also Kostenrechnung und Preisprüfung. Entwickler konzentrieren sich dagegen auf die technischen Punkte in der Mitte.

Danach beobachten Sie eine Woche lang die Trefferquote. Liegt sie unter Ihrer Erwartung, untersuchen Sie zuerst die Reihenfolge, dann die Einstellungsänderungen und zuletzt die Anfragefrequenz.

Welche Begriffe sollten Sie beim Thema Prompt Caching kennen?

In der Dokumentation begegnet Ihnen dieselbe Idee unter verschiedenen Namen. Ein kleines Glossar verringert die Verwirrung. Außerdem hilft es Ihrem Team, eine gemeinsame Sprache aufzubauen.

  • Präfix: der Teil des Prompts, der am Anfang beginnt und über Anfragen hinweg gleich bleibt.
  • Haltepunkt (Breakpoint): eine Markierung, die zeigt, wo der zwischenspeicherbare Abschnitt endet.
  • Treffer (Cache Hit): das Präfix liegt im Cache und kommt erneut zum Einsatz.
  • Fehlschlag (Cache Miss): es gibt keine Übereinstimmung, also läuft die Verarbeitung von vorn.
  • Schreiben und Lesen: das erste Speichern und die spätere Nutzung sind zwei Vorgänge, die getrennt berechnet sein können.
  • Lebensdauer (TTL): wie lange ein Eintrag besteht, wenn ihn niemand wiederverwendet.

Alle diese Begriffe führen zu einer Idee: denselben Anfang nutzen, ohne zweimal dafür zu zahlen. Die Namen der Einstellungen unterscheiden sich je nach Anbieter, die Logik bleibt gleich.

Wie wächst der Nutzen von Prompt Caching in mehrstufigen Chats?

Bei Chatbots geht mit jeder neuen Nachricht der gesamte Verlauf erneut an die API. Je länger das Gespräch, desto größer der gesendete Text, doch das Wachstum liegt immer am Ende. Weil der Anfang gleich bleibt, passt der Cache sehr gut zu dieser Struktur.

Zum Beispiel ist der Text der dritten Runde die zweite Runde plus eine neue Nachricht. Der Anbieter findet den Eintrag der zweiten Runde und verarbeitet nur die neue Nachricht. Daher bleiben die Zusatzkosten jeder Runde relativ konstant, auch wenn der Chat wächst.

Die einzige Falle ist das Umschreiben des Verlaufs. Alte Nachrichten zusammenzufassen, zu kürzen oder dazwischen Inhalt einzufügen, ändert das Präfix und macht den Cache wertlos. Müssen Sie den Verlauf kürzen, tun Sie es selten und mit Absicht.

Wozu dient das Vorwärmen des Caches?

Die erste Anfrage an einen Cache ist immer langsamer, denn das Präfix ist noch nicht gespeichert. Manche Anbieter erlauben eine Aufwärmanfrage, die das Präfix schreibt, bevor echte Nutzer kommen. Die Dokumentation von Anthropic beschreibt diesen Ansatz als Vorwärmen.

Vorwärmen lohnt sich vor allem bei Bildschirmen für Nutzer, die empfindlich auf Wartezeit reagieren. Zum Beispiel senden Sie vor Arbeitsbeginn eine Aufwärmanfrage, sodass der erste echte Nutzer auf einen bereiten Cache trifft. Allerdings bedeutet das eine zusätzliche Anfrage und zusätzliche Kosten.

Wärmen Sie deshalb nicht jede Anwendung vor. Messen Sie zuerst: Stört die langsame erste Anfrage Ihre Nutzer wirklich? Wenn nicht, ist das Vorwärmen unnötige Komplexität.

Wie bauen Sie eine Prompt Vorlage, wenn Sie wissen wollen, was ist Prompt Caching in der Praxis?

Die technische Antwort ist eine Vorlage, die den Prompt in Schichten gliedert. Die Schichten laufen vom am wenigsten zum am meisten veränderlichen Teil. Diese Reihenfolge passt genau zur Treffer Logik des Caches.

  1. Erstens Tooldefinitionen und Systemanweisung, die sich selten ändern.
  2. Zweitens Referenzdokumente, die tagelang gleich bleiben.
  3. Danach der Gesprächsverlauf, der während einer Sitzung wächst.
  4. Schließlich die Nutzernachricht und die Live Daten dieser Anfrage.

Definieren Sie diese Struktur an einer einzigen Stelle im Code. So weiß jemand im Team, der die Anweisung aktualisiert, dass dies den Cache zurücksetzt, und ändert sie mit Absicht. Setzen Sie einen häufig wechselnden Teil in eine obere Schicht, zerstört er den Treffer aller darunter liegenden Schichten.

Eine Versionsnummer oder Änderungsnotiz in die Vorlage zu schreiben, ist verlockend, doch schreiben Sie sie nicht ins Präfix. Brauchen Sie Versionsangaben, halten Sie sie in Ihren Protokollen fest, nicht in der Anfrage.

Wie gehen wir als Team bei Prompt Caching für Unternehmen vor?

Als Talha Aslan und Team verstehen wir bei KI Projekten zuerst den Arbeitsablauf und zerlegen dann die Kosten in Posten. Prompt Caching ist in dieser Analyse ein kleiner, aber wirksamer Posten, weil bei Assistenten mit langen Anweisungen die Eingabekosten einen großen Anteil haben.

In der Praxis folgen wir dieser Reihenfolge. Zunächst vereinfachen wir den Prompt, danach trennen wir feste und variable Teile, und schließlich schalten wir den Cache ein und messen die Treffer. Die Reihenfolge ist wichtig, denn einen unnötig langen Prompt zwischenzuspeichern festigt eine teure Gewohnheit, statt das Problem zu lösen.

Planen Sie eine KI Integration, die zu Ihrem Unternehmen passt, sehen Sie sich unsere Leistungen zur KI Automatisierung an. Dort behandeln wir Architektur, Kosten und Sicherheit gemeinsam, ausgehend von Ihrem Anwendungsfall.

Bedenken Sie, dass unsere Ausführungen hier ein allgemeiner Rahmen sind. Bei jedem Projekt bewerten wir Anbieterwahl, Datenregeln und Budget gesondert.

Was tun Sie nach der Frage was ist Prompt Caching als Nächstes?

Fassen wir kurz zusammen. Prompt Caching speichert den wiederkehrenden Anfang eines Prompts beim Anbieter und senkt Kosten und Wartezeit. Damit es funktioniert, muss das Präfix lang, stabil und über alle Anfragen exakt gleich sein.

Öffnen Sie als ersten Schritt Ihren aktuellen Prompt und markieren Sie die festen und variablen Teile. Verschieben Sie im zweiten Schritt den festen Teil nach oben. Beobachten Sie im dritten Schritt eine Woche lang die Trefferquote und bestätigen Sie sie mit den offiziellen Nutzungsfeldern.

Behandeln Sie keinen Preis, keine Dauer und keine Schwelle in diesem Artikel als feststehend. Die Dokumentation der Anbieter ändert sich, also lesen Sie vor Ihrer Entscheidung die offiziellen Seiten.

Zu verwandten Themen sind unsere Artikel über Tokens und API Kosten, das Kontextfenster und große Sprachmodelle eine gute Fortsetzung.

Häufig gestellte Fragen

Ist Prompt Caching kostenlos?
Nein, Prompt Caching ist in der Regel nicht kostenlos; es senkt nur den Preis wiederholter Eingabe. Je nach Anbieter kann das Schreiben in den Cache anders berechnet sein als normale Eingabe, während das Lesen günstiger ist. Prüfen Sie die genauen Sätze und Bedingungen auf der offiziellen Preisseite des Anbieters, denn diese Werte ändern sich mit der Zeit und je nach Modell.
Verändert Prompt Caching die Qualität der Antwort?
Nein, Prompt Caching ist nicht dafür gedacht, die Qualität der Antwort zu ändern. Das Modell betrachtet weiterhin die gesamte Anfrage und erzeugt eine frische Antwort; der Cache nutzt nur den Verarbeitungsaufwand für den wiederholten Teil der Eingabe wieder. Die Konsistenz Ihrer Antworten hängt von Einstellungen wie der Temperatur ab, nicht vom Cache. Ein kleiner Vergleich im eigenen Szenario schadet trotzdem nicht.
Wie lange bleibt der Cache bestehen?
Die Dauer hängt vom Anbieter, vom Modell und von der gewählten Option ab, daher wäre ein einzelner Wert falsch. Die allgemeine Logik lautet, dass ein Eintrag kurze Zeit gehalten wird und sich oft verlängert, wenn Sie ihn in dieser Zeit wiederverwenden. Prüfen Sie die aktuelle Dauer in der offiziellen Dokumentation des Anbieters und planen Sie Ihre Anfragefrequenz danach.
Ist Prompt Caching dasselbe wie Redis?
Nein, es sind verschiedene Werkzeuge auf verschiedenen Ebenen. Redis speichert in Ihrer Infrastruktur eine fertige Antwort oder ein berechnetes Ergebnis und kann den Modellaufruf ganz überspringen. Prompt Caching speichert beim Anbieter das verarbeitete Präfix der Eingabe; das Modell läuft weiterhin und schreibt die Antwort jedes Mal neu. Sie können beides im selben System einsetzen.
Sollte ich Prompt Caching in jedem Prompt nutzen?
Nein, Sie brauchen es nicht in jedem Prompt. Ist der Prompt kurz, ändert sich das Präfix bei jeder Anfrage oder ist der Verkehr selten, bleibt der Gewinn gering. Zudem berechnen manche Anbieter das Schreiben eines Präfixes extra. Schauen Sie zuerst auf die Länge des festen Teils und die Anfragefrequenz, messen Sie dann die Trefferquote und entscheiden Sie über das Weitermachen.
Ist es sicher, personenbezogene Daten im Cache zu halten?
Die kurze Antwort lautet: Vermeiden Sie es, wenn möglich. Laut Dokumentation der Anbieter sind Caches nicht zwischen Organisationen oder Arbeitsbereichen geteilt, doch personenbezogene Daten gehören trotzdem nicht ins feste Präfix. Verschieben Sie die Daten in den Suffix, senden Sie sie nicht ohne Not und fragen Sie bei der DSGVO Ihre Rechtsberatung. Diese Antwort ist keine Rechtsberatung.
  • prompt caching
  • ki api kosten
  • llm caching
  • token kosten
  • ki optimierung
  • kontextfenster
  • api latenz
Teilen:
Talha Aslan

Google Partner und Experte für digitales Marketing. Seit 2012 praktisch in SEO, Google Ads, Webdesign und E-Commerce Projekten; jeder Beitrag hier stammt aus dieser Erfahrung.

Nächstes Projekt

Sprechen wir über Ihr Projekt.

Ihre Anfrage geht direkt an Talha Aslan und Team: Strategie von Talha, Umsetzung durch ein erfahrenes Team. Das Erstgespräch ist kostenlos, wir hören zu und melden uns mit einer klaren Roadmap.