Künstliche Intelligenz

Was ist ein Token? So berechnen Sie KI API Kosten

Talha Aslan 16 Minuten Lesezeit 2 Aufrufe

Was ist ein Token?

Ein Token ist der kleinste Textbaustein, den ein großes Sprachmodell liest und schreibt. Es kann ein ganzes Wort sein, ein Wortteil oder ein einzelnes Satzzeichen. KI Anbieter rechnen ab, indem sie diese Bausteine zählen, und stellen Ihnen die Summe in Rechnung.

Die Definition klingt einfach, allerdings hängt Ihr gesamtes KI Budget daran. Jede Frage zählt. Außerdem zählt jedes angehängte Dokument und jede Anweisung. Zudem zählt die Antwort des Modells mit.

Deshalb wird aus der Frage "Was kostet das?" die Frage "Wie viele Token verbrauchen wir?". Zunächst erklären wir in diesem Leitfaden den Begriff in einfachen Worten. Danach rechnen wir ein erfundenes Kostenbeispiel durch. Zudem zeigen wir, wie Sie Ausgaben senken und ein Budget kontrollieren.

Hinweis: Dieser Artikel ist eine allgemeine Information. Preise und Modelleigenschaften ändern sich oft, deshalb prüfen Sie aktuelle Werte auf der offiziellen Preisseite des Anbieters.

Ist ein Token dasselbe wie ein Wort?

Nein, das ist es nicht. Das Modell zerlegt Text zunächst in kleine Stücke. Diesen Schritt nennt man also Tokenisierung. Kurze, häufige Wörter werden meist zu einem Token. Seltene, lange oder zusammengesetzte Wörter zerfallen dagegen in mehrere Teile.

Zum Beispiel bleibt ein kurzes Wort wie "Haus" oft ganz. Ein langes Wort wie "Unvergesslichkeit" kann dagegen in mehrere Teile zerfallen. Zahlen, Leerzeichen, Emojis und Codeschnipsel bringen ebenfalls eigene Token mit.

Merken Sie sich diese drei Punkte:

  • Wortzahl und Tokenzahl stimmen nicht eins zu eins überein.
  • Der Texttyp verändert das Ergebnis. Zum Beispiel erzeugen Fließtext, Tabellen, Code und JSON unterschiedlich viele Token.
  • Jede Modellfamilie nutzt ihren eigenen Tokenizer, daher kann derselbe Text in zwei Modellen verschieden viele Token ergeben.

Kurz gesagt führt eine feste Regel wie "1.000 Wörter sind so viele Token" in die Irre. Stattdessen sehen Sie die echte Zahl im Zählwerkzeug Ihres Anbieters. Die Tokenizer Seite von OpenAI ist ein Beispiel für ein solches Werkzeug.

Wie funktioniert die Tokenisierung genau?

Die Tokenisierung zerlegt Text anhand einer Liste, die das Modell vorher gelernt hat. Zum Beispiel können Sie sich die Liste wie ein Wörterbuch vorstellen. Dann ordnet das Modell Ihren Text den Einträgen dieser Liste zu. Außerdem hat jeder Eintrag eine Nummer. Das Modell verarbeitet diese Nummern, nicht die Wörter selbst.

Deshalb kann dasselbe Wort in einem anderen Zusammenhang anders zerfallen. Ein Wort mit Leerzeichen davor kann ein anderer Baustein sein als dasselbe Wort am Zeilenanfang. Zudem kann die großgeschriebene Form separat zählen. Kleine Unterschiede summieren sich also im großen Maßstab.

Wenn wir "Was ist ein Token?" als Ingenieur beantworten, ist es eine Eintragsnummer im Vokabular des Modells. Als Geschäftsinhaber beantworten wir die Frage anders: Es ist die Einheit auf Ihrer Rechnung. Folglich ergeben erst beide Sichtweisen zusammen ein solides Budget.

In der Praxis gilt: Auch Formatierung kostet Token. Überflüssige Leerzeichen, lange Tabellenränder, wiederholte Überschriften und unnötige JSON Felder erhöhen die Zahl. Sauberer Input senkt daher Kosten und Fehler.

Was ist ein Token bei Deutsch im Vergleich zu Englisch?

Allerdings können sich Sprachen unterscheiden. Tokenizer entstehen meist aus Daten, in denen Englisch dominiert. Deshalb zerfällt englischer Text oft in weniger Teile. Sprachen mit langen Zusammensetzungen oder vielen Wortendungen, wie Deutsch und Türkisch, brauchen für dieselbe Bedeutung häufig mehr Token.

Ein deutsches Kompositum wie "Kundenzufriedenheitsumfrage" zerfällt zum Beispiel in mehrere Stücke. Ebenso können Sonderzeichen wie ä, ö, ü und ß bei manchen Tokenizern zusätzliche Teile erfordern. Konkret gilt bei türkischen Wörtern mit vielen Endungen Ähnliches.

Ein festes Verhältnis nennen wir hier bewusst nicht, denn es hängt vom Modell und vom Text ab. Der richtige Weg ist einfach: Fügen Sie Ihren eigenen Text in das Zählwerkzeug des geplanten Modells ein. Dann sehen Sie Ihren echten Bedarf.

Daher liegt die Folge für Ihr Geschäft auf der Hand. Verarbeiten Sie deutsche Kundennachrichten, planen Sie Ihr Budget nicht mit englischen Beispielen. Machen Sie stattdessen einen kleinen Test mit echten Nachrichten in Ihrer Sprache.

Was ist ein Kontextfenster und wie hängt es mit Token zusammen?

Ein Kontextfenster ist die Gesamtmenge an Token, die ein Modell in einer Anfrage verarbeiten kann. Das heißt, sie umfasst sowohl Ihre Eingabe als auch die Ausgabe des Modells. Ist das Fenster voll, sieht das Modell ältere Teile nicht mehr, oder die Anfrage schlägt fehl.

Nehmen wir an, Sie bauen eine Chat Anwendung. In jeder neuen Runde müssen Sie womöglich frühere Nachrichten erneut senden. Je länger das Gespräch wird, desto mehr Token trägt also jede Anfrage. Die Kosten steigen somit entsprechend.

Die Fenstergröße unterscheidet sich je nach Modell, und diese Information veraltet schnell. Daher nennen wir keine Zahl. Prüfen Sie das aktuelle Limit auf der Modellseite des Anbieters.

Ein großes Fenster heißt außerdem nicht, dass große Dateien gratis wären. Denn Sie zahlen für jedes gesendete Token. Zudem kann ein Modell in sehr langen Kontexten wichtige Details übersehen. Nur den nötigen Teil zu senden ist günstiger und oft genauer. Bei Firmendokumenten löst das ein RAG Ansatz: Sie senden die zur Frage passenden Abschnitte, nicht die ganze Datei.

Was ist der Unterschied zwischen Eingabetoken und Ausgabetoken?

Zunächst ist Eingabetoken alles, was Sie an das Modell senden. Dazu zählen Anweisungen, die Frage, Beispiele, frühere Gespräche und angehängte Dokumente. Dann ist Ausgabetoken die Antwort, die das Modell schreibt. Beide zählen, allerdings berechnen die meisten Anbieter für jede Art einen anderen Preis.

In der Regel kosten Ausgabetoken mehr als Eingabetoken. Neuen Text zu erzeugen erfordert mehr Rechenleistung, als vorhandenen Text zu lesen. Das Verhältnis legt der Anbieter fest, und es kann sich ändern. Prüfen Sie deshalb die Preisseite.

Also liefert diese Trennung einen praktischen Hinweis. Zum Beispiel verlagern Aufgaben mit langen Antworten die Kosten auf die Ausgabe. Aufgaben, die ein langes Dokument kurz zusammenfassen, verlagern sie auf die Eingabe. Die Optimierung beginnt daher jeweils an anderer Stelle.

Manche Modelle verbrauchen außerdem eigene Token für Denk oder Schlussfolgerungsschritte. Diese Token sehen Sie womöglich nicht auf dem Bildschirm, dennoch können sie auf der Rechnung erscheinen. Deshalb lesen Sie dazu die Dokumentation Ihres Modells.

Wie entsteht eine API Rechnung?

Eine API Rechnung ist eine einfache Multiplikation: verbrauchte Token mal Einzelpreis. Eingabe und Ausgabe rechnet man getrennt und addiert sie dann. Außerdem liefert der Anbieter die Nutzungszahlen in jeder Antwort mit. Dieses Feld ist die verlässlichste Kontrolle Ihrer Rechnung.

Die Formel lautet:

  • Eingabekosten = Eingabetoken ÷ 1 Million × Preis für Eingabe.
  • Ausgabekosten = Ausgabetoken ÷ 1 Million × Preis für Ausgabe.
  • Summe = Eingabekosten + Ausgabekosten.

Zunächst zeigen Anbieter Preise oft "pro Million Token". Allerdings ist diese Einheit nicht überall gleich. Manche Anbieter nutzen dann eine andere Skala. Achten Sie deshalb auf die Einheit auf der Preisseite.

Außerdem können weitere Posten hinzukommen. Zum Beispiel können zwischengespeicherte Eingaben, Rabatte für Stapelverarbeitung, Bild oder Audioeingaben und eingebaute Werkzeugaufrufe eigene Preise haben. Das Prinzip bleibt gleich, doch Namen und Preise unterscheiden sich je nach Anbieter.

Beispielrechnung: Was kostet ein Support Bot pro Monat?

Die folgende Rechnung ist vollständig erfunden. Die Einzelpreise gehören zu keinem echten Anbieter. Stattdessen geht es nur darum, die Logik zu zeigen. Echte Preise prüfen Sie auf der Preisseite Ihres Anbieters.

Unsere Annahmen (Beispielrechnung) lauten:

  • Der Bot bearbeitet 10.000 Chats pro Monat.
  • Jeder Chat hat im Schnitt 1.500 Eingabetoken und 400 Ausgabetoken.
  • Der erfundene Preis beträgt 2 Einheiten pro 1 Million Eingabetoken und 8 Einheiten pro 1 Million Ausgabetoken.

So sieht die Rechnung aus:

PostenRechnungErgebnis (erfundene Einheiten)
---------
Eingabetoken gesamt10.000 × 1.50015.000.000
Eingabekosten15 × 230
Ausgabetoken gesamt10.000 × 4004.000.000
Ausgabekosten4 × 832
Monatssumme30 + 3262

Die Ausgabemenge liegt weit unter der Eingabemenge, trotzdem sind die Ausgabekosten fast so hoch. Der Grund: Wir haben einen höheren Preis angenommen, den wir angenommen haben. Daran sehen Sie, warum kurze Antworten wichtig sind.

Danach probieren wir eine zweite Annahme. Angenommen, 1.000 Token der Eingabe sind ein fester Teil (Systemanweisung und Regeln), der aus dem Zwischenspeicher kommt. Dieser Teil koste ein Zehntel des normalen Eingabepreises. Das ist nur ein Beispiel, den echten Wert erfragen Sie beim Anbieter.

Der zwischengespeicherte Teil umfasst 10 Millionen Token und kostet 2 Einheiten. Die übrigen 5 Millionen Eingabetoken kosten 10 Einheiten. Außerdem bleibt die Ausgabe bei 32 Einheiten. Die neue Summe beträgt somit 44 Einheiten. Allein durch das Zwischenspeichern der festen Anweisung sinkt die erfundene Rechnung um etwa 29 Prozent.

Was ist ein Token Schätzwert und wie ermitteln Sie ihn vor dem Start?

Daher bewahrt Sie vor dem Start eine Schätzung vor Raterei. Drei Methoden helfen. Erstens fügen Sie Beispieltexte in das Zählwerkzeug des Anbieters ein. Zweitens lesen Sie nach einem API Aufruf das Nutzungsfeld der Antwort. Drittens nutzen Sie, falls vorhanden, eine Schnittstelle zum Zählen. So erklärt die Gemini Dokumentation von Google das Zählen von Token, und die Dokumentation von Anthropic beschreibt eine eigene Methode.

Gehen Sie für Ihre Schätzung so vor:

  1. Wählen Sie mindestens 20 echte Beispielnachrichten oder Dokumente.
  2. Lassen Sie jede durch den Zähler laufen und notieren Sie Durchschnitt und Höchstwert.
  3. Messen Sie die Tokenzahl Ihrer Systemanweisung separat.
  4. Legen Sie die erwartete Antwortlänge fest und schätzen Sie die Ausgabetoken.
  5. Multiplizieren Sie mit dem Monatsvolumen und addieren Sie einen Puffer von 20 bis 30 Prozent.

Der Puffer ist ein Startwert aus unserer Praxis, keine Garantie. Prüfen Sie ihn nach dem ersten Monat mit echten Daten. Auf diese Weise verkleinern Sie die Lücke zwischen Schätzung und Rechnung.

Wie können Sie Token Kosten senken?

Konkret gibt es fünf Hauptmethoden. Zusammen entfalten sie also die größte Wirkung. Die Reihenfolge ist allerdings je nach Projekt verschieden, daher raten wir zuerst zum Messen.

  • Kurze, klare Prompts: Streichen Sie Wiederholungen und lange Einleitungen.
  • Zwischenspeicher: Speichern Sie feste Anweisungen und gemeinsamen Kontext zwischen.
  • Passendes Modell: Geben Sie einfache Aufgaben an kleine und schwere Aufgaben an stärkere Modelle.
  • Stapelverarbeitung: Senden Sie Aufgaben ohne Eile gesammelt.
  • Ausgabelimit: Legen Sie Länge und Format der Antwort fest.

Danach gehen wir auf jede Methode ein. Zum Schreiben der Prompts selbst lesen Sie auch unseren Leitfaden zu Prompt Engineering.

Wie viel spart ein kürzerer Prompt wirklich?

Fester Text, den Sie bei jeder Anfrage mitsenden, multipliziert sich mit dem Monatsvolumen. Eine überflüssige Anweisung von 500 Token bedeutet also bei 10.000 Anfragen 5 Millionen zusätzliche Token. Somit wird ein kleiner Überschuss im großen Maßstab zu einem großen Posten.

Um zu kürzen und trotzdem Qualität zu halten, probieren Sie Folgendes:

  • Schreiben Sie dieselbe Regel nicht zweimal.
  • Nutzen Sie kurze, klare Stichpunkte statt langer Erklärungen.
  • Reduzieren Sie die Beispiele auf die zwei oder drei nützlichsten.
  • Beschreiben Sie das Ausgabeformat in einem Satz.

Allerdings schlägt zu starkes Kürzen zurück. Wird die Anweisung vage, antwortet das Modell falsch, und Sie brauchen einen neuen Versuch. Denn auch ein Versuch kostet Token. Testen Sie daher jede neue Fassung mit Beispielfragen.

Wie funktioniert Prompt Caching?

Beim Caching merkt sich der Anbieter den wiederkehrenden Anfang Ihrer Anfragen. Senden Sie dieselbe lange Anweisung oder dasselbe Dokument oft, zahlen Sie für diesen Teil meist einen niedrigeren Preis. Zum Beispiel läuft das bei manchen Anbietern automatisch. Bei anderen müssen Sie es dagegen von Hand einrichten.

Am meisten profitieren diese Szenarien:

  • Support Bots mit langer Systemanweisung.
  • Interne Assistenten, die immer wieder Fragen zu einem Richtliniendokument beantworten.
  • Entwicklerwerkzeuge, die mit derselben Codebasis arbeiten.

Damit Caching greift, setzen Sie den festen Teil an den Anfang der Anfrage. Den veränderlichen Teil, also die Frage des Nutzers, hängen Sie ans Ende. Zeitlimits, Mindestlänge und Preisunterschiede hängen vom Anbieter ab. Prüfen Sie diese Details in der offiziellen Dokumentation.

Wie wirkt sich die Modellwahl auf die Kosten aus?

Die Wirkung ist groß. Anbieter bieten meist kleine, mittlere und große Modelle an. Allerdings kosten große Modelle mehr. Kleine Modelle reichen dagegen oft für Klassifizierung, kurze Zusammenfassungen, Verschlagwortung und einfaches Routing.

In Projekten empfehlen wir diese Reihenfolge:

  1. Testen Sie zuerst ein kleines Modell.
  2. Messen Sie die Qualität an 20 Beispielen.
  3. Wechseln Sie nur dann eine Stufe höher, wenn das Ergebnis nicht reicht.
  4. Geben Sie in einem gemischten Ablauf leichte Schritte an ein kleines und schwere Schritte an ein starkes Modell.

Daher bevorzugen wir hier keinen einzelnen Anbieter und kein einzelnes Modell. Modelllisten veralten schnell, und die "beste" Wahl hängt von Ihrer Aufgabe ab. Wichtig ist, für jeden Schritt die günstigste ausreichende Option zu finden. In Unternehmensprojekten planen wir diese Wahl gemeinsam mit Ihnen bei der KI Integration.

Was sind Stapelverarbeitung und Ausgabelimit?

Stapelverarbeitung heißt, viele Anfragen gemeinsam als ein Paket zu senden. Deshalb passt sie zu Arbeiten, bei denen Sie kein sofortiges Ergebnis brauchen. Zum Beispiel eignet sich das nächtliche Klassifizieren von tausend Produktbeschreibungen gut. Manche Anbieter gewähren dafür einen Rabatt, allerdings kommen die Ergebnisse später.

Ein Ausgabelimit legt die maximale Länge der Antwort fest. Denn ohne Limit schreibt ein Modell womöglich mehr als nötig. Zudem kosten Ausgabetoken meist mehr.

So steuern Sie die Ausgabe:

  • Stellen Sie die maximale Zahl der Ausgabetoken passend zur Aufgabe ein.
  • Geben Sie eine klare Längenvorgabe wie "höchstens drei Sätze".
  • Fordern Sie nach Möglichkeit ein kurzes, strukturiertes Format wie JSON.
  • Untersagen Sie Füllhöflichkeiten und Wiederholungen.

Ein zu niedriges Limit kann eine Antwort mittendrin abschneiden. Setzen Sie es daher etwas über die längste Antwort in Ihren echten Beispielen.

Wie halten Sie die Qualität und sparen trotzdem Token?

Sparen darf allerdings nicht heißen, auf Qualität zu verzichten. Messen Sie jede Änderung mit einem kleinen Testset. Lassen Sie zum Beispiel 20 echte Fragen erst mit dem aktuellen Aufbau und dann mit dem gekürzten Aufbau laufen. Dann lesen Sie die Antworten nebeneinander. Sehen Sie keinen Unterschied, übernehmen Sie die neue Fassung.

Nehmen Sie auch schwierige Fälle ins Testset auf. Eine unklare Frage, eine sehr lange Nachricht und ein Satz mit Tippfehlern sind gute Prüfungen. Besteht die kürzere Anweisung diese Fälle, können Sie sie sicher einsetzen.

Bedenken Sie außerdem: Eine falsche Antwort führt zu neuen Versuchen und zu menschlicher Nachprüfung. Das kostet mindestens so viel wie Token. Anders gesagt ist der Aufbau mit den wenigsten Token nicht immer der günstigste. Das richtige Maß sind die Gesamtkosten eines korrekten Ergebnisses.

Außerdem halten Sie Änderungen schriftlich fest. Notieren Sie in einer einfachen Tabelle, welche Fassung wie viele Token verbrauchte und wie viele Beispiele bestanden. Drei Monate später beantworten Sie die Frage "Warum haben wir das so gemacht?" dann mit Fakten.

Was ist der Unterschied zwischen Abo und API?

Ein Abo gibt Ihnen eine Chat Oberfläche für eine feste Monatsgebühr. Eine API verbindet dagegen Ihre eigene Software mit dem Modell, und Sie zahlen für die verbrauchten Token. Anbieter bepreisen beides meist als getrennte Produkte. Das eine schließt das andere nicht automatisch ein.

MerkmalAboAPI
---------
NutzungFertige Chat OberflächeEinbindung in eigene Software
AbrechnungFeste PeriodengebührPro verbrauchtem Token
Planbarkeit der KostenEinfachSchwankt mit dem Volumen
AutomatisierungBegrenztBreit
NutzungsgrenzenKontingente des AnbietersBudget und Ratenlimits unter Ihrer Kontrolle
Geeignet fürPersönliche Nutzung und TeamProdukte, Bots und Abläufe

Schreibt ein Team nur Texte und sammelt Ideen, genügt meist ein Abo. Planen Sie einen Bot für Kunden, automatische Berichte oder einen Ablauf, brauchen Sie eine API. Den Aufbau Schritt für Schritt zeigt unsere Anleitung zur OpenAI API. Umfang und Limits ändern sich je nach Anbieter, deshalb prüfen Sie die aktuellen Bedingungen auf der offiziellen Seite.

Ist ein Ratenlimit dasselbe wie ein Tokenlimit?

Nein, das sind verschiedene Begriffe. Ein Tokenlimit kann die Gesamtgröße einer einzelnen Anfrage meinen oder die Menge, die Sie in einem Zeitraum verbrauchen dürfen. Ein Ratenlimit begrenzt dagegen, wie viele Anfragen oder Token Sie in einer bestimmten Zeit senden dürfen.

Anbieter nutzen oft Größen wie Anfragen pro Minute und Token pro Minute. Die Limits hängen von Ihrer Kontostufe und vom Modell ab. Prüfen Sie die Zahlen daher in der Oberfläche und in der Dokumentation Ihres Anbieters.

Erreichen Sie ein Ratenlimit, liefert das System einen Fehler. Alles sofort erneut zu versuchen ist keine gute Lösung. Bauen Sie stattdessen ein Wiederholungsmuster, das nach jedem Fehler länger wartet. So umgehen Sie das Limit und vermeiden sinnlose Kosten.

Zudem ersetzt ein Ratenlimit kein Budgetlimit. Das Ratenlimit bremst das System, das Budgetlimit stoppt die Ausgaben. Beides zusammen einzurichten ist der gesündeste Weg.

Wie richten Sie Budgetlimit und Überwachung ein?

Eine Endlosschleife oder Missbrauch kann in wenigen Stunden eine überraschende Rechnung erzeugen. Deshalb empfehlen wir vor dem Start drei Schutzebenen.

  1. Limit beim Anbieter: Legen Sie in der Oberfläche eine monatliche Ausgabengrenze und eine Warnschwelle fest. Der Name der Einstellung unterscheidet sich je nach Anbieter, schauen Sie also in die offizielle Hilfe.
  2. Limit in Ihrer App: Setzen Sie pro Nutzer eine Tagesgrenze für Anfragen und Token.
  3. Eigene Protokolle: Speichern Sie die Nutzungsdaten jeder Anfrage in Ihrer Datenbank.

Beobachten Sie täglich vier Werte: Eingabetoken gesamt, Ausgabetoken gesamt, durchschnittliche Kosten pro Anfrage und die zehn teuersten Anfragen. Fangen Sie einen Ausreißer schon am ersten Tag ab, genügt meist eine kleine Korrektur.

Schützen Sie außerdem Ihren API Schlüssel. Legen Sie ihn nicht in Frontend Code oder in ein öffentliches Repository. Bewahren Sie ihn auf dem Server auf und tauschen Sie ihn bei Bedarf aus.

Welche Fehler treiben die Rechnung in die Höhe?

Diese Fehler sehen wir in der Praxis am häufigsten. Alle sind vermeidbar.

  • Jedes Mal den ganzen Chatverlauf senden. Fassen Sie alte Nachrichten zusammen oder kürzen Sie sie.
  • Ganze Dokumente senden. Wählen Sie nur die relevanten Abschnitte.
  • Bei Fehlern endlos wiederholen. Setzen Sie eine Obergrenze für Versuche.
  • In Testumgebungen das Livemodell nutzen. Nehmen Sie für Tests ein kleines Modell und kurze Beispiele.
  • Die Ausgabelänge nicht begrenzen. Das Modell schreibt mehr als nötig.
  • Keine Limits pro Nutzer setzen. Ein einzelner Nutzer kann das Budget aufbrauchen.

Die meisten dieser Fehler fallen in der ersten Woche nicht auf, weil das Volumen klein ist. Steigt der Verkehr, wächst derselbe Fehler mit. Folglich ist ein Überwachungspanel ab dem ersten Tag günstiger als späteres Feuerlöschen.

Wie verknüpfen Sie Token Kosten mit Geschäftszielen?

Nur zu fragen "Was haben wir diesen Monat ausgegeben?" reicht nicht. Besser ist die Frage: "Was kostet uns jede gelöste Anfrage, jeder Textentwurf oder jeder qualifizierte Lead an Token?" So verbinden Sie Kosten mit einem Geschäftsergebnis.

Im Marketing nutzen Sie diese Logik längst. Sie verfolgen die Kosten pro Klick und den Ertrag der Werbeausgaben. Wenden Sie dieselbe Disziplin auf KI Kosten an. Unser ROAS Rechner und der Google Ads Budget Rechner helfen bei der Rechnung. Zur Auffrischung zu Klickkosten lesen Sie unseren CPC Leitfaden.

Beispielszenario: Ein E-Commerce Team lässt Produktbeschreibungen von KI schreiben. Das Team misst die durchschnittlichen Tokenkosten pro Beschreibung und die Zeit für die Nachbearbeitung. Danach vergleicht es beides mit den Kosten fürs Schreiben von Hand. Die Entscheidung folgt aus diesem Vergleich. Das ist ein Beispielszenario und kein echtes Kundenergebnis.

Wie plant ein kleines Unternehmen ein realistisches Budget?

Für ein kleines Unternehmen zählt kontrolliertes Testen, nicht die perfekte Prognose. Wählen Sie zunächst einen einzigen Anwendungsfall. Das kann zum Beispiel ein WhatsApp Assistent für häufige Fragen sein oder ein Ablauf, der einen Wochenbericht zusammenfasst.

Machen Sie dann einen einfachen Plan für drei Monate:

  • Monat eins: Testen Sie mit kleinem Volumen und sammeln Sie echte Tokendaten.
  • Monat zwei: Kürzen Sie den Prompt und aktivieren Sie Zwischenspeicher und Ausgabelimit.
  • Monat drei: Vergleichen Sie die Kosten mit den Geschäftsergebnissen und entscheiden Sie.

Halten Sie in jeder Phase eine Ausgabengrenze in der Anbieteroberfläche. So bleibt selbst der schlechteste Fall begrenzt. Teilen Sie außerdem die Monatskosten durch die Zahl erledigter Aufgaben, um die "Kosten pro Aufgabe" zu erhalten.

Lesen Sie die Zahl nie als Garantie. Das ist unsere Methode aus der Praxis, doch jedes Unternehmen hat ein anderes Volumen und eine andere Sprache. Mit eigenen Daten zu messen ist der sicherste Weg. Für eine zweite Meinung zur Rentabilität sehen Sie sich unsere KI Beratung an.

Wo sollte Ihr Team anfangen?

Beantworten Sie zuerst "Was ist ein Token?" anhand Ihrer eigenen Daten. Beginnen Sie dann klein, messen Sie und skalieren Sie danach. Diese Reihenfolge nutzen wir:

  1. Schreiben Sie Geschäftsziel und Erfolgskriterium auf.
  2. Messen Sie die Tokenzahl mit echten Beispielen.
  3. Bauen Sie einen Prototyp mit dem kleinsten Modell, das genügt.
  4. Kürzen Sie die festen Anweisungen und machen Sie sie cachefreundlich.
  5. Legen Sie Ausgabelimit und Format fest.
  6. Setzen Sie Budgetgrenzen beim Anbieter und in der App.
  7. Überwachen Sie im ersten Monat täglich, danach wöchentlich.

Planen Sie ein Firmensystem, setzen wir als Talha Aslan und Team diese Schritte gern gemeinsam mit Ihnen um, im Rahmen unserer KI Automatisierung. Für Teams, die keine Daten nach außen senden wollen, ist ein lokales LLM eine weitere Option. Die Grundlagen von Sprachmodellen finden Sie in unserem LLM Leitfaden.

Hinweis: Dieser Artikel dient der allgemeinen Information und ist keine Rechtsberatung. Senden Sie personenbezogene Daten an eine API, klären Sie Ihre Pflichten nach der DSGVO mit einer Rechtsberatung.

Häufig gestellte Fragen

Gibt es ein festes Verhältnis zwischen Token und Wörtern?
Nein, ein festes Verhältnis gibt es nicht. Es hängt vom Modell, von der Sprache und vom Texttyp ab. Kurze, häufige Wörter sind oft ein Token, lange oder seltene Wörter zerfallen in mehrere Teile. Die echte Zahl sehen Sie, wenn Sie Ihren eigenen Text in das Zählwerkzeug des Anbieters einfügen.
Kostet deutscher Text mehr als englischer?
Oft ja, denn dieselbe Bedeutung braucht in Sprachen mit langen Zusammensetzungen und vielen Wortendungen häufig mehr Token. Der Abstand hängt jedoch vom Modell und vom Inhalt ab, deshalb wäre ein fester Wert irreführend. Testen Sie echte deutsche Beispiele im Zählwerkzeug des gewählten Modells.
Warum sind Ausgabetoken meist teurer?
Neuen Text zu erzeugen erfordert mehr Rechenleistung, als vorhandenen Text zu lesen. Deshalb verlangen viele Anbieter für Ausgabetoken einen höheren Einzelpreis. Das Verhältnis unterscheidet sich je nach Anbieter und kann sich ändern. Prüfen Sie aktuelle Preise immer auf der offiziellen Preisseite, bevor Sie Ihr Budget planen.
Senkt Caching die Kosten in jedem Projekt?
Nein, die Wirkung ist nicht überall gleich. Caching hilft, wenn jede Anfrage mit einem langen, festen Anfang beginnt. Ist jede Anfrage völlig verschieden, bleibt der Gewinn klein. Auch Bedingungen wie Zeitlimit und Mindestlänge hängen vom Anbieter ab, deshalb lesen Sie zuerst die offizielle Dokumentation.
Gilt für Abo und API derselbe Preis?
In der Regel nicht. Ein Chat Abo arbeitet mit einer festen Periodengebühr, während eine API die tatsächlich verbrauchten Token abrechnet. Die meisten Anbieter bepreisen beides getrennt, und das eine schließt das andere nicht ein. Betrachten Sie beide daher nicht als austauschbar und prüfen Sie die Bedingungen beim Anbieter.
Wie vermeide ich eine überraschende API Rechnung?
Nutzen Sie drei Schutzebenen. Legen Sie in der Anbieteroberfläche eine Ausgabengrenze und eine Warnschwelle fest, setzen Sie in Ihrer App ein Tokenlimit pro Nutzer und speichern Sie die Nutzungsdaten jeder Anfrage. Begrenzen Sie außerdem Wiederholungen, bewahren Sie den API Schlüssel auf dem Server auf und prüfen Sie anfangs täglich.
  • was ist ein token
  • ki api kosten
  • kontextfenster
  • prompt caching
  • llm kosten berechnen
  • openai api
  • ki budget
Teilen:
Talha Aslan

Google Partner und Experte für digitales Marketing. Seit 2012 praktisch in SEO, Google Ads, Webdesign und E-Commerce Projekten; jeder Beitrag hier stammt aus dieser Erfahrung.

Nächstes Projekt

Sprechen wir über Ihr Projekt.

Ihre Anfrage geht direkt an Talha Aslan und Team: Strategie von Talha, Umsetzung durch ein erfahrenes Team. Das Erstgespräch ist kostenlos, wir hören zu und melden uns mit einer klaren Roadmap.