Ein Token ist die kleinste Texteinheit, mit der ein KI-Sprachmodell arbeitet — meist ein Wort, ein Wortteil oder ein Satzzeichen. Sprachmodelle zerlegen jede Eingabe in Tokens, verarbeiten diese und erzeugen ihre Antwort ebenfalls Token für Token. Tokens sind zugleich die Abrechnungseinheit vieler KI-Dienste und begrenzen über das Kontextfenster, wie viel Text ein Modell gleichzeitig verarbeiten kann.

Was ist ein Token bei KI-Sprachmodellen?
Ein Token ist die kleinste Texteinheit, mit der ein KI-Sprachmodell arbeitet — meist ein Wort, ein Wortteil oder ein Satzzeichen. Sprachmodelle zerlegen jede Eingabe in Tokens, verarbeiten diese und erzeugen ihre Antwort ebenfalls Token für Token. Tokens sind zugleich die Abrechnungseinheit vieler KI-Dienste und begrenzen über das Kontextfenster, wie viel Text ein Modell gleichzeitig verarbeiten kann. Der Prozess der Zerlegung heißt Tokenisierung; der Wikipedia-Artikel zur Tokenisierung beschreibt das Grundprinzip.
Tokens sind das grundlegende Betriebsmittel großer Sprachmodelle, wie sie hinter ChatGPT und ähnlichen Diensten stehen. Der Wikipedia-Artikel zu großen Sprachmodellen und die englische Darstellung zu Large Language Models erläutern, wie diese Modelle auf Basis von Tokens trainiert werden und Text erzeugen.
Der Begriff Token wird auch in anderen Bereichen der Informatik verwendet — etwa für Zugriffstoken in der Authentifizierung. Im Kontext von KI-Sprachmodellen meint er jedoch ausschließlich die Texteinheiten, in die Eingabe und Ausgabe zerlegt werden. Diese Unterscheidung ist wichtig, um Missverständnisse zu vermeiden.
Wie funktioniert die Tokenisierung?
Bevor ein Sprachmodell einen Text verarbeitet, zerlegt ein sogenannter Tokenizer die Eingabe in Tokens. Häufige Wörter bilden oft ein einzelnes Token, seltene oder zusammengesetzte Wörter werden in mehrere Teile zerlegt. Ein deutsches Wort wie „Rechtsschutzversicherung“ besteht daher aus mehreren Tokens, während kurze englische Wörter oft nur eines belegen. Die genaue Zerlegung folgt einem statistisch erlernten Vokabular, das häufige Zeichenfolgen zu eigenen Tokens zusammenfasst.
Als grobe Orientierung entspricht ein Token im Durchschnitt etwa einem kurzen Wort oder Wortteil; deutsche Texte benötigen wegen langer Komposita tendenziell mehr Tokens als englische. Das Modell berechnet seine Antwort, indem es Token für Token die jeweils wahrscheinlichste Fortsetzung wählt. Die OpenAI-Dokumentation zu den Grundkonzepten beschreibt, wie Tokens Eingabe und Ausgabe eines Modells bilden.
Weil die Tokenisierung sprach- und modellabhängig ist, kann derselbe Text bei verschiedenen Modellen unterschiedlich viele Tokens ergeben. Für eine genaue Kalkulation nutzt man daher den Tokenizer des konkret eingesetzten Modells.
Warum sind Tokens wichtig?
Tokens haben zwei praktische Konsequenzen. Erstens: Kosten. Viele KI-Dienste rechnen ihre Nutzung über die API nach verarbeiteten Tokens ab — sowohl für die Eingabe als auch für die erzeugte Antwort. Wer KI in Workflows oder Anwendungen integriert, kalkuliert die laufenden Kosten deshalb in Tokens, nicht in Anfragen oder Wörtern.
Zweitens: Kapazität. Jedes Modell hat ein begrenztes Kontextfenster, gemessen in Tokens. Es bestimmt, wie viel Text — Eingabe plus bisheriger Gesprächsverlauf plus Antwort — das Modell gleichzeitig berücksichtigen kann. Überschreitet ein Dokument diese Grenze, muss es gekürzt oder aufgeteilt werden. Ein durchdachter Prompt hält die Tokenzahl niedrig und den relevanten Kontext hoch — beides senkt Kosten und verbessert die Antwortqualität.
Beide Aspekte hängen zusammen: Lange Eingaben kosten mehr und füllen zugleich das Kontextfenster. Ein bewusster Umgang mit Tokens ist deshalb sowohl eine Kosten- als auch eine Qualitätsfrage.
Tokens in der Praxis von Marketing-Teams
Für Marketing-Teams wird das Thema relevant, sobald KI über die API in Prozesse eingebunden wird: etwa bei automatisierten Textentwürfen, Chatbots auf der Website oder der Analyse großer Dokumentmengen. Die Tokenzahl von Ein- und Ausgaben bestimmt dann direkt die laufenden Kosten. Ein KI-Chatbot für Websites mit hohem Anfragevolumen kann so spürbare Betriebskosten verursachen, wenn jede Anfrage viel Kontext mitführt.
Sparen lässt sich mit kompakten Prompts, dem Weglassen unnötiger Textmengen und der Wahl eines passenden Modells — kleinere, günstigere Modelle reichen für einfache Aufgaben oft aus. Techniken wie Prompt Engineering und Kontext-Caching helfen, den Verbrauch weiter zu senken, ohne die Qualität zu opfern. Hersteller bieten Token-Zähler an, mit denen sich der Verbrauch eines Textes vorab abschätzen lässt — nützlich, um Budgets realistisch zu planen.
Typische Missverständnisse rund um Tokens
Ein verbreitetes Missverständnis ist die Gleichsetzung von Token und Wort. Tatsächlich ist ein Token oft nur ein Wortteil, und die genaue Zerlegung hängt vom jeweiligen Tokenizer und der Sprache ab. Wer Kosten kalkuliert, sollte deshalb nicht die Wortzahl, sondern die tatsächliche Tokenzahl zugrunde legen — sonst weichen Schätzung und Rechnung deutlich voneinander ab.
Ein weiteres Missverständnis betrifft das Kontextfenster: Ein großes Fenster bedeutet nicht automatisch bessere Antworten. Zu viel irrelevanter Kontext kann die Qualität sogar verschlechtern und die Kosten unnötig erhöhen. Entscheidend ist nicht die maximale Menge, sondern der passende, gut strukturierte Kontext — etwa über durchdachte Prompt-Vorlagen, die nur die wirklich relevanten Informationen bereitstellen.
Tokens in der Praxis: ein Rechenbeispiel
Ein einfaches Beispiel verdeutlicht die Kostenwirkung. Wird ein umfangreicher Systemkontext bei jeder Anfrage erneut mitgeschickt, summieren sich die Eingabe-Tokens schnell — bei tausenden Anfragen pro Tag entsteht daraus ein spürbarer Kostenblock, obwohl der eigentliche Nutzerinput klein ist. Wer stattdessen den wiederkehrenden Kontext bündelt und nur die tatsächlich variablen Teile überträgt, senkt den Verbrauch deutlich, ohne an Qualität zu verlieren.
Hier greifen mehrere Hebel ineinander: Ein knapper, präziser System-Prompt reduziert die feste Grundlast jeder Anfrage, während wiederkehrende Bestandteile gebündelt statt wiederholt übertragen werden. Für einfache, gut abgrenzbare Aufgaben kann zudem ein kleineres oder ein Open-Source-LLM ausreichen, das als lokales KI-Modell betrieben keine Token-Gebühren pro Anfrage verursacht.
Neben den reinen Kosten hat die Tokenzahl auch eine Datenschutzdimension: Je mehr — womöglich personenbezogener — Kontext an einen externen Dienst übertragen wird, desto sorgfältiger muss der Datenschutz bei KI-Tools geprüft werden. Sparsame, gut strukturierte Eingaben senken damit nicht nur die Rechnung, sondern auch das Risiko, unnötig viele Daten preiszugeben. So wird der bewusste Umgang mit Tokens zum entscheidenden Faktor dafür, ob eine KI-Anwendung — etwa zur Erstellung von KI-Content — wirtschaftlich und verantwortungsvoll zugleich betrieben werden kann. Für die Planung größerer Projekte empfiehlt es sich, den typischen Tokenverbrauch je Anwendungsfall vorab zu messen und hochzurechnen — so lassen sich monatliche Kosten realistisch abschätzen und Budgetgrenzen setzen, bevor eine Anwendung in den produktiven Betrieb geht. Automatische Warnungen bei Überschreitung eines Schwellenwerts verhindern zusätzlich, dass ein unerwarteter Anstieg des Verbrauchs unbemerkt zu hohen Rechnungen führt.
Tokens im Kontext von KI-Anwendungen
Tokens sind das verbindende Element zwischen technischer Funktionsweise, Kosten und Qualität von KI-Anwendungen. Sie erklären, warum lange Eingaben teurer sind, warum Modelle eine Kapazitätsgrenze haben und warum die Formulierung eines Prompts messbare Folgen hat. Wer mit künstlicher Intelligenz arbeitet, sollte das Konzept verstehen, um Systeme wirtschaftlich und zuverlässig zu betreiben.
Für den professionellen Einsatz — etwa in der KI im Kanzleimarketing — bedeutet das: Prozesse so gestalten, dass sie mit möglichst wenigen Tokens auskommen, ohne relevanten Kontext zu verlieren. Das senkt Kosten, hält Antworten schnell und macht den Einsatz von KI wirtschaftlich planbar. Das Verständnis von Tokens ist damit die Grundlage jeder ernsthaften Kalkulation von KI-Projekten.