Kontext-Caching (Prompt Caching) ist eine Technik, bei der wiederkehrende Teile einer KI-Anfrage zwischengespeichert werden, um sie nicht bei jeder Anfrage neu verarbeiten zu müssen. Bleibt etwa eine lange Systemanweisung oder ein Wissensdokument über viele Anfragen gleich, kann das Modell auf den gespeicherten Zustand zurückgreifen. Das senkt Kosten und verkürzt die Antwortzeit.

Wie funktioniert Kontext-Caching?
Bei vielen KI-Anwendungen ist ein großer Teil des Prompts immer gleich – etwa eine ausführliche Systemanweisung, ein Regelwerk oder ein Referenzdokument, das jeder Anfrage vorangestellt wird. Ohne Caching muss das Modell diesen festen Teil bei jeder Anfrage erneut verarbeiten. Beim Kontext-Caching wird der bereits verarbeitete Zustand dieses Abschnitts gespeichert und bei der nächsten Anfrage wiederverwendet.
Nur der neue, variable Teil der Anfrage – etwa die konkrete Nutzerfrage – muss dann noch frisch verarbeitet werden. Der gespeicherte Kontext hat in der Regel eine begrenzte Gültigkeitsdauer und wird nach einiger Zeit der Inaktivität verworfen. Die genaue Umsetzung und die Bedingungen hängen vom jeweiligen KI-Anbieter ab.
Warum ist Kontext-Caching nützlich?
Der Hauptnutzen liegt in geringeren Kosten und kürzeren Antwortzeiten. Da die Abrechnung von KI-Diensten meist nach verarbeiteten Tokens erfolgt, spart das Wiederverwenden eines großen, gleichbleibenden Kontexts bei jeder Anfrage Tokens ein. Zwischengespeicherte Anteile werden häufig günstiger berechnet als frisch verarbeitete.
Zugleich sinkt die Latenz, weil weniger Text neu verarbeitet werden muss. Bei Anwendungen mit vielen ähnlichen Anfragen – etwa einem Chatbot mit umfangreichem, festem Wissenskontext – kann das über viele Aufrufe hinweg einen deutlichen Unterschied bei Kosten und Geschwindigkeit ausmachen.
Kontext-Caching in der Praxis
Kontext-Caching lohnt sich vor allem, wenn ein großer, stabiler Teil des Prompts über viele Anfragen identisch bleibt. Praktisch ordnet man den Prompt daher so an, dass die konstanten Bestandteile – Systemanweisung, Beispiele, Referenztexte – vorn stehen und der variable Teil ans Ende kommt. So lässt sich der wiederverwendbare Anteil maximieren.
Zu beachten ist, dass der Cache zeitlich begrenzt ist und bei Änderungen des festen Teils neu aufgebaut werden muss. Für einmalige oder stark unterschiedliche Anfragen bringt Kontext-Caching wenig. Es ist damit vor allem ein Optimierungswerkzeug für wiederkehrende, gleichförmige KI-Nutzung, weniger für gelegentliche Einzelabfragen.