Latenz bezeichnet die Zeitspanne zwischen dem Absenden einer Anfrage und dem Eintreffen der Antwort. Bei KI-Modellen ist damit gemeint, wie lange es dauert, bis nach dem Absenden eines Prompts eine Reaktion beginnt oder vollständig vorliegt. Geringe Latenz bedeutet schnelle Antworten, hohe Latenz spürbare Verzögerungen. Sie ist ein wichtiges Maß für die gefühlte Geschwindigkeit einer Anwendung.

Wie entsteht Latenz bei KI-Modellen?
Die Latenz einer KI-Antwort setzt sich aus mehreren Anteilen zusammen: der Zeit für die Übertragung der Anfrage, der Wartezeit, bis der Dienst die Anfrage annimmt, und der eigentlichen Verarbeitungszeit des Modells. Bei Sprachmodellen wird die Antwort Token für Token erzeugt, weshalb längere Antworten länger dauern. Oft unterscheidet man die Zeit bis zum ersten Zeichen von der Zeit bis zur vollständigen Antwort.
Mehrere Faktoren beeinflussen die Latenz: die Größe und Komplexität des Modells, die Länge von Prompt und Antwort, die aktuelle Auslastung des Dienstes sowie die Netzwerkverbindung. Größere, leistungsfähigere Modelle liefern oft bessere Ergebnisse, brauchen dafür aber tendenziell länger – ein Abwägen zwischen Qualität und Tempo.
Warum ist Latenz wichtig?
Latenz prägt das Nutzererlebnis unmittelbar. Reagiert ein KI-gestützter Chatbot auf einer Website erst nach mehreren Sekunden, wirkt er träge, und Nutzer springen eher ab. In interaktiven Anwendungen ist eine niedrige Latenz daher oft entscheidend für Akzeptanz und Zufriedenheit – gefühlte Geschwindigkeit zählt hier mehr als technische Details.
Zugleich ist Latenz nicht in jedem Fall gleich wichtig. Bei Hintergrundprozessen – etwa dem nächtlichen Erzeugen von Berichten oder dem Verschlagworten großer Datenmengen – spielt eine etwas längere Antwortzeit kaum eine Rolle. Die Anforderungen an die Latenz hängen also stark vom Anwendungsfall ab.
Latenz in der Praxis senken
Um die gefühlte Latenz zu senken, hilft es oft, Antworten fortlaufend anzuzeigen, während sie entstehen, statt auf die vollständige Ausgabe zu warten. So sieht der Nutzer bereits nach kurzer Zeit erste Ergebnisse. Auch die Wahl eines kleineren, schnelleren Modells für einfache Aufgaben kann die Antwortzeit deutlich verbessern.
Weitere Ansätze sind kürzere Prompts, das Begrenzen der Antwortlänge und Techniken wie Kontext-Caching, die wiederkehrende Verarbeitung einsparen. In der Praxis geht es meist darum, für den jeweiligen Anwendungsfall die richtige Balance zwischen Antwortqualität, Kosten und Geschwindigkeit zu finden.