Prompt Injection ist ein Angriff auf KI-Sprachmodelle, bei dem manipulierte Eingaben das Modell dazu bringen, seine ursprünglichen Anweisungen zu ignorieren oder unerwünschte Aktionen auszuführen. Angreifer schmuggeln versteckte Befehle in Texte, Webseiten oder Dokumente, die das Modell verarbeitet. Prompt Injection zählt zu den zentralen Sicherheitsrisiken beim Einsatz von KI-Assistenten.
Wie funktioniert Prompt Injection?
Ein Sprachmodell unterscheidet nicht zuverlässig zwischen den Anweisungen seines Betreibers und Inhalten, die es zur Bearbeitung erhält. Bei der direkten Prompt Injection gibt ein Nutzer selbst manipulative Befehle ein, etwa „Ignoriere alle bisherigen Anweisungen“. Bei der indirekten Variante versteckt ein Angreifer Befehle in externen Inhalten.
Verarbeitet ein Assistent zum Beispiel eine Webseite oder ein Dokument mit verstecktem Text, kann er die dort eingeschmuggelten Anweisungen fälschlich als legitime Befehle auffassen. Besonders kritisch wird das, wenn das Modell über Werkzeuge Aktionen auslösen oder auf sensible Daten zugreifen kann.
Warum ist Prompt Injection gefährlich?
Erfolgreiche Angriffe können dazu führen, dass ein Assistent vertrauliche Informationen preisgibt, falsche Auskünfte gibt oder unerwünschte Aktionen ausführt, etwa Daten weiterleitet. Je mehr Rechte und Werkzeuge ein KI-System hat, desto größer der potenzielle Schaden.
Für Unternehmen und Kanzleien, die KI mit internen Daten verbinden, ist das ein ernstes Risiko. Da sich Prompt Injection nach heutigem Stand nicht vollständig ausschließen lässt, ist ein defensives Design mit klaren Grenzen entscheidend. Eingaben aus unsicheren Quellen dürfen nie unkritisch als Befehle behandelt werden.
Das Risiko wächst mit der Autonomie des Systems. Ein Assistent, der nur Text ausgibt, kann weniger Schaden anrichten als einer, der eigenständig E-Mails versendet oder auf Datenbanken zugreift. Deshalb sollte der Funktionsumfang eines KI-Systems bewusst auf das Nötige begrenzt werden.
Prompt Injection in der Praxis absichern
Zu den Schutzmaßnahmen zählen strikte Berechtigungen, sodass ein Assistent nur die nötigsten Werkzeuge und Daten erreicht. Sensible Aktionen sollten eine menschliche Freigabe erfordern. Zudem helfen Filter für Ein- und Ausgaben sowie eine klare Trennung zwischen vertrauenswürdigen Systemanweisungen und externen Inhalten. Ebenso wichtig ist die Sensibilisierung der Mitarbeitenden, damit ungewöhnliches Verhalten eines Assistenten früh erkannt und gemeldet wird.
Wichtig ist das Bewusstsein, dass Inhalte aus dem Web, aus E-Mails oder aus hochgeladenen Dokumenten manipuliert sein können. Ein Assistent sollte solche Inhalte als Daten behandeln, nicht als Anweisungen. Regelmäßige Tests und eine Protokollierung kritischer Aktionen erhöhen die Sicherheit zusätzlich.