Prompt Injection ist ein Angriff auf KI-Sprachmodelle, bei dem manipulierte Eingaben das Modell dazu bringen, seine ursprünglichen Anweisungen zu ignorieren oder unerwünschte Aktionen auszuführen. Angreifer schmuggeln versteckte Befehle in Texte, Webseiten oder Dokumente, die das Modell verarbeitet. Prompt Injection zählt zu den zentralen Sicherheitsrisiken beim Einsatz von KI-Assistenten.

Was ist Prompt Injection?
Prompt Injection ist ein Angriff auf KI-Sprachmodelle, bei dem manipulierte Eingaben das Modell dazu bringen, seine ursprünglichen Anweisungen zu ignorieren oder unerwünschte Aktionen auszuführen. Angreifer schmuggeln versteckte Befehle in Texte, Webseiten oder Dokumente, die ein KI-System verarbeitet. Prompt Injection zählt zu den zentralen Sicherheitsrisiken beim Einsatz von KI-Assistenten und betrifft praktisch jedes große Sprachmodell.
Öffentlich beschrieben wurde die Klasse dieser Angriffe 2022 unter anderem vom Entwickler Simon Willison, dessen Analyse zu Prompt Injection den Begriff prägte. Das Sicherheitsprojekt OWASP führt Prompt Injection seither als eigenständiges Top-Risiko: In der OWASP-Liste zu LLM-Risiken steht sie an erster Stelle. Auch das Bundesamt für Sicherheit in der Informationstechnik behandelt das Thema in seinen Materialien zur künstlichen Intelligenz.
Wie funktioniert Prompt Injection?
Ein Sprachmodell unterscheidet nicht zuverlässig zwischen den Anweisungen seines Betreibers — dem System-Prompt — und Inhalten, die es zur Bearbeitung erhält. Beides erreicht das Modell als Text im selben Kontextfenster. Bei der direkten Prompt Injection gibt ein Nutzer selbst manipulative Befehle ein, etwa „Ignoriere alle bisherigen Anweisungen“. Diese Variante zielt oft darauf, Schutzmechanismen zu umgehen, und ähnelt dem sogenannten Jailbreaking.
Bei der gefährlicheren indirekten Variante versteckt ein Angreifer Befehle in externen Inhalten. Verarbeitet ein Assistent etwa eine Webseite, eine E-Mail oder ein Dokument mit verstecktem Text, kann er die dort eingeschmuggelten Anweisungen fälschlich als legitime Befehle auffassen. Besonders kritisch wird das, wenn das Modell über Werkzeuge per Function Calling Aktionen auslösen oder über Retrieval Augmented Generation auf sensible Daten zugreifen kann. Wissenschaftlich beschrieben wurde diese indirekte Variante unter anderem in einer viel zitierten Fachpublikation von 2023.
Versteckt werden Befehle mit einfachen Mitteln: weißer Text auf weißem Grund, sehr kleine Schrift, Kommentare im Quelltext einer Seite oder Anweisungen in Metadaten und Alternativtexten von Bildern. Der menschliche Betrachter sieht davon nichts, das Modell aber verarbeitet den vollständigen Text. Genau diese Diskrepanz zwischen dem, was ein Mensch wahrnimmt, und dem, was das Modell liest, macht indirekte Angriffe so tückisch — sie lassen sich in scheinbar harmlose Inhalte einbetten, die ein Nutzer arglos an seinen Assistenten weitergibt.
Warum ist Prompt Injection so gefährlich?
Erfolgreiche Angriffe können dazu führen, dass ein KI-Assistent vertrauliche Informationen preisgibt, falsche Auskünfte erteilt oder unerwünschte Aktionen ausführt, etwa Daten an Dritte weiterleitet. Je mehr Rechte und Werkzeuge ein KI-System besitzt, desto größer der potenzielle Schaden. Ein reiner Chatbot ohne Systemzugriff kann höchstens falschen Text erzeugen; ein Agent mit E-Mail- und Datenbankzugriff kann realen Schaden anrichten.
Für Unternehmen und Kanzleien, die KI mit internen Daten verbinden, ist das ein ernstes Risiko — gerade mit Blick auf die DSGVO und Berufsgeheimnisse. Da sich Prompt Injection nach heutigem Stand nicht vollständig ausschließen lässt, ist ein defensives Design Pflicht. Halluzinationen sind dabei nur ein Randproblem; die eigentliche Gefahr liegt in der gezielten Manipulation. Auch die Unterscheidung zur bloßen Halluzination ist wichtig: Prompt Injection ist ein Angriff, kein Zufallsfehler. Während sich Halluzinationen durch bessere Daten und Modelle verringern lassen, bleibt Prompt Injection eine gezielte Ausnutzung der Funktionsweise — sie verschwindet nicht von selbst, wenn Modelle leistungsfähiger werden.
Wie kann man sich schützen?
Einen hundertprozentigen Schutz gibt es nach aktuellem Stand nicht — das betont auch OWASP in seinem Projekt zu LLM-Sicherheit. Wirksam ist ein Bündel von Maßnahmen: die strikte Trennung von Anweisungen und Daten, das Prinzip der minimalen Rechte für angebundene Werkzeuge, sowie Guardrails, die Ein- und Ausgaben filtern. Sensible Aktionen sollten eine menschliche Bestätigung erfordern.
Weitere Bausteine sind die Kennzeichnung nicht vertrauenswürdiger Inhalte, das Ausfiltern versteckter Textbestandteile aus verarbeiteten Dokumenten und eine klare Begrenzung dessen, was ein KI-Agent überhaupt auslösen darf. Ergänzend hilft Monitoring: Ungewöhnliche Aktionsmuster sollten protokolliert und überprüft werden. Sorgfältiges Prompt Engineering mit robusten Systemanweisungen erschwert Angriffe zusätzlich, ersetzt aber die technischen Schutzschichten nicht.
Ein bewährtes Leitprinzip ist, externe Inhalte grundsätzlich als potenziell feindlich zu behandeln — ähnlich wie in der klassischen IT-Sicherheit jede Nutzereingabe als nicht vertrauenswürdig gilt. Konkret heißt das: Ein Modell sollte aus einem verarbeiteten Dokument Informationen entnehmen dürfen, aber keine Handlungsanweisungen. Wo eine Aktion mit Außenwirkung ansteht — eine E-Mail, eine Überweisung, das Löschen von Daten —, gehört eine ausdrückliche menschliche Freigabe dazwischen. So bleibt der Schaden begrenzt, selbst wenn eine Injection das Modell erfolgreich täuscht.
Prompt Injection in der Praxis
Praktische Beispiele reichen von harmlos bis kritisch. In frühen Demonstrationen brachten Nutzer öffentliche Chatbots mit versteckten Anweisungen dazu, ihren geheimen System-Prompt preiszugeben oder unangemessene Antworten zu geben. In gefährlicheren Szenarien wurde gezeigt, wie eine manipulierte Webseite einen KI-Assistenten mit Browser-Zugriff dazu bewegen kann, Daten aus anderen geöffneten Sitzungen auszulesen.
Für Betreiber bedeutet das: Jede neue Fähigkeit eines KI-Systems — Datei-Zugriff, Werkzeugnutzung, Token-lastige lange Kontexte mit fremden Inhalten — erweitert auch die Angriffsfläche. Wer etwa ChatGPT oder vergleichbare Assistenten in Geschäftsprozesse einbindet, sollte Prompt Injection früh im Design mitdenken, statt sie als nachträgliches Sicherheitsthema zu behandeln.
Für Kanzleien und Unternehmen mit sensiblen Mandats- oder Kundendaten ist besondere Vorsicht geboten, wenn KI-Systeme Dokumente von außen entgegennehmen — eingehende E-Mails, hochgeladene PDFs, verlinkte Webseiten. Genau hier setzt die indirekte Injection an. Ein pragmatischer Ansatz ist, solche Systeme zunächst nur lesend und ohne Zugriff auf vertrauliche Bestände zu betreiben und Automatisierung mit Außenwirkung erst nach gründlicher Prüfung schrittweise freizugeben.
Einordnung: KI-Sicherheit als Daueraufgabe
Prompt Injection ist kein vorübergehender Bug, sondern eine strukturelle Eigenschaft heutiger Sprachmodelle: Solange Anweisungen und Daten denselben Kanal teilen, bleibt die Grenze angreifbar. Die Forschung arbeitet an Architekturen, die beides sauberer trennen, doch bis dahin gilt Verteidigung in der Tiefe als bester Ansatz.
Für die Praxis heißt das, KI-Sicherheit als fortlaufenden Prozess zu verstehen — mit regelmäßigen Tests, klaren Berechtigungsgrenzen und dem Bewusstsein, dass jede Automatisierung mit Datenzugriff ein Risiko trägt. Je verantwortungsvoller Modelle wie Claude und andere in sensiblen Bereichen eingesetzt werden, desto wichtiger wird dieses Sicherheitsdenken.
Regulatorisch rückt das Thema ebenfalls in den Fokus: Sicherheitsbehörden und der europäische Rechtsrahmen für künstliche Intelligenz erwarten von Anbietern zunehmend nachweisbare Schutzmaßnahmen und Risikoabschätzungen. Prompt Injection wird damit von einer rein technischen zu einer auch organisatorischen Frage — mit Verantwortlichkeiten, Dokumentation und wiederkehrender Prüfung. Wer KI produktiv einsetzt, sollte den Umgang mit dieser Schwachstelle daher als festen Bestandteil seines Sicherheitskonzepts behandeln, nicht als optionale Ergänzung.