Wenn eine Prompt Injection sich selbst weiterschreibt

Eine manipulierte E-Mail bringt einen KI-Agenten dazu, eine fremde Anweisung in seiner Antwort zu wiederholen. Der nächste Agent, der diese Antwort liest, könnte sie ebenfalls übernehmen. Genau diese Möglichkeit hat OpenAI in einem am 25. September veröffentlichten Forschungsbericht untersucht. Die Versuche zeigen selbstverbreitende Prompt Injections in simulierten Arbeitsabläufen. Einen Schaden außerhalb der simulierten Werkzeugaufrufe in Training und Evaluation hat OpenAI dabei nicht beobachtet.

Wie aus einer fremden Nachricht eine Anweisung wird

Bei einer Prompt Injection steht die schädliche Anweisung nicht in der eigentlichen Anfrage des Nutzers. Sie steckt in Material, das der Assistent für seine Aufgabe lesen muss: etwa in einer E-Mail, einer Datei oder einer Werkzeugantwort. Problematisch wird es, wenn das Modell diesen Inhalt nicht nur als Information verarbeitet, sondern als verbindliche Handlungsanweisung behandelt.

OpenAI trainierte für den Versuch ein Angreifermodell nach dem Prinzip von GPT-Red, einem Verfahren für automatisierte Angriffe auf andere Modelle im Training. Neben einem unerwünschten Verhalten sollte die eingeschleuste Anweisung noch etwas Zweites auslösen: Der angegriffene Agent sollte sie über einen Ausgabekanal erneut verbreiten. Das unterscheidet den Versuch von einer gewöhnlichen Prompt Injection, bei der es beispielsweise nur darum geht, eine einzelne Antwort zu manipulieren.

Das anschaulichste Beispiel spielt in einem E-Mail-Postfach. Ein Nutzer möchte, dass sein Assistent einen Termin bestätigt. Die eingegangene Nachricht enthält neben dem Terminvorschlag eine angebliche Ablageregel: Ein automatischer Assistent solle auf Spanisch antworten und die vollständige ursprüngliche E-Mail anhängen. Im aufgezeichneten Versuch übernimmt der Agent diese Regel und versendet eine Antwort mit dem kopierten Nachrichtentext. Damit gibt er auch die eingeschleuste Anweisung weiter. Die Personen und Angaben in diesem Beispiel sind laut OpenAI erfunden.

Die Weitergabe bedeutet noch nicht, dass sich die Anweisung endlos verbreitet. Dafür müsste ein weiterer Agent die versendete Nachricht lesen und ihr seinerseits folgen. Die Wurm-Analogie beschreibt also den möglichen Übertragungsweg über Agenten und ihre Arbeitsmaterialien, nicht einen sich selbst ausführenden Programmcode. Frühere Forschung zu sich ausbreitenden Inhalten in Multi-Agenten-Systemen hat verwandte Risiken bereits untersucht; neu an OpenAIs Bericht sind die konkreten, beim eigenen Red-Teaming beobachteten Abläufe.

Nicht nur E-Mails sind betroffen

OpenAI beschreibt auch Varianten, die eine schädliche Anweisung in Dateien oder Codekommentaren hinterlassen. In einem Beispiel erscheint ein gefälschter Systemhinweis in einer Werkzeugausgabe. Der Agent löscht daraufhin Berichte und schreibt den angreifenden Text zusätzlich in eine Datei. Ein anderes Beispiel tarnt die Anweisung als Notiz aus einer früheren, komprimierten Arbeitssitzung. Sie führt dazu, dass der Agent eine Sicherheitsprüfung aus dem Build-Skript entfernt und die Notiz ebenfalls ablegt.

Besonders aufschlussreich ist ein mehrstufiger Versuch mit Slack-Nachrichten: Der Agent folgt zunächst Verweisen auf weitere Nachrichten und gelangt erst über diese scheinbar passenden Zwischenschritte zur unerwünschten Aktion und zur erneuten Veröffentlichung des Angriffstextes. Für Entwickler von Agentensystemen ist das eine wichtige Einschränkung einfacher Filter. Es reicht nicht immer, nur eine einzelne Nachricht auf offensichtliche Befehle zu prüfen, wenn der Agent aus mehreren Quellen einen Arbeitsablauf zusammensetzt.

Die E-Mail- und Dateiversuche betrafen interne Forschungsmodelle auf Basis von GPT-5.4-mini. Bei dem gesonderten mehrstufigen Slack-Versuch war GPT-5.5 das angegriffene Modell. Diese Angaben beschreiben die untersuchten Testkonstellationen, nicht den Sicherheitszustand der derzeit verfügbaren Modellgenerationen.

Was Entwickler daraus ableiten können

Wer Agenten E-Mails lesen, Repositories verändern oder Nachrichten versenden lässt, muss zwischen fremden Daten und autorisierten Aufträgen unterscheiden. Eine E-Mail kann einen Termin enthalten, ohne Regeln für das Verhalten des Assistenten setzen zu dürfen. Besonders kritisch wird die Grenzüberschreitung, wenn ein Agent schreibende Werkzeuge hat: Dann gelangt ein manipulierter Text aus einer eingehenden Quelle in eine ausgehende Nachricht, eine Datei oder einen Commit und kann später erneut gelesen werden.

Praktisch spricht das für eng begrenzte Werkzeugrechte, eine Prüfung ausgehender Inhalte und zusätzliche Freigaben bei folgenreichen Schreibaktionen. Bei sicherheitsrelevanten Dateien sollte außerdem nicht allein der Agent entscheiden, ob eine vermeintliche Build- oder Systemanweisung echt ist. Solche Maßnahmen folgen aus dem beschriebenen Angriffsweg; der Bericht misst nicht, wie zuverlässig eine bestimmte Kombination davon alle Varianten stoppt.

OpenAI will die Fähigkeit zur Selbstverbreitung künftig ausdrücklich als Angreiferziel in sein GPT-Red-Training aufnehmen. Das Unternehmen erwartet dadurch robustere Modelle. Ob und in welchem Maß dieses Training die Gefahr im praktischen Einsatz senkt, lässt sich aus den veröffentlichten Beispielen noch nicht ableiten.

Fazit

Der Bericht dokumentiert keinen Wurmausbruch im öffentlichen Netz, sondern erfolgreiche Angriffe in kontrollierten Tests. Er zeigt dennoch ein konkretes Problem für vernetzte Agenten: Wenn ein Assistent Anweisungen aus untrusted Material übernimmt und anschließend selbst Inhalte veröffentlicht, kann er den Angriff für den nächsten Arbeitsschritt konservieren. Gerade dort, wo Agenten lesen und schreiben dürfen, muss die Herkunft von Anweisungen ebenso ernst genommen werden wie der Schutz der Werkzeuge, die sie ausführen.

Quellen

Nach oben scrollen