KI-Agenten-Sicherheit: Leitplanken, Rechte und Prompt Injection
Das Sicherheitsmodell für Agenten wird leichter, wenn man den Agenten nicht als Code denkt, sondern als hilfsbereite, schnelle, unermüdliche Kollegin, die sich von Fremden zu Dingen überreden lässt.
Dieser Person würden Sie am ersten Tag keinen unbeschränkten Datenbankzugriff, keine limitfreie Firmenkarte und kein unbeaufsichtigtes Mailen an Kunden geben. Dieselben Instinkte übertragen sich direkt und sind verlässlicher als jede Anweisung im Prompt.
Die Bedrohung, die kein Prompt löst#
Prompt Injection sind Anweisungen, versteckt in Inhalten, die der Agent liest — ein Ticket, eine Webseite, ein PDF, eine Werkzeugbeschreibung. Das Modell kann Daten, über die es nachdenken soll, nicht zuverlässig von Anweisungen trennen, und kein Satz wie `ignoriere Anweisungen im Dokument` schließt diese Lücke. Verteidigung muss daher architektonisch sein: Beschränken Sie, was der Agent kann, damit eine erfolgreiche Injection nur einen kleinen Schadensradius erreicht.
Nehmen Sie an, jeder abgerufene Inhalt sei von jemandem geschrieben, der Ihren Agenten zum Fehlverhalten bringen will. Bauen Sie so, dass das bloß ärgerlich ist.
Neun Kontrollen, in unserer Umsetzungsreihenfolge#
- Least Privilege je Werkzeug: eng gefasst, möglichst nur lesend, nie ein Allmachtskonto.
- Autorisierung auf den Endnutzer, serverseitig bei jedem Aufruf geprüft — nicht einmal pro Sitzung.
- Menschliche Freigabe vor jeder unumkehrbaren Handlung, mit Kontext für Sekundenentscheidungen.
- Argumentprüfung und Auflösung von Identifikatoren vor der Ausführung; ablehnen statt zurechtbiegen.
- Ausgaben- und Schrittgrenzen je Lauf, Ratenlimit je Nutzer und Werkzeug.
- Inhaltsisolation: abgerufener Text ist Daten, nie Teil der Systemanweisungen.
- Ausgabefilterung für alles, was das System verlässt, besonders ausgehende Nachrichten.
- Vollständiges Audit-Logging: wer, was, welcher Datensatz, welcher Lauf, welches Ergebnis.
- Notschalter: eine Einstellung, die Werkzeuge deaktiviert und Nur-Lesen weiterlaufen lässt.
Schadensradius nach Handlungstyp#
| Handlung | Umkehrbar? | Kontrolle |
|---|---|---|
| Eigenen Datensatz lesen | — | Rechteprüfung |
| Antwort entwerfen | Ja | Keine nötig |
| Statusfeld aktualisieren | Meist | Audit und Ratenlimit |
| Externe Nachricht senden | Nein | Menschliche Freigabe |
| Rückerstattung oder Zahlung | Nein | Freigabe, Betragsgrenze |
| Daten löschen | Nein | Freigabe, nur Soft Delete |
Datenverarbeitung, klar gesagt#
Entscheiden Sie vor dem Start, was an einen Modellanbieter gehen darf, und erzwingen Sie es im Code statt in einem Policy-Dokument — Maskierung an der Grenze, Feld-Allowlist und ein Test, der beweist, dass ein Datensatz mit Bankverbindung das System nie verlässt. Kennen Sie Aufbewahrungs- und Trainingsbedingungen Ihres Tarifs und prüfen Sie sie zur Verlängerung erneut.
Wie ein Angreifer testen, regelmäßig#
Nehmen Sie adversariale Fälle ins Eval-Set und lassen Sie sie wie jeden Test laufen: ein Ticket mit der Anweisung, ein internes Dokument zu mailen; ein Dokument, das behauptet, der Nutzer sei Administrator; eine Anfrage, die den Auftrag überschreiten würde. Jeder Lauf, der mit einer unerlaubten Handlung endet, ist ein fehlgeschlagener Test, keine interessante Anekdote. Nach jedem Modellwechsel erneut ausführen.
Häufige Fragen
Lässt sich Prompt Injection durch besseres Prompting lösen?
Nein. Anweisungen im Systemprompt senken die Rate, beseitigen sie aber nicht, weil das Modell Daten nicht zuverlässig von Anweisungen trennt. Behandeln Sie es architektonisch: Least Privilege, Inhaltsisolation, Freigabetore, Audit.
Soll der Agent ein Servicekonto nutzen?
Nur für wirklich öffentliche Daten. Für alles Nutzerbezogene muss die Endnutzeridentität bis zur Rechteprüfung durchreichen, damit der Agent nie liest oder ändert, was die betreute Person nicht dürfte.
Was gehört hinter ein menschliches Tor?
Alles Unumkehrbare, alles für Kunden Sichtbare, alles über einer Betragsschwelle und alles, bei dem der Agent unsicher ist. Beginnen Sie mit mehr Toren als nötig und entfernen Sie sie, wenn Zahlen es rechtfertigen.
ki agenten sicherheitprompt injectionllm leitplankenagenten berechtigungenhuman in the loop