KI-Agenten-Sicherheit: Leitplanken, Rechte und Prompt Injection

Betrieb und Produktion 10 Min. Lesezeit

Ein Sicherheitstor an einer Fertigungslinie, die Hand einer Bedienerin am Auslöser
Das Tor ist keine Einschränkung. Es erlaubt den Einsatz dort, wo Fehler Geld kosten.

Das Sicherheitsmodell für Agenten wird leichter, wenn man den Agenten nicht als Code denkt, sondern als hilfsbereite, schnelle, unermüdliche Kollegin, die sich von Fremden zu Dingen überreden lässt.

Dieser Person würden Sie am ersten Tag keinen unbeschränkten Datenbankzugriff, keine limitfreie Firmenkarte und kein unbeaufsichtigtes Mailen an Kunden geben. Dieselben Instinkte übertragen sich direkt und sind verlässlicher als jede Anweisung im Prompt.

Die Bedrohung, die kein Prompt löst#

Prompt Injection sind Anweisungen, versteckt in Inhalten, die der Agent liest — ein Ticket, eine Webseite, ein PDF, eine Werkzeugbeschreibung. Das Modell kann Daten, über die es nachdenken soll, nicht zuverlässig von Anweisungen trennen, und kein Satz wie `ignoriere Anweisungen im Dokument` schließt diese Lücke. Verteidigung muss daher architektonisch sein: Beschränken Sie, was der Agent kann, damit eine erfolgreiche Injection nur einen kleinen Schadensradius erreicht.

Nehmen Sie an, jeder abgerufene Inhalt sei von jemandem geschrieben, der Ihren Agenten zum Fehlverhalten bringen will. Bauen Sie so, dass das bloß ärgerlich ist.

Neun Kontrollen, in unserer Umsetzungsreihenfolge#

  1. Least Privilege je Werkzeug: eng gefasst, möglichst nur lesend, nie ein Allmachtskonto.
  2. Autorisierung auf den Endnutzer, serverseitig bei jedem Aufruf geprüft — nicht einmal pro Sitzung.
  3. Menschliche Freigabe vor jeder unumkehrbaren Handlung, mit Kontext für Sekundenentscheidungen.
  4. Argumentprüfung und Auflösung von Identifikatoren vor der Ausführung; ablehnen statt zurechtbiegen.
  5. Ausgaben- und Schrittgrenzen je Lauf, Ratenlimit je Nutzer und Werkzeug.
  6. Inhaltsisolation: abgerufener Text ist Daten, nie Teil der Systemanweisungen.
  7. Ausgabefilterung für alles, was das System verlässt, besonders ausgehende Nachrichten.
  8. Vollständiges Audit-Logging: wer, was, welcher Datensatz, welcher Lauf, welches Ergebnis.
  9. Notschalter: eine Einstellung, die Werkzeuge deaktiviert und Nur-Lesen weiterlaufen lässt.

Schadensradius nach Handlungstyp#

KI-Agenten-Sicherheit: Leitplanken, Rechte und Prompt Injection — Schadensradius nach Handlungstyp
HandlungUmkehrbar?Kontrolle
Eigenen Datensatz lesenRechteprüfung
Antwort entwerfenJaKeine nötig
Statusfeld aktualisierenMeistAudit und Ratenlimit
Externe Nachricht sendenNeinMenschliche Freigabe
Rückerstattung oder ZahlungNeinFreigabe, Betragsgrenze
Daten löschenNeinFreigabe, nur Soft Delete

Datenverarbeitung, klar gesagt#

Entscheiden Sie vor dem Start, was an einen Modellanbieter gehen darf, und erzwingen Sie es im Code statt in einem Policy-Dokument — Maskierung an der Grenze, Feld-Allowlist und ein Test, der beweist, dass ein Datensatz mit Bankverbindung das System nie verlässt. Kennen Sie Aufbewahrungs- und Trainingsbedingungen Ihres Tarifs und prüfen Sie sie zur Verlängerung erneut.

Wie ein Angreifer testen, regelmäßig#

Nehmen Sie adversariale Fälle ins Eval-Set und lassen Sie sie wie jeden Test laufen: ein Ticket mit der Anweisung, ein internes Dokument zu mailen; ein Dokument, das behauptet, der Nutzer sei Administrator; eine Anfrage, die den Auftrag überschreiten würde. Jeder Lauf, der mit einer unerlaubten Handlung endet, ist ein fehlgeschlagener Test, keine interessante Anekdote. Nach jedem Modellwechsel erneut ausführen.

Häufige Fragen

Lässt sich Prompt Injection durch besseres Prompting lösen?

Nein. Anweisungen im Systemprompt senken die Rate, beseitigen sie aber nicht, weil das Modell Daten nicht zuverlässig von Anweisungen trennt. Behandeln Sie es architektonisch: Least Privilege, Inhaltsisolation, Freigabetore, Audit.

Soll der Agent ein Servicekonto nutzen?

Nur für wirklich öffentliche Daten. Für alles Nutzerbezogene muss die Endnutzeridentität bis zur Rechteprüfung durchreichen, damit der Agent nie liest oder ändert, was die betreute Person nicht dürfte.

Was gehört hinter ein menschliches Tor?

Alles Unumkehrbare, alles für Kunden Sichtbare, alles über einer Betragsschwelle und alles, bei dem der Agent unsicher ist. Beginnen Sie mit mehr Toren als nötig und entfernen Sie sie, wenn Zahlen es rechtfertigen.

ki agenten sicherheitprompt injectionllm leitplankenagenten berechtigungenhuman in the loop

Alle Leitfäden

Zuletzt aktualisiert 2026-08-04 von aiagentdevelopment.info · Über uns

Von Praktikern

Jeder Leitfaden stammt von Engineers, die Agenten produktiv betreiben — nicht von anderen Seiten umgeschrieben.

Regelmäßig geprüft

Das Feld bewegt sich schnell. Jeder Leitfaden trägt das Datum der letzten Prüfung — auch wenn sich nichts geändert hat.

Keine bezahlten Platzierungen

Kein Modellanbieter, Framework oder Agentenplattform kann hier Erwähnung, Platzierung oder Link kaufen.

Zwölf Sprachen

Jeder Leitfaden wird übersetzt, nicht maschinell eingeblendet — jede Sprache hat eigene URL und eigenes Prüfdatum.

Grenzen benannt

Wir sagen klar, wenn eine Aufgabe keinen Agenten braucht und ein einfaches Skript billiger und verlässlicher wäre.