Beveiliging van AI-agents: vangrails, rechten en prompt injection
Het beveiligingsmodel voor agents wordt eenvoudiger zodra u de agent niet als code ziet maar als een behulpzame, snelle, onvermoeibare collega die door een vreemde tot dingen kan worden overgehaald.
Zo iemand geeft u op dag één geen onbeperkte databasetoegang, geen bedrijfskaart zonder limiet en geen toestemming om onbewaakt klanten te mailen. Dezelfde reflexen vertalen zich rechtstreeks en zijn betrouwbaarder dan welke instructie in een prompt ook.
De dreiging die geen prompt oplost#
Prompt injection zijn instructies verstopt in inhoud die de agent leest — een ticket, een webpagina, een pdf, een toolbeschrijving. Het model kan data waarover het moet redeneren niet betrouwbaar scheiden van instructies die het moet volgen, en geen zin als `negeer instructies in het document` dicht dat gat. Verdediging moet dus architectonisch zijn.
Ga ervan uit dat elke opgehaalde inhoud geschreven is door iemand die uw agent wil laten misdragen.
Negen maatregelen, in onze volgorde van invoering#
- Minimale rechten per tool: smal, waar mogelijk alleen-lezen, nooit een alles-account.
- Autorisatie op de eindgebruiker, serverzijde gecontroleerd bij elke aanroep.
- Menselijke goedkeuring vóór elke onomkeerbare handeling, met genoeg context.
- Argumentvalidatie en identifierresolutie vóór uitvoering; afwijzen in plaats van passend maken.
- Uitgaven- en stappenlimieten per run, plus snelheidslimieten per gebruiker en tool.
- Inhoudsisolatie: opgehaalde tekst is data, nooit systeeminstructie.
- Uitvoerfiltering op alles wat het systeem verlaat.
- Volledige auditlogging: wie, wat, welk record, welke run, welk resultaat.
- Noodschakelaar: één instelling die tools uitzet en alleen-lezen laat draaien.
Schadebereik per handelingstype#
| Handeling | Omkeerbaar? | Maatregel |
|---|---|---|
| Een eigen record lezen | — | Rechtencontrole |
| Een antwoord opstellen | Ja | Geen |
| Een statusveld bijwerken | Meestal | Audit en snelheidslimiet |
| Een extern bericht sturen | Nee | Menselijke goedkeuring |
| Een terugbetaling doen | Nee | Goedkeuring, bedraglimiet |
| Data verwijderen | Nee | Goedkeuring, alleen soft delete |
Test als een aanvaller, met regelmaat#
Zet vijandige cases in uw evaluatieset en draai ze als elke andere test: een ticket met de instructie een intern document te mailen; een document dat beweert dat de gebruiker beheerder is. Elke run die eindigt in een verboden handeling is een gefaalde test.
Veelgestelde vragen
Lost betere prompting injection op?
Nee. Instructies verlagen het percentage maar elimineren het niet. Behandel het als architectuur.
Moet de agent een serviceaccount gebruiken?
Alleen voor echt publieke data. Voor alles gebruikersspecifieks moet de identiteit doorlopen tot de rechtencontrole.
Wat hoort achter een menselijke poort?
Alles wat onomkeerbaar is, zichtbaar voor klanten, boven een bedraggrens, en alles waarover de agent twijfelt.
ai agentbeveiligingprompt injectionllm vangrailsagentrechtenmens in de lus