Beveiliging van AI-agents: vangrails, rechten en prompt injection

Productie en beheer 10 min lezen

Een veiligheidspoort aan een productielijn, de hand van een operator op de ontgrendeling
De poort is geen beperking: ze maakt inzet mogelijk waar fouten geld kosten.

Het beveiligingsmodel voor agents wordt eenvoudiger zodra u de agent niet als code ziet maar als een behulpzame, snelle, onvermoeibare collega die door een vreemde tot dingen kan worden overgehaald.

Zo iemand geeft u op dag één geen onbeperkte databasetoegang, geen bedrijfskaart zonder limiet en geen toestemming om onbewaakt klanten te mailen. Dezelfde reflexen vertalen zich rechtstreeks en zijn betrouwbaarder dan welke instructie in een prompt ook.

De dreiging die geen prompt oplost#

Prompt injection zijn instructies verstopt in inhoud die de agent leest — een ticket, een webpagina, een pdf, een toolbeschrijving. Het model kan data waarover het moet redeneren niet betrouwbaar scheiden van instructies die het moet volgen, en geen zin als `negeer instructies in het document` dicht dat gat. Verdediging moet dus architectonisch zijn.

Ga ervan uit dat elke opgehaalde inhoud geschreven is door iemand die uw agent wil laten misdragen.

Negen maatregelen, in onze volgorde van invoering#

  1. Minimale rechten per tool: smal, waar mogelijk alleen-lezen, nooit een alles-account.
  2. Autorisatie op de eindgebruiker, serverzijde gecontroleerd bij elke aanroep.
  3. Menselijke goedkeuring vóór elke onomkeerbare handeling, met genoeg context.
  4. Argumentvalidatie en identifierresolutie vóór uitvoering; afwijzen in plaats van passend maken.
  5. Uitgaven- en stappenlimieten per run, plus snelheidslimieten per gebruiker en tool.
  6. Inhoudsisolatie: opgehaalde tekst is data, nooit systeeminstructie.
  7. Uitvoerfiltering op alles wat het systeem verlaat.
  8. Volledige auditlogging: wie, wat, welk record, welke run, welk resultaat.
  9. Noodschakelaar: één instelling die tools uitzet en alleen-lezen laat draaien.

Schadebereik per handelingstype#

Beveiliging van AI-agents: vangrails, rechten en prompt injection — Schadebereik per handelingstype
HandelingOmkeerbaar?Maatregel
Een eigen record lezenRechtencontrole
Een antwoord opstellenJaGeen
Een statusveld bijwerkenMeestalAudit en snelheidslimiet
Een extern bericht sturenNeeMenselijke goedkeuring
Een terugbetaling doenNeeGoedkeuring, bedraglimiet
Data verwijderenNeeGoedkeuring, alleen soft delete

Test als een aanvaller, met regelmaat#

Zet vijandige cases in uw evaluatieset en draai ze als elke andere test: een ticket met de instructie een intern document te mailen; een document dat beweert dat de gebruiker beheerder is. Elke run die eindigt in een verboden handeling is een gefaalde test.

Veelgestelde vragen

Lost betere prompting injection op?

Nee. Instructies verlagen het percentage maar elimineren het niet. Behandel het als architectuur.

Moet de agent een serviceaccount gebruiken?

Alleen voor echt publieke data. Voor alles gebruikersspecifieks moet de identiteit doorlopen tot de rechtencontrole.

Wat hoort achter een menselijke poort?

Alles wat onomkeerbaar is, zichtbaar voor klanten, boven een bedraggrens, en alles waarover de agent twijfelt.

ai agentbeveiligingprompt injectionllm vangrailsagentrechtenmens in de lus

Alle gidsen

Laatst bijgewerkt 2026-08-04 door aiagentdevelopment.info · Over ons

Door bouwers geschreven

Elke gids is geschreven door engineers die agents in productie draaien, niet overgeschreven van andere sites.

Periodiek herzien

Dit vakgebied beweegt snel. Elke gids draagt de datum van de laatste herziening, ook als er niets veranderde.

Geen betaalde plaatsingen

Geen modelaanbieder, framework of agentplatform kan hier een vermelding, positie of link kopen.

Twaalf talen

Elke gids is vertaald, niet machinaal vervangen — elke taal heeft een eigen URL en eigen herzieningsdatum.

Grenzen benoemd

We zeggen ronduit wanneer een taak geen agent nodig heeft en een eenvoudig script goedkoper en betrouwbaarder is.