Säkerhet och skyddsräcken för AI-agenter
Den viktigaste meningen i agentsäkerhet är att modellen inte kan skilja på er instruktion och en instruktion som råkade stå i ett dokument den läste. Allt annat följer av det.
Därför är prompten fel plats att lägga era gränser. Den vägleder beteende; den kan inte hindra en handling.
Hotbilden, kort#
- Promptinjektion: text i ett dokument, e-post eller sida som instruerar agenten.
- Förvirrad ställföreträdare: agenten använder sina egna höga rättigheter för användarens räkning.
- Dataexfiltrering: känsligt innehåll skickas ut via ett verktyg eller en länk.
- Verktygskedjor: två ofarliga verktyg som tillsammans blir en skadlig handling.
- Beroendekedja: en tredjepartsverktygsserver vars beskrivningar hamnar i er kontext.
Var gränsen ska ligga#
| Kontroll | Var den hör hemma | Styrka |
|---|---|---|
| "Radera aldrig data" i prompten | Prompt | Förslag |
| Verktyget saknar raderingsförmåga | Kod | Gräns |
| Rättighetskontroll per anrop | Serversidan | Gräns |
| Godkännande över ett belopp | Kod plus människa | Gräns |
| Utgående domäner i tillåtlista | Nätverk | Gräns |
Sju kontroller vi alltid inför#
- Kör verktyg med slutanvändarens rättigheter, aldrig med en tjänstidentitet med full åtkomst.
- Separera läsande och skrivande verktyg och kräv godkännande för de skrivande som gör ont.
- Validera alla argument på serversidan mot ett strikt schema.
- Behandla hämtat innehåll som data: markera det tydligt och låt aldrig verktygsval styras enbart av det.
- Tillåtlista utgående nätverksmål så att exfiltrering inte har någon väg.
- Sätt tak per körning och per användare på belopp, antal handlingar och kostnad.
- Logga varje verktygsanrop med identitet och argument, och behåll loggen som revisionsspår.
Testa som en angripare#
Lägg injektionsfall i utvärderingsmängden: ett dokument som ber agenten ignorera instruktioner, en post som ber den e-posta ut data, ett fält som innehåller ett verktygsnamn. Kör dem vid varje modellbyte.
Ett skyddsräcke som ingen försökt bryta är ett antagande.
Vanliga frågor
Går promptinjektion att lösa helt?
Nej. Den kan begränsas till obetydlig skada genom att begränsa vad agenten får göra.
Hjälper en modell som filtrerar indata?
Något, som ett lager. Den ersätter inte rättigheter och godkännanden.
Vad är den vanligaste verkliga bristen?
En agent som kör med en tjänstidentitet som ser allt.
agentsäkerhetpromptinjektionskyddsräckenförvirrad ställföreträdarellm-säkerhet