Sicurezza degli agenti AI: guardrail, permessi e prompt injection
Il modello di sicurezza degli agenti diventa più semplice quando si smette di pensarli come codice e si comincia a pensarli come una collega disponibile, rapida, instancabile e che uno sconosciuto può convincere.
A quella persona non dareste il primo giorno accesso illimitato al database, una carta aziendale senza tetto e il permesso di scrivere ai clienti senza supervisione. Gli stessi riflessi si trasferiscono e sono più affidabili di qualsiasi istruzione nel prompt.
La minaccia che nessun prompt risolve#
La prompt injection sono istruzioni nascoste in contenuti che l'agente legge — un ticket, una pagina, un PDF, la descrizione di uno strumento. Il modello non separa in modo affidabile i dati da ragionare dalle istruzioni da seguire, e nessuna frase tipo `ignora le istruzioni nel documento` colma quel divario. La difesa dev'essere architetturale.
Presumete che ogni contenuto recuperato sia scritto da qualcuno che vuole far comportare male il vostro agente.
Nove controlli, nel nostro ordine di adozione#
- Privilegio minimo per strumento: ambito stretto, sola lettura quando possibile.
- Autorizzazione sull'utente finale, verificata lato server a ogni chiamata.
- Approvazione umana davanti a ogni azione irreversibile, con contesto sufficiente.
- Validazione degli argomenti e risoluzione degli identificatori prima dell'esecuzione.
- Tetti di spesa e passi per esecuzione, e limiti di frequenza per utente e strumento.
- Isolamento dei contenuti: il testo recuperato è dato, mai istruzione di sistema.
- Filtraggio dell'output su tutto ciò che esce, specie i messaggi.
- Log di audit completo: chi, cosa, quale record, quale esecuzione, quale esito.
- Interruttore di emergenza: un'impostazione che disattiva gli strumenti.
Raggio del danno per tipo di azione#
| Azione | Reversibile? | Controllo |
|---|---|---|
| Leggere un record proprio | — | Verifica dei permessi |
| Redigere una risposta | Sì | Nessuno |
| Aggiornare un campo di stato | Di solito | Audit e limite di frequenza |
| Inviare un messaggio esterno | No | Approvazione umana |
| Emettere un rimborso | No | Approvazione, tetto d'importo |
| Cancellare dati | No | Approvazione, solo cancellazione logica |
Testate come un attaccante, con regolarità#
Mettete casi avversariali nel set di valutazione ed eseguiteli come qualsiasi altro test: un ticket con l'istruzione di inviare un documento interno; un documento che sostiene che l'utente sia amministratore. Qualsiasi esecuzione che finisca con un'azione vietata è un test fallito.
Domande frequenti
La prompt injection si risolve con prompt migliori?
No. Le istruzioni riducono il tasso ma non lo eliminano. Trattatela come architettura.
L'agente deve usare un account di servizio?
Solo per dati davvero pubblici. Per tutto ciò che è specifico dell'utente, l'identità deve arrivare fino al controllo dei permessi.
Cosa sta dietro un cancello umano?
Tutto ciò che è irreversibile, visibile al cliente, sopra una soglia di importo, e tutto ciò su cui l'agente è incerto.
sicurezza agenti aiprompt injectionguardrail llmpermessi degli agentiumano nel ciclo