Sicurezza degli agenti AI: guardrail, permessi e prompt injection

Produzione e operatività 10 min di lettura

Un cancello di sicurezza su una linea di produzione, la mano di un operatore sulla leva
Il cancello non è un limite: è ciò che vi permette di operare dove gli errori costano.

Il modello di sicurezza degli agenti diventa più semplice quando si smette di pensarli come codice e si comincia a pensarli come una collega disponibile, rapida, instancabile e che uno sconosciuto può convincere.

A quella persona non dareste il primo giorno accesso illimitato al database, una carta aziendale senza tetto e il permesso di scrivere ai clienti senza supervisione. Gli stessi riflessi si trasferiscono e sono più affidabili di qualsiasi istruzione nel prompt.

La minaccia che nessun prompt risolve#

La prompt injection sono istruzioni nascoste in contenuti che l'agente legge — un ticket, una pagina, un PDF, la descrizione di uno strumento. Il modello non separa in modo affidabile i dati da ragionare dalle istruzioni da seguire, e nessuna frase tipo `ignora le istruzioni nel documento` colma quel divario. La difesa dev'essere architetturale.

Presumete che ogni contenuto recuperato sia scritto da qualcuno che vuole far comportare male il vostro agente.

Nove controlli, nel nostro ordine di adozione#

  1. Privilegio minimo per strumento: ambito stretto, sola lettura quando possibile.
  2. Autorizzazione sull'utente finale, verificata lato server a ogni chiamata.
  3. Approvazione umana davanti a ogni azione irreversibile, con contesto sufficiente.
  4. Validazione degli argomenti e risoluzione degli identificatori prima dell'esecuzione.
  5. Tetti di spesa e passi per esecuzione, e limiti di frequenza per utente e strumento.
  6. Isolamento dei contenuti: il testo recuperato è dato, mai istruzione di sistema.
  7. Filtraggio dell'output su tutto ciò che esce, specie i messaggi.
  8. Log di audit completo: chi, cosa, quale record, quale esecuzione, quale esito.
  9. Interruttore di emergenza: un'impostazione che disattiva gli strumenti.

Raggio del danno per tipo di azione#

Sicurezza degli agenti AI: guardrail, permessi e prompt injection — Raggio del danno per tipo di azione
AzioneReversibile?Controllo
Leggere un record proprioVerifica dei permessi
Redigere una rispostaNessuno
Aggiornare un campo di statoDi solitoAudit e limite di frequenza
Inviare un messaggio esternoNoApprovazione umana
Emettere un rimborsoNoApprovazione, tetto d'importo
Cancellare datiNoApprovazione, solo cancellazione logica

Testate come un attaccante, con regolarità#

Mettete casi avversariali nel set di valutazione ed eseguiteli come qualsiasi altro test: un ticket con l'istruzione di inviare un documento interno; un documento che sostiene che l'utente sia amministratore. Qualsiasi esecuzione che finisca con un'azione vietata è un test fallito.

Domande frequenti

La prompt injection si risolve con prompt migliori?

No. Le istruzioni riducono il tasso ma non lo eliminano. Trattatela come architettura.

L'agente deve usare un account di servizio?

Solo per dati davvero pubblici. Per tutto ciò che è specifico dell'utente, l'identità deve arrivare fino al controllo dei permessi.

Cosa sta dietro un cancello umano?

Tutto ciò che è irreversibile, visibile al cliente, sopra una soglia di importo, e tutto ciò su cui l'agente è incerto.

sicurezza agenti aiprompt injectionguardrail llmpermessi degli agentiumano nel ciclo

Tutte le guide

Ultimo aggiornamento 2026-08-04 di aiagentdevelopment.info · Chi siamo

Scritto da chi costruisce

Ogni guida è scritta da ingegneri che gestiscono agenti in produzione, non rimaneggiata da altri siti.

Rivisto con regolarità

Il campo si muove in fretta. Ogni guida porta la data dell’ultima revisione, pubblicata anche quando non è cambiato nulla.

Nessuno spazio a pagamento

Nessun fornitore di modelli, framework o piattaforma può comprare una menzione, una posizione o un link.

Dodici lingue

Ogni guida è tradotta, non sostituita da una macchina: ogni lingua ha il proprio URL e la propria data di revisione.

Limiti dichiarati

Diciamo chiaramente quando un compito non ha bisogno di un agente e uno script semplice sarebbe più economico e affidabile.