Una roadmap per agenti AI che arriva davvero in produzione
Lo schema di fallimento dei progetti di agenti non è tecnico. È un buon prototipo alla terza settimana, seguito da tre mesi di miglioramenti senza direzione e da una cancellazione silenziosa perché nessuno sapeva dire se fosse pronto.
Questa roadmap lo corregge con test di uscita. Ogni fase ha una condizione scritta prima che la fase inizi, soddisfatta o no. Se una fase non passa il suo test, correggete la lacuna concreta o vi fermate.
Fase 1 — Perimetro (1–2 settimane)#
Scrivete il compito come una frase che un revisore possa segnare giusta o sbagliata. Elencate gli strumenti con i loro schemi. Decidete quali azioni sono irreversibili. Raccogliete venti esempi reali.
Test di uscita: una collega che non era alle riunioni legge il brief e valuta correttamente cinque esecuzioni di esempio.
Fase 2 — Prototipo (2–3 settimane)#
Costruite il ciclo più piccolo che svolga il compito con strumenti veri su un ambiente di test. Se potete, ancora nessuna scelta di framework. Passate i vostri venti casi e correggete il design degli strumenti prima del prompt.
Test di uscita: il 60% dei venti casi passa end-to-end e accanto a ogni fallimento c'è una causa identificata.
Fase 3 — Irrobustimento (3–5 settimane)#
Qui sta gran parte del lavoro vero e qui muoiono i progetti sottofinanziati. Permessi sull'identità dell'utente finale, cancelli sull'irreversibile, validazione degli argomenti, tracce leggibili, monitoraggio, valutazione portata a cinquanta casi inclusi quelli avversariali e una modalità degradata.
- Autorizzazione verificata lato server a ogni chiamata.
- Cancello umano davanti a ogni azione irreversibile.
- Tetti di passi e spesa, più rilevazione delle ripetizioni.
- Tracce con identificativo su ogni chiamata e ritenzione decisa di proposito.
- Casi avversariali nella valutazione, eseguiti come ogni altro test.
Test di uscita: 85% sul set, 100% sul sottoinsieme dei rifiuti e nessun rilievo di sicurezza aperto.
Fase 4 — Lancio (2 settimane, poi continuo)#
Partite con un pubblico limitato. Leggete esecuzioni ogni giorno. Tenete il percorso di escalation visibile e presidiato. Allargate quando i numeri reggono due settimane di fila, non quando lo dice il calendario.
| Settimana | Pubblico | Cosa osservate |
|---|---|---|
| 1 | Solo team interno | Tracce, guasti evidenti, errori degli strumenti |
| 2 | 5% del traffico reale | Tasso di escalation, successo |
| 3–4 | 25% | Costo per compito, latenza di picco |
| 5+ | Tutto, se i numeri reggono | Deriva, nuove categorie |
Domande frequenti
Dodici settimane sembrano tante per una demo di tre giorni.
La demo funzionava davvero. Le nove settimane restanti sono permessi, valutazione, monitoraggio e percorsi di errore.
Le fasi possono sovrapporsi?
L'irrobustimento può iniziare durante il prototipo, e per i permessi dovrebbe. Non lanciate prima di aver passato il test di irrobustimento.
E se il prototipo non passa il test?
Guardate le cause annotate. Se sono design degli strumenti e accesso ai dati, correggete. Se il compito richiede un giudizio indefinibile, fermatevi.
roadmap agenti aipiano di progetto agentifasi progetto llmcalendario consegna aichecklist di lancio