Une feuille de route d'agents IA qui atteint vraiment la production
Le schéma d'échec des projets d'agents n'est pas technique. C'est un bon prototype en semaine trois, puis trois mois d'amélioration sans direction, puis une annulation silencieuse parce que personne ne pouvait dire si c'était prêt.
Cette feuille de route corrige cela par des tests de sortie. Chaque phase a une condition écrite avant de commencer, qui est remplie ou non. Si une phase échoue à son test, vous corrigez le manque précis ou vous arrêtez — deux issues meilleures que la dérive.
Phase 1 — Cadrer (1–2 semaines)#
Écrivez la tâche comme une phrase qu'un relecteur peut marquer juste ou fausse. Listez les outils avec leurs schémas. Décidez quelles actions sont irréversibles et passeront derrière un humain. Réunissez vingt exemples réels, y compris les gênants.
Test de sortie : une collègue absente des réunions lit le brief et note correctement cinq exécutions d'exemple.
Phase 2 — Prototyper (2–3 semaines)#
Construisez la plus petite boucle qui fait la tâche avec de vrais outils sur un environnement de test. Si possible, pas encore de choix de framework : une boucle écrite à la main montre ce dont vous avez vraiment besoin. Passez vos vingt cas, regardez chaque échec et corrigez la conception d'outils plutôt que le prompt quand vous avez le choix.
Test de sortie : 60 % des vingt cas passent de bout en bout, et une cause identifiée est notée à côté de chaque échec.
Phase 3 — Durcir (3–5 semaines)#
C'est là que se trouve l'essentiel du travail réel et là que meurent les projets sous-budgétés. Droits sur l'identité de l'utilisateur final, portes devant l'irréversible, validation des arguments, traces lisibles, supervision avec quelques métriques, évaluation portée à cinquante cas dont des cas adverses, et un mode dégradé.
- Autorisation vérifiée côté serveur à chaque appel d'outil.
- Porte humaine devant chaque action irréversible, avec contexte prêt à décider.
- Plafonds d'étapes et de dépense, plus détection de répétition.
- Traces avec identifiant sur chaque appel et rétention décidée volontairement.
- Cas adverses dans l'évaluation, exécutés comme tout autre test.
Test de sortie : 85 % sur le jeu, 100 % sur le sous-ensemble de refus et aucun constat de sécurité ouvert.
Phase 4 — Lancer (2 semaines puis en continu)#
Commencez avec un public limité : une équipe, un segment ou un pourcentage du trafic. Lisez des exécutions chaque jour. Gardez le chemin d'escalade visible et doté, car la première semaine réserve des surprises. Élargissez quand les chiffres tiennent deux semaines, pas quand le calendrier le dit.
| Semaine | Public | Ce que vous surveillez |
|---|---|---|
| 1 | Équipe interne seule | Traces, échecs évidents, erreurs d'outil |
| 2 | 5 % du trafic réel | Taux d'escalade, taux de réussite |
| 3–4 | 25 % | Coût par tâche, latence au pic |
| 5+ | Complet si les chiffres tiennent | Dérive, nouvelles catégories |
Ce qui se passe après le lancement#
Un agent est un service, pas un projet. Quelqu'un le possède, l'évaluation grandit avec le trafic réel, les versions sont requalifiées lors des retraits, et les portes humaines sont retirées sélectivement quand les preuves s'accumulent. Qui ne planifie que quatre phases obtient un agent excellent en octobre et silencieusement faux en mars.
Questions fréquentes
Douze semaines paraissent longues pour une démo faite en trois jours.
La démo fonctionnait vraiment. Les neuf semaines restantes sont les droits, l'évaluation, la supervision et les chemins d'échec : ce qui décide si on peut lui confier de vrais clients. Les sauter ne supprime pas le travail, cela le déplace après l'incident.
Les phases peuvent-elles se chevaucher ?
Le durcissement peut commencer pendant le prototype, et devrait pour les droits. Ne lancez pas avant d'avoir passé le test de durcissement : un lancement limité sans portes n'est pas un risque limité.
Et si le prototype échoue à son test ?
Regardez les causes notées. S'il s'agit de conception d'outils et d'accès aux données, corrigez. Si la tâche exige un jugement que personne ne sait définir, arrêtez. Arrêter en semaine cinq est un bon résultat.
feuille de route agents iaplan de projet agentsphases projet llmcalendrier livraison iachecklist lancement agent