Mapa drogowa agenta AI, która naprawdę dochodzi do produkcji
Wzorzec porażki projektów agentowych nie jest techniczny. To dobry prototyp w trzecim tygodniu, potem trzy miesiące ulepszania bez kierunku i ciche anulowanie, bo nikt nie potrafił powiedzieć, czy jest gotowe.
Ta mapa naprawia to testami wyjścia. Każda faza ma warunek spisany przed jej startem, spełniony albo nie.
Faza 1 — Zakres (1–2 tygodnie)#
Zapiszcie zadanie jako zdanie, które recenzent może uznać za trafne lub nietrafne. Wypiszcie narzędzia ze schematami argumentów. Zdecydujcie, które działania są nieodwracalne. Zbierzcie dwadzieścia realnych przykładów.
Test wyjścia: koleżanka, której nie było na spotkaniach, czyta brief i poprawnie ocenia pięć przykładowych przebiegów.
Faza 2 — Prototyp (2–3 tygodnie)#
Zbudujcie najmniejszą pętlę, która wykona zadanie z prawdziwymi narzędziami w środowisku testowym. Przepuśćcie dwadzieścia przypadków i naprawiajcie projekt narzędzi przed promptem.
Test wyjścia: 60% z dwudziestu przypadków przechodzi od końca do końca, a przy każdej porażce zapisana jest ustalona przyczyna.
Faza 3 — Utwardzanie (3–5 tygodni)#
Tu jest większość prawdziwej pracy i tu umierają projekty z za małym budżetem. Uprawnienia na tożsamości użytkownika końcowego, bramki przed nieodwracalnym, walidacja argumentów, czytelne ślady, monitoring, zestaw ewaluacyjny rozrośnięty do pięćdziesięciu przypadków oraz tryb degradacji.
- Autoryzacja sprawdzana po stronie serwera przy każdym wywołaniu.
- Ludzka bramka przed każdym nieodwracalnym działaniem.
- Limity kroków i wydatków oraz wykrywanie powtórzeń.
- Ślady z identyfikatorem przy każdym wywołaniu i świadomie ustalona retencja.
- Przypadki przeciwnika w ewaluacji, uruchamiane jak każdy inny test.
Test wyjścia: 85% na zestawie, 100% na podzbiorze odmów i brak otwartych ustaleń bezpieczeństwa.
Faza 4 — Wdrożenie (2 tygodnie, potem ciągle)#
Zacznijcie od ograniczonej grupy. Czytajcie przebiegi codziennie. Poszerzajcie, gdy liczby utrzymają się dwa tygodnie, a nie gdy kalendarz tak mówi.
| Tydzień | Grupa | Na co patrzycie |
|---|---|---|
| 1 | Tylko zespół wewnętrzny | Ślady, oczywiste awarie, błędy narzędzi |
| 2 | 5% realnego ruchu | Odsetek eskalacji, odsetek sukcesu |
| 3–4 | 25% | Koszt na zadanie, opóźnienie w szczycie |
| 5+ | Całość, jeśli liczby się trzymają | Dryf, nowe kategorie |
Najczęstsze pytania
Dwanaście tygodni to dużo jak na demo z trzech dni.
Demo naprawdę działało. Pozostałe dziewięć tygodni to uprawnienia, ewaluacja, monitoring i ścieżki awarii.
Czy fazy mogą się nakładać?
Utwardzanie może zacząć się w trakcie prototypu i dla uprawnień powinno. Nie zaczynajcie wdrożenia przed zdanym testem utwardzania.
A jeśli prototyp nie zda testu?
Spójrzcie na zapisane przyczyny. Jeśli to projekt narzędzi i dostęp do danych — naprawcie. Jeśli zadanie wymaga oceny, której nikt nie umie zdefiniować — przerwijcie.
mapa drogowa agenta aiplan projektu agentowegofazy projektu llmharmonogram dostarczenia ailista kontrolna wdrożenia