Czym jest agent AI? Definicja użyteczna dla budujących
Słowo agent rozciągnięto tak, że obejmuje wszystko: od promptu z ładną nazwą po system rozproszony z własnym dyżurem. To nie problem słownictwa, tylko budżetu: zespoły zatwierdzają jedno, a dostają drugie.
Oto definicja, której używamy przy określaniu zakresu prac, celowo wąska. Agent AI to oprogramowanie, w którym model językowy wybiera następny krok, wywołuje prawdziwe narzędzie, by go wykonać, czyta to, co wróciło, i wybiera ponownie — aż cel zostanie osiągnięty albo zatrzyma go limit. Jeśli nic w waszym systemie nie wywołuje narzędzia, macie bardzo dobry generator tekstu. Jeśli kolejność jest ustalona z góry, macie przepływ pracy z modelem w jednym z pudełek. Oba są w porządku. Żaden nie potrzebuje budżetu na agenta.
Produktem jest pętla, nie model#
Każdy agent to te same trzy ruchy powtarzane: zdecyduj, działaj, obserwuj. Model wnosi tylko decydowanie. Cała reszta — jakie narzędzia istnieją, jak sformułowane są ich błędy, jaki stan przetrwa między iteracjami, kiedy pętla musi się zatrzymać — to zwykłe oprogramowanie, które piszecie i za które odpowiadacie. Zespoły przekonane, że produktem jest model, spędzają czas na promptach i dziwią się zawodności. Te, które traktują pętlę jak produkt, pracują nad kontraktami narzędzi i warunkami zatrzymania i dostają coś, co da się debugować w kiepskie popołudnie.
Przydatny test: gdybyście usunęli model i posadzili człowieka czytającego te same informacje, czy reszta systemu miałaby jeszcze sens? Jeśli nie, otoczenie jest zbyt cienkie.
Co odróżnia agenta od tego, z czym bywa mylony#
| System | Kto decyduje o następnym kroku | Wywołuje prawdziwe narzędzia | Typowa awaria |
|---|---|---|---|
| Chatbot | Nikt — odpowiada | Nie | Zła lub zmyślona odpowiedź |
| Przepływ z krokiem LLM | Programistka, z góry | Tak, w stałej kolejności | Pęka przy danych spoza przepływu |
| Agent | Model, w czasie działania | Tak, wybierane na bieżąco | Błądzi, zapętla się, działa na złych danych |
| System wieloagentowy | Kilka modeli i koordynator | Tak | Wszystko powyższe, trudniejsze do prześledzenia |
Cztery części każdego prawdziwego agenta#
Zdejmijcie nazwy frameworków, a każdy produkcyjny agent, z jakim pracowaliśmy, zawiera te same cztery części.
- Sprawdzalny cel: zdanie, które ktoś może oznaczyć jako trafne lub nietrafne.
- Powierzchnia narzędzi: konkretne funkcje z typowanymi argumentami i uczciwymi błędami.
- Nośnik stanu: co następna iteracja może zobaczyć z poprzedniej.
- Warunki zatrzymania: limit kroków, limit wydatków i reguła przekazania człowiekowi.
Autonomia to pokrętło, nie przełącznik#
Ciekawą decyzją projektową nie jest to, czy użyć agenta, lecz ile dać mu luzu. W praktyce są cztery ustawienia, a udane projekty startują bardziej z lewej, niż sugeruje demo: agent przygotowuje projekt, a człowiek wysyła; agent działa na odwracalnym i pyta o nieodwracalne; agent działa swobodnie w piaskownicy z limitem wydatków; agent działa swobodnie na systemach produkcyjnych. Każdy krok w prawo mnoży zarówno wartość, jak i promień szkód.
Gdzie ta definicja zarabia na siebie#
Rygor oszczędza w trzech miejscach. Przy określaniu zakresu: pięć stałych wywołań API z jednym krokiem podsumowania to przepływ, a zbudowanie tego jako agenta dodaje niedeterminizm, którego nikt nie potrzebował. Przy szacowaniu: agenci kosztują więcej, bo powierzchnia awarii jest większa. Przy ocenie: agenta da się przetestować dobrze dopiero wtedy, gdy przyjmiecie, że to samo wejście może pójść różnymi ścieżkami — czyli sprawdzając wyniki, a nie zapisy rozmów.
Jeśli ktoś prosi o agenta, zapytajcie, jaką decyzję oprogramowanie ma podjąć samodzielnie. Jeśli takiej nie ma, właśnie oszczędziliście mu trzy miesiące.
Najczęstsze pytania
Czy chatbot to agent AI?
Zgodnie z tą definicją nie. Chatbot odpowiada w rozmowie; agent działa w systemach poza nią. Bot wsparcia, który czyta bazę zamówień, wystawia zwrot i wysyła e-mail, jest agentem.
Czy agent musi być autonomiczny?
Musi wybierać swój następny krok, co nie znaczy działać bez nadzoru. Agent planujący pięć kroków, wykonujący cztery i zatrzymujący się po zgodę przy piątym nadal jest agentem.
Czy potrzebuję frameworka?
Nie. Najmniejszy użyteczny agent to pętla, lista definicji narzędzi i warunek zatrzymania — może sto linii.
czym jest agent aidefinicja agenta aiagent czy przepływ pracyagentic aipętla myśl działaj