Testowanie agentów AI: zestaw ewaluacyjny, który zwraca koszt
Pytanie, które oddziela agentów wchodzących na produkcję od gnijących w pilotażu, jest proste: skąd wiecie, czy wczorajsza zmiana coś poprawiła? Bez odpowiedzi każda poprawka promptu to zgadywanie, a każdą regresję odkrywa klient.
Zestaw ewaluacyjny jest tą odpowiedzią i nie wymaga platformy. Pięćdziesiąt przypadków w jednym pliku, skrypt, który je uruchamia, i jedna reguła oceny na przypadek powiedzą więcej niż jakikolwiek ranking, bo to wasze przypadki.
Jak wygląda przypadek#
Przypadek to wejście, stan początkowy świata i sprawdzalne oczekiwanie. To oczekiwanie prawie nigdy nie jest dokładnym ciągiem znaków — agent może mieć rację na kilka sposobów. Oceniajcie wynik: czy wywołał narzędzie zwrotu z zamówieniem 4471; czy końcowa odpowiedź zawiera właściwą datę; czy odmówił i dopytał, jak powinien.
Zapiszcie potrzebny stan razem z przypadkiem. Test, który przechodzi tylko we wtorek z powodu danych na żywo, nie jest testem.
Pięćdziesiąt przypadków i skąd się biorą#
| Źródło | Mniej więcej ile | Dlaczego |
|---|---|---|
| Częste realne żądania z logów | 20 | Chroni codzienną ścieżkę |
| Znane dawne awarie | 10 | Zapobiega powrotom regresji |
| Wejścia niejednoznaczne | 8 | Ma dopytać, nie zgadywać |
| Przypadki do odmowy | 6 | Poza zakresem, bez uprawnień, niebezpieczne |
| Puste lub zepsute wyniki narzędzi | 6 | Najczęstszy realny incydent |
Oceniajcie wyniki, nie ścieżki#
Dwa przebiegi dochodzące do tego samego poprawnego wyniku różnymi drogami są oba poprawne, a zestaw wymuszający jeden zapis będzie stale bezzasadnie czerwony. Sprawdzajcie, co się zmieniło i co powiedziano: wywołania ze skutkami, kluczowe fakty odpowiedzi, czy poproszono o ludzką bramkę.
Cztery liczby do śledzenia w czasie#
- Odsetek sukcesu na całym zestawie i osobno na podzbiorze odmów.
- Odsetek twierdzeń niepopartych dowodami.
- Mediana i 95. percentyl kosztu oraz opóźnienia na przebieg.
- Odsetek interwencji ludzkich: jak często ktoś musiał wejść i dlaczego.
Uruchamiajcie w potoku i po wdrożeniu#
Uruchamiajcie zestaw przy każdej zmianie promptów, narzędzi, wersji modelu lub konfiguracji wyszukiwania. Po wdrożeniu próbkujcie realny ruch: kilka przebiegów dziennie ocenionych ręcznie, a wszystko zaskakujące trafia do zestawu.
Najczęstsze pytania
Od ilu przypadków zacząć?
Pięćdziesiąt łapie realne regresje i da się je napisać w kilka dni. Dwadzieścia wystarczy na start.
Czy może oceniać model?
Tak, ostrożnie. Dajcie jawne kryteria, trzymajcie rubrykę krótką i regularnie sprawdzajcie próbkę ręcznie.
Czy ewaluacja ma blokować wdrożenia?
Blokujcie na podzbiorze krytycznym dla bezpieczeństwa. Dla ogólnej jakości śledźcie trend.
ocena agentów aitesty agentówzestaw ewaluacyjny llmtesty regresji llmmetryki jakości