Testowanie agentów AI: zestaw ewaluacyjny, który zwraca koszt

Produkcja i utrzymanie 9 min czytania

Siatka wyników na ekranie z zaliczonymi i niezaliczonymi, obok wydrukowana lista przypadków
Nieefektowny plik, który decyduje, czy wasz agent kiedykolwiek wyjdzie z pilotażu.

Pytanie, które oddziela agentów wchodzących na produkcję od gnijących w pilotażu, jest proste: skąd wiecie, czy wczorajsza zmiana coś poprawiła? Bez odpowiedzi każda poprawka promptu to zgadywanie, a każdą regresję odkrywa klient.

Zestaw ewaluacyjny jest tą odpowiedzią i nie wymaga platformy. Pięćdziesiąt przypadków w jednym pliku, skrypt, który je uruchamia, i jedna reguła oceny na przypadek powiedzą więcej niż jakikolwiek ranking, bo to wasze przypadki.

Jak wygląda przypadek#

Przypadek to wejście, stan początkowy świata i sprawdzalne oczekiwanie. To oczekiwanie prawie nigdy nie jest dokładnym ciągiem znaków — agent może mieć rację na kilka sposobów. Oceniajcie wynik: czy wywołał narzędzie zwrotu z zamówieniem 4471; czy końcowa odpowiedź zawiera właściwą datę; czy odmówił i dopytał, jak powinien.

Zapiszcie potrzebny stan razem z przypadkiem. Test, który przechodzi tylko we wtorek z powodu danych na żywo, nie jest testem.

Pięćdziesiąt przypadków i skąd się biorą#

Testowanie agentów AI: zestaw ewaluacyjny, który zwraca koszt — Pięćdziesiąt przypadków i skąd się biorą
ŹródłoMniej więcej ileDlaczego
Częste realne żądania z logów20Chroni codzienną ścieżkę
Znane dawne awarie10Zapobiega powrotom regresji
Wejścia niejednoznaczne8Ma dopytać, nie zgadywać
Przypadki do odmowy6Poza zakresem, bez uprawnień, niebezpieczne
Puste lub zepsute wyniki narzędzi6Najczęstszy realny incydent

Oceniajcie wyniki, nie ścieżki#

Dwa przebiegi dochodzące do tego samego poprawnego wyniku różnymi drogami są oba poprawne, a zestaw wymuszający jeden zapis będzie stale bezzasadnie czerwony. Sprawdzajcie, co się zmieniło i co powiedziano: wywołania ze skutkami, kluczowe fakty odpowiedzi, czy poproszono o ludzką bramkę.

Cztery liczby do śledzenia w czasie#

  1. Odsetek sukcesu na całym zestawie i osobno na podzbiorze odmów.
  2. Odsetek twierdzeń niepopartych dowodami.
  3. Mediana i 95. percentyl kosztu oraz opóźnienia na przebieg.
  4. Odsetek interwencji ludzkich: jak często ktoś musiał wejść i dlaczego.

Uruchamiajcie w potoku i po wdrożeniu#

Uruchamiajcie zestaw przy każdej zmianie promptów, narzędzi, wersji modelu lub konfiguracji wyszukiwania. Po wdrożeniu próbkujcie realny ruch: kilka przebiegów dziennie ocenionych ręcznie, a wszystko zaskakujące trafia do zestawu.

Najczęstsze pytania

Od ilu przypadków zacząć?

Pięćdziesiąt łapie realne regresje i da się je napisać w kilka dni. Dwadzieścia wystarczy na start.

Czy może oceniać model?

Tak, ostrożnie. Dajcie jawne kryteria, trzymajcie rubrykę krótką i regularnie sprawdzajcie próbkę ręcznie.

Czy ewaluacja ma blokować wdrożenia?

Blokujcie na podzbiorze krytycznym dla bezpieczeństwa. Dla ogólnej jakości śledźcie trend.

ocena agentów aitesty agentówzestaw ewaluacyjny llmtesty regresji llmmetryki jakości

Wszystkie przewodniki

Ostatnia aktualizacja 2026-08-04, aiagentdevelopment.info · O nas

Pisane przez budujących

Każdy przewodnik piszą inżynierowie utrzymujący agentów w produkcji, a nie przerabiają go z innych stron.

Regularne przeglądy

Ta dziedzina zmienia się szybko. Każdy przewodnik ma datę ostatniego przeglądu — publikujemy ją także wtedy, gdy nic się nie zmieniło.

Bez płatnych miejsc

Żaden dostawca modeli, framework ani platforma nie kupi wzmianki, pozycji ani linku.

Dwanaście języków

Każdy przewodnik jest tłumaczony, a nie podmieniany maszynowo — każdy język ma własny URL i własną datę przeglądu.

Granice nazwane

Mówimy wprost, kiedy zadanie nie wymaga agenta, a zwykły skrypt będzie tańszy i pewniejszy.