Obniżanie kosztu agenta bez pogarszania go

Produkcja i utrzymanie 8 min czytania

Opadająca linia na wykresie pulpitu obok kalkulatora i notatek
Dwie zmiany zwykle wyjaśniają większość spadku i żadna nie dotyka jakości.

Gdy rachunek za tokeny kogoś zaskakuje, odruchem jest przejście wszędzie na tańszy model i przyjęcie utraty jakości. To rzadko konieczne. W systemach, które audytowaliśmy, większość wydatków brała się z kontekstu, którego nie musiało tam być, i z kroków niepotrzebujących drogiego modelu.

Metoda poniżej jest nudna i skuteczna: najpierw mierzcie, potem zastosujcie cztery zmiany według zwrotu, potem zdecydujcie, czy problem nadal istnieje.

Mierzcie na przebieg, zanim cokolwiek zmienicie#

Miesięczna suma nic nie mówi. Zapisujcie na przebieg: tokeny wejścia i wyjścia, liczbę wywołań, model na wywołanie i typ zadania. Potem patrzcie na koszt na ukończone zadanie, w rozbiciu na typ.

Liczcie też przebiegi nieudane w mianowniku.

Cztery zmiany, według zwrotu#

Obniżanie kosztu agenta bez pogarszania go — Cztery zmiany, według zwrotu
ZmianaTypowa oszczędnośćRyzyko
Przycinanie kontekstu: wyrzucanie użytych dokumentów, sprężanie historii20–40%Niskie, jeśli cel pozostaje przypięty
Kierowanie tanich kroków do mniejszego modelu20–40%Niskie, z ewaluacją na krok
Buforowanie stałego prefiksu promptu10–30% przy powtarzalnym ruchuNiskie
Redukcja kroków: lepsze narzędzia, mniej ponowień10–25%Średnie — wymaga pracy nad narzędziami

Rachunek to kontekst#

Każda tura wysyła nagromadzony kontekst ponownie, więc przebieg ośmiu kroków może zapłacić za ten sam dokument osiem razy. Trzy nawyki naprawiają większość: wyrzucajcie przywołane fragmenty, gdy ich krok się kończy; sprężajcie stare tury do notatek faktograficznych; przycinajcie wyniki narzędzi do używanych pól.

Kierujcie według kroku, nie gustu#

Ekstrakcja, klasyfikacja i formatowanie rzadko wymagają najsilniejszego modelu; planowanie i proza dla użytkownika często tak. Obniżcie pierwszą grupę o poziom, uruchomcie zestaw ewaluacyjny i zachowajcie zmianę tylko, jeśli liczby się trzymają.

  1. Zacznijcie od kroku o największym wolumenie i najmniejszej ocenie.
  2. Zmieniajcie po jednym kroku i ponawiajcie ewaluację.
  3. Zapisujcie, który model wyprodukował którą decyzję.
  4. Ustawcie limit wydatków na przebieg.

Najczęstsze pytania

Czy buforowanie się opłaca?

Jeśli wasze przebiegi dzielą długi stały prefiks, tak, i to jedna z najtańszych wygranych.

Czy dostrajać, by oszczędzać?

Tylko dla kroku o dużym wolumenie, wąskiego i stabilnego.

Jak uniknąć jednego bardzo drogiego przebiegu?

Limity kroków i wydatków na przebieg, wykrywanie identycznych powtórzeń i zatrzymanie z wynikiem częściowym.

koszty agentów aioptymalizacja kosztów llmobniżanie kosztu tokenówbuforowanie promptówrouting modeli

Wszystkie przewodniki

Ostatnia aktualizacja 2026-08-04, aiagentdevelopment.info · O nas

Pisane przez budujących

Każdy przewodnik piszą inżynierowie utrzymujący agentów w produkcji, a nie przerabiają go z innych stron.

Regularne przeglądy

Ta dziedzina zmienia się szybko. Każdy przewodnik ma datę ostatniego przeglądu — publikujemy ją także wtedy, gdy nic się nie zmieniło.

Bez płatnych miejsc

Żaden dostawca modeli, framework ani platforma nie kupi wzmianki, pozycji ani linku.

Dwanaście języków

Każdy przewodnik jest tłumaczony, a nie podmieniany maszynowo — każdy język ma własny URL i własną datę przeglądu.

Granice nazwane

Mówimy wprost, kiedy zadanie nie wymaga agenta, a zwykły skrypt będzie tańszy i pewniejszy.