Baza wiedzy

Koszty tokenów agenta AI — jak nie przepalić budżetu

Agent płaci za kontekst przy KAŻDEJ turze pętli narzędziowej, nie raz na rozmowę. Dlatego rachunek rośnie z liczbą kroków, a nie z liczbą pytań — i dlatego najskuteczniejsze oszczędności są w kontekście, nie w cenniku modelu.

Opublikowano · Jakub Butryn, Founder · Lead engineer

Co naprawdę zużywa tokeny

Trzy pozycje dominują: historia rozmowy powtarzana w każdym zapytaniu, schematy narzędzi (przy kilkudziesięciu narzędziach to znacząca stała opłata) i wyniki narzędzi wracające do modelu. Sama odpowiedź użytkownikowi jest zwykle najtańsza.

Wniosek praktyczny: pętla o dziesięciu krokach kosztuje dziesięć razy kontekst, a nie dziesięć krótkich odpowiedzi. Ograniczenie liczby kroków bywa tańsze niż zmiana modelu na słabszy.

Pięć mechanizmów, które realnie obniżają rachunek

Kompresja historii ze zachowaniem wyników narzędzi. Zawężona lista narzędzi na proces. Cache odpowiedzi dla identycznych zapytań pomocniczych. Krótkie, ustrukturyzowane wyniki narzędzi zamiast zrzutów. Limit kroków na turę.

Do tego rzecz nieoczywista: model lokalny do zadań powtarzalnych i tanich. Przełączenie dostawcy jedną komendą pozwala trzymać drogi model na planowanie, a lokalny na rutynę.

Limity, które chronią przed niespodzianką

Budżet okienny (np. na 5 godzin) z twardym odcięciem i czytelnym komunikatem działa lepiej niż miesięczny limit, bo pomyłka w pętli zużywa budżet w minutach, nie w dniach. Do tego licznik widoczny w interfejsie po każdej turze.

Warto też odróżnić limit częstości od limitu kosztu. Pierwszy chroni przed zalewem zapytań, drugi przed jedną drogą operacją. Potrzebne są oba.

Jak liczyć, czy się opłaca

Policz koszt na obsłużone zgłoszenie, nie koszt miesięczny. Podziel rachunek za tokeny przez liczbę zakończonych zadań i porównaj z kosztem tej samej pracy wykonanej ręcznie. Ta liczba mówi więcej niż cennik za milion tokenów.

Jeśli koszt na zadanie rośnie, przyczyną jest zwykle rosnąca liczba kroków (agent szuka po omacku), nie cena modelu. Wtedy naprawiaj narzędzia i opisy, nie dostawcę.

Najczęstsze pytania

Dlaczego agent AI zużywa tyle tokenów?

Bo płaci za cały kontekst przy każdym kroku pętli, a nie raz na rozmowę. Zadanie o dziesięciu krokach kosztuje dziesięć razy kontekst: historia, schematy narzędzi i ich wyniki.

Jak obniżyć koszty agenta AI bez utraty jakości?

Kompresja historii z zachowaniem wyników narzędzi, zawężona lista narzędzi, cache zapytań pomocniczych, krótkie wyniki narzędzi, limit kroków oraz model lokalny do zadań rutynowych.

Omów swój przypadek — konsultacja bezpłatna Telegram @sotius