Jak oszczędzać na tokenach?
Weźmy prosty przykład — nasz licznik kalorii działa, ale przy każdej kolejnej wiadomości ponownie płacimy za przetworzenie tego samego zdjęcia. W tym pokoju przyjrzymy się prompt caching oraz wielu innym metodom optymalizacji kosztów, które pozwolą nam ograniczyć niepotrzebne zużycie tokenów.
Płacimy za to samo wielokrotnie
Podczas zwykłej rozmowy z modelem zużycie tokenów zazwyczaj nie jest dużym problemem. Sytuacja zmienia się jednak, gdy do kontekstu trafiają obrazy lub obszerne dokumenty tekstowe. Wyobraź sobie, że przesyłasz kilka zdjęć, a następnie kontynuujesz rozmowę. W standardowym podejściu model przy każdym kolejnym wywołaniu API otrzymuje cały kontekst konwersacji, w tym również wcześniej przesłane obrazy. Oznacza to, że ich reprezentacja jest ponownie uwzględniana w tokenach wejściowych, co zwiększa koszt każdego kolejnego zapytania.
Anthropic rozwiązał ten problem, wprowadzając mechanizm prompt caching. Działa on w następujący sposób: w żądaniu oznaczamy punkt, do którego ma zostać utworzona pamięć podręczna. Wszystko, co znajduje się przed tym znacznikiem, stanowi prefiks. Przy kolejnym wywołaniu API serwer porównuje początek nowego żądania z zapisanym prefiksem. Jeśli są one identyczne, zamiast ponownie przetwarzać ten fragment wejścia, wykorzystuje jego wcześniej zapisaną reprezentację. Dzięki temu zmniejsza się liczba przetwarzanych tokenów, co przekłada się na niższe koszty i krótszy czas odpowiedzi (zob. Zdj. 1).
Zaloguj się, aby czytać dalej
To tylko początek modułu. Załóż darmowe konto lub zaloguj się, aby mieć dostęp do bezpłatnych modułów.
