Zyski:
- Wyjaśnij koncepcję tokena, rozróżnienia tokena wejściowego/wyjściowego i tokenizacji.
- Potrafi obliczyć koszt żądania i miesięczne obciążenie pracą na podstawie liczby tokenów i ceny jednostkowej
- Potrafi porównać wpływ wyboru modelu i długości zamówienia na koszt
Nie można zbudować rozwiązania na dużą skalę bez zrozumienia ekonomii interfejsów API LLM. Wersja demonstracyjna jest uruchamiana raz; Najważniejsze jest, aby móc przewidzieć, jaki będzie rachunek, gdy wykonywane będą tysiące połączeń miesięcznie. W tej części omawiamy kwestie pieniężne: czym jest token, dlaczego dane wejściowe i wyjściowe są wyceniane inaczej, jak obliczyć koszt żądania i jak zaplanować miesięczny nakład pracy. Informacje te pozwalają zmierzyć zwrot technik optymalizacyjnych (buforowanie, wybór modelu, wsad) w kolejnych jednostkach.
Co to jest token?
Token to najmniejsza jednostka, w której model przetwarza tekst. Słowo nie zawsze jest symbolem; token jest zwykle częścią słowa. Z grubsza mówiąc, w języku angielskim 1 token to ≈ 4 znaki ≈ 0,75 słowa. W języku tureckim i kodzie proporcje są różne: słowa tureckie są często dzielone na więcej tokenów niż w języku angielskim ze względu na strukturę sufiksów i alfabet. Dlatego konieczne jest zmierzenie liczby tokenów za pomocą narzędzia do liczenia tokenów dostawcy, a nie zgadywanie na podstawie wzroku.
Tokenizacja (proces dzielenia tekstu na tokeny) może przebiegać inaczej w przypadku każdego modelu. Ma to dwie praktyczne konsekwencje: (1) Ten sam tekst może dawać różną liczbę żetonów w różnych modelach; (2) Przewidywania dokonane za pomocą tokenizerów innych dostawców (np. biblioteki tiktoken OpenAI) będą niedokładne w przypadku Claude'a — użyj wskazówki dotyczącej liczenia tokenów dla używanego modelu.
Podpowiedź: „Ile tokenów?” Nie odpowiadaj na pytanie w ciemno. Przekaż reprezentatywny tekst przez interfejs API zliczania tokenów; Decyzje budżetowe opieraj na pomiarach.
Tokeny wejściowe i wyjściowe
Faktura składa się z dwóch pozycji:
- Tokeny wejściowe: Wszystko, co wysyłasz do modelu – monit systemowy, poprzednie wycieczki, wiadomość użytkownika, dokumentacja, jeśli istnieje. Są one przetwarzane wszystkie na raz.
- Tokeny wyjściowe: odpowiedź wygenerowana przez model. Dla każdego tokena wyjściowego model wykonuje obliczenia krok po kroku.
W przypadku większości dostawców produkcja jest kilkakrotnie droższa niż wkład. Powód jest prosty: odczytanie wszystkich danych wejściowych na raz jest tańsze niż generowanie danych wyjściowych token po tokenie. Znajomość tej asymetrii wyjaśnia, dlaczego optymalizacje takie jak „wymagają zwięzłych odpowiedzi” są tak skuteczne.
Przykładowe ceny (za 1 milion tokenów, USD)
Poniższa tabela stanowi odniesienie; Ceny mogą z czasem ulec zmianie. Prosimy o potwierdzenie aktualnej listy swojego dostawcy.
klasa modelowa
przykładowy model
Wejście ($/1 mln)
Produkcja ($/1 mln)
Typowe użycie
szybko/tanio
Haiku 4.5
1,00
5.00
Klasyfikacja, oznakowanie, proste podsumowanie
zrównoważony
sonet 5
3.00
15.00
Cel ogólny, kodowanie, praca agenta
silny
Opus 4.8
5.00
25.00
Złożone rozumowanie, zadania dalekosiężne
W każdej klasie wynik jest 5 razy większy od wejścia; Co więcej, nawet wkład mocnego modelu jest 5 razy większy niż wkład taniego modelu. Te dwie osie (wejście↔wyjście i klasa modelu) tworzą ramy decyzji dotyczących kosztów.
Jak obliczyć koszt?
Formuła jest prosta:
koszt = (token_wejściowy / 1 000 000) × cena_wejściowa + (token_wyjściowy / 1 000 000) × cena_wyjściowa
Przykładowe konto. Żądanie z Sonetem 5: 1500 tokenów wejściowych, 400 tokenów wyjściowych.
wejście = 1500 / 1 000 000 × 3,00 = 0,0045 USD wyjście = 400 / 1 000 000 × 15,00 = 0,0060 USD ogółem = 0,0105 USD (około 1 centa)
Jedno połączenie wygląda tanio. Ale pomnóż przez liczbę połączeń: 20 000 połączeń dziennie → 210 USD dziennie, ~ 6300 USD miesięcznie. Tutaj liczy się skala.
Szablon miesięcznego budżetu
Aby wyodrębnić miesięczny koszt obciążenia pracą, użyj tego szablonu:
1) Średni token wejściowy na żądanie: ......2) Średni token wyjściowy na żądanie: ......3) Liczba żądań dziennie: ......4) Przepracowane dni w miesiącu: ......5) Koszt na żądanie = (1)/1M×cena_wejściowa + (2)/1M×cena_wyjściowa6) Koszt miesięczny = (5) × (3) × (4)
Przelanie tego wzorca do arkusza kalkulacyjnego i sprawdzenie, jak suma będzie wyglądać po zmianie modelu, ucieleśnia decyzje dotyczące wyboru modelu (jednostka 5) i pamięci podręcznej (jednostka 6).
Skrócenie monitu za pomocą szablonów do kopiowania
Większość kosztów wynika z niepotrzebnie długich podpowiedzi i marnotrawstwa wyników. Poniższe szablony zapewniają bezpośrednie oszczędności.
# Ogranicz długość wyjściową. Odpowiedz za pomocą maksymalnie 3 elementów. Dodaj uzasadnienie lub zdanie wprowadzające.
# Zwróć tylko żądane pole Zwróć tylko następujący kod JSON, nie dodawaj żadnego innego tekstu:{"category": "...", "pilność": "low|medium|high"}
# Usuń niepotrzebny kontekstUsuń z poniższego tekstu tylko datę i kwotę. Nie powtarzaj całego tekstu.Tekst: """{{text}}"""
# Podsumuj długą mowę (zapisywanie danych wejściowych) Podsumuj tę mowę w 5 punktach. W kolejnych rundach będę korzystał z tego podsumowania zamiast pełnej przeszłości. Mowa: „””{{przeszłość}}””
Słaba zachęta / Silna zachęta (pod względem kosztów)
# SŁABY (wydaje dane wyjściowe, drogie) Przeanalizuj tę prośbę o pomoc i napisz mi obszerną recenzję.
# SILNY (ogranicza wydajność, tani i przewidywalny) Sklasyfikuj to zgłoszenie serwisowe. Po prostu zwróć następujący kod JSON:{"category":"faktura|technical|refund|inny","pilność":"low|medium|high"}Nie pisz opisu.
Słaba wersja produkuje może 500 tokenów wyjściowych; mocna wersja ~15. Ponieważ produkcja jest droga, jest to znacząca różnica w przeliczeniu na połączenie i mnoży się wraz z głośnością.
Trzy mini etui
Przypadek 1 — Ukryty koszt długiego monitu. Ponieważ automatyzacja księgowości sortowała każdą fakturę, do każdego żądania dodawała 40-stronicowy „zestaw zasad” jako dane wejściowe: ~12 000 tokenów wejściowych na każde żądanie. Właśnie wprowadzono sonnet 5 12 000/1M×3 = 0,036 USD. 5000 rachunków dziennie → 180 dolarów dziennie. Dzięki buforowaniu zbioru zasad (jednostka 6) koszt wejściowy spadł o ~90%.
Przypadek 2 — Opłacalność zmniejszenia rozmiaru modelu. Jeden zespół przeprowadzał proste tagowanie nastrojów „pozytywnych/negatywnych” za pomocą Opus 4.8: 300 tokenów wejściowych + 10 tokenów wyjściowych. Opus kosztuje 300/1M×5 + 10/1M×25 = 0,00175 USD. Przechodząc na Haiku, 300/1M×1 + 10/1M×5 = 0,00035 USD — 5 razy taniej, różnica w dokładności była niezmierzona. Przy 3 milionach połączeń miesięcznie różnica wynosi 5250 USD → 1050 USD.
Przypadek 3 — Zwolnienie wyjścia. Kiedy zespół marketingowy tworzył opis produktu, nie wyznaczał żadnych ograniczeń wydajności; modelka czasami mówiła 1500 żetonów. Kiedy dodałem instrukcję „maksymalnie 60 słów”, średnia wydajność spadła z 900 do 90 tokenów. Ponieważ druk był drogi, miesięczny rachunek obniżono o jedną trzecią, a teksty stały się bardziej przydatne.
Typowe błędy
- Odgadywanie tokena na podstawie wzroku: możesz się mylić, zwłaszcza w języku tureckim i kodzie. Mierzyć.
- Zakładając, że dane wejściowe i wyjściowe są takie same: dane wyjściowe są zwykle znacznie droższe; Większość optymalizacji polega na skracaniu wyników.
- Nie daj się zwieść taniości pojedynczego połączenia: decyzja jest podejmowana na podstawie liczby połączeń. 0,01 × milion = 10 000 dolarów.
- Przewidywanie za pomocą tokenizera innego dostawcy: daje nieprawidłowe wyniki; Użyj narzędzia do liczenia tokenów modelu.
- Nielimitowane powiększanie historii rozmów: Każda runda dodawana jest do wpisu; podsumowywać w długich rozmowach.
- Utrzymywanie niepotrzebnie wysokiego poziomu `max_tokens`: Ukrywa plan budżetu i ryzyko obcięcia; Podaj realistyczną wartość.
Głębiej: okno kontekstowe i długi koszt wejścia
Bardzo ważne jest, aby zobaczyć, jak cena kształtuje się „w trakcie rozmowy”, a nie tylko „za każde żądanie”. Całkowita ilość tekstu, który model może przetworzyć, nazywana jest oknem kontekstowym; Suma danych wejściowych i wyjściowych musi mieścić się w tym oknie. Nowoczesne modele oferują bardzo duże okna (setki tysięcy, a nawet miliony tokenów), ale to nie znaczy, że możesz je „wypełniać w nieskończoność” — wszystko, co umieścisz w oknie, jest rozliczane jako dane wejściowe.
Pułapka w długich rozmowach polega na tym, że z każdą nową rundą przesyłasz całą historię od nowa (bezpaństwowość w jednostce 1). W rozmowie trwającej 20 rund, 20. prośba zawiera jako dane wejściowe całe pierwsze 19 rund. Zatem w miarę wydłużania się rozmowy koszt żądania rośnie kumulatywnie, a nie liniowo. Trwająca 50 rund rozmowa z asystentem agenta może generować koszty wejściowe dziesiątki razy większe niż w pierwszej rundzie.
Można sobie z tym poradzić na dwa sposoby. Pierwszym z nich jest podsumowanie: skompresowanie starszych rund w jeden blok podsumowań, przy czym tylko kilka ostatnich rund pozostaje surowych. Drugie to szybkie buforowanie (jednostka 6): odczytywanie ustalonego kontekstu za jedną dziesiątą ceny zamiast wielokrotnego przetwarzania go za pełną cenę. Razem znacznie zmniejszają rachunki w przypadku długich, wymagających dużego kontekstu obciążeń. Zatem ekonomia tokenów dotyczy zaprojektowania całej sesji, a nie pojedynczego żądania.
Podsumowując
Token to najmniejsza jednostka, w której przetwarzany jest tekst; nakłady i wyniki są wyceniane oddzielnie, a dane wyjściowe są często znacznie droższe. Koszt to liczba tokenów pomnożona przez cenę jednostkową, a prawdziwą decyzję podejmuje się na podstawie wolumenu. Skrócenie czasu, ograniczenie wydajności i wybór najlżejszego modelu, który spełni zadanie, to najbardziej bezpośrednie dźwignie, które wielokrotnie zmniejszają koszty.
Zadanie aplikacji
Wybierz zadanie dla siebie. (1) Określ liczbę żetonów wejściowych i szacunkowych wyjściowych dla reprezentatywnego podpowiedzi (jeśli to możliwe, zmierz za pomocą narzędzia do liczenia żetonów). (2) Oblicz koszt jednego żądania dla trzech klas modeli. (3) Oszacuj dzienną liczbę żądań i oblicz miesięczny budżet dla trzech modeli. (4) Dodaj instrukcję skrócenia wyjścia i zanotuj oczekiwane oszczędności.
lista kontrolna
- [ ] Potrafię wyjaśnić koncepcję tokenów i tokenizację różni się w zależności od modelu.
- [ ] Wiem, dlaczego tokeny wejściowe i wyjściowe mają różną cenę.
- [ ] Potrafię obliczyć koszt wniosku za pomocą wzoru.
- [ ] Potrafię utworzyć miesięczny budżet na obciążenie pracą, korzystając z szablonu.
- [ ] Mogę pokazać na przykładzie korzyści wynikające ze skrócenia wyników i redukcji modelu.