Zyski:
- Możliwość odczytu cen tokenów wejścia/wyjścia i pozycji na fakturze
- Możliwość oszacowania miesięcznego kosztu przepływu pracy za pomocą przybliżonego wzoru
- Wdrażanie metod obniżających koszty, takich jak buforowanie, przetwarzanie wsadowe i przemieszczanie modelu
Umiejętność oszacowania, ile będzie kosztować model, jest jedną z najbardziej praktycznych umiejętności decydentów. „Co płacę miesięcznie?” Jeśli nie potrafisz odpowiedzieć na pytanie, nie możesz zaplanować budżetu ani wybrać odpowiedniego poziomu. Dobra wiadomość jest taka, że wycena jest prostsza, niż się wydaje, a kiedy już to zrozumiesz, możesz samodzielnie dokonać przybliżonego oszacowania. W tej części dowiesz się, jak odczytywać ceny tokenów wejściowych/wyjściowych, szacować miesięczny koszt przepływu pracy za pomocą prostej formuły oraz poznać metody, które faktycznie obniżają koszty.
Ogólna zasada: dane wejściowe i wyjściowe są wyceniane osobno
W modelach o wadze zamkniętej cena obliczana jest na podstawie ilości przetworzonych tokenów i wyróżnia się dwie oddzielne pozycje:
- Token wejściowy (input): Tekst wysyłany do modelu. Twój monit, Twoje dokumenty, Twoje próbki.
- Token wyjściowy: odpowiedź, którą generuje dla Ciebie model.
Punkt krytyczny: token wyjściowy jest często kilka razy droższy niż token wejściowy. Dzieje się tak dlatego, że wygenerowanie wyników jest bardziej kosztowne obliczeniowo dla modelu. Na przykład w jednym modelu wkład może wynosić 3 USD na milion tokenów, a wynik może wynosić 15 USD; Zatem produkcja jest pięciokrotnie droższa. Oznacza to, że długie i niepotrzebne odpowiedzi mogą szybko pochłonąć budżet.
Wskazówka: Jednym z najłatwiejszych sposobów obniżenia kosztów jest nie zadawanie modelowi niepotrzebnie długich odpowiedzi. Ograniczenia takie jak „maksymalnie 5 artykułów”, „pojedynczy akapit”, „eksportuj tylko tabelę” podnoszą jakość i oszczędzają token wyjściowy.
Aktualne przykłady cen
Poniżej przybliżone ceny kilku modeli (za milion tokenów, dolary amerykańskie). Wartości te dotyczą okresu, w którym moduł został przygotowany i często się zmieniają; Aby uzyskać dokładną decyzję, sprawdź aktualną stronę cenową dostawcy.
modelka
Scena
Wprowadź $/1 milion
Wyjście $/1M
Klaudiusz Opus 4.8
silny
~5
~25
Klaudiusz Sonnet 5
zrównoważony
~3
~15
Klaudiusz Haiku 4.5
lekki
~1
~5
Jak widać w tabeli, różnica w cenie pomiędzy poziomem mocnym i lekkim może sięgać nawet pięciokrotności. Dlatego podejście „najodpowiedniejszego modelu dla każdego biznesu” jest często stratą pieniędzy. Połączenie prostej pracy z tanim modelem i trudnej pracy z wydajnym modelem zapewnia ogromne oszczędności bez utraty jakości. Pogłębimy tę myśl w rozdziałach 7 i 9.
Szacowanie miesięcznych kosztów: prosta formuła
Aby uzyskać przybliżony szacunek miesięcznych kosztów, możesz użyć następującego wzoru:
Koszt miesięczny ≈ (Liczba żądań na miesiąc × Średni token wejściowy × Cena wejściowa / 1 000 000)+ (Liczba żądań na miesiąc × Średni token wyjściowy × Cena wyjściowa / 1 000 000)
Użyjmy przykładu. Załóżmy, że zespół e-commerce tworzy 50 000 opisów produktów miesięcznie. Każde żądanie wysyła średnio 500 tokenów wejściowych (informacje o produkcie) i otrzymuje 300 tokenów wyjściowych (opis). W modelu zrównoważonym (wejście ~3, wyjście ~15):
- Koszt wejściowy: 50 000 × 500 × 3 / 1 000 000 = 75 USD
- Koszt produkcji: 50 000 × 300 × 15 / 1 000 000 = 225 USD
- Razem ≈ 300 USD/miesiąc
Jeśli wykonali to samo zadanie w lekkim modelu (wejście ~1, wyjście ~5):
- Dane wejściowe: 50 000 × 500 × 1 / 1 000 000 = 25 USD
- Wyjście: 50 000 × 300 × 5 / 1 000 000 = 75 USD
- Razem ≈ 100 USD/miesiąc
Zatem sam wybór etapu może zmniejszyć tę samą pracę z 300 do 100 dolarów. W przypadku stosunkowo prostego zadania, takiego jak opis produktu, lekki model często jest więcej niż wystarczający.
Uwaga: ten wzór jest przybliżonym szacunkiem; Rzeczywiste rozliczenia różnią się w zależności od takich czynników, jak użycie pamięci podręcznej, ponowne próby i tryb rozumowania. Mimo to jest to bardzo dobry początek na uzyskanie potwierdzenia budżetu lub porównanie dwóch modeli. Najlepiej przed podjęciem decyzji zmierzyć rzeczywistą liczbę za pomocą małego pilota.
Pięć metod redukcji kosztów
- Wybierz odpowiedni poziom. Prosty, lekki model. To jest największe źródło oszczędności.
- Zmniejsz dane wejściowe. Zamiast wypełniać ogromne dokumenty na każde żądanie, wyślij tylko odpowiednią sekcję (optymalizacja kontekstu w części 5).
- Ogranicz wyjście. Wyjaśnij długość i format odpowiedzi; Niepotrzebnie długa odpowiedź = niepotrzebne koszty.
- Użyj buforowania. Many providers allow you to cache and re-read repeated fixed inputs (e.g. the same system instruction) much cheaper. Zapewnia to znaczne oszczędności, jeśli wysyłasz tę samą dużą instrukcję tysiące razy.
- Wykonaj przetwarzanie wsadowe. Jeśli się nie spieszysz, opcje „wsadowe”, które wysyłają wiele żądań zbiorczo i przetwarzają je ze zniżką, znacznie obniżają koszty.
Trzy realistyczne przypadki
Przypadek 1 – Oszczędności przy zmianie skokowej. Zespół obsługi klienta podsumowywał wszystkie przychodzące e-maile za pomocą najsilniejszego modelu, a miesięczny rachunek wynosił ~ 900 USD. Podsumowanie było prostym zadaniem; Kiedy przeszli na poziom zrównoważony, jakość wyjściowa pozostała prawie taka sama, ale rachunek spadł do ~250 dolarów. Oszczędności ~7800 USD rocznie, po prostu wybierając odpowiedni poziom.
Przypadek 2 — Zapisywanie z pamięcią podręczną. Zespół programistów wysyłał ten sam dokument „standardów kodowania” zawierający 8000 tokenów przy każdej prośbie o sprawdzenie kodu. 400 żądań dziennie × 8000 tokenów = duże, powtarzalne dane wejściowe. Kiedy włączono funkcję pamięci podręcznej, tę stałą partycję zaczęto czytać znacznie taniej, a znaczna część kosztów wejściowych zniknęła.
Przypadek 3 – Oszczędności poprzez ograniczenie produkcji. Kiedy zespół marketingowy poprosił o opis produktu, modelka tworzyła długie, kwieciste akapity. Kiedy dodano ograniczenie „maksymalnie 60 słów, jeden akapit”, wyjaśnienia stały się bardziej przydatne, a token wyjściowy został zmniejszony o połowę. Podczas gdy jakość wzrosła, koszty spadły; wygrana-wygrana.
Słaba podpowiedź/silna podpowiedź
Słaba zachęta:
Napisz mi ładny opis tego produktu. [informacje o produkcie]
Modelka może pisać tak długo, jak chce; Token wyjściowy jest niekontrolowany.
Potężny monit:
Twoja rola: copywriter e-commerce. Produkt: [INFORMACJA]. Zadanie: Napisz opis produktu. Ograniczenia: Maksymalnie 60 słów, jeden akapit, odwołanie do klientów nietechnicznych, zawiera 2 korzyści + 1 przypadek użycia. Unikaj fantazyjnych przymiotników.
Potężny monit kontroluje zarówno jakość, jak i długość wydruku (a tym samym koszt).
Szablony do kopiowania
1. Kosztorys miesięczny:
Co miesiąc wysyłam [QUANTITY] próśb. Średnie wejściowe ~[NUM] tokenów, wyjściowe ~[NUM] tokenów. Oblicz miesięczny koszt następujących modeli ([MODEL A], [MODEL B]) korzystając ze wzoru i porównaj w tabeli. Zaakceptuj ceny wejścia/wyjścia [CENY].
Porównanie poziomu 2:
Mój obowiązek [ZADANIE]. Czy ta praca naprawdę wymaga mocnego modelu, czy też wystarczy lekki/wyważony model? Oceń pod kątem jakości i kosztów i zaproponuj mi 2 poziomy do testów pilotażowych.
3. Kontrola redukcji kosztów:
Zidentyfikuj sposoby zmniejszenia kosztów w następującym przepływie pracy: [WORKFLOW]. Zapisz wykonalność i szacunkowe oszczędności dla każdego z nagłówków kaskady, redukcji danych wejściowych, ograniczenia danych wyjściowych, pamięci podręcznej i nagłówków przetwarzania wsadowego.
4. Ograniczenie mocy:
Przepisz następujący monit, aby zmniejszyć token wyjściowy bez obniżania jakości: „[PROMPT]”. Zoptymalizuj pod kątem długości, formatu i niepotrzebnych powtórzeń.
Typowe błędy
- Pomijanie różnicy wejścia/wyjścia: zezwalanie na długie odpowiedzi bez wiedzy, że wynik jest znacznie droższy.
- Najpotężniejszy model do każdego zadania: wykonywanie prostej pracy drogim modelem i niepotrzebne płacenie wielokrotnie więcej.
- Zwolnienie długości wyjściowej: Nadanie nieograniczonego uprawnienia do zapisu modelu bez narzucania jakichkolwiek ograniczeń dotyczących formatu lub długości.
- Ignorowanie pamięci podręcznej i wsadowej: brak poważnych możliwości oszczędności w przypadku powtarzalnych danych wejściowych i niepilnych zadań.
- Myślenie, że ceny są aktualne: Opieranie się na starym cenniku i nieprawidłowe planowanie budżetu; ceny zmieniają się często.
Podsumowując
- Cena obliczana jest na podstawie tokenów; nakłady i wyniki są wyceniane oddzielnie, a produkty wyjściowe są często kilkakrotnie droższe.
- Możesz z grubsza oszacować miesięczny koszt na podstawie wzoru: liczba żądań × średni token × cena.
- Sam właściwy wybór stopnia może wielokrotnie obniżyć koszty.
- Minimalizacja danych wejściowych, ograniczanie wyników, buforowanie i przetwarzanie wsadowe to praktyczne metody, które znacznie zmniejszają rachunki.
Zadanie aplikacji
Zdobądź wartości tokenów, które oszacowałeś w poprzedniej jednostce. Oblicz miesięczny koszt swojej firmy dla dwóch różnych poziomów, korzystając z szablonu 1 w tej jednostce (miesięczny kosztorys). Następnie, korzystając z trzeciego szablonu (skan redukcji kosztów), wywnioskowaj, ile oszczędności może wnieść każda metoda w przepływ pracy. Zaplanuj wybór dwóch najbardziej obiecujących metod i zastosuj je do budżetu na kolejny miesiąc.
lista kontrolna
- [ ] Wiem, że tokeny wejściowe i wyjściowe są wyceniane osobno, a dane wyjściowe są droższe.
- [ ] Potrafię z grubsza oszacować miesięczny koszt przepływu pracy za pomocą prostego wzoru.
- [ ] Mogę pokazać na przykładzie wpływ kosztów wyboru odpowiedniego poziomu.
- [ ] Potrafię rozpoznać pięć metod redukcji kosztów i wybrać tę właściwą.
- [ ] Mogę przepisać monit, aby zmniejszyć token wyjściowy.