Jednostka 5 / 10

Token, okno kontekstowe i multimodalność: jak działa umysł modelu

Zyski:

  • Umiejętność wyjaśnienia pojęć token, okno kontekstowe i multimodalność w języku potocznym
  • Zdiagnozuj, czy zadanie wymaga szerokiego kontekstu lub multimodalności
  • Możliwość uwzględnienia wpływu tych koncepcji na koszt i wybór modelu

Na razie poznaliśmy dostawców i typy modeli. Jednak dla prawidłowego wyboru modelu konieczne jest również zrozumienie, jak modele działają „wewnątrz”; ponieważ wszystkie decyzje dotyczące ceny, pojemności i dostępności opierają się na trzech podstawowych koncepcjach: tokenie, oknie kontekstowym i multimodalności. Ktoś, kto nie zna tych pojęć, nie może przeczytać cennika i zastanawiać się „czy ten dokument będzie pasował do modelu?” nie potrafi odpowiedzieć na pytanie i nie widzi, kiedy przetwarzanie wizualne jest niezbędne. Pod koniec tej jednostki będziesz w stanie wyjaśnić te trzy pojęcia w języku potocznym, zdiagnozować, czy praca wymaga szerokiego kontekstu lub multimodalności i wziąć pod uwagę ich wpływ na koszty.

Token: Jednostka używana przez model zamiast słowa

Modele sztucznej inteligencji przetwarzają tekst nie słowo po słowie, ale małe fragmenty zwane tokenami. Znak; Może to być słowo, część słowa, znak interpunkcyjny lub spacja. Aby dokonać przybliżonych obliczeń: w języku angielskim średni token ma około czterech znaków, a 100 słów to około 130-150 tokenów. W języku tureckim wskaźnik ten może być nieco wyższy ze względu na słowa z sufiksami i długie; Innymi słowy, tekst turecki o tym samym znaczeniu zużywa nieco więcej tokenów niż tekst w języku angielskim.

Dlaczego warto to wiedzieć? Bo wszystko jest płatne i mierzone w żetonach. Tekst (dane wejściowe) wysyłane do modelu i odpowiedź (wyjście) generowane przez model są liczone jako osobne tokeny. Zarówno Twoja faktura, jak i pojemność modelu są w tokenach.

Wskazówka: aby z grubsza oszacować liczbę żetonów w tekście, podziel liczbę znaków przez cztery. Wiadomość e-mail zawierająca 4000 znaków to około 1000 tokenów. W języku tureckim załóż nieco wyżej, aby pozostać po bezpiecznej stronie.

Okno kontekstowe: „Pamięć krótkotrwała” modelu

Okno kontekstowe to całkowita liczba tokenów, o których model może jednocześnie pamiętać. Dane wejściowe i wyjściowe muszą pasować do siebie w tym oknie. Pomyśl o tym jak o ilości papieru, którą możesz rozłożyć na stole jednocześnie: papier, który nie mieści się na stole, znajduje się w tym momencie poza twoim polem widzenia.

Jeśli okno kontekstowe modelu zawiera 200 000 tokenów, oznacza to około 150 000 słów lub kilka książek średniej wielkości. 1 milion tokenów może przetwarzać znacznie większe dokumenty jako całość. Niektóre dzisiejsze zaawansowane modele (np. Claude Opus 4.8 i Sonnet 5) oferują 1 milion kontekstów tokenów, podczas gdy lekkie modele często mają mniejsze okna (np. 200 000 tokenów dla Haiku 4.5).

Dlaczego to jest ważne? Ponieważ jeśli dokument nie mieści się w oknie kontekstowym, model nie może zobaczyć go w całości. Nie możesz dać 500-stronicowej umowy w całości modelowi na 200 000 tokenów; Albo dzielisz dokument na części (co może spowodować utratę powiązań między częściami), albo wybierasz model z szerszym kontekstem.

Uwaga: nie jest rozsądne wypełnianie każdego dokumentu, ponieważ dzieje się tak tylko dlatego, że okno kontekstowe jest duże. Im więcej żetonów umieścisz w okienku, tym więcej zapłacisz, a czasami modelowi w bardzo długich tekstach może brakować środkowych szczegółów. Często taniej i dokładniej jest wysłać tylko tę część, która działa.

Okno kontekstowe to kryteria decyzyjne

Zadanie

Przybliżony wymagany kontekst

Odpowiedni poziom

Krótka odpowiedź e-mail

kilkaset żetonów

lekki

Podsumowanie na jednej stronie

kilka tysięcy tokenów

Lekki/zrównoważony

Analiza 40-stronicowego raportu

~30 000 tokenów

Zrównoważony/mocny

300-stronicowa recenzja umowy

~250 000 tokenów

Potężny i szeroki kontekst

Przetwarzaj setki dokumentów jednocześnie

Ponad 500 000 tokenów

Najszerszy kontekst

Ta tabela odpowiada na pytanie „który model?” Pokazuje, że na część pytania odpowiada bezpośrednio rozmiar dokumentu. Kupowanie drogiego modelu z dużym kontekstem do krótkich prac jest stratą czasu; Do dużych dokumentów nie sprawdzi się model z małym okienkiem.

Multimodalność: wyjście poza tekst

Multimodalność to zdolność modelu do obsługi wielu typów danych (obrazu, dźwięku, czasami wideo), a nie tylko tekstu. „Modalny” oznacza tutaj „typ danych”; multimodalny oznacza „wiele rodzajów”.

  • Model tylko tekstowy: czyta i zapisuje tylko tekst pisany.
  • Model multimodalny: Potrafi odczytać zdjęcie rachunku, zinterpretować trend na wykresie, odszyfrować odręczną notatkę, czasami dokonać transkrypcji nagrania głosowego.

Dlaczego to jest ważne? Ponieważ charakter Twojej firmy może wymagać multimodalności. Zespół księgowy wyodrębniający kwoty ze zdjęć faktur, zespół ds. handlu elektronicznego klasyfikujący zdjęcia produktów lub zespół ubezpieczeniowy oceniający zdjęcia szkód nie mogą wykonać tego zadania z modelem, który czyta tylko tekst. Przetwarzanie wizualne jest niezbędne w przypadku tych zadań.

Trzy realistyczne przypadki

Przypadek 1 — Niespodzianka związana z kosztem symbolu. Zespół ds. treści wysyła także modelce 20-stronicowy „przewodnik po marce” podczas tworzenia każdego wpisu na blogu. Ten przewodnik zawiera około 15 000 tokenów. Produkują 2000 artykułów miesięcznie; Zatem samo wysyłanie przewodnika w kółko oznacza 30 milionów tokenów wejściowych. Skracając przewodnik i wysyłając tylko odpowiednią sekcję (około 2000 tokenów), zmniejszają wkład do jednej siódmej i znacznie zmniejszają rachunek.

Przypadek 2 — Okno kontekstowe nie wystarczy. Kancelaria prawnicza chce, aby 280-stronicowa umowa fuzji została przejrzana. Pierwszy model, który wypróbowali, miał oprawę na 200 000 tokenów i dokument nie pasował; Kiedy dokument zostanie rozdarty, modelka nie jest w stanie zauważyć, że artykuł w pierwszej sekcji stoi w sprzeczności z artykułem w sekcji ostatniej. Kiedy przełącza się na model z kontekstem 1 miliona tokenów, czyta dokument jako całość i wychwytuje sprzeczność. Tutaj okno kontekstowe bezpośrednio determinowało dokładność.

Przypadek 3 — Multimodalność jest koniecznością. Firma ubezpieczeniowa chce dokonać wstępnej oceny na podstawie zdjęć uszkodzeń pojazdu. Jest to niemożliwe w przypadku modelu, który czyta tylko tekst; Wymagany jest model multimodalny, który „widzi” fotografię. Kiedy przechodzą na model multimodalny, ustanawiają system wstępnej kontroli, który z grubsza klasyfikuje lokalizację i stopień uszkodzeń na zdjęciu oraz kieruje ekspertem. Zauważają jednak, że ostateczną decyzję podejmuje ekspert będący człowiekiem; ponieważ model jest wstępnym narzędziem przesiewowym, a nie ostatecznym słowem.

Słaba podpowiedź/silna podpowiedź

Słaba zachęta:

Podsumuj ten dokument. [wklejono zbyt długi dokument]

Potężny monit:

Podsumuj poniższy 40-stronicowy raport. Najpierw oszacuj przybliżoną liczbę tokenów w raporcie i powiedz nam, czy mieści się ona w oknie kontekstowym typowego, zrównoważonego modelu. Następnie podaj podsumowanie w następującym formacie: 5-elementowe streszczenie + 3 ryzykowne ustalenia. Korzystaj wyłącznie z informacji zawartych w raporcie; Oznacz część, której nie jesteś pewien, jako „niejasną w raporcie”. [raport]

Potężny monit rozpoznaje zarówno token/kontekst, jak i kontroluje format i sprawdzalność danych wyjściowych.

Szablony do kopiowania

1. Przewidywanie tokenów:

Oszacuj przybliżoną liczbę tokenów dla następującego tekstu i zinterpretuj ją pod względem kosztu wejściowego: „[TEKST]”. Zaokrąglij trochę, biorąc pod uwagę, że jest to turecki.

2. Sprawdzenie dostępności kontekstu:

Moja praca polega na przetwarzaniu następujących dokumentów: średnio [STRONY] z [ILOŚĆ] dokumentów miesięcznie. Jakiego okna kontekstowego wymaga ten rozmiar? Który z poziomów światła/zrównoważonego/silnego byłby wystarczający? Jakie ryzyko powstaje w przypadku konieczności demontażu?

3. Diagnoza multimodalności:

Mój przepływ pracy: [OPIS]. Czy ten strumień jest przetwarzany wizualnie, audio lub wideo? Jeśli tak, czy wymagany jest model multimodalny, czy też można go przekonwertować na tekst (OCR/transkrypcja) i rozwiązać za pomocą modelu tekstowego? Porównaj zalety i wady obu ścieżek.

4. Optymalizacja kontekstu:

Do każdej prośby wysyłam dokument do modelki, lecz większość z nich jest zbędna. Jak wyodrębnić z tego dokumentu części, które są rzeczywiście potrzebne do wykonania zadania [ZADANIE]? Zaproponuj 3 konkretne sposoby ograniczenia wkładu i wskaż szacunkowe oszczędności.

Typowe błędy

  • Mylenie tokena ze słowem: Token różni się od słowa; Faktura i pojemność są zawsze wyrażone w żetonach, liczenie słowne wprowadza w błąd.
  • Myślenie, że okno kontekstowe jest nieskończone: każdy model ma swoje granice; Jeżeli dokument się nie mieści, modelka nie widzi całości.
  • Używanie niepotrzebnego dużego kontekstu: Kupno drogiego modelu z dużym kontekstem do krótkiej pracy; lub wypełniaj ogromne dokumenty na każdą prośbę i płać na próżno.
  • Zakładając multimodalność: nie każdy model może przetwarzać wizualizacje; W przypadku prac wizualnych rozpocznij bez potwierdzenia, że ​​model jest multimodalny.
  • Zapominając o symbolicznym ładunku języka tureckiego: teksty tureckie zazwyczaj zużywają nieco więcej symboli dla tego samego znaczenia; pomijając to w szacowaniu kosztów.

Podsumowując

  • Token to mała jednostka, w której model przetwarza tekst; dane wejściowe i wyjściowe są mierzone i fakturowane oddzielnie jako żetony.
  • Okno kontekstowe to całkowita liczba żetonów, które model może jednocześnie zapamiętać; rozmiar dokumentu wpływa bezpośrednio na wybór modelu.
  • Multimodalność to zdolność modelu do przetwarzania danych nietekstowych, takich jak obraz/dźwięk; Jest niezbędny przy pracach wizualnych.
  • Obydwa te trzy pojęcia odnoszą się do pytania „który model?” oraz „ile to kosztuje?” Stanowi podstawę pytań.

Zadanie aplikacji

Wybierz powtarzające się zadanie AI w Twojej firmie. Niech pierwszy szablon (przewidywanie tokenów) obliczy, ile tokenów zawiera typowe dane wejściowe w tym zadaniu. Następnie określ, który poziom jest wystarczający, korzystając z szablonu 2 (sprawdzenie dostępności kontekstu). Jeśli masz zadanie wizualne, wyjaśnij, czy wymagany jest model multimodalny za pomocą trzeciego szablonu (diagnoza multimodalności). Otrzymany szacunkowy token wykorzystamy w kalkulacji kosztów kolejnej jednostki.

lista kontrolna

  • [ ] Znam pojęcie tokena i wiem, jak z grubsza oszacować, ile tokenów ma tekst.
  • [ ] Mogę wyjaśnić okno kontekstowe za pomocą analogii do „tabeli/pamięci”.
  • [ ] Potrafię ocenić, czy dokument będzie pasował do modelu.
  • [ ] Potrafię zdiagnozować, kiedy multimodalność jest niezbędna.
  • [ ] Biorę pod uwagę symboliczne obciążenie języka tureckiego i koszt niepotrzebnego kontekstu.