zisky:
- Schopnost vysvětlit pojmy token, kontextové okno a multimodalita v běžném jazyce
- Diagnostikujte, zda úkol vyžaduje široký kontext nebo multimodalitu
- Schopnost vzít v úvahu, jak tyto koncepty ovlivňují náklady a výběr modelu
Zatím jsme obeznámeni s poskytovateli a typy modelů. Pro správný výběr modelu je však také nutné pochopit, jak modely fungují „uvnitř“; protože rozhodnutí o ceně, kapacitě a dostupnosti závisí na třech základních konceptech: token, kontextové okno a multimodalita. Někdo, kdo nezná tyto pojmy, nemůže číst ceník a ptá se: "bude tento dokument pasovat na model?" nedokáže odpovědět na otázku a nevidí, kdy je vizuální zpracování zásadní. Na konci této jednotky budete schopni vysvětlit tyto tři pojmy v běžném jazyce, diagnostikovat, zda práce vyžaduje široký kontext nebo multimodalitu, a vzít v úvahu jejich dopad na náklady.
Token: Jednotka používaná modelem místo aplikace Word
Modely umělé inteligence zpracovávají text nikoli slovo po slovu, ale po malých kouscích nazývaných tokeny. Token; Může to být slovo, část slova, interpunkční znaménko nebo mezera. Pro hrubý výpočet: V angličtině je průměrný token asi čtyři znaky a 100 slov je asi 130-150 tokenů. V turečtině může být tato míra o něco vyšší kvůli příponám a dlouhým slovům; Jinými slovy, turecký text se stejným významem spotřebuje o něco více tokenů než anglický.
Proč je to důležité vědět? Protože vše je účtováno a měřeno v žetonech. Text (vstup), který odešlete do modelu, a odpověď (výstup) vytvořená modelem se počítají jako samostatné tokeny. Vaše faktura i kapacita modelu jsou v tokenech.
Tip: Chcete-li získat hrubý odhad počtu tokenů v textu, vydělte počet znaků čtyřmi. E-mail o 4 000 znacích je přibližně 1 000 tokenů. V turečtině předpokládejte trochu vyšší, abyste zůstali na bezpečné straně.
Kontextové okno: Modelova „krátkodobá paměť“
Kontextové okno představuje celkové množství tokenů, které si model může v daný okamžik uchovat v paměti. Vstup a výstup se musí do tohoto okna vejít. Představte si to jako množství papíru, které můžete rozložit na stůl najednou: Papír, který se nevejde na stůl, je v tu chvíli mimo vaše zorné pole.
Pokud je kontextové okno modelu 200 000 tokenů, odpovídá to přibližně 150 000 slovům nebo několika středně velkým knihám. 1 milion tokenů dokáže zpracovat mnohem větší dokumenty jako celek. Některé dnes výkonné modely (např. Claude Opus 4.8 a Sonnet 5) nabízejí 1 milion kontextů tokenů, zatímco lehké modely často přicházejí s menšími okny (např. 200 000 tokenů pro Haiku 4.5).
Proč je to důležité? Protože pokud se dokument nevejde do kontextového okna, model jej nevidí celý pohromadě. Nemůžete dát 500stránkovou smlouvu jako celek modelu s 200 000 tokeny; Buď dokument rozdělíte na části (což může ztratit vztah mezi částmi), nebo zvolíte model s širším kontextem.
Upozornění: Není moudré vyplňovat každý dokument, protože kontextové okno je velké. Čím více žetonů do okna vložíte, tím více zaplatíte a někdy model může ve velmi dlouhých textech postrádat střední detaily. Často je levnější a přesnější poslat jen ten díl, který funguje.
Kontextové okno je rozhodovacím kritériem
Quest
Přibližný požadovaný kontext
Odpovídající úroveň
Krátká odpověď na email
několik stovek žetonů
lehký
Souhrn na jednu stránku
několik tisíc žetonů
Lehký/vyvážený
40stránková analýza zprávy
~30 000 tokenů
Vyvážený/silný
300stránková revize smlouvy
~250 000 tokenů
Silný s širokým kontextem
Zpracovávejte stovky dokumentů najednou
500 000+ žetonů
Nejširší kontext
Tato tabulka odpovídá na otázku "který model?" Ukazuje, že část otázky je zodpovězena přímo velikostí dokumentu. Je škoda kupovat drahý model s velkým kontextem pro krátké zakázky; Model s malým oknem je pro velké dokumenty nevhodný.
Multimodalita: Překračování textu
Multimodalita je schopnost modelu zpracovávat více typů dat (obrázek, zvuk, někdy video), nejen text. "Modální" zde znamená "datový typ"; multimodální znamená „mnoho druhů“.
- Model pouze s textem: Čte a zapisuje pouze psaný text.
- Multimodální model: Dokáže přečíst fotografii účtu, interpretovat trend v grafu, dekódovat ručně psanou poznámku, někdy přepsat hlasový záznam.
Proč je to důležité? Protože povaha vašeho podnikání může vyžadovat multimodalitu. Účetní tým, který extrahuje částky z obrázků faktur, tým elektronického obchodu, který klasifikuje fotografie produktů, nebo pojišťovací tým, který vyhodnocuje fotografie poškození, nemohou tuto práci dělat s modelem, který čte pouze text. Vizuální zpracování je pro tyto úkoly zásadní.
Tři realistické případy
Případ 1 – Překvapení o ceně tokenu. Tým pro obsah také zašle modelce 20stránkový dokument „průvodce značkou“ při vytváření každého příspěvku na blogu. Tato příručka obsahuje asi 15 000 žetonů. Vyrobí 2000 článků měsíčně; Takže pouhé zasílání průvodce znovu a znovu znamená 30 milionů vstupních tokenů. Zkrácením průvodce a odesláním pouze příslušného úseku (asi 2000 tokenů) snižují vstup na sedminu a výrazně snižují účet.
Případ 2 – Kontextové okno nestačí. Advokátní kancelář chce nechat přezkoumat 280stránkovou smlouvu o fúzi. První model, který vyzkoušeli, měl vazbu 200 000 tokenů a dokument se nevešel; Když je dokument roztržen, model si nevšimne, že článek v první sekci je v rozporu s článkem v poslední sekci. Když se přepne na model s 1 milionem kontextu tokenů, přečte dokument jako celek a zachytí rozpor. Zde kontextové okno přímo určovalo přesnost.
Případ 3 – Multimodalita je nutností. Pojišťovna chce provést předběžné posouzení z fotografií poškození vozidla. To je nemožné u modelu, který pouze čte text; Je vyžadován multimodální model, který „vidí“ fotografii. Když přejdou na multimodální model, zavedou systém předběžného screeningu, který zhruba klasifikuje místo a závažnost poškození na fotografii a nasměruje odborníka. Poznamenávají však, že konečné rozhodnutí činí lidský expert; protože model je předběžným screeningovým nástrojem, nikoli konečným slovem.
Slabá výzva / Silná výzva
Slabá výzva:
Shrňte tento dokument. [vložen příliš dlouhý dokument]
Výkonná výzva:
Shrňte 40stránkovou zprávu níže. Nejprve odhadněte přibližný počet tokenů ve zprávě a řekněte nám, zda se hodí do kontextového okna typického vyváženého modelu. Shrnutí pak uveďte v tomto formátu: 5-položkové shrnutí + 3 riziková zjištění. Používejte pouze informace ve zprávě; Část, kterou si nejste jisti, označte jako „nejasná ve zprávě“. [zpráva]
Výkonná výzva si je vědoma tokenu/kontextu a řídí formát a ověřitelnost výstupu.
Kopírovatelné šablony
1. Předpověď tokenu:
Odhadněte přibližný počet tokenů pro následující text a interpretujte jej jako vstupní náklady: "[TEXT]". Zaokrouhlete to trochu nahoru s ohledem na to, že je to turečtina.
2. Kontrola dostupnosti kontextu:
Mým úkolem je zpracovat následující dokumenty: průměr [STRÁNEK] z [QTY] dokumentů za měsíc. Jaké kontextové okno vyžaduje tato velikost? Která ze světelných/vyvážených/silných úrovní by byla dostatečná? Jaké riziko vzniká v případě nutnosti demontáže?
3. Multimodální diagnostika:
Můj pracovní postup: [POPIS]. Je v tomto streamu zpracování obrazu, zvuku nebo videa? Pokud ano, je vyžadován multimodální model, nebo jej lze převést na text (OCR/přepis) a vyřešit pomocí textového modelu? Porovnejte klady a zápory obou cest.
4. Optimalizace kontextu:
Ke každé žádosti posílám modelce doklad, ale většinou je to zbytečné. Jak z tohoto dokumentu extrahuji části, které jsou skutečně vyžadovány pro [TASK]? Navrhněte 3 konkrétní způsoby, jak snížit vstup a uveďte odhadované úspory tokenů.
Časté chyby
- Záměna tokenu za slovo: Token se liší od slova; Faktura a kapacita jsou vždy v tokenech, počítání slovy je zavádějící.
- Myšlení kontextového okna je nekonečné: Každý model má limit; Pokud se dokument nevejde, model nevidí celek.
- Použití zbytečného velkého kontextu: Nákup drahého modelu s velkým kontextem pro krátkou práci; nebo vyplňovat obrovské dokumenty pro každou žádost a platit marně.
- Za předpokladu multimodality: Ne každý model dokáže zpracovat vizuály; Pro vizuální práci začněte bez potvrzení, že model je multimodální.
- Zapomeňte na tokenovou zátěž turečtiny: Turecké texty obecně spotřebují o něco více tokenů pro stejný význam; toto při odhadu nákladů ignorovat.
V souhrnu
- Token je malá jednotka, ve které model zpracovává text; vstup a výstup jsou měřeny a fakturovány samostatně jako tokeny.
- Kontextové okno je celkový počet tokenů, které si model může v daný okamžik zapamatovat; velikost dokumentu přímo ovlivňuje výběr modelu.
- Multimodalita je schopnost modelu zpracovávat netextová data, jako jsou vizuální/audio; Je nezbytný pro vizuální díla.
- Oba tyto tři pojmy jsou relevantní pro otázku "který model?" stejně jako "kolik to stojí?" Tvoří základ otázek.
Aplikační úkol
Vyberte si opakující se úkol AI ve vaší firmě. Nechte 1. šablonu (předpověď tokenu) vypočítat, kolik tokenů je typickým vstupem v této úloze. Poté určete, která úroveň je dostatečná se šablonou 2 (kontrola dostupnosti kontextu). Pokud máte vizuální práci, ujasněte si, zda je vyžadován multimodální model pomocí 3. šablony (diagnostika multimodality). Výsledný tokenový odhad použijeme při kalkulaci nákladů na další jednotku.
kontrolní seznam
- [ ] Znám pojem token a jak zhruba odhadnout, kolik tokenů má text.
- [ ] Kontextové okno mohu vysvětlit analogií „tabulka/paměť“.
- [ ] Umím vyhodnotit, zda dokument zapadne do modelu.
- [ ] Umím diagnostikovat, kdy je multimodalita nezbytná.
- [ ] Beru v úvahu tokenovou režii turečtiny a cenu zbytečného kontextu.