zisky:
- Schopnosť vysvetliť pojmy token, kontextové okno a multimodalita v bežnom jazyku
- Diagnostikujte, či úloha vyžaduje široký kontext alebo multimodalitu
- Schopnosť vziať do úvahy, ako tieto koncepty ovplyvňujú náklady a výber modelu
Doteraz sme oboznámení s poskytovateľmi a typmi modelov. Pre správny výber modelu je však potrebné pochopiť aj to, ako modely fungujú „vo vnútri“; pretože rozhodnutia o cene, kapacite a dostupnosti sa všetky spoliehajú na tri základné koncepty: token, kontextové okno a multimodalita. Niekto, kto nepozná tieto pojmy, nemôže čítať cenník a čudovať sa, "bude tento dokument pasovať na model?" nedokáže odpovedať na otázku a nevidí, kedy je vizuálne spracovanie nevyhnutné. Na konci tohto bloku budete schopní vysvetliť tieto tri pojmy v bežnom jazyku, diagnostikovať, či práca vyžaduje široký kontext alebo multimodalitu, a vziať do úvahy ich vplyv na náklady.
Token: Jednotka používaná modelom namiesto Wordu
Modely umelej inteligencie spracovávajú text nie slovo po slove, ale v malých kúskoch nazývaných tokeny. Token; Môže to byť slovo, časť slova, interpunkčné znamienko alebo medzera. Na približný výpočet: V angličtine má priemerný token približne štyri znaky a 100 slov predstavuje približne 130 – 150 tokenov. V turečtine môže byť táto sadzba o niečo vyššia v dôsledku sufixovaných a dlhých slov; Inými slovami, turecký text s rovnakým významom spotrebuje o niečo viac tokenov ako anglický.
Prečo je to dôležité vedieť? Pretože všetko sa účtuje a meria v žetónoch. Text (vstup), ktorý odošlete do modelu, a odpoveď (výstup) produkovaná modelom sa počítajú ako samostatné tokeny. Vaša faktúra aj kapacita modelu sú v tokenoch.
Tip: Ak chcete získať približný odhad počtu znakov v texte, vydeľte počet znakov štyrmi. E-mail so 4 000 znakmi má približne 1 000 tokenov. V turečtine predpokladajte trochu vyššie, aby ste zostali na bezpečnej strane.
Kontextové okno: Modelova „Krátkodobá pamäť“
Kontextové okno predstavuje celkové množstvo tokenov, ktoré si model môže súčasne uchovať. Vstup a výstup sa musia v tomto okne zhodovať. Predstavte si to ako množstvo papiera, ktoré môžete naraz rozložiť na stôl: Papier, ktorý sa nezmestí na stôl, je v tej chvíli mimo vášho zorného poľa.
Ak je kontextové okno modelu 200 000 tokenov, zodpovedá to približne 150 000 slovám alebo niekoľkým stredne veľkým knihám. 1 milión tokenov dokáže spracovať oveľa väčšie dokumenty ako celok. Niektoré dnešné výkonné modely (napr. Claude Opus 4.8 a Sonnet 5) ponúkajú 1 milión kontextov tokenov, zatiaľ čo ľahké modely sa často dodávajú s menšími oknami (napr. 200 000 tokenov pre Haiku 4.5).
Prečo je to dôležité? Pretože ak sa dokument nezmestí do kontextového okna, model ho nemôže vidieť celý spolu. Nemôžete dať 500-stranovú zmluvu ako celok modelu s 200 000 tokenmi; Buď dokument rozdelíte na časti (čo môže stratiť vzťah medzi časťami), alebo zvolíte model so širším kontextom.
Pozor: Nie je rozumné vypĺňať každý dokument, pretože kontextové okno je veľké. Čím viac žetónov do okienka vložíte, tým viac zaplatíte a niekedy môžu modelu chýbať stredné detaily vo veľmi dlhých textoch. Často je lacnejšie a presnejšie poslať len diel, ktorý funguje.
Kontextové okno je rozhodovacím kritériom
Quest
Približný požadovaný kontext
Primeraná úroveň
Krátka odpoveď na email
niekoľko stoviek žetónov
ľahký
Jednostranové zhrnutie
niekoľko tisíc žetónov
Svetlé/vyvážené
40-stranová analýza správy
~30 000 tokenov
Vyvážený/silný
300-stranová recenzia zmluvy
~250 000 tokenov
Výkonný so širokým kontextom
Spracovávajte stovky dokumentov naraz
500 000+ tokenov
Najširší kontext
Táto tabuľka odpovedá na otázku "aký model?" Ukazuje, že časť otázky je zodpovedaná priamo veľkosťou dokumentu. Je zbytočné kupovať drahý model s veľkým kontextom na krátke úlohy; Model s malým okienkom nie je vhodný pre veľké dokumenty.
Multimodalita: Prekračovanie textu
Multimodalita je schopnosť modelu spracovať viacero typov údajov (obrázok, zvuk, niekedy aj video), nielen text. „Modálny“ tu znamená „typ údajov“; multimodálny znamená „mnoho druhov“.
- Model len s textom: Číta a píše iba písaný text.
- Multimodálny model: Dokáže prečítať fotografiu účtu, interpretovať trend na grafe, dekódovať rukou napísanú poznámku, niekedy prepísať hlasový záznam.
Prečo je to dôležité? Pretože povaha vášho podnikania môže vyžadovať multimodalitu. Účtovný tím, ktorý vyťahuje sumy z obrázkov faktúr, tím elektronického obchodu, ktorý klasifikuje fotografie produktov, alebo poisťovací tím, ktorý hodnotí fotografie poškodení, nemôže robiť túto prácu s modelom, ktorý iba číta text. Vizuálne spracovanie je nevyhnutné pre tieto úlohy.
Tri realistické prípady
Prípad 1 – Token cost prekvapenie. Tím pre obsah tiež pošle modelke 20-stranový dokument „sprievodcu značkou“ pri vytváraní každého blogového príspevku. Táto príručka obsahuje približne 15 000 žetónov. Vyrábajú 2000 článkov mesačne; Takže len posielanie sprievodcu znova a znova znamená 30 miliónov tokenov vstupu. Skrátením sprievodcu a odoslaním len príslušného úseku (asi 2000 tokenov) znížia vstup na sedminu a výrazne znížia účet.
Prípad 2 – Kontextové okno nestačí. Advokátska kancelária chce dať preskúmať 280-stranovú zmluvu o zlúčení. Prvý model, ktorý vyskúšali, mal väzbu 200 000 tokenov a dokument sa nezmestil; Keď je dokument roztrhnutý, model si nemôže všimnúť, že článok v prvej sekcii je v rozpore s článkom v poslednej sekcii. Keď sa prepne na model s 1 miliónom tokenového kontextu, prečíta dokument ako celok a zachytí rozpor. Presnosť tu priamo určovalo kontextové okno.
Prípad 3 – Multimodalita je nevyhnutnosťou. Poisťovňa chce urobiť predbežný odhad z fotografií poškodenia vozidla. To je nemožné s modelom, ktorý iba číta text; Vyžaduje sa multimodálny model, ktorý „vidí“ fotografiu. Keď prejdú na multimodálny model, zavedú systém predbežného skríningu, ktorý zhruba klasifikuje miesto a závažnosť poškodenia na fotografii a nasmeruje odborníka. Poznamenávajú však, že konečné rozhodnutie robí ľudský expert; pretože model je predbežný skríningový nástroj, nie konečné slovo.
Slabá výzva / silná výzva
Slabá výzva:
Zhrňte tento dokument. [bol prilepený príliš dlhý dokument]
Výkonná výzva:
Zhrňte 40-stranovú správu nižšie. Najprv odhadnite približný počet tokenov v správe a povedzte nám, či sa hodí do kontextového okna typického vyváženého modelu. Potom uveďte súhrn v tomto formáte: 5-položkový zhrnutie + 3 rizikové zistenia. Používajte iba informácie v správe; Časť, ktorou si nie ste istí, označte ako „v správe nie je jasná“. [správa]
Výkonná výzva si uvedomuje token/kontext a riadi formát a overiteľnosť výstupu.
Kopírovateľné šablóny
1. Predikcia tokenu:
Odhadnite približný počet tokenov pre nasledujúci text a interpretujte ho ako vstupné náklady: „[TEXT]“. Trochu to zaokrúhlite, berúc do úvahy, že je to turecké.
2. Kontrola dostupnosti kontextu:
Mojou úlohou je spracovať nasledujúce dokumenty: priemerne [STRÁNKY] z [QTY] dokumentov za mesiac. Aké kontextové okno vyžaduje táto veľkosť? Ktorá zo svetelných/vyvážených/silných úrovní by bola dostatočná? Aké riziko vzniká, ak je potrebné ho rozobrať?
3. Multimodálna diagnóza:
Môj pracovný postup: [DESCRIPTION]. Je v tomto streame spracovanie obrazu, zvuku alebo videa? Ak áno, je potrebný multimodálny model, alebo ho možno previesť na text (OCR/prepis) a vyriešiť pomocou textového modelu? Porovnajte výhody a nevýhody týchto dvoch ciest.
4. Kontextová optimalizácia:
Ku každej požiadavke posielam modelke doklad, no väčšina je zbytočná. Ako z tohto dokumentu získam časti, ktoré sú skutočne potrebné pre [TASK]? Navrhnite 3 konkrétne spôsoby zníženia vstupu a uveďte odhadované úspory tokenov.
Časté chyby
- Zámena tokenu za slovo: Token sa líši od slova; Faktúra a kapacita sú vždy v tokenoch, počítanie slovami je zavádzajúce.
- Kontextové okno je nekonečné: Každý model má limit; Ak sa dokument nezmestí, model nevidí celý.
- Použitie zbytočného veľkého kontextu: Nákup drahého modelu s veľkým kontextom na krátku prácu; alebo vyplniť obrovské dokumenty pre každú žiadosť a platiť márne.
- Predpokladajme multimodalitu: Nie každý model dokáže spracovať vizuály; Pre vizuálnu prácu začnite bez potvrdenia, že model je multimodálny.
- Zabudnutie na množstvo tokenov v turečtine: turecké texty vo všeobecnosti spotrebujú o niečo viac tokenov pre rovnaký význam; ignorovať to pri odhade nákladov.
V súhrne
- Token je malá jednotka, v ktorej model spracováva text; vstup a výstup sa merajú a fakturujú oddelene ako tokeny.
- Kontextové okno predstavuje celkový počet tokenov, ktoré si model môže súčasne pamätať; veľkosť dokumentu priamo ovplyvňuje výber modelu.
- Multimodalita je schopnosť modelu spracovávať netextové dáta, ako sú vizuálne/audio; Je to nevyhnutné pre vizuálne diela.
- Tieto tri pojmy sú relevantné pre otázku „aký model?“ ako aj "koľko to stojí?" Tvorí základ otázok.
Aplikačná úloha
Vyberte si vo svojom podnikaní opakujúcu sa úlohu AI. Nechajte 1. šablónu (predikcia tokenov) vypočítať, koľko tokenov je typickým vstupom v tejto úlohe. Potom určite, ktorá úroveň je dostatočná so šablónou 2 (kontrola dostupnosti kontextu). Ak máte vizuálnu prácu, ujasnite si, či je potrebný multimodálny model pomocou 3. šablóny (diagnostika multimodality). Výsledný tokenový odhad použijeme pri kalkulácii nákladov na ďalšiu jednotku.
kontrolný zoznam
- [ ] Poznám pojem token a ako zhruba odhadnúť, koľko tokenov má text.
- [ ] Kontextové okno viem vysvetliť analógiou „tabuľka/pamäť“.
- [ ] Viem vyhodnotiť, či dokument zapadne do modelu.
- [ ] Viem diagnostikovať, kedy je multimodalita nevyhnutná.
- [ ] Beriem do úvahy symbolickú réžiu turečtiny a náklady na zbytočný kontext.