Dobici:
- Sposobnost objašnjavanja pojmova tokena, kontekstnog prozora i multimodalnosti svakodnevnim jezikom
- Dijagnosticirajte da li zadatak zahtijeva širok kontekst ili multimodalnost
- Sposobnost da se uzme u obzir kako ovi koncepti utiču na cenu i izbor modela
Do sada smo upoznati sa dobavljačima i tipovima modela. Međutim, za pravi odabir modela potrebno je razumjeti i kako modeli funkcioniraju "iznutra"; jer se odluke o cijeni, kapacitetu i dostupnosti oslanjaju na tri osnovna koncepta: token, kontekstni prozor i multimodalnost. Neko ko ne poznaje ove koncepte ne može pročitati cjenovnik i zapitati se "hoće li ovaj dokument odgovarati modelu?" ne mogu odgovoriti na pitanje i ne mogu vidjeti kada je vizualna obrada neophodna. Do kraja ove cjeline moći ćete objasniti ova tri koncepta svakodnevnim jezikom, dijagnosticirati da li posao zahtijeva širok kontekst ili multimodalnost i uzeti u obzir njihov utjecaj na troškove.
Token: jedinica koju koristi model umjesto riječi
Modeli umjetne inteligencije obrađuju tekst ne riječ po riječ, već u malim dijelovima koji se nazivaju tokeni. A token; To može biti riječ, dio riječi, znak interpunkcije ili razmak. Da napravimo grubu kalkulaciju: na engleskom, prosječan token je oko četiri znaka, a 100 riječi je oko 130-150 tokena. Na turskom, ova stopa može biti nešto viša zbog sufiksa i dugih riječi; Drugim riječima, turski tekst sa istim značenjem troši nešto više znakova nego engleski.
Zašto je ovo važno znati? Jer sve se naplaćuje i mjeri u tokenima. Tekst (unos) koji šaljete modelu i odgovor (izlaz) proizveden od strane modela se računaju kao zasebni tokeni. I vaša faktura i kapacitet modela su u tokenima.
Savjet: Da biste dobili grubu procjenu koliko tokena ima tekst, podijelite broj znakova sa četiri. E-mail od 4.000 znakova je otprilike 1.000 tokena. Na turskom, pretpostavite malo više da biste ostali na sigurnoj strani.
Kontekstni prozor: "Kratkoročno pamćenje" modela
Prozor konteksta je ukupna količina tokena koje model može imati na umu u jednom trenutku. Ulaz i izlaz moraju stati zajedno u ovaj prozor. Razmišljajte o tome kao o količini papira koju možete odjednom da stavite na sto: papir koji ne stane na sto je u tom trenutku izvan vašeg vidnog polja.
Ako kontekstni prozor modela ima 200.000 tokena, to je jednako otprilike 150.000 riječi ili nekoliko knjiga srednje veličine. 1 milion tokena može obraditi mnogo veće dokumente u cjelini. Neki moćni modeli danas (npr. Claude Opus 4.8 i Sonet 5) nude 1 milion konteksta tokena, dok lagani modeli često dolaze s manjim prozorima (npr. 200.000 tokena za Haiku 4.5).
Zašto je to važno? Jer ako dokument ne stane u kontekstni prozor, model ga ne može vidjeti sve zajedno. Ne možete dati ugovor od 500 stranica u cijelosti modelu od 200.000 tokena; Dokument možete ili podijeliti na dijelove (koji mogu izgubiti odnos između dijelova) ili odabrati model sa širim kontekstom.
Oprez: Nije mudro popunjavati svaki dokument jer je to samo zato što je kontekstni prozor velik. Što više tokena stavite u prozor, to više plaćate, a ponekad modelu mogu nedostajati središnji detalji u vrlo dugim tekstovima. Često je jeftinije i preciznije poslati samo onaj dio koji radi.
Kontekstni prozor je kriterijum odluke
Quest
Približan potreban kontekst
Odgovarajući nivo
Kratak odgovor na email
nekoliko stotina žetona
lagana
Sažetak na jednoj stranici
nekoliko hiljada tokena
Lagano/uravnoteženo
Analiza izvještaja na 40 stranica
~30,000 tokena
Uravnoteženo/snažno
Pregled ugovora na 300 stranica
~250,000 tokena
Moćan sa širokim kontekstom
Obradite stotine dokumenata odjednom
500.000+ tokena
Najširi kontekst
Ova tabela odgovara na pitanje "koji model?" To pokazuje da se na dio pitanja direktno odgovara veličina dokumenta. Uzalud je kupovati skupi model sa velikim kontekstom za kratke poslove; Model sa malim prozorom je neadekvatan za velike dokumente.
Multimodalnost: Ići dalje od teksta
Multimodalnost je sposobnost modela da rukuje više vrsta podataka (slika, audio, ponekad i video), a ne samo tekst. "Modal" ovdje znači "tip podataka"; multimodal znači "mnogo vrsta".
- Model samo za tekst: Čita i piše samo pisani tekst.
- Multimodalni model: Može čitati fotografiju računa, interpretirati trend na grafikonu, dekodirati rukom pisanu bilješku, ponekad transkribovati glasovni snimak.
Zašto je to važno? Jer priroda vašeg poslovanja može zahtijevati multimodalnost. Računovodstveni tim koji izdvaja iznose iz slika faktura, tim za e-trgovinu koji klasifikuje fotografije proizvoda ili tim za osiguranje koji procjenjuje fotografije oštećenja ne može obaviti ovaj posao s modelom koji samo čita tekst. Vizuelna obrada je neophodna za ove zadatke.
Tri realna slučaja
Slučaj 1 — Token košta iznenađenje. Tim za sadržaj takođe šalje modelu dokument „vodiča za brend“ od 20 stranica dok stvaraju svaki blog post. Ovaj vodič ima oko 15.000 tokena. Proizvode 2.000 artikala mjesečno; Dakle, samo slanje vodiča iznova i iznova znači 30 miliona tokena unosa. Skraćivanjem vodiča i slanjem samo relevantnog odjeljka (oko 2.000 tokena), oni smanjuju unos na jednu sedminu i značajno smanjuju račun.
Slučaj 2 — Kontekstni prozor nije dovoljan. Advokatska firma želi da se revidira ugovor o spajanju na 280 stranica. Prvi model koji su isprobali imao je povez od 200.000 tokena i dokument nije odgovarao; Kada se dokument rastavi, model ne može primijetiti da je članak u prvom dijelu u suprotnosti sa članom u posljednjem dijelu. Kada se prebaci na model sa kontekstom od 1 milion tokena, on čita dokument kao celinu i hvata kontradikciju. Ovdje kontekstni prozor direktno određuje tačnost.
Slučaj 3 — Multimodalnost je neophodna. Osiguravajuća kompanija želi napraviti preliminarnu procjenu na osnovu fotografija oštećenja vozila. To je nemoguće sa modelom koji samo čita tekst; Potreban je multimodalni model koji "vidi" fotografiju. Kada pređu na multimodalni model, uspostavljaju sistem prethodnog pregleda koji grubo klasificira lokaciju i težinu oštećenja na fotografiji i usmjerava stručnjaka. Međutim, primjećuju da konačnu odluku donosi stručnjak za ljude; jer je model preliminarni alat za skrining, a ne konačna riječ.
Slaba prompt / jaka prompt
Slab upit:
Rezimirajte ovaj dokument. [predugačak dokument zalijepljen]
Snažan upit:
U nastavku sumirajte izvještaj od 40 stranica. Prvo procijenite približan broj tokena u izvještaju i recite nam da li se uklapa u okvir konteksta tipičnog uravnoteženog modela. Zatim dajte sažetak u ovom formatu: izvršni sažetak od 5 stavki + 3 rizična nalaza. Koristite samo informacije iz izvještaja; Označite dio za koji niste sigurni kao "nije jasan u izvještaju". [izvještaj]
Moćni prompt je svjestan i tokena/konteksta i kontrolira format i provjerljivost izlaza.
Copiable Templates
1. Predviđanje tokena:
Procijenite približan broj tokena za sljedeći tekst i protumačite ga u smislu cijene unosa: "[TEXT]". Zaokružite malo, uzimajući u obzir da je turski.
2. Provjera dostupnosti konteksta:
Moj posao je da obrađujem sljedeće dokumente: prosječno [PAGES] od [QTY] dokumenata mjesečno. Koji kontekstni prozor zahtijeva ova veličina? Koji od laganih/uravnoteženih/jakih nivoa bi bio dovoljan? Kakav rizik nastaje ako ga treba demontirati?
3. Multimodalna dijagnoza:
Moj radni tok: [OPIS]. Postoji li vizualna, audio ili video obrada u ovom streamu? Ako je tako, da li je potreban multimodalni model ili se može pretvoriti u tekst (OCR/transkripcija) i riješiti s tekstualnim modelom? Uporedite prednosti i nedostatke ova dva puta.
4. Optimizacija konteksta:
Uz svaki zahtjev šaljem dokument modelu, ali većina je nepotrebna. Kako da izdvojim dijelove koji su zapravo potrebni za [TASK] iz ovog dokumenta? Predložite 3 konkretna načina za smanjenje unosa i navedite procijenjene uštede tokena.
Uobičajene greške
- Zamijeniti token za riječ: Token se razlikuje od riječi; Račun i kapacitet su uvijek u tokenima, računanje riječima je pogrešno.
- Misliti da je kontekstni prozor beskonačan: svaki model ima ograničenje; Ako se dokument ne uklapa, model ne može vidjeti cjelinu.
- Korišćenje nepotrebnog velikog konteksta: Kupovina skupog modela sa velikim kontekstom za kratak posao; ili ispunite ogromne dokumente za svaki zahtjev i uzalud plaćate.
- Uz pretpostavku multimodalnosti: ne može svaki model obraditi vizualne elemente; Za vizualni rad počnite bez potvrđivanja da je model multimodalan.
- Zaboravljanje na količinu leksema turskog: turski tekstovi generalno troše nešto više leksema za isto značenje; zanemarujući ovo u procjeni troškova.
Ukratko
- Token je mala jedinica u kojoj model obrađuje tekst; ulaz i izlaz se mjere i fakturišu odvojeno kao tokeni.
- Prozor konteksta je ukupan broj tokena koje model može imati na umu u jednom trenutku; veličina dokumenta direktno utiče na izbor modela.
- Multimodalnost je sposobnost modela da obrađuje netekstualne podatke kao što su vizuelni/audio; Neophodan je za vizuelne radove.
- Oba ova tri koncepta su relevantna za pitanje "koji model?" kao i "koliko to košta?" Ona čini osnovu za pitanja.
Zadatak aplikacije
Odaberite ponavljajući AI zadatak u svom poslu. Neka prvi predložak (predviđanje tokena) izračuna koliko je tokena tipičan unos u ovom zadatku. Zatim odredite koji je nivo dovoljan sa šablonom 2 (provjera dostupnosti konteksta). Ako imate vizualni posao, razjasnite je li potreban multimodalni model sa 3. šablonom (dijagnostika multimodalnosti). Rezultirajuću procjenu tokena koristit ćemo u proračunu troškova sljedeće jedinice.
kontrolna lista
- [ ] Znam pojam tokena i kako otprilike procijeniti koliko tokena ima tekst.
- [ ] Mogu objasniti kontekstni prozor analogijom "tablica/memorija".
- [ ] Mogu procijeniti da li će se dokument uklopiti u model.
- [ ] Mogu dijagnosticirati kada je multimodalnost neophodna.
- [ ] Uzimam u obzir simbolične troškove turskog jezika i cijenu nepotrebnog konteksta.