Dobici:
- Sposobnost objašnjavanja pojmova tokena, kontekstnog prozora i multimodalnosti u svakodnevnom jeziku
- Dijagnosticirajte zahtijeva li zadatak široki kontekst ili multimodalnost
- Sposobnost uzimanja u obzir kako ovi koncepti utječu na cijenu i odabir modela
Do sada smo upoznati s pružateljima i vrstama modela. Međutim, za pravi odabir modela potrebno je razumjeti kako modeli funkcioniraju "iznutra"; jer se sve odluke o cijeni, kapacitetu i dostupnosti oslanjaju na tri temeljna koncepta: token, kontekstni prozor i multimodalnost. Netko tko ne poznaje ove koncepte ne može čitati cjenik i pitati se "hoće li ovaj dokument odgovarati modelu?" ne može odgovoriti na pitanje i ne vidi kada je vizualna obrada bitna. Do kraja ove jedinice moći ćete objasniti ova tri pojma svakodnevnim jezikom, dijagnosticirati zahtijeva li posao širok kontekst ili multimodalnost te uzeti u obzir njihov utjecaj na trošak.
Token: jedinica koju koristi model umjesto riječi
Modeli umjetne inteligencije ne obrađuju tekst riječ po riječ, već u malim dijelovima koji se nazivaju tokeni. Žeton; To može biti riječ, dio riječi, interpunkcijski znak ili razmak. Da napravimo grubi izračun: u engleskom jeziku prosječni token ima oko četiri znaka, a 100 riječi je oko 130-150 tokena. U turskom, ova stopa može biti malo viša zbog sufiksa i dugih riječi; Drugim riječima, turski tekst s istim značenjem troši nešto više tokena nego engleski.
Zašto je ovo važno znati? Jer sve se naplaćuje i mjeri u žetonima. Tekst (unos) koji šaljete modelu i odgovor (izlaz) koji proizvodi model računaju se kao zasebni tokeni. I vaša faktura i kapacitet modela su u žetonima.
Savjet: Da biste dobili grubu procjenu koliko tekst ima tokena, podijelite broj znakova s četiri. E-pošta od 4000 znakova je otprilike 1000 tokena. Na turskom, pretpostavite malo više da biste ostali na sigurnoj strani.
Prozor konteksta: Modelovo "Kratkotrajno pamćenje"
Kontekstni prozor je ukupna količina tokena koju model može imati na umu u jednom trenutku. Ulaz i izlaz moraju stati zajedno u ovaj prozor. Zamislite to kao količinu papira koju možete raširiti po stolu odjednom: papir koji ne stane na stol u tom je trenutku izvan vašeg vidnog polja.
Ako je kontekstni prozor modela 200 000 tokena, to je jednako otprilike 150 000 riječi ili nekoliko knjiga srednje veličine. 1 milijun tokena može obraditi puno veće dokumente u cjelini. Neki moćni modeli danas (npr. Claude Opus 4.8 i Sonnet 5) nude 1 milijun konteksta tokena, dok lagani modeli često dolaze s manjim prozorima (npr. 200 000 tokena za Haiku 4.5).
Zašto je to važno? Jer ako dokument ne stane u kontekstni prozor, model ga ne može vidjeti sve zajedno. Ne možete dati ugovor od 500 stranica u cijelosti modelu od 200.000 tokena; Možete ili podijeliti dokument na dijelove (koji mogu izgubiti odnos između dijelova) ili odabrati model sa širim kontekstom.
Oprez: Nije pametno ispunjavati svaki dokument jer je kontekstni prozor velik. Što više tokena stavite u prozor, to više plaćate, a ponekad model može propustiti središnje detalje u vrlo dugim tekstovima. Često je jeftinije i preciznije poslati samo dio koji radi.
Kontekstni prozor je kriterij odlučivanja
Potraga
Približan potreban kontekst
Odgovarajuća razina
Kratak odgovor e-poštom
nekoliko stotina žetona
lagana
Sažetak na jednoj stranici
nekoliko tisuća žetona
Lagano/uravnoteženo
Analiza izvješća na 40 stranica
~30 000 tokena
Uravnotežen/jak
Pregled ugovora na 300 stranica
~250 000 tokena
Snažan sa širokim kontekstom
Obradite stotine dokumenata odjednom
500 000+ tokena
Najširi kontekst
Ova tablica odgovara na pitanje "koji model?" To pokazuje da se na dio pitanja izravno odgovara veličinom dokumenta. Šteta je kupiti skup model s velikim prostorom za kratke poslove; Model s malim prozorom nije prikladan za velike dokumente.
Multimodalnost: Ići dalje od teksta
Multimodalnost je sposobnost modela da rukuje s više vrsta podataka (slike, audio, ponekad video), a ne samo s tekstom. "Modalni" ovdje znači "tip podataka"; multimodalno znači "mnogo vrsta".
- Model samo za tekst: čita i piše samo pisani tekst.
- Multimodalni model: Može pročitati fotografiju računa, protumačiti trend na grafikonu, dekodirati rukom napisanu bilješku, ponekad prepisati glasovnu snimku.
Zašto je to važno? Budući da priroda vašeg poslovanja može zahtijevati multimodalnost. Računovodstveni tim koji izvlači iznose iz slika faktura, tim za e-trgovinu koji klasificira fotografije proizvoda ili osiguravajući tim koji procjenjuje fotografije štete ne može obaviti ovaj posao s modelom koji samo čita tekst. Vizualna obrada ključna je za ove zadatke.
Tri realna slučaja
Slučaj 1 — Iznenađenje cijene tokena. Tim za sadržaj također šalje modelu dokument "vodiča robne marke" od 20 stranica dok stvaraju svaki post na blogu. Ovaj vodič sadrži oko 15.000 tokena. Proizvode 2000 članaka mjesečno; Dakle, samo slanje vodiča iznova i iznova znači 30 milijuna tokena unosa. Skraćivanjem vodiča i slanjem samo relevantnog odjeljka (oko 2000 tokena), unos smanjuju na jednu sedminu i značajno smanjuju račun.
Slučaj 2 — Kontekstni prozor nije dovoljan. Odvjetnička tvrtka želi pregledati ugovor o spajanju od 280 stranica. Prvi model koji su isprobali imao je uvez od 200.000 tokena i dokument nije odgovarao; Kada je dokument raskomadan, model ne može primijetiti da je članak u prvom odjeljku u suprotnosti s člankom u posljednjem odjeljku. Kada se prebaci na model s kontekstom od 1 milijun tokena, čita dokument u cjelini i hvata kontradiktornost. Ovdje je kontekstni prozor izravno odredio točnost.
Slučaj 3 — Multimodalnost je neophodna. Osiguravajuće društvo želi napraviti preliminarnu procjenu na temelju fotografija oštećenja vozila. To je nemoguće s modelom koji samo čita tekst; Potreban je multimodalni model koji "vidi" fotografiju. Kada prijeđu na multimodalni model, uspostavljaju sustav predprovjere koji grubo klasificira mjesto i težinu oštećenja na fotografiji i usmjerava stručnjaka. Međutim, napominju da ljudski stručnjak donosi konačnu odluku; jer je model preliminarni alat za provjeru, a ne konačna riječ.
Slab upit / Jak upit
Slab upit:
Sažmite ovaj dokument. [predug dokument zalijepljen]
Snažan upit:
U nastavku sažmite izvješće od 40 stranica. Prvo procijenite približan broj tokena u izvješću i recite nam uklapa li se u okvir konteksta tipičnog uravnoteženog modela. Zatim dajte sažetak u ovom formatu: izvršni sažetak od 5 stavki + 3 rizična nalaza. Koristite samo informacije u izvješću; Označite dio u koji niste sigurni kao "nije jasno u izvješću". [izvješće]
Moćni prompt svjestan je tokena/konteksta i kontrolira format i mogućnost provjere izlaza.
Predlošci koji se mogu kopirati
1. Predviđanje tokena:
Procijenite približan broj žetona za sljedeći tekst i protumačite to u smislu troška unosa: "[TEKST]". Malo zaokruži, vodeći računa da je turski.
2. Provjera dostupnosti konteksta:
Moj posao je obraditi sljedeće dokumente: prosječno [PAGES] od [QTY] dokumenata mjesečno. Koji kontekstni prozor zahtijeva ova veličina? Koja bi od laganih/uravnoteženih/jakih razina bila dovoljna? Koji rizik nastaje ako ga je potrebno rastaviti?
3. Dijagnoza multimodalnosti:
Moj tijek rada: [OPIS]. Postoji li vizualna, audio ili video obrada u ovom streamu? Ako je tako, je li potreban multimodalni model ili se može pretvoriti u tekst (OCR/transkripcija) i riješiti pomoću tekstualnog modela? Usporedite prednosti i mane dvaju putova.
4. Optimizacija konteksta:
Uz svaki zahtjev šaljem dokument modelu, ali većina je nepotrebna. Kako iz ovog dokumenta izdvojiti dijelove koji su zapravo potrebni za [TASK]? Predložite 3 konkretna načina za smanjenje unosa i navedite procijenjene uštede tokena.
Uobičajene greške
- Zamjena tokena za riječ: Token se razlikuje od riječi; Faktura i kapacitet su uvijek u žetonima, računanje riječima je pogrešno.
- Razmišljanje da je kontekstni prozor beskonačan: Svaki model ima ograničenje; Ako dokument ne odgovara, model ne može vidjeti cijeli.
- Korištenje nepotrebnog velikog konteksta: Kupnja skupog modela s velikim kontekstom za kratak posao; ili ispunjavati ogromne dokumente za svaki zahtjev i plaćati uzalud.
- Pretpostavljajući multimodalnost: Ne može svaki model obraditi vizualne elemente; Za vizualni rad započnite bez potvrde da je model multimodalan.
- Zaboravljanje tokena u turskom: turski tekstovi općenito troše malo više tokena za isto značenje; zanemarujući to u procjeni troškova.
Ukratko
- Token je mala jedinica u kojoj model obrađuje tekst; ulaz i izlaz mjere se i fakturiraju odvojeno kao žetoni.
- Kontekstni prozor je ukupan broj tokena koje model može imati na umu u jednom trenutku; veličina dokumenta izravno utječe na odabir modela.
- Multimodalnost je sposobnost modela da obradi netekstualne podatke kao što su vizualni/audio; Neophodan je za vizualna djela.
- Ova tri koncepta su relevantna za pitanje "koji model?" kao i "koliko to košta?" Ono čini osnovu pitanja.
Zadatak aplikacije
Odaberite AI zadatak koji se ponavlja u vašem poslovanju. Neka 1. predložak (predviđanje tokena) izračuna koliko je tokena tipičan unos u ovom zadatku. Zatim odredite koja je razina dovoljna s predloškom 2 (provjera dostupnosti konteksta). Ako imate vizualni posao, razjasnite je li potreban multimodalni model s 3. predloškom (dijagnoza multimodalnosti). Dobivenu procjenu tokena koristit ćemo u izračunu troškova sljedeće jedinice.
popis za provjeru
- [ ] Znam koncept tokena i kako grubo procijeniti koliko tokena ima tekst.
- [ ] Mogu objasniti kontekstni prozor analogijom "tablica/memorija".
- [ ] Mogu procijeniti hoće li se dokument uklopiti u model.
- [ ] Mogu dijagnosticirati kada je multimodalnost neophodna.
- [ ] Uzimam u obzir token režijske troškove turskog i cijenu nepotrebnog konteksta.