Kasu:
- Oskab argikeeles selgitada mõisteid token, kontekstaken ja multimodaalsus
- Diagnoosige, kas ülesanne nõuab laia konteksti või multimodaalsust
- Oskus arvestada, kuidas need kontseptsioonid mõjutavad kulusid ja mudelivalikut
Siiani oleme kursis pakkujate ja mudelitüüpidega. Õige mudelivaliku jaoks on aga vaja mõista ka seda, kuidas mudelid "sees" töötavad; sest hinna, võimsuse ja saadavuse otsused põhinevad kõik kolmel põhikontseptsioonil: token, kontekstaken ja multimodaalsus. Keegi, kes neid mõisteid ei tea, ei saa lugeda hinnalehte ja küsida "kas see dokument sobib mudelile?" ei oska küsimusele vastata ega näe, millal on visuaalne töötlemine hädavajalik. Selle õppetüki lõpuks saate neid kolme mõistet igapäevases keeles selgitada, diagnoosida, kas töö nõuab laia konteksti või multimodaalsust, ja võtta arvesse nende mõju kuludele.
Token: ühik, mida mudel kasutab sõna asemel
Tehisintellekti mudelid töötlevad teksti mitte sõna-sõnalt, vaid väikeste tükkidena, mida nimetatakse märgideks. žetoon; See võib olla sõna, sõna osa, kirjavahemärk või tühik. Ligikaudse arvutuse tegemiseks: inglise keeles on keskmine märk umbes neli tähemärki ja 100 sõna on umbes 130–150 märki. Türgi keeles võib see määr olla veidi kõrgem järelliiteliste ja pikkade sõnade tõttu; Teisisõnu, sama tähendusega türgikeelne tekst kulutab veidi rohkem märke kui inglise keel.
Miks on seda oluline teada? Sest kõik on laetud ja mõõdetud žetoonides. Mudelile saadetud tekst (sisend) ja mudeli poolt toodetud vastus (väljund) loetakse eraldi žetoonidena. Nii teie arve kui ka mudeli maht on žetoonides.
Näpunäide. Kui soovite ligikaudselt hinnata, kui palju märke tekstis on, jagage märkide arv neljaga. 4000 tähemärgi pikkune meil on ligikaudu 1000 märki. Türgi keeles eeldage, et turvalisel poolel püsida pisut kõrgemal.
Konteksti aken: mudeli "lühiajaline mälu"
Kontekstikaken on žetoonide koguarv, mida mudel suudab korraga meeles pidada. Sisend ja väljund peavad selles aknas kokku sobima. Mõelge sellele, kui palju paberit saate korraga lauale laotada: paber, mis lauale ei mahu, on sel hetkel teie vaateväljast väljas.
Kui mudeli kontekstiaknas on 200 000 märki, võrdub see ligikaudu 150 000 sõnaga või mitme keskmise suurusega raamatuga. 1 miljon märki suudab töödelda palju suuremaid dokumente tervikuna. Mõned tänapäeval võimsad mudelid (nt Claude Opus 4.8 ja Sonnet 5) pakuvad 1 miljonit märgikonteksti, samas kui kergetel mudelitel on sageli väiksemad aknad (nt 200 000 žetoonit Haiku 4.5 jaoks).
Miks see oluline on? Sest kui dokument kontekstiaknasse ei mahu, ei näe mudel seda kõike koos. Te ei saa anda 500-leheküljelist lepingut tervikuna 200 000 märgi mudelile; Te kas jagate dokumendi osadeks (mis võib kaotada osadevahelise seose) või valite laiema kontekstiga mudeli.
Ettevaatust. Igat dokumenti pole mõistlik täita, kuna see on lihtsalt suur kontekstiaken. Mida rohkem tokeneid aknasse paned, seda rohkem maksad ja mõnikord võivad modellil väga pikkade tekstide puhul keskmised detailid vahele jääda. Sageli on odavam ja täpsem saata ainult see osa, mis töötab.
Kontekstikaken on otsustamise kriteerium
Quest
Ligikaudne nõutav kontekst
Sobiv tase
Lühike vastus meilile
mitusada märki
kergekaaluline
Ühe lehekülje kokkuvõte
mitu tuhat märki
Kerge/tasakaalustatud
40-leheküljeline aruande analüüs
~30 000 tokenit
Tasakaalustatud/tugev
300-leheküljeline lepingu ülevaade
~250 000 tokenit
Võimas laia kontekstiga
Töötle sadu dokumente korraga
500 000+ märki
Laiem kontekst
See tabel vastab küsimusele "milline mudel?" See näitab, et osale küsimusest vastab otse dokumendi suurus. Raiskamine on osta lühikeste tööde jaoks kallist suure kontekstiga mudelit; Väikese aknaga mudel ei ole suurte dokumentide jaoks piisav.
Multimodaalsus: tekstist kaugemale minemine
Multimodaalsus on mudeli võime käsitleda mitut tüüpi andmeid (pilt, heli, mõnikord ka video), mitte ainult teksti. "Modal" tähendab siin "andmetüüpi"; multimodaalne tähendab "palju liiki".
- Ainult teksti mudel: loeb ja kirjutab ainult kirjutatud teksti.
- Multimodaalne mudel: oskab lugeda arve fotot, tõlgendada trendi graafikul, dekodeerida käsitsi kirjutatud märkmeid, mõnikord transkribeerida helisalvestist.
Miks see oluline on? Kuna teie ettevõtte olemus võib nõuda multimodaalsust. Arvepiltidelt summasid välja võttev raamatupidamismeeskond, tootefotosid klassifitseeriv e-kaubanduse meeskond või kahjufotosid hindav kindlustusmeeskond ei saa seda tööd teha mudeliga, mis loeb ainult teksti. Visuaalne töötlemine on nende ülesannete jaoks hädavajalik.
Kolm realistlikku juhtumit
Juhtum 1 – sümboolne kulu üllatus. Sisumeeskond saadab mudelile iga ajaveebipostituse tegemise ajal ka 20-leheküljelise "brändijuhendi" dokumendi. See juhend sisaldab umbes 15 000 märki. Nad toodavad 2000 artiklit kuus; Nii et lihtsalt juhendi ikka ja jälle saatmine tähendab 30 miljonit sisendit. Lühendades juhendit ja saates ainult vastava jaotise (umbes 2000 tokenit), vähendavad nad sisendit seitsmendikuni ja vähendavad oluliselt arvet.
Juhtum 2 – kontekstiaknast ei piisa. Advokaadibüroo soovib lasta läbi vaadata 280-leheküljeline ühinemisleping. Esimesel mudelil, mida nad proovisid, oli köide 200 000 märgist ja dokument ei sobinud; Kui dokument on lahti rebitud, ei saa mudel märgata, et esimeses jaotises olev artikkel on vastuolus viimase jaotise artikliga. Kui see lülitub üle 1 miljoni märgi kontekstiga mudelile, loeb see dokumenti tervikuna ja tabab vastuolu. Siin määras kontekstiaken otseselt täpsuse.
3. juhtum – multimodaalsus on kohustuslik. Kindlustusselts soovib anda sõidukikahjustuste fotode põhjal esialgse hinnangu. See on võimatu mudeliga, mis loeb ainult teksti; Vaja on multimodaalset mudelit, mis "näeb" fotot. Kui nad lähevad üle multimodaalsele mudelile, loovad nad eelkontrollisüsteemi, mis liigitab ligikaudselt fotol kahjustuse asukoha ja raskusastme ning suunab eksperdi. Nad märgivad aga, et lõpliku otsuse teeb inimekspert; sest mudel on esialgne sõelumisvahend, mitte lõplik sõna.
Nõrk viip / Tugev viip
Nõrk viip:
Tehke sellest dokumendist kokkuvõte. [liiga pikk dokument kleebitud]
Võimas viip:
Tehke allpool kokkuvõte 40-leheküljelisest aruandest. Esmalt hinnake aruandes olevate märkide ligikaudset arvu ja öelge meile, kas see sobib tüüpilise tasakaalustatud mudeli kontekstiaknasse. Seejärel esitage kokkuvõte sellises vormingus: 5-punktiline kokkuvõte + 3 riskantset leidu. Kasutage ainult aruandes sisalduvat teavet; Märkige see osa, milles te pole kindel, kui "aruandes pole selge". [aruanne]
Võimas viip on nii märgist/konteksti teadlik kui ka kontrollib väljundi vormingut ja kontrollitavust.
Kopeeritavad mallid
1. Token-ennustus:
Hinnake järgmise teksti ligikaudset märkide arvu ja tõlgendage seda sisendkuluna: "[TEKST]". Ümardage seda veidi ülespoole, võttes arvesse, et see on türgi keel.
2. Konteksti saadavuse kontroll:
Minu ülesanne on töödelda järgmisi dokumente: keskmiselt [PAGES] dokumente [QTY] kuus. Millist konteksti akent see suurus nõuab? Millisest heledast/tasakaalustatud/tugevast tasemest piisaks? Mis oht tekib, kui see tuleb lahti võtta?
3. Multimodaalsuse diagnoos:
Minu töövoog: [DESCRIPTION]. Kas selles voos on visuaalne, heli- või videotöötlus? Kui jah, siis kas on vaja multimodaalset mudelit või saab selle teisendada tekstiks (OCR/transkriptsioon) ja lahendada tekstimudeliga? Võrrelge kahe tee plusse/miinuseid.
4. Konteksti optimeerimine:
Iga sooviga saadan modellile dokumendi, kuid suurem osa sellest on tarbetu. Kuidas ma saan sellest dokumendist välja võtta osad, mida [TASK] jaoks tegelikult vaja on? Soovitage 3 konkreetset viisi sisendi vähendamiseks ja märkige hinnanguline märgisääst.
Levinud vead
- Sõna märgi eksimine: Märk erineb sõnast; Arve ja maht on alati žetoonides, sõnadega arvutamine on eksitav.
- Mõeldes kontekstiaknale on lõpmatu: igal mudelil on piir; Kui dokument ei sobi, ei näe mudel tervikut.
- Tarbetu suure konteksti kasutamine: lühikese töö jaoks kalli suure kontekstiga mudeli ostmine; või täitke iga taotluse jaoks tohutuid dokumente ja maksate asjata.
- Eeldades multimodaalsust: mitte iga mudel ei saa visuaale töödelda; Visuaalse töö jaoks alustage kinnitamata, et mudel on multimodaalne.
- Unustades türgi keele märgikoormuse: türgikeelsetes tekstides kulub sama tähenduse jaoks üldiselt veidi rohkem märke; jättes seda kuluhinnangus arvestamata.
Kokkuvõttes
- Token on väike ühik, milles mudel teksti töötleb; sisend ja väljund mõõdetakse ja arveldatakse eraldi žetoonidena.
- Kontekstikaken on žetoonide koguarv, mida mudel võib korraga meeles pidada; dokumendi suurus mõjutab otseselt mudeli valikut.
- Multimodaalsus on mudeli võime töödelda mittetekstilisi andmeid, nagu visuaal/heli; See on visuaalsete tööde jaoks hädavajalik.
- Need kolm mõistet on mõlemad asjakohased küsimuse "milline mudel?" samuti "kui palju see maksab?" See on küsimuste aluseks.
Rakenduse ülesanne
Valige oma ettevõttes korduv tehisintellekti ülesanne. Laske 1. mallil (märgi ennustus) arvutada, mitu märki selle ülesande tüüpiline sisend sisaldab. Seejärel määrake malliga 2, milline tase on piisav (konteksti saadavuse kontroll). Kui teil on visuaalne töö, selgitage 3. malliga (multimodaalsuse diagnostika), kas multimodaalne mudel on vajalik. Saadud märgihinnangut kasutame järgmise ühiku maksumuse arvutamisel.
kontrollnimekiri
- [ ] Ma tean märgi mõistet ja seda, kuidas ligikaudselt hinnata, kui palju märke tekstil on.
- [ ] Oskan konteksti akent seletada "tabeli/mälu" analoogiaga.
- [ ] Saan hinnata, kas dokument sobib mudelisse.
- [ ] Saan diagnoosida, kui multimodaalsus on hädavajalik.
- [ ] Võtan arvesse türgi keele sümboolseid üldkulusid ja tarbetu konteksti kulu.