Ieguvumi:
- Spēja ikdienas valodā izskaidrot marķiera, konteksta loga un multimodalitātes jēdzienus
- Nosakiet, vai uzdevumam ir nepieciešams plašs konteksts vai multimodalitāte
- Spēja ņemt vērā, kā šie jēdzieni ietekmē izmaksas un modeļa izvēli
Līdz šim esam iepazinušies ar pakalpojumu sniedzējiem un modeļu veidiem. Tomēr pareizai modeļu izvēlei ir arī jāsaprot, kā modeļi darbojas "iekšā"; jo lēmumi par cenu, ietilpību un pieejamību ir balstīti uz trim pamatjēdzieniem: marķieri, konteksta logu un multimodalitāti. Kāds, kurš nezina šos jēdzienus, nevar izlasīt cenu lapu un brīnīties: "Vai šis dokuments atbilst modelim?" nevar atbildēt uz jautājumu un nevar redzēt, kad vizuālā apstrāde ir būtiska. Līdz šīs nodaļas beigām jūs varēsit izskaidrot šos trīs jēdzienus ikdienas valodā, noteikt, vai darbam ir nepieciešams plašs konteksts vai multimodalitāte, un ņemt vērā to ietekmi uz izmaksām.
Tokens: vienība, ko modelis izmanto vārda vietā
Mākslīgā intelekta modeļi apstrādā tekstu nevis vārdu pa vārdam, bet gan mazos gabaliņos, ko sauc par marķieriem. Žetons; Tas var būt vārds, vārda daļa, pieturzīme vai atstarpe. Lai veiktu aptuvenu aprēķinu: angļu valodā vidējais marķieris ir aptuveni četras rakstzīmes, un 100 vārdi ir aptuveni 130–150 marķieri. Turku valodā šis rādītājs var būt nedaudz augstāks galotņu un garu vārdu dēļ; Citiem vārdiem sakot, teksts turku valodā ar tādu pašu nozīmi patērē nedaudz vairāk žetonu nekā angļu valodā.
Kāpēc tas ir svarīgi zināt? Jo viss ir uzlādēts un mērīts žetonos. Teksts (ievade), ko nosūtāt modelim, un modeļa radītā atbilde (izvade) tiek skaitīti kā atsevišķi marķieri. Gan jūsu rēķins, gan modeļa ietilpība ir marķieros.
Padoms. Lai iegūtu aptuvenu aprēķinu par to, cik marķieriem ir teksts, daliet rakstzīmju skaitu ar četriem. 4000 rakstzīmju e-pasts ir aptuveni 1000 marķieru. Turku valodā pieņemsim nedaudz augstāk, lai paliktu drošā pusē.
Konteksta logs: modeļa "īstermiņa atmiņa"
Konteksta logs ir kopējais marķieru skaits, ko modelis var paturēt prātā vienlaikus. Ievadei un izvadei šajā logā ir jāiekļaujas kopā. Padomājiet par to kā par papīra daudzumu, ko varat uzreiz uzklāt uz galda: papīrs, kas neietilpst uz galda, tajā brīdī ir ārpus jūsu redzes lauka.
Ja modeļa konteksta logā ir 200 000 marķieru, tas atbilst aptuveni 150 000 vārdu vai vairākām vidēja izmēra grāmatām. 1 miljons marķieru var apstrādāt daudz lielākus dokumentus kopumā. Daži jaudīgi modeļi mūsdienās (piemēram, Claude Opus 4.8 un Sonnet 5) piedāvā 1 miljonu marķieru kontekstu, savukārt vieglajiem modeļiem bieži ir mazāki logi (piemēram, 200 000 marķieru Haiku 4.5).
Kāpēc tas ir svarīgi? Jo, ja dokuments neietilpst konteksta logā, modelis nevar redzēt to visu kopā. Jūs nevarat pilnībā piešķirt 500 lappušu līgumu 200 000 marķiera modelim; Jūs vai nu sadalāt dokumentu daļās (kas var zaudēt attiecības starp daļām), vai arī izvēlieties modeli ar plašāku kontekstu.
Uzmanību: nav prātīgi aizpildīt katru dokumentu, jo tas notiek tikai tāpēc, ka konteksta logs ir liels. Jo vairāk žetonu ievietojat logā, jo vairāk maksājat, un dažreiz modelis var palaist garām vidējās detaļas ļoti garos tekstos. Bieži vien lētāk un precīzāk ir nosūtīt tikai to detaļu, kas darbojas.
Kontekstlogs ir lēmuma kritērijs
Meklējumi
Aptuvenais nepieciešamais konteksts
Atbilstošs līmenis
Īsa atbilde uz e-pastu
vairāki simti žetonu
viegls
Vienas lapas kopsavilkums
vairāki tūkstoši žetonu
Viegls/līdzsvarots
40 lappušu ziņojuma analīze
~30 000 žetonu
Līdzsvarots/spēcīgs
300 lappušu līguma apskats
~250 000 žetonu
Spēcīgs ar plašu kontekstu
Apstrādājiet simtiem dokumentu vienlaikus
500 000+ žetonu
Plašākais konteksts
Šī tabula atbild uz jautājumu "kurš modelis?" Tas parāda, ka daļa no jautājuma tiek tieši atbildēta pēc dokumenta izmēra. Ir veltīgi pirkt dārgu modeli ar lielu kontekstu īsiem darbiem; Modelis ar mazu logu nav piemērots lieliem dokumentiem.
Multimodalitāte: iet ārpus teksta
Multimodalitāte ir modeļa spēja apstrādāt vairāku veidu datus (attēlu, audio, dažreiz arī video), ne tikai tekstu. "Modāls" šeit nozīmē "datu tips"; multimodāls nozīmē "daudz veidu".
- Tikai teksta modelis: lasa un raksta tikai rakstītu tekstu.
- Multimodāls modelis: var nolasīt rēķina fotoattēlu, interpretēt tendences diagrammā, atšifrēt ar roku rakstītu piezīmi, dažreiz atšifrēt balss ierakstu.
Kāpēc tas ir svarīgi? Tā kā jūsu uzņēmuma būtība var prasīt multimodalitāti. Grāmatvedības komanda, kas izvelk summas no rēķinu attēliem, e-komercijas komanda, kas klasificē preču fotoattēlus, vai apdrošināšanas komanda, kas novērtē bojājumu fotoattēlus, nevar veikt šo darbu ar modeli, kas lasa tikai tekstu. Šo uzdevumu veikšanai būtiska ir vizuālā apstrāde.
Trīs reāli gadījumi
1. gadījums — žetonu izmaksu pārsteigums. Satura komanda arī nosūta modelim 20 lappušu “zīmola rokasgrāmatas” dokumentu, kad viņi izstrādā katru emuāra ierakstu. Šajā rokasgrāmatā ir aptuveni 15 000 žetonu. Viņi ražo 2000 rakstus mēnesī; Tātad tikai ceļveža atkārtota nosūtīšana nozīmē 30 miljonus ievades marķieru. Saīsinot ceļvedi un nosūtot tikai attiecīgo sadaļu (apmēram 2000 žetonu), tie samazina ievadi līdz septītajai daļai un ievērojami samazina rēķinu.
2. gadījums — ar konteksta logu nepietiek. Advokātu birojs vēlas, lai tiktu izskatīts 280 lappušu garš apvienošanās līgums. Pirmajā modelī, ko viņi izmēģināja, bija 200 000 žetonu iesiešana, un dokuments nederēja; Kad dokuments tiek saplēsts, modelis nevar pamanīt, ka raksts pirmajā sadaļā ir pretrunā ar pēdējās sadaļas rakstu. Kad tas pārslēdzas uz modeli ar 1 miljona marķiera kontekstu, tas nolasa dokumentu kopumā un uztver pretrunu. Šeit konteksta logs tieši noteica precizitāti.
3. gadījums — Multimodalitāte ir obligāta. Apdrošināšanas kompānija vēlas veikt provizorisku novērtējumu pēc transportlīdzekļa bojājumu fotogrāfijām. Tas nav iespējams ar modeli, kas lasa tikai tekstu; Nepieciešams multimodāls modelis, kas "redz" fotogrāfiju. Pārejot uz multimodālu modeli, viņi izveido iepriekšējas pārbaudes sistēmu, kas aptuveni klasificē fotoattēlā redzamā bojājuma vietu un smagumu un vada ekspertu. Tomēr viņi atzīmē, ka galīgo lēmumu pieņem cilvēku eksperts; jo modelis ir sākotnējās pārbaudes rīks, nevis galavārds.
Vāja uzvedne / spēcīga uzvedne
Vāja uzvedne:
Apkopojiet šo dokumentu. [ielīmēts pārāk garš dokuments]
Spēcīga uzvedne:
Apkopojiet 40 lappušu garo pārskatu zemāk. Vispirms novērtējiet aptuveno marķieru skaitu pārskatā un pastāstiet mums, vai tas iekļaujas tipiska līdzsvarota modeļa konteksta logā. Pēc tam sniedziet kopsavilkumu šādā formātā: 5 punktu kopsavilkums + 3 riskanti atklājumi. Izmantojiet tikai pārskatā ietverto informāciju; Atzīmējiet daļu, par kuru neesat pārliecināts, kā "pārskatā nav skaidrs". [ziņojums]
Spēcīgā uzvedne ir gan marķiera/konteksta ziņā, gan kontrolē izvades formātu un pārbaudāmību.
Kopējamas veidnes
1. Token prognoze:
Novērtējiet aptuveno marķieru skaitu šādam tekstam un interpretējiet to kā ievades izmaksas: "[TEKSTS]". Nedaudz noapaļo uz augšu, ņemot vērā, ka tas ir turku.
2. Konteksta pieejamības pārbaude:
Mans darbs ir apstrādāt šādus dokumentus: vidēji [PAGES] no [QTY] dokumentiem mēnesī. Kāds konteksta logs ir nepieciešams šim izmēram? Kurš no vieglajiem/līdzsvarotajiem/stiprajiem līmeņiem būtu pietiekams? Kāds risks rodas, ja tas ir jāizjauc?
3. Multimodalitātes diagnostika:
Mana darbplūsma: [DESCRIPTION]. Vai šajā straumē tiek veikta vizuālā, audio vai video apstrāde? Ja jā, vai ir nepieciešams multimodāls modelis, vai arī to var pārvērst tekstā (OCR/transkripcija) un atrisināt ar teksta modeli? Salīdziniet abu ceļu plusus/mīnusus.
4. Konteksta optimizācija:
Ar katru pieprasījumu nosūtu modelim dokumentu, bet lielākā daļa ir lieki. Kā no šī dokumenta izvilkt daļas, kas faktiski ir nepieciešamas [UZDEVUMS]? Iesakiet 3 konkrētus veidus, kā samazināt ievadi, un norādiet aptuveno marķiera ietaupījumu.
Biežas kļūdas
- Marķiera piejaukšana vārdam: marķieris atšķiras no vārda; Rēķins un jauda vienmēr ir žetonos, rēķināt ar vārdiem ir maldinoši.
- Domājot, ka konteksta logs ir bezgalīgs: katram modelim ir ierobežojums; Ja dokuments neatbilst, modelis nevar redzēt visu.
- Nevajadzīga liela konteksta izmantošana: dārga modeļa iegāde ar lielu kontekstu īsam darbam; vai aizpildiet milzīgus dokumentus par katru pieprasījumu un maksājiet veltīgi.
- Pieņemot multimodalitāti: ne katrs modelis var apstrādāt vizuālos materiālus; Vizuālajam darbam sāciet, nepārliecinoties, ka modelis ir multimodāls.
- Aizmirstot par turku valodas žetonu slodzi: turku teksti parasti patērē nedaudz vairāk žetonu vienai un tai pašai nozīmei; ignorējot to izmaksu aprēķinos.
Rezumējot
- Marķieris ir maza vienība, kurā modelis apstrādā tekstu; ievade un izvade tiek mērīta un izrakstīta atsevišķi kā marķieri.
- Konteksta logs ir kopējie marķieri, ko modelis var paturēt prātā vienlaikus; dokumenta lielums tieši ietekmē modeļa izvēli.
- Multimodalitāte ir modeļa spēja apstrādāt datus, kas nav teksta dati, piemēram, vizuālo/audio; Tas ir būtiski vizuāliem darbiem.
- Abi šie trīs jēdzieni ir saistīti ar jautājumu "kurš modelis?" kā arī "cik tas maksā?" Tas veido jautājumu pamatu.
Lietojumprogrammas uzdevums
Izvēlieties periodisku AI uzdevumu savā uzņēmumā. Palūdziet 1. veidnei (marķiera prognozei) aprēķināt, cik marķieru ir tipiska ievade šajā uzdevumā. Pēc tam nosakiet, kurš līmenis ir pietiekams, izmantojot 2. veidni (konteksta pieejamības pārbaude). Ja jums ir vizuāls darbs, noskaidrojiet, vai ir nepieciešams multimodāls modelis, izmantojot 3. veidni (multimodalitātes diagnostika). Mēs izmantosim iegūto marķiera tāmi nākamās vienības izmaksu aprēķinā.
kontrolsaraksts
- [ ] Es zinu marķiera jēdzienu un to, kā aptuveni novērtēt, cik marķieru ir tekstam.
- [ ] Es varu izskaidrot konteksta logu ar "tabulas/atmiņas" analoģiju.
- [ ] Varu izvērtēt, vai dokuments iederēsies modelī.
- [ ] Es varu diagnosticēt, kad multimodalitāte ir būtiska.
- [ ] Es ņemu vērā turku valodas simboliskās pieskaitāmās izmaksas un nevajadzīga konteksta izmaksas.