Dobički:
- Sposobnost razlage konceptov žetona, kontekstnega okna in večmodalnosti v vsakdanjem jeziku
- Ugotovite, ali naloga zahteva širok kontekst ali multimodalnost
- Sposobnost upoštevati, kako ti koncepti vplivajo na ceno in izbiro modela
Zaenkrat smo seznanjeni s ponudniki in tipi modelov. Za pravilno izbiro modela pa je treba razumeti tudi, kako modeli delujejo "znotraj"; saj se odločitve o ceni, zmogljivosti in razpoložljivosti opirajo na tri ključne koncepte: žeton, kontekstno okno in multimodalnost. Nekdo, ki ne pozna teh konceptov, ne more brati cenika in se spraševati, "ali bo ta dokument ustrezal modelu?" ne more odgovoriti na vprašanje in ne vidi, kdaj je vizualna obdelava bistvena. Do konca te enote boste sposobni razložiti te tri koncepte v vsakdanjem jeziku, ugotoviti, ali delo zahteva širok kontekst ali multimodalnost, in upoštevati njihov vpliv na stroške.
Žeton: Enota, ki jo uporablja model namesto besede
Modeli umetne inteligence ne obdelujejo besedila besedo za besedo, temveč majhne koščke, imenovane žetoni. žeton; Lahko je beseda, del besede, ločilo ali presledek. Če naredimo grob izračun: v angleščini je povprečen žeton približno štiri znake, 100 besed pa približno 130-150 žetonov. V turščini je lahko ta stopnja nekoliko višja zaradi priponskih in dolgih besed; Z drugimi besedami, turško besedilo z enakim pomenom porabi nekoliko več žetonov kot angleško.
Zakaj je to pomembno vedeti? Ker se vse obračunava in meri v žetonih. Besedilo (vnos), ki ga pošljete modelu, in odgovor (izhod), ki ga ustvari model, se štejeta kot ločena žetona. Vaš račun in zmogljivost modela sta v žetonih.
Namig: Če želite dobiti grobo oceno, koliko žetonov ima besedilo, število znakov delite s štiri. E-poštno sporočilo s 4000 znaki je približno 1000 žetonov. V turščini domnevajte, da je malo višje, da ostanete na varni strani.
Kontekstno okno: modelov "kratkoročni spomin"
Kontekstno okno je skupna količina žetonov, ki jih lahko model hkrati zapomni. Vhod in izhod se morata ujemati skupaj v tem oknu. Zamislite si to kot količino papirja, ki jo lahko naenkrat razgrnete po mizi: papir, ki ne sodi na mizo, je v tistem trenutku izven vašega vidnega polja.
Če je kontekstno okno modela 200.000 žetonov, je to enako približno 150.000 besedam ali več srednje velikim knjigam. 1 milijon žetonov lahko obdela veliko večje dokumente kot celoto. Nekateri današnji zmogljivi modeli (npr. Claude Opus 4.8 in Sonnet 5) ponujajo 1 milijon kontekstov žetonov, medtem ko so lahki modeli pogosto opremljeni z manjšimi okni (npr. 200.000 žetonov za Haiku 4.5).
Zakaj je pomembno? Kajti če dokument ne ustreza kontekstnemu oknu, ga model ne more videti vsega skupaj. 500-stranske pogodbe v celoti ne morete dati modelu z 200.000 žetoni; Dokument bodisi razdelite na dele (ki lahko izgubijo razmerje med deli) bodisi izberete model s širšim kontekstom.
Pozor: Ni pametno izpolnjevati vsakega dokumenta, ker je kontekstno okno veliko. Več žetonov kot vstavite v okence, več plačate, včasih pa lahko model zgreši srednje podrobnosti v zelo dolgih besedilih. Pogosto je ceneje in natančneje poslati le del, ki deluje.
Kontekstno okno je merilo odločitve
Iskanje
Približen zahtevani kontekst
Primerna raven
Kratek e-poštni odgovor
več sto žetonov
lahka
Povzetek na eni strani
več tisoč žetonov
Lahka/uravnotežena
Analiza poročila na 40 straneh
~30.000 žetonov
Uravnotežen/močan
Pregled pogodbe na 300 straneh
~250.000 žetonov
Močan s širokim kontekstom
Obdelajte na stotine dokumentov hkrati
500.000+ žetonov
Najširši kontekst
Ta tabela odgovarja na vprašanje "kateri model?" Kaže, da na del vprašanja neposredno odgovarja velikost dokumenta. Škoda je kupiti drag model z velikim prostorom za kratke naloge; Model z majhnim okencem ni primeren za velike dokumente.
Multimodalnost: preseči besedilo
Multimodalnost je zmožnost modela, da obravnava več vrst podatkov (slike, zvok, včasih video), ne samo besedila. "Modalen" tukaj pomeni "tip podatkov"; multimodalno pomeni "več vrst".
- Model samo za besedilo: bere in piše samo napisano besedilo.
- Multimodalni model: zna prebrati fotografijo računa, interpretirati trend na grafu, dekodirati ročno napisano opombo, včasih prepisati glasovni posnetek.
Zakaj je pomembno? Ker narava vašega posla morda zahteva multimodalnost. Računovodska ekipa, ki izvleče zneske iz slik računov, ekipa za e-trgovino, ki razvršča fotografije izdelkov, ali zavarovalniška ekipa, ki ocenjuje fotografije škode, tega dela ne more opraviti z modelom, ki bere samo besedilo. Vizualna obdelava je bistvena za te naloge.
Trije realni primeri
Primer 1 – Presenečenje glede cene žetona. Skupina za vsebino modelu pošlje tudi 20-stranski dokument »vodič po blagovni znamki«, ko ustvari vsako objavo v spletnem dnevniku. Ta vodnik vsebuje približno 15.000 žetonov. Mesečno izdelajo 2000 artiklov; Torej samo pošiljanje vodnika znova in znova pomeni 30 milijonov žetonov vnosa. S skrajšanjem vodiča in pošiljanjem le ustrezne rubrike (približno 2000 žetonov) zmanjšajo vnos na eno sedmino in bistveno znižajo račun.
2. primer – Kontekstno okno ni dovolj. Odvetniška družba želi pregledati 280 strani dolgo pogodbo o združitvi. Prvi model, ki so ga preizkusili, je imel vezavo 200.000 žetonov in dokument ni ustrezal; Ko je dokument raztrgan, model ne more opaziti, da je člen v prvem razdelku v nasprotju s členom v zadnjem razdelku. Ko preklopi na model z 1 milijonom konteksta žetonov, prebere dokument kot celoto in ujame protislovje. Tu je kontekstno okno neposredno določalo natančnost.
Primer 3 – Multimodalnost je nujna. Zavarovalnica želi narediti predhodno oceno na podlagi fotografij škode na vozilu. To je nemogoče pri modelu, ki samo bere besedilo; Potreben je multimodalni model, ki "vidi" fotografijo. Ko preidejo na multimodalni model, vzpostavijo sistem predhodnega pregleda, ki na fotografiji približno razvrsti lokacijo in resnost poškodbe ter usmerja strokovnjaka. Opažajo pa, da človeški strokovnjak sprejme končno odločitev; ker je model orodje za predhodno preverjanje in ne zadnja beseda.
Šibek poziv / močan poziv
Šibek poziv:
Povzemite ta dokument. [prilepljen predolg dokument]
Močan poziv:
Povzemite 40-stransko poročilo spodaj. Najprej ocenite približno število žetonov v poročilu in nam povejte, ali se ujema s kontekstnim oknom tipičnega uravnoteženega modela. Nato podajte povzetek v tej obliki: povzetek s 5 točkami + 3 tvegane ugotovitve. Uporabite le informacije v poročilu; Del, za katerega niste prepričani, označite kot "v poročilu ni jasno". [poročilo]
Zmogljiv poziv se zaveda žetona/konteksta ter nadzoruje obliko in preverljivost izhoda.
Predloge, ki jih je mogoče kopirati
1. Napoved žetona:
Ocenite približno število žetonov za naslednje besedilo in to interpretirajte v smislu vhodnih stroškov: "[BESEDILO]". Malo zaokrožite, upoštevajte, da je turško.
2. Preverjanje razpoložljivosti konteksta:
Moja naloga je obdelava naslednjih dokumentov: povprečno [PAGES] od [QTY] dokumentov na mesec. Kakšno kontekstno okno zahteva ta velikost? Katera od stopenj svetlobe/uravnoteženosti/močnosti bi zadostovala? Kakšno tveganje nastane, če ga je treba razstaviti?
3. Diagnoza multimodalnosti:
Moj potek dela: [OPIS]. Ali je v tem toku vizualna, zvočna ali video obdelava? Če je tako, ali je potreben multimodalni model ali ga je mogoče pretvoriti v besedilo (OCR/transkripcija) in rešiti z besedilnim modelom? Primerjajte prednosti in slabosti obeh poti.
4. Optimizacija konteksta:
Ob vsaki zahtevi modelu pošljem dokument, ki pa je večinoma nepotreben. Kako izvlečem dele, ki so dejansko potrebni za [TASK] iz tega dokumenta? Predlagajte 3 konkretne načine za zmanjšanje vnosa in navedite ocenjene prihranke žetonov.
Pogoste napake
- Zamenjavanje žetona z besedo: Žeton se razlikuje od besede; Račun in zmogljivost sta vedno v žetonih, računanje z besedami je zavajajoče.
- Misliti, da je kontekstno okno neskončno: vsak model ima mejo; Če se dokument ne prilega, model ne vidi celote.
- Uporaba nepotrebnega velikega konteksta: nakup dragega modela z velikim kontekstom za kratko delo; ali za vsako zahtevo izpolnite ogromne dokumente in plačate zaman.
- Ob predpostavki multimodalnosti: ne more vsak model obdelati vizualnih elementov; Za vizualno delo začnite brez potrditve, da je model multimodalen.
- Pozabljamo na obremenitev z žetoni v turščini: turška besedila na splošno porabijo nekoliko več žetonov za isti pomen; ignoriranje tega pri oceni stroškov.
Če povzamem
- Žeton je majhna enota, v kateri model obdeluje besedilo; vhod in izhod se merita in fakturirata ločeno kot žetoni.
- Kontekstno okno je skupno število žetonov, ki jih lahko model hkrati zapomni; velikost dokumenta neposredno vpliva na izbiro modela.
- Multimodalnost je zmožnost modela za obdelavo nebesedilnih podatkov, kot so vizualni/zvočni; Bistvenega pomena je za vizualna dela.
- Ti trije koncepti so pomembni za vprašanje "kateri model?" kot tudi "koliko stane?" Je osnova vprašanj.
Aplikacijska naloga
Izberite ponavljajočo se nalogo AI v vašem podjetju. Naj 1. predloga (napoved žetona) izračuna, koliko žetonov je tipičen vnos v tej nalogi. Nato določite, katera raven zadostuje s predlogo 2 (preverjanje razpoložljivosti konteksta). Če imate vizualno delo, pojasnite, ali je potreben multimodalni model s 3. predlogo (diagnoza multimodalnosti). Dobljeno žetonsko oceno bomo uporabili pri izračunu stroškov naslednje enote.
kontrolni seznam
- [ ] Poznam koncept žetona in kako približno oceniti, koliko žetonov vsebuje besedilo.
- [ ] Kontekstno okno lahko razložim z analogijo "tabela/pomnilnik".
- [ ] Lahko ocenim, ali bo dokument ustrezal modelu.
- [ ] Znam diagnosticirati, kdaj je multimodalnost nujna.
- [ ] Upoštevam simbolične režijske stroške turščine in stroške nepotrebnega konteksta.