Gevinster:
- Evne til å forklare begrepene token, kontekstvindu og multimodalitet i hverdagsspråk
- Diagnostiser om en oppgave krever bred kontekst eller multimodalitet
- Evne til å ta hensyn til hvordan disse konseptene påvirker kostnad og modellvalg
Så langt er vi kjent med leverandørene og modelltypene. For riktig modellvalg er det imidlertid også nødvendig å forstå hvordan modellene fungerer «innvendig»; fordi beslutninger om pris, kapasitet og tilgjengelighet er avhengig av tre kjernekonsepter: token, kontekstvindu og multimodalitet. Noen som ikke kan disse konseptene kan ikke lese prislisten og lurer på "vil dette dokumentet passe til modellen?" kan ikke svare på spørsmålet og kan ikke se når visuell prosessering er avgjørende. Ved slutten av denne enheten vil du kunne forklare disse tre begrepene i hverdagsspråket, diagnostisere om en jobb krever bred kontekst eller multimodalitet, og ta hensyn til deres innvirkning på kostnadene.
Token: Enhet som brukes av modellen i stedet for Word
Kunstig intelligens-modeller behandler tekst ikke ord for ord, men i små biter kalt tokens. Et symbol; Det kan være et ord, en del av et ord, et skilletegn eller et mellomrom. For å gjøre en grov beregning: På engelsk er en gjennomsnittlig token omtrent fire tegn, og 100 ord er omtrent 130-150 tokens. På tyrkisk kan denne frekvensen være litt høyere på grunn av suffikser og lange ord; Med andre ord, en tyrkisk tekst med samme betydning bruker litt flere tokens enn engelsk.
Hvorfor er dette viktig å vite? Fordi alt er ladet og målt i tokens. Teksten (input) du sender til modellen og responsen (output) produsert av modellen regnes som separate tokens. Både fakturaen din og kapasiteten til modellen er i tokens.
Tips: For å få et grovt estimat på hvor mange tokens en tekst har, del antall tegn på fire. En e-post på 4000 tegn er omtrent 1000 tokens. På tyrkisk, anta litt høyere for å være på den sikre siden.
Kontekstvindu: Modellens "Short Term Memory"
Kontekstvinduet er den totale mengden tokens som modellen kan huske på om gangen. Inngang og utgang må passe sammen i dette vinduet. Tenk på det som hvor mye papir du kan spre på et bord på en gang: Papiret som ikke får plass på bordet er utenfor synsfeltet ditt i det øyeblikket.
Hvis en modells kontekstvindu er 200 000 tokens, tilsvarer dette omtrent 150 000 ord, eller flere mellomstore bøker. 1 million tokens kan behandle mye større dokumenter som helhet. Noen kraftige modeller i dag (f.eks. Claude Opus 4.8 og Sonnet 5) tilbyr 1 million token-kontekster, mens lette modeller ofte kommer med mindre vinduer (f.eks. 200 000 tokens for Haiku 4.5).
Hvorfor er det viktig? For hvis et dokument ikke passer inn i kontekstvinduet, kan ikke modellen se alt sammen. Du kan ikke gi en 500-siders kontrakt i sin helhet til en 200 000 token-modell; Du deler enten opp dokumentet i deler (som kan miste forholdet mellom delene) eller velger en modell med en bredere kontekst.
Forsiktig: Det er ikke lurt å fylle ut alle dokumenter, da det bare er fordi kontekstvinduet er stort. Jo flere tokens du legger inn i vinduet, jo mer betaler du, og noen ganger kan modellen savne de midterste detaljene i veldig lange tekster. Det er ofte billigere og mer nøyaktig å sende kun den delen som fungerer.
Kontekstvindu er et beslutningskriterium
Quest
Omtrentlig nødvendig kontekst
Passende nivå
Kort e-postsvar
flere hundre tokens
lett
En side sammendrag
flere tusen tokens
Lett/balansert
40-siders rapportanalyse
~30 000 tokens
Balansert/sterk
300 siders kontraktgjennomgang
~250 000 tokens
Kraftig med bred kontekst
Behandle hundrevis av dokumenter samtidig
500 000+ tokens
Den bredeste konteksten
Denne tabellen svarer på spørsmålet "hvilken modell?" Den viser at en del av spørsmålet besvares direkte etter dokumentstørrelse. Det er bortkastet å kjøpe en dyr modell med stor kontekst for korte jobber; En modell med et lite vindu er utilstrekkelig for store dokumenter.
Multimodality: Going Beyond the Text
Multimodalitet er en modells evne til å håndtere flere typer data (bilde, lyd, noen ganger video), ikke bare tekst. "Modal" betyr her "datatype"; multimodal betyr "mange slag".
- Bare tekstmodell: Leser og skriver kun skrevet tekst.
- Multimodal modell: Kan lese et bilde av en regning, tolke en trend på en graf, dekode et håndskrevet notat, noen ganger transkribere et stemmeopptak.
Hvorfor er det viktig? Fordi virksomhetens natur kan kreve multimodalitet. Et regnskapsteam som trekker ut beløp fra fakturabilder, et e-handelsteam som klassifiserer produktbilder, eller et forsikringsteam som vurderer skadebilder kan ikke gjøre denne jobben med en modell som kun leser tekst. Visuell prosessering er avgjørende for disse oppgavene.
Tre realistiske tilfeller
Tilfelle 1 - Token kostnadsoverraskelse. Et innholdsteam sender også modellen et 20-siders "merkeveiledning"-dokument når de produserer hvert blogginnlegg. Denne guiden er på omtrent 15 000 tokens. De produserer 2000 artikler i måneden; Så bare å sende veiledningen om og om igjen betyr 30 millioner tokens med input. Ved å forkorte veiledningen og kun sende den aktuelle delen (ca. 2000 tokens), reduserer de innspillet til en syvendedel og reduserer regningen betydelig.
Tilfelle 2 — Kontekstvindu er ikke nok. Et advokatfirma ønsker å få gjennomgått en fusjonsavtale på 280 sider. Den første modellen de prøvde hadde en binding på 200 000 tokens og dokumentet passet ikke; Når dokumentet er revet i stykker, kan ikke modellen legge merke til at en artikkel i den første delen motsier en artikkel i den siste delen. Når den bytter til en modell med 1 million token-kontekst, leser den dokumentet som en helhet og fanger opp motsigelsen. Her bestemte kontekstvinduet direkte nøyaktigheten.
Case 3 – Multimodalitet er et must. Et forsikringsselskap ønsker å foreta en foreløpig vurdering fra bilskadefotografier. Dette er umulig med en modell som kun leser tekst; Det kreves en multimodal modell som "ser" fotografiet. Når de bytter til en multimodal modell, etablerer de et forhåndsscreeningssystem som grovt klassifiserer plasseringen og alvorlighetsgraden av skaden på bildet og leder eksperten. De bemerker imidlertid at en menneskelig ekspert tar den endelige avgjørelsen; fordi modellen er et foreløpig screeningsverktøy, ikke det siste ordet.
Svak forespørsel / sterk forespørsel
Svak melding:
Oppsummer dette dokumentet. [for langt dokument limt inn]
Kraftig ledetekst:
Oppsummer rapporten på 40 sider nedenfor. Estimer først det omtrentlige antallet tokens i rapporten og fortell oss om det passer innenfor kontekstvinduet til en typisk balansert modell. Gi så sammendraget i dette formatet: 5-elements executive summary + 3 risikable funn. Bruk kun informasjonen i rapporten; Merk den delen du ikke er sikker på som "ikke tydelig i rapporten". [rapport]
Den kraftige ledeteksten er både token-/kontekstbevisst og kontrollerer formatet og verifiserbarheten til utdataene.
Kopierbare maler
1. Token-prediksjon:
Estimer det omtrentlige antall tokens for følgende tekst og tolk dette i form av inngangskostnad: "[TEXT]". Rund det opp litt, ta i betraktning at det er tyrkisk.
2. Kontroll av konteksttilgjengelighet:
Min jobb er å behandle følgende dokumenter: gjennomsnittlig [PAGES] av [QTY] dokumenter per måned. Hvilket kontekstvindu krever denne størrelsen? Hvilket av de lyse/balanserte/sterke nivåene vil være tilstrekkelig? Hvilken risiko oppstår hvis den må demonteres?
3. Multimodalitetsdiagnose:
Min arbeidsflyt: [DESCRIPTION]. Er det visuell, lyd- eller videobehandling i denne strømmen? Er det i så fall nødvendig med en multimodal modell, eller kan den konverteres til tekst (OCR/transkripsjon) og løses med tekstmodellen? Sammenlign fordeler/ulemper ved de to banene.
4. Kontekstoptimalisering:
Jeg sender et dokument til modellen ved hver forespørsel, men det meste er unødvendig. Hvordan trekker jeg ut delene som faktisk kreves for [TASK] fra dette dokumentet? Foreslå 3 konkrete måter å redusere innsatsen på og angi estimerte symbolbesparelser.
Vanlige feil
- Forveksler token med et ord: Token er forskjellig fra et ord; Faktura og kapasitet er alltid i tokens, å regne i ord er misvisende.
- Tenker kontekstvinduet er uendelig: Hver modell har en grense; Hvis dokumentet ikke passer, kan ikke modellen se helheten.
- Bruke unødvendig stor kontekst: Kjøpe en dyr modell med stor kontekst for en kort jobb; eller fyll ut enorme dokumenter for hver forespørsel og betal forgjeves.
- Forutsatt multimodalitet: Ikke alle modeller kan behandle bilder; For visuelt arbeid, start uten å bekrefte at modellen er multimodal.
- Å glemme symbolmengden med tyrkisk: Tyrkiske tekster bruker generelt litt flere tokens for samme betydning; ignorerer dette i kostnadsestimatet.
Oppsummert
- En token er den lille enheten som modellen behandler tekst i; input og output måles og faktureres separat som tokens.
- Kontekstvinduet er det totale antallet tokens modellen kan huske på om gangen; dokumentstørrelsen påvirker modellvalget direkte.
- Multimodalitet er modellens evne til å behandle ikke-tekstdata som visuell/lyd; Det er viktig for visuelle arbeider.
- Disse tre konseptene er begge relevante for spørsmålet "hvilken modell?" samt "hvor mye koster det?" Det danner grunnlaget for spørsmålene.
Søknadsoppgave
Velg en tilbakevendende AI-oppgave i virksomheten din. La den første malen (tokenprediksjon) beregne hvor mange tokens en typisk inngang er i denne oppgaven. Bestem deretter hvilket nivå som er tilstrekkelig med mal 2 (kontroll av konteksttilgjengelighet). Har du en visuell jobb, avklar om det kreves en multimodal modell med 3. mal (multimodalitetsdiagnose). Vi vil bruke det resulterende tokenestimatet i kostnadsberegningen for neste enhet.
sjekkliste
- [ ] Jeg kjenner begrepet token og hvordan man grovt kan anslå hvor mange tokens en tekst har.
- [ ] Jeg kan forklare kontekstvinduet med en "tabell/minne"-analogi.
- [ ] Jeg kan vurdere om et dokument vil passe inn i en modell.
- [ ] Jeg kan diagnostisere når multimodalitet er avgjørende.
- [ ] Jeg tar i betraktning den symbolske overheaden til tyrkisk og kostnadene ved unødvendig kontekst.