Gevinster:
- Evne til at forklare begreberne token, kontekstvindue og multimodalitet i dagligdags sprog
- Diagnostiser om en opgave kræver bred kontekst eller multimodalitet
- Evne til at tage højde for, hvordan disse koncepter påvirker omkostninger og modelvalg
Indtil videre er vi bekendt med udbyderne og modeltyperne. For det rigtige modelvalg er det dog også nødvendigt at forstå, hvordan modellerne fungerer "inde i"; fordi beslutninger om pris, kapacitet og tilgængelighed alle er afhængige af tre kernekoncepter: token, kontekstvindue og multimodalitet. En person, der ikke kender disse begreber, kan ikke læse prisbladet og spekulere på "vil dette dokument passe til modellen?" kan ikke besvare spørgsmålet og kan ikke se, hvornår visuel behandling er essentiel. Ved afslutningen af denne enhed vil du være i stand til at forklare disse tre begreber i dagligdags sprog, diagnosticere, om et job kræver bred kontekst eller multimodalitet, og tage hensyn til deres indvirkning på omkostningerne.
Token: Enhed brugt af modellen i stedet for Word
Kunstig intelligens-modeller behandler tekst ikke ord for ord, men i små stykker kaldet tokens. Et token; Det kan være et ord, en del af et ord, et tegnsætningstegn eller et mellemrum. For at lave en grov udregning: På engelsk er en gennemsnitlig token omkring fire tegn, og 100 ord er omkring 130-150 tokens. På tyrkisk kan denne sats være lidt højere på grund af suffikser og lange ord; Med andre ord, en tyrkisk tekst med samme betydning forbruger lidt flere tokens end engelsk.
Hvorfor er det vigtigt at vide? Fordi alt er opladet og målt i tokens. Den tekst (input), du sender til modellen, og den respons (output), som modellen producerer, tælles som separate tokens. Både din faktura og modellens kapacitet er i poletter.
Tip: For at få et groft skøn over, hvor mange tokens en tekst har, skal du dividere antallet af tegn med fire. En e-mail på 4.000 tegn er cirka 1.000 tokens. På tyrkisk, antag lidt højere for at være på den sikre side.
Kontekstvindue: Modellens "Short Term Memory"
Kontekstvinduet er det samlede antal tokens, som modellen kan huske på ad gangen. Input og output skal passe sammen i dette vindue. Tænk på det som mængden af papir, du kan sprede på et bord på én gang: Det papir, der ikke passer på bordet, er ude af dit synsfelt i det øjeblik.
Hvis en models kontekstvindue er 200.000 tokens, svarer det til cirka 150.000 ord eller flere mellemstore bøger. 1 million tokens kan behandle meget større dokumenter som helhed. Nogle kraftfulde modeller i dag (f.eks. Claude Opus 4.8 og Sonnet 5) tilbyder 1 million token-kontekster, mens letvægtsmodeller ofte kommer med mindre vinduer (f.eks. 200.000 tokens til Haiku 4.5).
Hvorfor er det vigtigt? For hvis et dokument ikke passer ind i kontekstvinduet, kan modellen ikke se det hele samlet. Du kan ikke give en 500-siders kontrakt i sin helhed til en 200.000 token-model; Du deler enten dokumentet op i dele (som kan miste forholdet mellem delene) eller vælger en model med en bredere kontekst.
Forsigtig: Det er ikke klogt at udfylde hvert dokument, da det kun er fordi kontekstvinduet er stort. Jo flere poletter du sætter ind i vinduet, jo mere betaler du, og nogle gange kan modellen savne de midterste detaljer i meget lange tekster. Det er ofte billigere og mere præcist kun at sende den del, der virker.
Kontekstvinduet er et beslutningskriterie
Quest
Omtrentlig nødvendig kontekst
Passende niveau
Kort mail svar
flere hundrede tokens
letvægts
Resumé på én side
flere tusinde tokens
Let/balanceret
40-siders rapportanalyse
~30.000 tokens
Balanceret/stærk
300 siders kontraktgennemgang
~250.000 tokens
Kraftig med bred kontekst
Behandle hundredvis af dokumenter på én gang
500.000+ tokens
Bredeste sammenhæng
Denne tabel besvarer spørgsmålet "hvilken model?" Det viser, at en del af spørgsmålet besvares direkte efter dokumentstørrelse. Det er spild at købe en dyr model med stor sammenhæng til korte jobs; En model med et lille vindue er utilstrækkelig til store dokumenter.
Multimodalitet: Gå ud over teksten
Multimodalitet er en models evne til at håndtere flere typer data (billede, lyd, nogle gange video), ikke kun tekst. "Modal" betyder her "datatype"; multimodal betyder "mange slags".
- Kun tekstmodel: Læser og skriver kun skrevet tekst.
- Multimodal model: Kan læse et foto af en regning, fortolke en tendens på en graf, afkode en håndskrevet note, nogle gange transskribere en stemmeoptagelse.
Hvorfor er det vigtigt? Fordi din virksomheds karakter kan kræve multimodalitet. Et regnskabsteam, der udtrækker beløb fra fakturabilleder, et e-handelsteam, der klassificerer produktbilleder, eller et forsikringsteam, der vurderer skadesbilleder, kan ikke udføre dette job med en model, der kun læser tekst. Visuel behandling er afgørende for disse opgaver.
Tre realistiske sager
Case 1 - Token cost surprise. Et indholdsteam sender også et 20-siders "brand guide"-dokument til modellen, mens de producerer hvert blogindlæg. Denne guide er omkring 15.000 tokens. De producerer 2.000 artikler om måneden; Så bare at sende guiden igen og igen betyder 30 millioner tokens af input. Ved at forkorte guiden og kun sende det relevante afsnit (ca. 2.000 tokens), reducerer de input til en syvende og reducerer regningen markant.
Tilfælde 2 — Kontekstvindue er ikke nok. Et advokatfirma ønsker at få gennemgået en fusionsaftale på 280 sider. Den første model, de prøvede, havde en indbinding på 200.000 tokens, og dokumentet passede ikke; Når dokumentet er revet fra hinanden, kan modellen ikke bemærke, at en artikel i første afsnit modsiger en artikel i sidste afsnit. Når den skifter til en model med 1 million token-kontekst, læser den dokumentet som helhed og fanger modsigelsen. Her bestemte kontekstvinduet direkte nøjagtigheden.
Case 3 — Multimodalitet er et must. Et forsikringsselskab ønsker at foretage en foreløbig vurdering ud fra bilskadefotografier. Dette er umuligt med en model, der kun læser tekst; Der kræves en multimodal model, der "ser" fotografiet. Når de skifter til en multimodal model, etablerer de et forscreeningssystem, der groft klassificerer placeringen og sværhedsgraden af skaden på billedet og leder eksperten. De bemærker dog, at en menneskelig ekspert træffer den endelige beslutning; fordi modellen er et foreløbigt screeningsværktøj, ikke det sidste ord.
Svag prompt / stærk prompt
Svag prompt:
Opsummer dette dokument. [for langt dokument indsat]
Kraftig prompt:
Opsummer den 40 sider lange rapport nedenfor. Estimer først det omtrentlige antal tokens i rapporten, og fortæl os, om det passer inden for kontekstvinduet for en typisk balanceret model. Giv derefter resuméet i dette format: 5-punkts executive summary + 3 risikable fund. Brug kun oplysningerne i rapporten; Marker den del, du ikke er sikker på, som "ikke tydelig i rapporten". [rapport]
Den kraftfulde prompt er både token-/kontekstbevidst og styrer formatet og verificerbarheden af outputtet.
Kopierbare skabeloner
1. Token-forudsigelse:
Estimer det omtrentlige antal tokens for følgende tekst og fortolk dette i form af inputomkostninger: "[TEXT]". Rund det lidt op, idet du tager i betragtning, at det er tyrkisk.
2. Kontrol af konteksttilgængelighed:
Min opgave er at behandle følgende dokumenter: gennemsnitlig [SIDE] af [ANTAL] dokumenter om måneden. Hvilket kontekstvindue kræver denne størrelse? Hvilket af de lette/afbalancerede/stærke niveauer ville være tilstrækkelige? Hvilken risiko opstår, hvis det skal demonteres?
3. Multimodalitetsdiagnose:
Min arbejdsgang: [DESCRIPTION]. Er der visuel, lyd- eller videobehandling i denne stream? Hvis ja, kræves en multimodal model, eller kan den konverteres til tekst (OCR/transskription) og løses med tekstmodellen? Sammenlign fordele/ulemper ved de to veje.
4. Kontekstoptimering:
Jeg sender et dokument til modellen med hver anmodning, men det meste af det er unødvendigt. Hvordan udtrækker jeg de dele, der faktisk kræves til [TASK] fra dette dokument? Foreslå 3 konkrete måder at reducere input på og angiv estimerede tokenbesparelser.
Almindelige fejl
- At forveksle token med et ord: Token er forskellig fra et ord; Faktura og kapacitet er altid i tokens, at regne i ord er vildledende.
- Tænker kontekstvinduet er uendeligt: Hver model har en grænse; Hvis dokumentet ikke passer, kan modellen ikke se helheden.
- Brug af unødvendig stor kontekst: Køb af en dyr model med stor kontekst til et kort job; eller udfyld enorme dokumenter for hver anmodning og betal forgæves.
- Forudsat multimodalitet: Ikke alle modeller kan behandle visuals; For visuelt arbejde, start uden at bekræfte, at modellen er multimodal.
- Glemte token-belastningen af tyrkisk: Tyrkiske tekster bruger generelt lidt flere tokens for samme betydning; ignorerer dette i omkostningsvurderingen.
Sammenfattende
- Et token er den lille enhed, som modellen behandler tekst i; input og output måles og faktureres separat som poletter.
- Kontekstvinduet er det samlede antal tokens, som modellen kan huske på ad gangen; dokumentstørrelsen påvirker direkte valg af model.
- Multimodalitet er modellens evne til at behandle ikke-tekstdata såsom visuel/lyd; Det er vigtigt for visuelle værker.
- Disse tre begreber er begge relevante for spørgsmålet "hvilken model?" samt "hvor meget koster det?" Det danner grundlag for spørgsmålene.
Ansøgningsopgave
Vælg en tilbagevendende AI-opgave i din virksomhed. Få den 1. skabelon (token-forudsigelse) til at beregne, hvor mange tokens et typisk input er i denne opgave. Bestem derefter hvilket niveau der er tilstrækkeligt med skabelon 2 (kontrol af konteksttilgængelighed). Har du et visuelt job, afklar om en multimodal model er påkrævet med 3. skabelon (multimodalitetsdiagnose). Vi vil bruge det resulterende token-estimat i omkostningsberegningen for den næste enhed.
tjekliste
- [ ] Jeg kender begrebet token og hvordan man groft vurderer, hvor mange tokens en tekst har.
- [ ] Jeg kan forklare kontekstvinduet med en "tabel/hukommelse"-analogi.
- [ ] Jeg kan vurdere, om et dokument passer ind i en model.
- [ ] Jeg kan diagnosticere, hvornår multimodalitet er afgørende.
- [ ] Jeg tager højde for den symbolske overhead af tyrkisk og omkostningerne ved unødvendig kontekst.