Vinster:
- Förmåga att förklara begreppen token, kontextfönster och multimodalitet i vardagsspråk
- Diagnostisera om en uppgift kräver ett brett sammanhang eller multimodalitet
- Förmåga att ta hänsyn till hur dessa koncept påverkar kostnad och modellval
Än så länge är vi bekanta med leverantörerna och modelltyperna. Men för rätt modellval är det också nödvändigt att förstå hur modellerna fungerar "inuti"; eftersom pris, kapacitet och tillgänglighetsbeslut alla bygger på tre kärnkoncept: token, kontextfönster och multimodalitet. Någon som inte kan dessa begrepp kan inte läsa prisbladet och undra "kommer detta dokument att passa modellen?" kan inte svara på frågan och kan inte se när visuell bearbetning är väsentlig. I slutet av denna enhet kommer du att kunna förklara dessa tre begrepp i vardagligt språk, diagnostisera om ett jobb kräver ett brett sammanhang eller multimodalitet och ta hänsyn till deras inverkan på kostnaden.
Token: Enhet som används av modellen istället för Word
Modeller med artificiell intelligens bearbetar text inte ord för ord, utan i små bitar som kallas tokens. En token; Det kan vara ett ord, en del av ett ord, ett skiljetecken eller ett mellanslag. För att göra en grov beräkning: På engelska är en genomsnittlig token cirka fyra tecken, och 100 ord är cirka 130-150 tokens. På turkiska kan denna siffra vara något högre på grund av suffixerade och långa ord; Med andra ord, en turkisk text med samma betydelse förbrukar något fler tokens än engelska.
Varför är detta viktigt att veta? För allt är laddat och mätt i tokens. Texten (inmatningen) du skickar till modellen och svaret (utgången) som produceras av modellen räknas som separata tokens. Både din faktura och modellens kapacitet är i polletter.
Tips: För att få en grov uppskattning av hur många tokens en text har, dividera antalet tecken med fyra. Ett e-postmeddelande på 4 000 tecken är ungefär 1 000 tokens. På turkiska, antag lite högre för att vara på den säkra sidan.
Kontextfönster: Modellens "Short Term Memory"
Kontextfönstret är det totala antalet tokens som modellen kan ha i åtanke åt gången. Ingång och utgång måste passa ihop i detta fönster. Tänk på det som hur mycket papper du kan sprida på ett bord på en gång: Det papper som inte får plats på bordet är utanför ditt synfält i det ögonblicket.
Om en modells kontextfönster är 200 000 tokens motsvarar detta ungefär 150 000 ord, eller flera medelstora böcker. 1 miljon tokens kan behandla mycket större dokument som helhet. Vissa kraftfulla modeller idag (t.ex. Claude Opus 4.8 och Sonnet 5) erbjuder 1 miljon token-kontexter, medan lätta modeller ofta kommer med mindre fönster (t.ex. 200 000 tokens för Haiku 4.5).
Varför är det viktigt? För om ett dokument inte får plats i sammanhangsfönstret kan modellen inte se allt tillsammans. Du kan inte ge ett kontrakt på 500 sidor i sin helhet till en modell på 200 000 token; Du delar antingen upp dokumentet i delar (som kan tappa relationen mellan delarna) eller väljer en modell med ett bredare sammanhang.
Varning: Det är inte klokt att fylla i varje dokument eftersom det bara beror på att sammanhangsfönstret är stort. Ju fler polletter du stoppar in i fönstret desto mer betalar du, och ibland kan modellen missa mittdetaljerna i väldigt långa texter. Det är ofta billigare och mer korrekt att bara skicka den del som fungerar.
Kontextfönstret är ett beslutskriterier
Quest
Ungefärligt önskat sammanhang
Lämplig nivå
Kort mailsvar
flera hundra polletter
lätt
Sammanfattning på en sida
flera tusen tokens
Lätt/balanserad
40-sidig rapportanalys
~30 000 tokens
Balanserad/stark
300-sidig kontraktsgranskning
~250 000 tokens
Kraftfull med bred kontext
Behandla hundratals dokument samtidigt
500 000+ tokens
Bredaste sammanhang
Denna tabell svarar på frågan "vilken modell?" Det visar att en del av frågan besvaras direkt av dokumentstorlek. Det är slöseri att köpa en dyr modell med stort sammanhang för korta jobb; En modell med ett litet fönster är otillräckligt för stora dokument.
Multimodalitet: Gå bortom texten
Multimodalitet är förmågan hos en modell att hantera flera typer av data (bild, ljud, ibland video), inte bara text. "Modal" betyder här "datatyp"; multimodal betyder "många slag".
- Endast textmodell: Läser och skriver endast skriven text.
- Multimodal modell: Kan läsa ett foto av en räkning, tolka en trend på en graf, avkoda en handskriven lapp, ibland transkribera en röstinspelning.
Varför är det viktigt? Eftersom din verksamhets natur kan kräva multimodalitet. Ett redovisningsteam som tar ut belopp från fakturabilder, ett e-handelsteam som klassificerar produktbilder eller ett försäkringsteam som utvärderar skadebilder kan inte göra det här jobbet med en modell som bara läser text. Visuell bearbetning är väsentlig för dessa uppgifter.
Tre realistiska fall
Fall 1 – Token kostnadsöverraskning. Ett innehållsteam skickar också ett 20-sidigt dokument med "varumärkesguide" till modellen när de producerar varje blogginlägg. Den här guiden handlar om 15 000 tokens. De producerar 2 000 artiklar i månaden; Så att bara skicka guiden om och om igen betyder 30 miljoner tokens av input. Genom att förkorta guiden och bara skicka den relevanta delen (cirka 2 000 tokens) minskar de inmatningen till en sjundedel och minskar räkningen avsevärt.
Fall 2 — Kontextfönstret är inte tillräckligt. En advokatbyrå vill få ett 280-sidigt fusionsavtal granskat. Den första modellen de provade hade en bindning på 200 000 tokens och dokumentet passade inte; När dokumentet rivs sönder kan modellen inte märka att en artikel i det första avsnittet motsäger en artikel i det sista avsnittet. När den byter till en modell med 1 miljon tokens kontext läser den dokumentet i sin helhet och fångar motsägelsen. Här bestämde kontextfönstret direkt noggrannheten.
Fall 3 – Multimodalitet är ett måste. Ett försäkringsbolag vill göra en preliminär bedömning från fordonsskadefotografier. Detta är omöjligt med en modell som bara läser text; En multimodal modell som "ser" fotografiet krävs. När de byter till en multimodal modell etablerar de ett förscreeningssystem som grovt klassificerar platsen och skadans svårighetsgrad på bilden och leder experten. De noterar dock att en mänsklig expert fattar det slutgiltiga beslutet; eftersom modellen är ett preliminärt screeningverktyg, inte det sista ordet.
Svag prompt / Stark prompt
Svag uppmaning:
Sammanfatta detta dokument. [för långt dokument inklistrat]
Kraftfull uppmaning:
Sammanfatta rapporten på 40 sidor nedan. Beräkna först det ungefärliga antalet tokens i rapporten och berätta för oss om det passar inom kontextfönstret för en typisk balanserad modell. Ge sedan sammanfattningen i detta format: 5-post sammanfattning + 3 riskfyllda fynd. Använd endast informationen i rapporten; Markera den del du inte är säker på som "inte tydlig i rapporten". [rapport]
Den kraftfulla prompten är både token/kontextmedveten och styr formatet och verifierbarheten av utdata.
Kopierbara mallar
1. Tokenförutsägelse:
Uppskatta det ungefärliga antalet tokens för följande text och tolka detta i termer av ingångskostnad: "[TEXT]". Avrunda det lite, med hänsyn till att det är turkiskt.
2. Kontroll av kontexttillgänglighet:
Mitt jobb är att behandla följande dokument: genomsnittlig [SIDA] av [QTY] dokument per månad. Vilket sammanhangsfönster kräver denna storlek? Vilken av de ljusa/balanserade/starka nivåerna skulle vara tillräckliga? Vilken risk uppstår om den behöver demonteras?
3. Multimodalitetsdiagnos:
Mitt arbetsflöde: [BESKRIVNING]. Finns det visuell, ljud- eller videobehandling i denna ström? Om så är fallet, krävs en multimodal modell, eller kan den konverteras till text (OCR/transkription) och lösas med textmodellen? Jämför för- och nackdelar med de två vägarna.
4. Kontextoptimering:
Jag skickar ett dokument till modellen med varje förfrågan, men det mesta är onödigt. Hur extraherar jag de delar som faktiskt krävs för [TASK] från detta dokument? Föreslå 3 konkreta sätt att minska insatsen och ange uppskattade tokenbesparingar.
Vanliga misstag
- Misstaga symbol för ett ord: Token skiljer sig från ett ord; Faktura och kapacitet är alltid i polletter, att räkna i ord är missvisande.
- Att tänka att sammanhangsfönstret är oändligt: Varje modell har en gräns; Om dokumentet inte passar kan modellen inte se helheten.
- Använder onödigt stort sammanhang: Köpa en dyr modell med stort sammanhang för ett kort jobb; eller fyll i enorma dokument för varje förfrågan och betala förgäves.
- Om vi antar multimodalitet: Alla modeller kan inte bearbeta visuella bilder; För visuellt arbete, börja utan att bekräfta att modellen är multimodal.
- Att glömma tokenladdningen av turkiska: Turkiska texter förbrukar i allmänhet något fler tokens för samma betydelse; bortse från detta i kostnadsuppskattningen.
Sammanfattningsvis
- En token är den lilla enhet i vilken modellen bearbetar text; input och output mäts och faktureras separat som polletter.
- Kontextfönstret är det totala antalet tokens som modellen kan ha i åtanke åt gången; dokumentstorleken påverkar direkt valet av modell.
- Multimodalitet är modellens förmåga att bearbeta icke-textdata som bild/ljud; Det är viktigt för visuella verk.
- Dessa tre begrepp är båda relevanta för frågan "vilken modell?" samt "hur mycket kostar det?" Det ligger till grund för frågorna.
Applikationsuppgift
Välj en återkommande AI-uppgift i ditt företag. Låt den första mallen (tokenförutsägelse) beräkna hur många tokens en typisk ingång är i denna uppgift. Bestäm sedan vilken nivå som är tillräcklig med mall 2 (kontroll av kontexttillgänglighet). Om du har ett visuellt jobb, förtydliga om en multimodal modell krävs med den 3:e mallen (multimodalitetsdiagnos). Vi kommer att använda den resulterande tokenuppskattningen i kostnadsberäkningen för nästa enhet.
checklista
- [ ] Jag kan begreppet token och hur man grovt uppskattar hur många tokens en text har.
- [ ] Jag kan förklara sammanhangsfönstret med en "tabell/minne"-analogi.
- [ ] Jag kan utvärdera om ett dokument passar in i en modell.
- [ ] Jag kan diagnostisera när multimodalitet är viktigt.
- [ ] Jag tar hänsyn till den symboliska omkostnaden för turkiska och kostnaderna för onödiga sammanhang.