Eenheid 5 / 10

Token, contextvenster en multimodaliteit: hoe de geest van het model werkt

Winst:

  • Vermogen om de concepten token, contextvenster en multimodaliteit in alledaagse taal uit te leggen
  • Stel vast of een taak een brede context of multimodaliteit vereist
  • Vermogen om rekening te houden met de manier waarop deze concepten de kosten en modelselectie beïnvloeden

Tot nu toe zijn we bekend met de aanbieders en modeltypes. Voor de juiste modelkeuze is het echter ook noodzakelijk om te begrijpen hoe de modellen "binnen" werken; omdat beslissingen over prijs, capaciteit en beschikbaarheid allemaal afhankelijk zijn van drie kernconcepten: token, contextvenster en multimodaliteit. Iemand die deze concepten niet kent, kan het prijsoverzicht niet lezen en zich afvragen: "zal dit document in het model passen?" kan de vraag niet beantwoorden en kan niet zien wanneer visuele verwerking essentieel is. Aan het einde van dit blok kun je deze drie concepten in alledaagse taal uitleggen, diagnosticeren of een baan een brede context of multimodaliteit vereist, en rekening houden met hun impact op de kosten.

Token: eenheid die door het model wordt gebruikt in plaats van door Word

Modellen voor kunstmatige intelligentie verwerken tekst niet woord voor woord, maar in kleine stukjes die tokens worden genoemd. Een teken; Het kan een woord, een deel van een woord, een leesteken of een spatie zijn. Om een ​​ruwe berekening te maken: in het Engels is een gemiddeld token ongeveer vier tekens, en 100 woorden zijn ongeveer 130-150 tokens. In het Turks kan dit percentage iets hoger zijn vanwege achtervoegsels en lange woorden; Met andere woorden: een Turkse tekst met dezelfde betekenis verbruikt iets meer tokens dan de Engelse.

Waarom is dit belangrijk om te weten? Omdat alles in tokens wordt afgerekend en gemeten. De tekst (invoer) die u naar het model verzendt en de reactie (uitvoer) die door het model wordt geproduceerd, worden als afzonderlijke tokens geteld. Zowel uw factuur als de capaciteit van het model zijn in tokens.

Tip: Om een ​​ruwe schatting te krijgen van het aantal tokens dat een tekst heeft, deelt u het aantal tekens door vier. Een e-mail van 4.000 tekens is ongeveer 1.000 tokens. Ga in het Turks uit van iets hoger om aan de veilige kant te blijven.

Contextvenster: "Kortetermijngeheugen" van het model

Het contextvenster is het totale aantal tokens dat het model tegelijk in gedachten kan houden. Invoer en uitvoer moeten in dit venster bij elkaar passen. Zie het als de hoeveelheid papier die je in één keer op tafel kunt spreiden: het papier dat niet op tafel past, is op dat moment buiten je gezichtsveld.

Als het contextvenster van een model 200.000 tokens bedraagt, komt dit neer op ongeveer 150.000 woorden, of meerdere middelgrote boeken. 1 miljoen tokens kunnen veel grotere documenten als geheel verwerken. Sommige krachtige modellen van vandaag (bijvoorbeeld Claude Opus 4.8 en Sonnet 5) bieden 1 miljoen tokencontexten, terwijl lichtgewichtmodellen vaak met kleinere vensters worden geleverd (bijvoorbeeld 200.000 tokens voor Haiku 4.5).

Waarom is het belangrijk? Want als een document niet in het contextvenster past, kan het model het niet allemaal samen zien. Je kunt geen volledig contract van 500 pagina's geven aan een model van 200.000 tokens; Je verdeelt het document in delen (waardoor de relatie tussen de delen mogelijk verloren gaat) of kiest een model met een bredere context.

Let op: Het is niet verstandig om elk document in te vullen, omdat het contextvenster groot is. Hoe meer tokens je in het venster stopt, hoe meer je betaalt, en soms kan het model de middelste details in hele lange teksten missen. Het is vaak goedkoper en nauwkeuriger om alleen het onderdeel te sturen dat werkt.

Contextvenster is een beslissingscriterium

Zoektocht

Geschatte vereiste context

Passend niveau

Korte e-mailreactie

enkele honderden tokens

lichtgewicht

Samenvatting van één pagina

enkele duizenden tokens

Licht/evenwichtig

Rapportanalyse van 40 pagina's

~30.000 tokens

Evenwichtig/sterk

Contractoverzicht van 300 pagina's

~250.000 tokens

Krachtig met brede context

Verwerk honderden documenten tegelijk

500.000+ tokens

Breedste context

Deze tabel geeft antwoord op de vraag "welk model?" Het laat zien dat een deel van de vraag direct wordt beantwoord op basis van de documentgrootte. Het is zonde om een ​​duur model met een grote context voor korte klussen te kopen; Voor grote documenten is een model met een klein venster niet geschikt.

Multimodaliteit: verder gaan dan de tekst

Multimodaliteit is het vermogen van een model om meerdere soorten gegevens (beeld, audio en soms video) te verwerken, en niet alleen tekst. "Modaal" betekent hier "gegevenstype"; multimodaal betekent "vele soorten".

  • Alleen-tekstmodel: Leest en schrijft alleen geschreven tekst.
  • Multimodaal model: kan een foto van een rekening lezen, een trend in een grafiek interpreteren, een handgeschreven notitie decoderen en soms een stemopname transcriberen.

Waarom is het belangrijk? Omdat de aard van uw bedrijf mogelijk multimodaliteit vereist. Een boekhoudteam dat bedragen uit factuurafbeeldingen haalt, een e-commerceteam dat productfoto's classificeert, of een verzekeringsteam dat schadefoto's beoordeelt, kan dit werk niet doen met een model dat alleen tekst leest. Visuele verwerking is essentieel voor deze taken.

Drie realistische gevallen

Geval 1 – Tokenkostenverrassing. Een contentteam stuurt het model ook een ‘merkgids’-document van twintig pagina’s bij het schrijven van elke blogpost. Deze gids bevat ongeveer 15.000 tokens. Ze produceren 2.000 artikelen per maand; Dus het keer op keer verzenden van de gids betekent 30 miljoen tokens aan input. Door de gids in te korten en alleen het relevante gedeelte (ongeveer 2.000 tokens) te sturen, verminderen ze de input tot een zevende en verlagen ze de rekening aanzienlijk.

Geval 2 — Contextvenster is niet genoeg. Een advocatenkantoor wil een fusieovereenkomst van 280 pagina's laten beoordelen. Het eerste model dat ze probeerden had een binding van 200.000 tokens en het document paste niet; Wanneer het document uit elkaar wordt gescheurd, kan het model niet merken dat een artikel in de eerste sectie in tegenspraak is met een artikel in de laatste sectie. Wanneer het overschakelt naar een model met een context van 1 miljoen tokens, leest het het document als geheel en vangt het de tegenstrijdigheid op. Hier bepaalde het contextvenster direct de nauwkeurigheid.

Geval 3 — Multimodaliteit is een must. Een verzekeringsmaatschappij wil een voorlopige inschatting maken op basis van foto's van voertuigschade. Dit is onmogelijk met een model dat alleen tekst leest; Er is een multimodaal model nodig dat de foto ‘ziet’. Wanneer ze overstappen op een multimodaal model, zetten ze een pre-screeningsysteem op dat de locatie en de ernst van de schade op de foto grofweg classificeert en de deskundige aanstuurt. Ze merken echter op dat een menselijke expert de uiteindelijke beslissing neemt; omdat het model een voorlopig screeningsinstrument is en niet het laatste woord.

Zwakke prompt/sterke prompt

Zwakke prompt:

Vat dit document samen. [te lang document geplakt]

Krachtige prompt:

Vat het rapport van 40 pagina's hieronder samen. Schat eerst het geschatte aantal tokens in het rapport en vertel ons of dit binnen het contextvenster van een typisch gebalanceerd model past. Geef de samenvatting vervolgens in dit formaat: managementsamenvatting van 5 items + 3 risicovolle bevindingen. Gebruik alleen de informatie in het rapport; Markeer het onderdeel waarvan u niet zeker bent als "niet duidelijk in het rapport". [rapport]

De krachtige prompt is zowel token- als contextbewust en regelt het formaat en de verifieerbaarheid van de uitvoer.

Kopieerbare sjablonen

1. Tokenvoorspelling:

Schat bij benadering het aantal tokens voor de volgende tekst en interpreteer dit in termen van invoerkosten: "[TEKST]". Rond het een beetje af, rekening houdend met het feit dat het Turks is.

2. Controle van de contextbeschikbaarheid:

Het is mijn taak om de volgende documenten te verwerken: gemiddeld [PAGES] van [QTY] documenten per maand. Welk contextvenster heeft deze grootte nodig? Welke van de lichte/gebalanceerde/sterke niveaus zou voldoende zijn? Welk risico ontstaat er als er gedemonteerd moet worden?

3. Multimodaliteitsdiagnose:

Mijn workflow: [BESCHRIJVING]. Is er visuele, audio- of videoverwerking in deze stream? Zo ja, is er dan een multimodaal model nodig, of kan dit omgezet worden naar tekst (OCR/transcriptie) en opgelost worden met het tekstmodel? Vergelijk de voor- en nadelen van de twee paden.

4. Contextoptimalisatie:

Bij elk verzoek stuur ik een document naar het model, maar het meeste is onnodig. Hoe haal ik de onderdelen die daadwerkelijk nodig zijn voor [TAAK] uit dit document? Stel drie concrete manieren voor om de input te verminderen en geef geschatte symbolische besparingen aan.

Veel voorkomende fouten

  • Token voor een woord verwarren: Token is anders dan een woord; Factuur en capaciteit staan ​​altijd in tokens, rekenen in woorden is misleidend.
  • Denken dat het contextvenster oneindig is: elk model heeft een limiet; Als het document niet past, kan het model het geheel niet zien.
  • Onnodig grote context gebruiken: een duur model met een grote context kopen voor een korte klus; of vul voor elke aanvraag enorme documenten in en betaal tevergeefs.
  • Uitgaande van multimodaliteit: niet elk model kan beelden verwerken; Begin bij visueel werk zonder te bevestigen dat het model multimodaal is.
  • De tokenbelasting van het Turks vergeten: Turkse teksten verbruiken over het algemeen iets meer tokens voor dezelfde betekenis; dit negeren bij de kostenraming.

Samengevat

  • Een token is de kleine eenheid waarin het model tekst verwerkt; input en output worden als tokens afzonderlijk gemeten en gefactureerd.
  • Het contextvenster is het totaal aantal tokens dat het model tegelijkertijd in gedachten kan houden; documentgrootte heeft rechtstreeks invloed op de modelselectie.
  • Multimodaliteit is het vermogen van het model om niet-tekstuele gegevens zoals visueel/audio te verwerken; Het is essentieel voor visuele werken.
  • Deze drie concepten zijn beide relevant voor de vraag "welk model?" en “Hoeveel kost het?” Het vormt de basis van de vragen.

Applicatie taak

Kies een terugkerende AI-taak in uw bedrijf. Laat de eerste sjabloon (tokenvoorspelling) berekenen hoeveel tokens een typische invoer in deze taak bevat. Bepaal vervolgens met sjabloon 2 (contextbeschikbaarheidscontrole) welk niveau voldoende is. Als u een visuele taak heeft, verduidelijk dan of een multimodaal model nodig is met het 3e sjabloon (multimodaliteitsdiagnose). We zullen de resulterende symbolische schatting gebruiken bij de kostenberekening van de volgende eenheid.

controlelijst

  • [ ] Ik ken het concept van token en weet hoe ik grofweg kan inschatten hoeveel tokens een tekst heeft.
  • [ ] Ik kan het contextvenster uitleggen met een "tabel/geheugen"-analogie.
  • [ ] Ik kan beoordelen of een document in een model past.
  • [ ] Ik kan diagnosticeren wanneer multimodaliteit essentieel is.
  • [ ] Ik houd rekening met de symbolische overhead van het Turks en de kosten van onnodige context.