Egység 5 / 10

Token, kontextusablak és multimodalitás: Hogyan működik a modell elméje

Nyereség:

  • Képes a token, a kontextusablak és a multimodalitás fogalmainak magyarázatára a mindennapi nyelven
  • Diagnosztizálja, hogy egy feladat tág kontextust vagy multimodalitást igényel-e
  • Képes figyelembe venni, hogy ezek a fogalmak hogyan befolyásolják a költségeket és a modellválasztást

Eddig ismerjük a szolgáltatókat és a modelltípusokat. A megfelelő modellválasztáshoz azonban azt is meg kell érteni, hogy a modellek hogyan működnek „belül”; mert az árra, a kapacitásra és a rendelkezésre állásra vonatkozó döntések három alapkoncepción alapulnak: tokenen, kontextusablakon és multimodalitáson. Valaki, aki nem ismeri ezeket a fogalmakat, nem tudja elolvasni az árlapot, és azon tűnődik, hogy "ez a dokumentum megfelel a modellnek?" nem tud válaszolni a kérdésre, és nem látja, mikor szükséges a vizuális feldolgozás. Ennek a résznek a végére képes lesz elmagyarázni ezt a három fogalmat a mindennapi nyelven, diagnosztizálni, hogy egy munka tág kontextust vagy multimodalitást igényel-e, és figyelembe tudja venni a költségekre gyakorolt ​​hatását.

Token: A modell által szó helyett használt egység

A mesterséges intelligencia modellek nem szóról szóra dolgozzák fel a szöveget, hanem apró darabokban, úgynevezett tokenekben. Egy token; Lehet szó, szórész, írásjel vagy szóköz. Egy durva számításhoz: Angolul egy átlagos token körülbelül négy karakterből áll, és 100 szó körülbelül 130-150 token. A törökben ez az arány valamivel magasabb lehet a toldalékos és hosszú szavak miatt; Más szóval, az azonos jelentésű török ​​szöveg valamivel több jelzőt fogyaszt, mint az angol.

Miért fontos ezt tudni? Mert minden fel van töltve és tokenben mérve. A modellnek küldött szöveg (input) és a modell által generált válasz (kimenet) külön tokennek számít. Mind a számlája, mind a modell kapacitása tokenben van megadva.

Tipp: Ha hozzávetőlegesen meg szeretné becsülni, hogy egy szöveg hány tokennel rendelkezik, ossza el a karakterek számát néggyel. Egy 4000 karakteres e-mail körülbelül 1000 token. Törökül feltételezzük, hogy egy kicsit magasabban maradunk, hogy a biztonságos oldalon maradjunk.

Kontextus ablak: a modell „rövid távú memóriája”

A kontextusablak a tokenek teljes mennyisége, amelyet a modell egyszerre tud szem előtt tartani. A bemenetnek és a kimenetnek egymáshoz kell illeszkednie ebben az ablakban. Képzeld el úgy, hogy mennyi papírt tudsz egyszerre felteríteni az asztalra: Az a papír, amelyik nem fér el az asztalon, abban a pillanatban kívül esik a látótereden.

Ha egy modell környezeti ablaka 200 000 tokenből áll, ez körülbelül 150 000 szónak vagy több közepes méretű könyvnek felel meg. 1 millió token sokkal nagyobb dokumentumok egészét képes feldolgozni. Egyes mai nagy teljesítményű modellek (például a Claude Opus 4.8 és a Sonnet 5) 1 millió token környezetet kínálnak, míg a könnyű modellek gyakran kisebb ablakokkal (pl. 200 000 token a Haiku 4.5-höz).

Miért fontos? Mert ha egy dokumentum nem fér el a kontextus ablakban, akkor a modell nem láthatja együtt az egészet. 500 oldalas szerződést nem lehet teljes egészében adni egy 200 000 token modellnek; Vagy részekre osztja a dokumentumot (amely elveszítheti a részek közötti kapcsolatot), vagy válasszon egy szélesebb kontextusú modellt.

Figyelem: Nem bölcs dolog minden dokumentumot kitölteni, mert ez csak azért van, mert a kontextusablak nagy. Minél több tokent teszel be az ablakba, annál többet fizetsz, és előfordul, hogy a modell kihagyja a középső részleteket nagyon hosszú szövegekből. Gyakran olcsóbb és pontosabb, ha csak a működő alkatrészt küldjük el.

A kontextusablak egy döntési kritérium

Quest

Hozzávetőleges szükséges kontextus

Megfelelő szint

Rövid e-mail válasz

több száz token

könnyű

Egyoldalas összefoglaló

több ezer token

Könnyű/kiegyensúlyozott

40 oldalas jelentéselemzés

~30.000 token

Kiegyensúlyozott/erős

300 oldalas szerződés áttekintése

~250 000 token

Erőteljes, széles kontextussal

Több száz dokumentum feldolgozása egyszerre

500 000+ token

A legtágabb kontextus

Ez a táblázat megválaszolja a "melyik modell?" Azt mutatja, hogy a kérdés egy részére közvetlenül a dokumentum mérete válaszol. Hiába vásárol egy drága modellt nagy kontextussal rövid munkákhoz; A kis ablakkal rendelkező modell nem megfelelő nagyméretű dokumentumokhoz.

Multimodalitás: túllépni a szövegen

A multimodalitás a modell azon képessége, hogy többféle adatot (kép, hang, néha videó) is kezeljen, nem csak szöveget. A „Modal” itt „adattípust” jelent; A multimodális jelentése "sokféle".

  • Csak szöveges modell: Csak írott szöveget olvas és ír.
  • Multimodális modell: Képes beolvasni egy számláról készült fotót, grafikonon értelmezni egy trendet, dekódolni egy kézzel írt feljegyzést, néha átírni egy hangfelvételt.

Miért fontos? Mert vállalkozása jellege megkövetelheti a multimodalitást. A számlaképekből összegeket kinyerő könyvelő, a termékfotókat osztályozó e-kereskedelmi csapat vagy a kárfotókat értékelő biztosítócsapat nem tudja ezt a munkát csak szöveget olvasó modellel elvégezni. A vizuális feldolgozás elengedhetetlen ezekhez a feladatokhoz.

Három reális eset

1. eset – Token költség meglepetés. A tartalommal foglalkozó csapat egy 20 oldalas „márkakalauz” dokumentumot is elküld a modellnek, amikor minden egyes blogbejegyzést elkészítenek. Ez az útmutató körülbelül 15 000 tokenről szól. 2000 cikket gyártanak havonta; Tehát pusztán az útmutató újra és újra elküldése 30 millió token bevitelt jelent. Az útmutató lerövidítésével és csak a megfelelő szakasz elküldésével (kb. 2000 token) egyhetedére csökkentik a bevitelt, és jelentősen csökkentik a számlát.

2. eset – A kontextusablak nem elég. Egy ügyvédi iroda egy 280 oldalas egyesülési szerződés felülvizsgálatát szeretné kérni. Az első modell, amit kipróbáltak, 200 000 jelzőt tartalmazott, és a dokumentum nem illett bele; Amikor a dokumentumot széttépik, a modell nem tudja észrevenni, hogy az első részben lévő cikk ellentmond az utolsó szakasz cikkének. Amikor átvált egy 1 millió token környezettel rendelkező modellre, a dokumentum egészét olvassa el, és felfogja az ellentmondást. Itt a kontextusablak közvetlenül meghatározta a pontosságot.

3. eset – A multimodalitás kötelező. Egy biztosító társaság előzetes értékelést szeretne készíteni a járműkárokról készült fényképek alapján. Ez lehetetlen egy olyan modellnél, amely csak szöveget olvas; Szükség van egy multimodális modellre, amely "látja" a fényképet. Amikor multimodális modellre váltanak, olyan előszűrési rendszert hoznak létre, amely hozzávetőlegesen osztályozza a fotón a sérülés helyét és súlyosságát, és irányítja a szakértőt. Megjegyzik azonban, hogy a végső döntést humán szakértő hozza meg; mert a modell egy előzetes átvilágítási eszköz, nem pedig a végső szó.

Gyenge felszólítás / Erős felszólítás

Gyenge felszólítás:

Foglalja össze ezt a dokumentumot. [túl hosszú dokumentum beillesztve]

Erőteljes felszólítás:

Foglalja össze az alábbiakban a 40 oldalas jelentést. Először becsülje meg a jelentésben lévő tokenek hozzávetőleges számát, és mondja meg, hogy belefér-e egy tipikus kiegyensúlyozott modell kontextusablakába. Ezután adja meg az összefoglalót ebben a formátumban: 5 tételes vezetői összefoglaló + 3 kockázatos megállapítás. Csak a jelentésben szereplő információkat használja; Jelölje meg azt a részt, amelyben nem biztos, hogy "nem egyértelmű a jelentésben". [jelentés]

A hatékony prompt egyszerre ismeri a jogkivonatot/kontextust, és szabályozza a kimenet formátumát és ellenőrizhetőségét.

Másolható sablonok

1. Token előrejelzés:

Becsülje meg a következő szöveghez tartozó tokenek hozzávetőleges számát, és értelmezze ezt a beviteli költség alapján: "[SZÖVEG]". Kicsit kerekítsd fel, figyelembe véve, hogy török.

2. Kontextus elérhetőségének ellenőrzése:

Az én feladatom a következő dokumentumok feldolgozása: átlagosan [OLDAL] [MENNYI] dokumentumból havonta. Milyen kontextusablak szükséges ehhez a mérethez? A könnyű/kiegyensúlyozott/erős szintek közül melyik lenne elegendő? Milyen kockázat merül fel, ha szét kell szerelni?

3. Multimodalitás diagnózis:

Saját munkafolyamat: [DESCRIPTION]. Van kép-, hang- vagy videófeldolgozás ebben az adatfolyamban? Ha igen, szükség van-e multimodális modellre, vagy át lehet alakítani szöveggé (OCR/átírás) és megoldható a szövegmodellel? Hasonlítsa össze a két út előnyeit/hátrányait.

4. Kontextus optimalizálás:

Minden kéréssel küldök egy dokumentumot a modellnek, de a legtöbb felesleges. Hogyan szedhetem ki ebből a dokumentumból a [TASK]-hoz ténylegesen szükséges részeket? Javasoljon 3 konkrét módot a bevitel csökkentésére, és jelezze a becsült token megtakarításokat.

Gyakori hibák

  • A token összetévesztése egy szóval: A token különbözik a szótól; A számla és a kapacitás mindig tokenben van feltüntetve, szavakkal számolni félrevezető.
  • Ha azt gondoljuk, hogy a kontextusablak végtelen: minden modellnek van határa; Ha a dokumentum nem fér bele, a modell nem láthatja az egészet.
  • Szükségtelen nagy kontextus használata: drága modell vásárlása nagy kontextussal rövid munkához; vagy töltsön ki hatalmas dokumentumokat minden kérésre és hiába fizet.
  • Multimodalitást feltételezve: Nem minden modell képes a látványelemek feldolgozására; Vizuális munkához kezdje anélkül, hogy megerősítené, hogy a modell multimodális.
  • A török ​​nyelv jelzőterhelését elfelejtve: a török ​​szövegek általában valamivel több jelzőt fogyasztanak ugyanarra a jelentésre; ezt figyelmen kívül hagyva a költségbecslésnél.

Összefoglalva

  • A token az a kis egység, amelyben a modell szöveget dolgoz fel; A bemenetet és a kimenetet tokenként külön mérik és számlázzák.
  • A kontextusablak az összes token, amelyet a modell egy időben szem előtt tarthat; a dokumentum mérete közvetlenül befolyásolja a modellválasztást.
  • A multimodalitás a modell azon képessége, hogy feldolgozza a nem szöveges adatokat, például a vizuális/audió; A vizuális munkákhoz elengedhetetlen.
  • Ez a három fogalom egyaránt releváns a "melyik modell?" valamint a "mennyibe kerül?" Ez képezi a kérdések alapját.

Pályázati feladat

Válasszon egy ismétlődő AI-feladatot vállalkozásában. Az 1. sablon (jogkivonat előrejelzése) számítsa ki, hogy egy tipikus bemenet hány tokent tartalmaz ebben a feladatban. Ezután határozza meg, hogy melyik szint elegendő a 2. sablonnal (kontextus rendelkezésre állás ellenőrzése). Ha vizuális munkája van, tisztázza, hogy szükség van-e multimodális modellre a 3. sablonnal (multimodális diagnózis). Az így kapott token becslést használjuk a következő egység költségszámításánál.

ellenőrző lista

  • [ ] Ismerem a token fogalmát, és azt, hogyan kell hozzávetőlegesen megbecsülni, hogy egy szöveg hány tokennel rendelkezik.
  • [ ] A környezeti ablakot egy "tábla/memória" hasonlattal tudom magyarázni.
  • [ ] Ki tudom értékelni, hogy egy dokumentum belefér-e egy modellbe.
  • [ ] Meg tudom állapítani, ha a multimodalitás elengedhetetlen.
  • [ ] Figyelembe veszem a török ​​nyelv jelképes rezsijét és a felesleges szövegkörnyezet költségeit.