Unitate 5 / 10

Token, fereastră de context și multimodalitate: cum funcționează mintea modelului

Câștiguri:

  • Abilitatea de a explica conceptele de token, fereastră de context și multimodalitate în limbajul de zi cu zi
  • Diagnosticați dacă o sarcină necesită un context larg sau multimodalitate
  • Capacitatea de a lua în considerare modul în care aceste concepte afectează costurile și selecția modelului

Până acum suntem familiarizați cu furnizorii și tipurile de modele. Cu toate acestea, pentru alegerea corectă a modelului, este, de asemenea, necesar să înțelegeți cum funcționează modelele „în interior”; deoarece deciziile privind prețul, capacitatea și disponibilitatea se bazează pe trei concepte de bază: token, fereastră de context și multimodalitate. Cineva care nu cunoaște aceste concepte nu poate citi fișa de preț și se întreabă „se va potrivi acest document cu modelul?” nu pot răspunde la întrebare și nu pot vedea când procesarea vizuală este esențială. Până la sfârșitul acestei unități, veți fi capabil să explicați aceste trei concepte în limbajul de zi cu zi, să diagnosticați dacă un loc de muncă necesită un context larg sau multimodalitate și să țineți cont de impactul lor asupra costurilor.

Token: Unitate folosită de model în loc de cuvânt

Modelele de inteligență artificială procesează textul nu cuvânt cu cuvânt, ci în bucăți mici numite jetoane. Un jeton; Poate fi un cuvânt, o parte a unui cuvânt, un semn de punctuație sau un spațiu. Pentru a face un calcul aproximativ: în engleză, un simbol mediu este de aproximativ patru caractere, iar 100 de cuvinte sunt aproximativ 130-150 de simboluri. În turcă, această rată poate fi puțin mai mare din cauza cuvintelor sufixate și lungi; Cu alte cuvinte, un text turcesc cu același sens consumă puțin mai multe jetoane decât engleza.

De ce este important de știut acest lucru? Pentru că totul este încărcat și măsurat în jetoane. Textul (intrarea) pe care îl trimiteți modelului și răspunsul (ieșirea) produs de model sunt considerate ca simboluri separate. Atât factura dvs., cât și capacitatea modelului sunt în jetoane.

Sfat: pentru a obține o estimare aproximativă a câte simboluri are un text, împărțiți numărul de caractere la patru. Un e-mail de 4.000 de caractere înseamnă aproximativ 1.000 de jetoane. În turcă, presupuneți un pic mai mare pentru a rămâne în siguranță.

Fereastra de context: „Memoria pe termen scurt” a modelului

Fereastra de context este cantitatea totală de jetoane pe care modelul le poate ține cont la un moment dat. Intrarea și ieșirea trebuie să se potrivească în această fereastră. Gândiți-vă la asta ca la cantitatea de hârtie pe care o puteți întinde pe o masă deodată: hârtia care nu se potrivește pe masă este în afara câmpului vizual în acel moment.

Dacă fereastra de context a unui model este de 200.000 de jetoane, aceasta echivalează cu aproximativ 150.000 de cuvinte sau mai multe cărți de dimensiune medie. 1 milion de jetoane pot procesa documente mult mai mari în ansamblu. Unele modele puternice de astăzi (de exemplu Claude Opus 4.8 și Sonnet 5) oferă 1 milion de contexte de jetoane, în timp ce modelele ușoare vin adesea cu ferestre mai mici (de exemplu, 200.000 de jetoane pentru Haiku 4.5).

De ce este important? Pentru că dacă un document nu se încadrează în fereastra de context, modelul nu poate vedea totul împreună. Nu poți da un contract de 500 de pagini în întregime unui model de 200.000 de jetoane; Fie împărțiți documentul în părți (care pot pierde relația dintre părți), fie alegeți un model cu un context mai larg.

Atenție: Nu este înțelept să completați fiecare document deoarece este doar pentru că fereastra de context este mare. Cu cât pui mai multe jetoane în fereastră, cu atât plătești mai mult și, uneori, modelul poate pierde detaliile din mijloc în textele foarte lungi. Este adesea mai ieftin și mai precis să trimiteți doar piesa care funcționează.

Fereastra de context este un criteriu de decizie

Căutare

Context necesar aproximativ

Nivel adecvat

Scurt răspuns la e-mail

câteva sute de jetoane

ușoară

Rezumat pe o pagină

câteva mii de jetoane

Lejer/echilibrat

Analiza raportului de 40 de pagini

~30.000 de jetoane

Echilibrat/puternic

Revizuirea contractului de 300 de pagini

~250.000 de jetoane

Puternic cu context larg

Procesați sute de documente simultan

Peste 500.000 de jetoane

Contextul cel mai larg

Acest tabel răspunde la întrebarea „ce model?” Acesta arată că o parte a întrebării primește răspuns direct în funcție de dimensiunea documentului. Este o risipă să cumperi un model scump cu un context larg pentru locuri de muncă scurte; Un model cu o fereastră mică este inadecvat pentru documente mari.

Multimodalitate: depășirea textului

Multimodalitatea este capacitatea unui model de a gestiona mai multe tipuri de date (imagine, audio, uneori video), nu doar text. „Modal” înseamnă aici „tip de date”; multimodal înseamnă „multe feluri”.

  • Model numai text: citește și scrie doar text scris.
  • Model multimodal: Poate citi o fotografie a unei facturi, poate interpreta o tendință pe un grafic, poate decoda o notă scrisă de mână, uneori poate transcrie o înregistrare vocală.

De ce este important? Deoarece natura afacerii tale poate necesita multimodalitate. O echipă de contabilitate care extrage sume din imaginile facturii, o echipă de comerț electronic care clasifică fotografiile produselor sau o echipă de asigurări care evaluează fotografiile daune nu poate face această treabă cu un model care citește doar text. Procesarea vizuală este esențială pentru aceste sarcini.

Trei cazuri realiste

Cazul 1 - Surpriza costului jetonului. De asemenea, o echipă de conținut trimite modelului un document de 20 de pagini „ghid de marcă” pe măsură ce elaborează fiecare postare de blog. Acest ghid este de aproximativ 15.000 de jetoane. Ei produc 2.000 de articole pe lună; Așadar, doar trimiterea ghidului din nou și din nou înseamnă 30 de milioane de jetoane de intrare. Scurtând ghidul și trimițând doar secțiunea relevantă (aproximativ 2.000 de jetoane), acestea reduc intrarea la o șapte și reduc semnificativ factura.

Cazul 2 — Fereastra context nu este suficientă. O firmă de avocatură dorește să fie revizuit un acord de fuziune de 280 de pagini. Primul model pe care l-au încercat avea o legare de 200.000 de jetoane și documentul nu se potrivea; Când documentul este rupt, modelul nu poate observa că un articol din prima secțiune contrazice un articol din ultima secțiune. Când trece la un model cu context de 1 milion de token, citește documentul ca întreg și prinde contradicția. Aici fereastra de context a determinat direct acuratețea.

Cazul 3 – Multimodalitatea este o necesitate. O companie de asigurări dorește să facă o evaluare preliminară din fotografiile daunelor vehiculului. Acest lucru este imposibil cu un model care citește doar text; Este necesar un model multimodal care „vede” fotografia. Când trec la un model multimodal, ei stabilesc un sistem de pre-screening care clasifică aproximativ locația și severitatea daunelor din fotografie și direcționează expertul. Ei notează, totuși, că un expert uman ia decizia finală; deoarece modelul este un instrument de screening preliminar, nu cuvântul final.

Solicitare slabă / Solicitare puternică

Prompt slab:

Rezumați acest document. [document prea lung lipit]

Solicitare puternică:

Rezumați mai jos raportul de 40 de pagini. Mai întâi, estimați numărul aproximativ de jetoane din raport și spuneți-ne dacă se încadrează în fereastra de context a unui model echilibrat tipic. Apoi dați rezumatul în acest format: rezumat executiv cu 5 articole + 3 constatări riscante. Utilizați numai informațiile din raport; Marcați partea de care nu sunteți sigur ca „nu este clară în raport”. [raport]

Promptul puternic ține cont de token/context și controlează formatul și verificabilitatea rezultatului.

Șabloane copiabile

1. Predicție simbol:

Estimați numărul aproximativ de jetoane pentru următorul text și interpretați acest lucru în termeni de cost de intrare: „[TEXT]”. Rotunjește puțin, ținând cont că este turcească.

2. Verificarea disponibilității contextului:

Sarcina mea este să procesez următoarele documente: medie [PAGES] de [QTY] documente pe lună. Ce fereastră de context necesită această dimensiune? Care dintre nivelurile de lumină/echilibrat/puternic ar fi suficient? Ce risc apare dacă trebuie demontat?

3. Diagnostic multimodal:

Fluxul meu de lucru: [DESCRIERE]. Există procesare vizuală, audio sau video în acest flux? Dacă da, este necesar un model multimodal sau poate fi convertit în text (OCR/transcriere) și rezolvat cu modelul text? Comparați avantajele/dezavantajele celor două căi.

4. Optimizarea contextului:

Trimit un document la model cu fiecare solicitare, dar cea mai mare parte este inutil. Cum extrag părțile care sunt de fapt necesare pentru [SARCINA] din acest document? Sugerați 3 moduri concrete de a reduce intrarea și indicați economiile estimate de simboluri.

Greșeli comune

  • Confundarea simbolului cu un cuvânt: Tokenul este diferit de un cuvânt; Factura și capacitatea sunt întotdeauna în simboluri, calcularea în cuvinte este înșelătoare.
  • Gândirea că fereastra de context este infinită: fiecare model are o limită; Dacă documentul nu se potrivește, modelul nu poate vedea întregul.
  • Utilizarea unui context mare inutil: Cumpărarea unui model scump cu un context mare pentru un loc de muncă scurt; sau completați documente uriașe pentru fiecare cerere și plătiți în zadar.
  • Presupunând multimodalitate: nu orice model poate procesa imagini; Pentru lucrări vizuale, începeți fără a confirma că modelul este multimodal.
  • Uitând încărcătura de jetoane de turcă: textele turcești consumă în general puțin mai multe jetoane pentru același înțeles; ignorând acest lucru în estimarea costurilor.

Pe scurt

  • Un token este unitatea mică în care modelul procesează text; intrarea și ieșirea sunt măsurate și facturate separat ca simboluri.
  • Fereastra de context reprezintă numărul total de jetoane pe care modelul le poate ține cont la un moment dat; dimensiunea documentului afectează direct selecția modelului.
  • Multimodalitatea este capacitatea modelului de a procesa date non-text, cum ar fi vizual/audio; Este esențial pentru lucrările vizuale.
  • Aceste trei concepte sunt ambele relevante pentru întrebarea „care model?” precum și „cât costă?” Ea formează baza întrebărilor.

Sarcina de aplicare

Alegeți o sarcină AI recurentă în afacerea dvs. Solicitați primului șablon (predicția de jetoane) să calculeze câte jetoane este o intrare tipică în această sarcină. Apoi determinați ce nivel este suficient cu șablonul 2 (verificarea disponibilității contextului). Dacă aveți o muncă vizuală, clarificați dacă este necesar un model multimodal cu al 3-lea șablon (diagnostic multimodalitate). Vom folosi estimarea simbolului rezultată în calculul costului următoarei unități.

lista de verificare

  • [ ] Cunosc conceptul de token și cum să estimez aproximativ câte simboluri are un text.
  • [ ] Pot explica fereastra de context cu o analogie „tabel/memorie”.
  • [ ] Pot evalua dacă un document se va potrivi într-un model.
  • [ ] Pot diagnostica când multimodalitatea este esențială.
  • [ ] Iau în considerare costul general al simbolului turcesc și costul contextului inutil.