Yunit 5 / 10

Token, Context Window at Multimodality: Paano Gumagana ang Isip ng Modelo

Mga nadagdag:

  • Kakayahang ipaliwanag ang mga konsepto ng token, context window at multimodality sa pang-araw-araw na wika
  • I-diagnose kung ang isang gawain ay nangangailangan ng malawak na konteksto o multimodality
  • Kakayahang isaalang-alang kung paano nakakaapekto ang mga konseptong ito sa gastos at pagpili ng modelo

Sa ngayon ay pamilyar kami sa mga provider at mga uri ng modelo. Gayunpaman, para sa tamang pagpili ng modelo, kinakailangan ding maunawaan kung paano gumagana ang mga modelo "sa loob"; dahil ang mga desisyon sa presyo, kapasidad, at availability ay umaasa sa tatlong pangunahing konsepto: token, context window, at multimodality. Ang isang taong hindi nakakaalam ng mga konseptong ito ay hindi makakabasa ng price sheet at nagtataka "magkakasya ba ang dokumentong ito sa modelo?" hindi masagot ang tanong at hindi makita kung kailan mahalaga ang visual processing. Sa pagtatapos ng yunit na ito, magagawa mong ipaliwanag ang tatlong konseptong ito sa pang-araw-araw na wika, masuri kung ang isang trabaho ay nangangailangan ng malawak na konteksto o multimodality, at isasaalang-alang ang epekto nito sa gastos.

Token: Yunit na Ginamit ng Modelo Sa halip na Salita

Ang mga modelo ng artificial intelligence ay nagpoproseso ng teksto hindi bawat salita, ngunit sa maliliit na piraso na tinatawag na mga token. Isang token; Maaari itong maging isang salita, bahagi ng isang salita, isang bantas, o isang puwang. Upang makagawa ng magaspang na pagkalkula: Sa English, ang isang average na token ay humigit-kumulang apat na character, at ang 100 salita ay humigit-kumulang 130-150 token. Sa Turkish, ang rate na ito ay maaaring bahagyang mas mataas dahil sa suffixed at mahabang salita; Sa madaling salita, ang isang Turkish na teksto na may parehong kahulugan ay gumagamit ng bahagyang mas maraming token kaysa sa Ingles.

Bakit ito mahalagang malaman? Dahil ang lahat ay sinisingil at sinusukat sa mga token. Ang text (input) na ipinadala mo sa modelo at ang tugon (output) na ginawa ng modelo ay binibilang bilang hiwalay na mga token. Parehong nasa mga token ang iyong invoice at ang kapasidad ng modelo.

Tip: Upang makakuha ng magaspang na pagtatantya kung gaano karaming mga token mayroon ang isang text, hatiin ang bilang ng mga character sa apat. Ang 4,000 character na email ay humigit-kumulang 1,000 token. Sa Turkish, ipagpalagay na mas mataas ng kaunti upang manatili sa ligtas na bahagi.

Context Window: Ang "Short Term Memory" ng Modelo

Ang window ng konteksto ay ang kabuuang dami ng mga token na maaaring tandaan ng modelo sa isang pagkakataon. Dapat magkasya ang input at output sa window na ito. Isipin ito tulad ng dami ng papel na maaari mong ikalat sa isang mesa nang sabay-sabay: Ang papel na hindi kasya sa mesa ay wala sa iyong larangan ng paningin sa sandaling iyon.

Kung ang window ng konteksto ng isang modelo ay 200,000 token, katumbas ito ng humigit-kumulang 150,000 salita, o ilang mga medium-sized na libro. Ang 1 milyong token ay maaaring magproseso ng mas malalaking dokumento sa kabuuan. Ang ilang makapangyarihang modelo ngayon (hal. Claude Opus 4.8 at Sonnet 5) ay nag-aalok ng 1 milyong konteksto ng token, habang ang mga magaan na modelo ay kadalasang may kasamang mas maliliit na bintana (hal. 200,000 token para sa Haiku 4.5).

Bakit ito mahalaga? Dahil kung hindi magkasya ang isang dokumento sa window ng konteksto, hindi makikita ng modelo ang lahat ng ito nang magkasama. Hindi ka maaaring magbigay ng 500-pahinang kontrata sa kabuuan nito sa isang 200,000 na modelo ng token; Maaari mong hatiin ang dokumento sa mga bahagi (na maaaring mawala ang ugnayan sa pagitan ng mga bahagi) o pumili ng modelong may mas malawak na konteksto.

Babala: Hindi matalinong punan ang bawat dokumento dahil ito ay dahil lang sa malaki ang window ng konteksto. Kung mas maraming mga token ang inilalagay mo sa window, mas malaki ang babayaran mo, at kung minsan ay maaaring makaligtaan ng modelo ang mga gitnang detalye sa napakahabang mga teksto. Kadalasan ay mas mura at mas tumpak na ipadala lamang ang bahaging gumagana.

Ang Context Window ay isang Pamantayan ng Desisyon

Paghanap

Tinatayang kinakailangang konteksto

Angkop na antas

Maikling tugon sa email

ilang daang token

magaan ang timbang

Isang buod ng pahina

ilang libong token

Banayad/balanse

40-pahinang pagsusuri ng ulat

~30,000 token

Balanseng/malakas

300-pahinang pagsusuri sa kontrata

~250,000 token

Makapangyarihan na may malawak na konteksto

Iproseso ang daan-daang mga dokumento nang sabay-sabay

500,000+ token

Pinakamalawak na konteksto

Sinasagot ng talahanayang ito ang tanong na "aling modelo?" Ipinapakita nito na ang bahagi ng tanong ay direktang sinasagot ng laki ng dokumento. Sayang ang pagbili ng mamahaling modelo na may malaking konteksto para sa maiikling trabaho; Ang isang modelo na may maliit na window ay hindi sapat para sa malalaking dokumento.

Multimodality: Lampas sa Teksto

Ang multimodality ay ang kakayahan ng isang modelo na humawak ng maraming uri ng data (larawan, audio, minsan video), hindi lang text. "Modal" dito ay nangangahulugang "uri ng data"; multimodal ay nangangahulugang "maraming uri".

  • Text-only na modelo: Nagbabasa at nagsusulat lamang ng nakasulat na teksto.
  • Multimodal na modelo: Maaaring magbasa ng larawan ng isang bill, mag-interpret ng trend sa isang graph, mag-decode ng sulat-kamay na tala, minsan mag-transcribe ng voice recording.

Bakit ito mahalaga? Dahil ang katangian ng iyong negosyo ay maaaring mangailangan ng multimodality. Ang isang accounting team na kumukuha ng mga halaga mula sa mga larawan ng invoice, isang e-commerce team na nag-uuri ng mga larawan ng produkto, o isang insurance team na nagsusuri ng mga pinsalang larawan ay hindi maaaring gawin ang trabahong ito gamit ang isang modelo na nagbabasa lamang ng teksto. Mahalaga ang visual processing sa mga gawaing ito.

Tatlong Makatotohanang Kaso

Kaso 1 — Sorpresa sa halaga ng token. Ang isang content team ay nagpapadala rin sa modelo ng isang 20-pahinang dokumento na "gabay sa tatak" habang gumagawa sila ng bawat post sa blog. Ang gabay na ito ay humigit-kumulang 15,000 token. Gumagawa sila ng 2,000 artikulo sa isang buwan; Kaya ang pagpapadala lamang ng gabay nang paulit-ulit ay nangangahulugan ng 30 milyong mga token ng input. Sa pamamagitan ng pagpapaikli sa gabay at pagpapadala lamang ng nauugnay na seksyon (mga 2,000 token), binabawasan nila ang input sa ikapitong bahagi at makabuluhang binabawasan ang singil.

Kaso 2 — Hindi sapat ang window ng konteksto. Nais ng isang law firm na masuri ang isang 280-pahinang kasunduan sa pagsasanib. Ang unang modelo na sinubukan nila ay may binding na 200,000 token at hindi magkasya ang dokumento; Kapag napunit ang dokumento, hindi mapapansin ng modelo na ang isang artikulo sa unang seksyon ay sumasalungat sa isang artikulo sa huling seksyon. Kapag lumipat ito sa isang modelo na may 1 milyong token na konteksto, binabasa nito ang dokumento sa kabuuan at nahuhuli ang kontradiksyon. Dito direktang tinutukoy ng window ng konteksto ang katumpakan.

Kaso 3 — Multimodality ay kinakailangan. Nais ng isang kompanya ng seguro na gumawa ng isang paunang pagtatasa mula sa mga larawan ng pinsala sa sasakyan. Ito ay imposible sa isang modelo na nagbabasa lamang ng teksto; Ang isang multimodal na modelo na "nakikita" ang litrato ay kinakailangan. Kapag lumipat sila sa isang multimodal na modelo, nagtatag sila ng isang pre-screening system na halos nag-uuri sa lokasyon at kalubhaan ng pinsala sa larawan at nagdidirekta sa eksperto. Napansin nila, gayunpaman, na ang isang dalubhasa ng tao ang gumagawa ng pangwakas na desisyon; dahil ang modelo ay isang preliminary screening tool, hindi ang huling salita.

Mahina Prompt / Malakas na Prompt

Mahinang prompt:

Ibuod ang dokumentong ito. [napakahaba ng dokumentong na-paste]

Napakahusay na prompt:

Ibuod ang 40-pahinang ulat sa ibaba. Tantyahin muna ang tinatayang bilang ng mga token sa ulat at sabihin sa amin kung umaangkop ito sa loob ng window ng konteksto ng karaniwang balanseng modelo. Pagkatapos ay ibigay ang buod sa format na ito: 5-item executive summary + 3 mapanganib na natuklasan. Gamitin lamang ang impormasyon sa ulat; Markahan ang bahaging hindi ka sigurado bilang "hindi malinaw sa ulat". [ulat]

Ang malakas na prompt ay parehong may kaalaman sa token/konteksto at kinokontrol ang format at pagbe-verify ng output.

Mga Kopyadong Template

1. Hula ng token:

Tantyahin ang tinatayang bilang ng mga token para sa sumusunod na text at bigyang-kahulugan ito sa mga tuntunin ng halaga ng input: "[TEXT]". Bilugan ito ng kaunti, isinasaalang-alang na ito ay Turkish.

2. Pagsusuri sa availability ng konteksto:

Ang aking trabaho ay iproseso ang mga sumusunod na dokumento: average na [PAGES] ng [QTY] na mga dokumento bawat buwan. Anong window ng konteksto ang kailangan ng laki na ito? Alin sa magaan/balanseng/malakas na antas ang magiging sapat? Anong panganib ang lalabas kung kailangan itong lansagin?

3. Multimodality diagnosis:

Aking workflow: [DESCRIPTION]. Mayroon bang visual, audio o video processing sa stream na ito? Kung gayon, kailangan ba ng multimodal na modelo, o maaari ba itong i-convert sa text (OCR/transcription) at lutasin gamit ang text model? Ihambing ang mga kalamangan / kahinaan ng dalawang landas.

4. Pag-optimize ng konteksto:

Nagpapadala ako ng dokumento sa modelo sa bawat kahilingan, ngunit karamihan sa mga ito ay hindi kailangan. Paano ko kukunin ang mga bahagi na talagang kinakailangan para sa [TASK] mula sa dokumentong ito? Magmungkahi ng 3 kongkretong paraan upang bawasan ang input at ipahiwatig ang tinantyang pagtitipid sa token.

Mga karaniwang pagkakamali

  • Napagkakamalang token para sa isang salita: Ang Token ay iba sa isang salita; Ang invoice at kapasidad ay palaging nasa mga token, ang pagkalkula sa mga salita ay nakaliligaw.
  • Iniisip na ang window ng konteksto ay walang katapusan: Ang bawat modelo ay may limitasyon; Kung hindi magkasya ang dokumento, hindi makikita ng modelo ang kabuuan.
  • Paggamit ng hindi kinakailangang malaking konteksto: Pagbili ng mamahaling modelo na may malaking konteksto para sa isang maikling trabaho; o punan ang malalaking dokumento para sa bawat kahilingan at magbayad nang walang kabuluhan.
  • Ipagpalagay na multimodality: Hindi lahat ng modelo ay maaaring magproseso ng mga visual; Para sa visual na trabaho, magsimula nang hindi kinukumpirma na ang modelo ay multimodal.
  • Nakalimutan ang token load ng Turkish: Ang mga tekstong Turkish ay karaniwang gumagamit ng bahagyang mas maraming token para sa parehong kahulugan; hindi pinapansin ito sa pagtatantya ng gastos.

Sa buod

  • Ang token ay ang maliit na yunit kung saan pinoproseso ng modelo ang teksto; ang input at output ay sinusukat at ini-invoice nang hiwalay bilang mga token.
  • Ang window ng konteksto ay ang kabuuang mga token na maaaring isaisip ng modelo sa isang pagkakataon; Ang laki ng dokumento ay direktang nakakaapekto sa pagpili ng modelo.
  • Ang multimodality ay ang kakayahan ng modelo na magproseso ng data na hindi teksto tulad ng visual/audio; Ito ay mahalaga para sa mga visual na gawa.
  • Ang tatlong konseptong ito ay parehong may kaugnayan sa tanong na "aling modelo?" pati na rin ang "magkano ang halaga nito?" Ito ang nagiging batayan ng mga tanong.

Gawain ng aplikasyon

Pumili ng umuulit na gawain ng AI sa iyong negosyo. Ipakalkula sa unang template (token prediction) kung gaano karaming mga token ang karaniwang input sa gawaing ito. Pagkatapos ay tukuyin kung aling antas ang sapat sa template 2 (pagsusuri sa availability ng konteksto). Kung mayroon kang visual na trabaho, linawin kung kinakailangan ang isang multimodal na modelo gamit ang 3rd template (multimodality diagnosis). Gagamitin namin ang resultang pagtatantya ng token sa pagkalkula ng gastos ng susunod na yunit.

checklist

  • [ ] Alam ko ang konsepto ng token at kung paano halos tantiyahin kung gaano karaming mga token ang mayroon ang isang text.
  • [ ] Maaari kong ipaliwanag ang window ng konteksto gamit ang isang "talahanayan/memorya" na pagkakatulad.
  • [ ] Masusuri ko kung babagay ang isang dokumento sa isang modelo.
  • [ ] Makakapag-diagnose ako kapag mahalaga ang multimodality.
  • [ ] Isinasaalang-alang ko ang token overhead ng Turkish at ang halaga ng hindi kinakailangang konteksto.