Јединица 5 / 10

Токен, контекстни прозор и мултимодалност: како функционише ум модела

Добици:

  • Способност да се у свакодневном језику објасне концепти токена, контекстног прозора и мултимодалности
  • Дијагностикујте да ли задатак захтева широк контекст или мултимодалност
  • Способност да се узме у обзир како ови концепти утичу на цену и избор модела

До сада смо упознати са добављачима и типовима модела. Међутим, за прави избор модела потребно је разумети и како модели функционишу „изнутра“; јер се одлуке о цени, капацитету и доступности ослањају на три основна концепта: токен, контекстни прозор и мултимодалност. Неко ко не познаје ове концепте не може да прочита ценовник и да се запита „да ли ће овај документ одговарати моделу?“ не може да одговори на питање и не види када је визуелна обрада неопходна. До краја ове јединице, моћи ћете да објасните ова три концепта свакодневним језиком, да дијагностикујете да ли посао захтева широк контекст или мултимодалност и да узмете у обзир њихов утицај на цену.

Токен: Јединица коју користи модел уместо речи

Модели вештачке интелигенције обрађују текст не реч по реч, већ у малим деловима који се називају токени. Токен; То може бити реч, део речи, знак интерпункције или размак. Да направимо грубу калкулацију: На енглеском, просечан токен је око четири знака, а 100 речи је око 130-150 токена. На турском, ова стопа може бити нешто виша због суфикса и дугих речи; Другим речима, турски текст са истим значењем троши нешто више лексема него енглески.

Зашто је ово важно знати? Јер све се наплаћује и мери у жетонима. Текст (унос) који шаљете моделу и одговор (излаз) произведен од стране модела се рачунају као одвојени токени. И ваша фактура и капацитет модела су у токенима.

Савет: Да бисте добили грубу процену колико токена има текст, поделите број знакова са четири. Е-маил од 4.000 знакова је отприлике 1.000 токена. На турском, претпоставите мало више да бисте остали на сигурној страни.

Контекстни прозор: „Краткорочно памћење“ модела

Прозор контекста је укупна количина токена које модел може имати на уму у једном тренутку. Улаз и излаз морају стати заједно у овај прозор. Замислите то као количину папира коју можете одједном да ставите на сто: папир који не стане на сто је у том тренутку изван вашег видног поља.

Ако је контекстни прозор модела 200.000 токена, то је једнако отприлике 150.000 речи или неколико књига средње величине. 1 милион токена може да обради много веће документе у целини. Неки моћни модели данас (нпр. Цлауде Опус 4.8 и Сонет 5) нуде 1 милион контекста токена, док лаки модели често долазе са мањим прозорима (нпр. 200.000 токена за Хаику 4.5).

Зашто је то важно? Јер ако се документ не уклапа у контекстни прозор, модел не може видети све заједно. Не можете дати уговор од 500 страница у целости моделу од 200.000 токена; Документ можете или поделити на делове (који могу изгубити везу између делова) или одабрати модел са ширим контекстом.

Опрез: Није мудро попуњавати сваки документ јер је то само зато што је прозор контекста велики. Што више жетона ставите у прозор, више плаћате, а понекад моделу могу недостајати средњи детаљи у веома дугим текстовима. Често је јефтиније и тачније послати само део који ради.

Прозор контекста је критеријум одлуке

Куест

Приближан потребан контекст

Одговарајући ниво

Кратак одговор е-поштом

неколико стотина жетона

лагана

Резиме на једној страници

неколико хиљада жетона

Лагано/уравнотежено

Анализа извештаја на 40 страна

~30,000 токена

Уравнотежено/снажно

Преглед уговора на 300 страница

~250,000 токена

Моћан са широким контекстом

Обрадите стотине докумената одједном

500.000+ токена

Најшири контекст

Ова табела одговара на питање "који модел?" То показује да се на део питања директно одговара величина документа. Узалуд је куповати скуп модел са великим контекстом за кратке послове; Модел са малим прозором је неадекватан за велике документе.

Мултимодалност: превазилажење текста

Мултимодалност је способност модела да рукује више врста података (слика, аудио, понекад и видео), а не само текст. "Модал" овде значи "тип података"; мултимодални значи „много врста“.

  • Модел само за текст: Чита и пише само писани текст.
  • Мултимодални модел: Може читати фотографију рачуна, тумачити тренд на графикону, декодирати руком писану белешку, понекад транскрибовати гласовни снимак.

Зашто је то важно? Јер природа вашег пословања може захтевати мултимодалност. Рачуноводствени тим који издваја износе из слика фактура, тим за е-трговину који класификује фотографије производа или тим за осигурање који процењује фотографије оштећења не може да уради овај посао са моделом који само чита текст. Визуелна обрада је неопходна за ове задатке.

Три реална случаја

Случај 1 — Токен кошта изненађење. Тим за садржај такође шаље моделу документ „водича за бренд“ од 20 страница док праве сваки пост на блогу. Овај водич има око 15.000 жетона. Они производе 2.000 артикала месечно; Дакле, само слање водича изнова и изнова значи 30 милиона токена уноса. Скраћивањем водича и слањем само релевантног одељка (око 2.000 токена), они смањују унос на једну седмину и значајно смањују рачун.

Случај 2 — Контекстни прозор није довољан. Адвокатска фирма жели да се ревидира уговор о спајању на 280 страница. Први модел који су испробали имао је повез од 200.000 жетона и документ се није уклапао; Када се документ поцепа, модел не може приметити да је чланак у првом одељку у супротности са чланом у последњем одељку. Када се пређе на модел са контекстом од 1 милион токена, он чита документ као целину и ухвати контрадикцију. Овде контекстни прозор директно одређује тачност.

Случај 3 — Мултимодалност је неопходна. Осигуравајућа компанија жели да направи прелиминарну процену на основу фотографија оштећења возила. Ово је немогуће са моделом који само чита текст; Потребан је мултимодални модел који "види" фотографију. Када пређу на мултимодални модел, успостављају систем претходног скрининга који грубо класификује локацију и тежину оштећења на фотографији и усмерава стручњака. Међутим, примећују да коначну одлуку доноси стручњак за људе; јер је модел прелиминарни алат за скрининг, а не коначна реч.

Слаба порука / јака промпт

Слабо обавештење:

Сумирајте овај документ. [предугачак документ залепљен]

Снажан упит:

Сумирајте извештај од 40 страница у наставку. Прво процените приближан број токена у извештају и реците нам да ли се уклапа у оквир контекста типичног уравнотеженог модела. Затим дајте резиме у овом формату: резиме од 5 ставки + 3 ризична налаза. Користите само информације у извештају; Означите део за који нисте сигурни као „није јасан у извештају“. [извештај]

Моћни промпт је свестан и токена/контекста и контролише формат и проверљивост излаза.

Цопиабле Темплатес

1. Предвиђање токена:

Процените приближан број токена за следећи текст и протумачите ово у смислу цене уноса: „[ТЕКСТ]“. Заокружите мало, узимајући у обзир да је турски.

2. Провера доступности контекста:

Мој посао је да обрађујем следеће документе: просечно [ПАГЕС] од [КТИ] докумената месечно. Који контекстни прозор захтева ова величина? Који од светлих/уравнотежених/јаких нивоа би био довољан? Какав ризик настаје ако је потребно демонтирати?

3. Мултимодална дијагноза:

Мој ток рада: [ОПИС]. Да ли у овом стриму постоји визуелна, аудио или видео обрада? Ако јесте, да ли је потребан мултимодални модел или се може конвертовати у текст (ОЦР/транскрипција) и решити помоћу текстуалног модела? Упоредите предности/против ова два пута.

4. Оптимизација контекста:

Уз сваки захтев шаљем документ моделу, али већина је непотребна. Како да из овог документа издвојим делове који су заиста потребни за [ТАСК]? Предложите 3 конкретна начина за смањење уноса и наведите процењене уштеде токена.

Уобичајене грешке

  • Погрешка лексема за реч: Токен се разликује од речи; Фактура и капацитет су увек у токенима, рачунање речима је погрешно.
  • Мислити да је контекстни прозор бесконачан: сваки модел има ограничење; Ако се документ не уклапа, модел не може да види целину.
  • Коришћење непотребног великог контекста: Куповина скупог модела са великим контекстом за кратак посао; или попуните огромна документа за сваки захтев и џабе платите.
  • Под претпоставком мултимодалности: Не може сваки модел да обрађује визуелне елементе; За визуелни рад, почните без потврђивања да је модел мултимодалан.
  • Заборављање на количину лексема на турском: турски текстови углавном троше нешто више лексема за исто значење; игноришући ово у процени трошкова.

Укратко

  • Токен је мала јединица у којој модел обрађује текст; улаз и излаз се мере и фактуришу одвојено као токени.
  • Прозор контекста је укупан број токена које модел може имати на уму у једном тренутку; величина документа директно утиче на избор модела.
  • Мултимодалност је способност модела да обрађује нетекстуалне податке као што су визуелни/аудио; Неопходан је за визуелна дела.
  • Оба ова три концепта су релевантна за питање "који модел?" као и "колико то кошта?" Она чини основу питања.

Задатак апликације

Изаберите задатак вештачке интелигенције који се понавља у свом послу. Нека 1. шаблон (предвиђање токена) израчуна колико је токена типичан унос у овом задатку. Затим одредите који ниво је довољан са шаблоном 2 (провера доступности контекста). Ако имате визуелни посао, разјасните да ли је потребан мултимодални модел са 3. шаблоном (дијагноза мултимодалности). Користићемо резултујућу процену токена у прорачуну трошкова следеће јединице.

контролна листа

  • [ ] Знам појам токена и како да грубо проценим колико токена има текст.
  • [ ] Прозор контекста могу да објасним аналогијом „табела/меморија“.
  • [ ] Могу да проценим да ли ће се документ уклопити у модел.
  • [ ] Могу да дијагностикујем када је мултимодалност неопходна.
  • [ ] Узимам у обзир наметну вредност турског језика и цену непотребног контекста.