Печалби:
- Способност за обяснение на понятията токен, контекстен прозорец и мултимодалност на ежедневния език
- Диагностицирайте дали дадена задача изисква широк контекст или мултимодалност
- Способност да се вземе предвид как тези концепции влияят на разходите и избора на модел
Засега сме запознати с доставчиците и типовете модели. Въпреки това, за правилния избор на модел е необходимо също така да се разбере как моделите работят "вътре"; тъй като решенията за цена, капацитет и наличност разчитат на три основни концепции: токен, контекстен прозорец и мултимодалност. Някой, който не познава тези концепции, не може да прочете ценовата листа и да се чуди "ще пасне ли този документ на модела?" не може да отговори на въпроса и не може да види кога визуалната обработка е от съществено значение. До края на този модул ще можете да обясните тези три понятия на ежедневен език, да диагностицирате дали дадена работа изисква широк контекст или мултимодалност и да вземете предвид тяхното въздействие върху разходите.
Токен: единица, използвана от модела вместо Word
Моделите с изкуствен интелект обработват текст не дума по дума, а на малки части, наречени токени. жетон; Може да бъде дума, част от дума, препинателен знак или интервал. За да направите грубо изчисление: на английски един среден токен е около четири знака, а 100 думи са около 130-150 токена. В турски този процент може да е малко по-висок поради суфикси и дълги думи; С други думи, турски текст със същото значение консумира малко повече токени от английския.
Защо е важно да знаете това? Защото всичко се таксува и измерва в жетони. Текстът (вход), който изпращате към модела, и отговорът (изход), произведен от модела, се броят като отделни токени. Както вашата фактура, така и капацитетът на модела са в жетони.
Съвет: За да получите приблизителна оценка за това колко токени съдържа даден текст, разделете броя на знаците на четири. Имейл от 4000 знака е приблизително 1000 токена. На турски приемете малко по-високо, за да останете на сигурно място.
Прозорец на контекста: „Краткосрочна памет“ на модела
Контекстният прозорец е общото количество токени, които моделът може да има предвид в даден момент. Входът и изходът трябва да пасват заедно в този прозорец. Мислете за това като за количеството хартия, което можете да разстелете върху масата наведнъж: Хартията, която не се побира на масата, е извън вашето зрително поле в този момент.
Ако контекстният прозорец на модела е 200 000 токена, това се равнява на приблизително 150 000 думи или няколко средно големи книги. 1 милион токени могат да обработват много по-големи документи като цяло. Някои мощни модели днес (напр. Claude Opus 4.8 и Sonnet 5) предлагат 1 милион символни контекста, докато олекотените модели често идват с по-малки прозорци (напр. 200 000 токена за Haiku 4.5).
Защо е важно? Защото, ако даден документ не се побира в контекстния прозорец, моделът не може да го види всички заедно. Не можете да дадете договор от 500 страници в неговата цялост на модел с 200 000 токена; Или разделяте документа на части (което може да загуби връзката между частите), или избирате модел с по-широк контекст.
Внимание: Не е разумно да попълвате всеки документ, тъй като е просто защото контекстният прозорец е голям. Колкото повече жетони поставите в прозореца, толкова повече плащате и понякога моделът може да пропусне средните детайли в много дълги текстове. Често е по-евтино и по-точно да изпратите само частта, която работи.
Контекстният прозорец е критерий за вземане на решение
Мисия
Приблизителен необходим контекст
Подходящо ниво
Кратък имейл отговор
няколкостотин жетона
лек
Резюме на една страница
няколко хиляди жетона
Лек/балансиран
Анализ на доклада от 40 страници
~30 000 токена
Балансиран/силен
300 страници преглед на договора
~250 000 токена
Мощен с широк контекст
Обработвайте стотици документи наведнъж
500 000+ токена
Най-широк контекст
Тази таблица отговаря на въпроса "кой модел?" Това показва, че част от въпроса се отговаря директно от размера на документа. Загуба е да купувате скъп модел с голям контекст за кратки работни места; Модел с малък прозорец е неподходящ за големи документи.
Мултимодалност: излизане отвъд текста
Мултимодалността е способността на модела да обработва множество типове данни (изображение, аудио, понякога видео), а не само текст. „Модален“ тук означава „тип данни“; мултимодален означава "много видове".
- Модел само с текст: Чете и пише само писмен текст.
- Мултимодален модел: Може да разчете снимка на банкнота, да интерпретира тенденция на графика, да декодира ръкописна бележка, понякога да транскрибира гласов запис.
Защо е важно? Тъй като естеството на вашия бизнес може да изисква мултимодалност. Счетоводен екип, който извлича суми от изображения на фактури, екип за електронна търговия, който класифицира снимки на продукти, или застрахователен екип, който оценява снимки на щети, не може да свърши тази работа с модел, който чете само текст. Визуалната обработка е от съществено значение за тези задачи.
Три реалистични случая
Случай 1 — Изненада на цената на токена. Екип по съдържание също изпраща на модела документ от 20 страници „ръководство за марката“, докато създава всяка публикация в блога. Това ръководство съдържа около 15 000 жетона. Те произвеждат 2000 статии на месец; Така че самото изпращане на ръководството отново и отново означава 30 милиона въведени символа. Съкращавайки ръководството и изпращайки само съответния раздел (около 2000 жетона), те намаляват входа до една седма и значително намаляват сметката.
Случай 2 — Контекстният прозорец не е достатъчен. Адвокатска кантора иска да бъде прегледано споразумение за сливане от 280 страници. Първият модел, който опитаха, имаше обвързване от 200 000 жетона и документът не пасна; Когато документът е разкъсан, моделът не може да забележи, че статия в първия раздел противоречи на член в последния раздел. Когато превключи към модел с контекст от 1 милион символи, той чете документа като цяло и улавя противоречието. Тук контекстният прозорец директно определя точността.
Случай 3 — Мултимодалността е задължителна. Застрахователна компания иска да направи предварителна оценка от снимки на щетите на автомобила. Това е невъзможно с модел, който чете само текст; Необходим е мултимодален модел, който "вижда" снимката. Когато преминат към мултимодален модел, те създават система за предварителен преглед, която грубо класифицира местоположението и тежестта на щетите в снимката и насочва експерта. Те обаче отбелязват, че човешкият експерт взема окончателното решение; защото моделът е инструмент за предварителен скрининг, а не последната дума.
Слаба подкана / Силна подкана
Слаба подкана:
Обобщете този документ. [поставен твърде дълъг документ]
Мощна подкана:
Обобщете доклада от 40 страници по-долу. Първо преценете приблизителния брой токени в отчета и ни кажете дали се вписва в контекстния прозорец на типичен балансиран модел. След това дайте резюмето в този формат: резюме от 5 елемента + 3 рискови констатации. Използвайте само информацията в отчета; Маркирайте частта, в която не сте сигурни, като „не е ясно в отчета“. [доклад]
Мощната подкана е съобразена с токен/контекст и контролира формата и възможността за проверка на изхода.
Копируеми шаблони
1. Токен прогноза:
Оценете приблизителния брой токени за следния текст и го интерпретирайте от гледна точка на входната цена: „[ТЕКСТ]“. Закръглете го малко, като вземете предвид, че е турско.
2. Проверка на наличността на контекста:
Моята работа е да обработвам следните документи: средно [PAGES] от [QTY] документи на месец. Какъв контекстен прозорец изисква този размер? Кое от нивата на светлина/балансирано/силно би било достатъчно? Какъв риск възниква, ако трябва да бъде демонтиран?
3. Мултимодална диагностика:
Моят работен процес: [ОПИСАНИЕ]. Има ли визуална, аудио или видео обработка в този поток? Ако е така, необходим ли е мултимодален модел или може да бъде преобразуван в текст (OCR/транскрипция) и решен с текстовия модел? Сравнете предимствата и недостатъците на двата пътя.
4. Оптимизация на контекста:
Изпращам документ на модела при всяка заявка, но повечето са ненужни. Как да извлека частите, които действително са необходими за [TASK] от този документ? Предложете 3 конкретни начина за намаляване на входа и посочете очакваните спестявания на жетони.
Често срещани грешки
- Сбъркане на токен с дума: Токенът е различен от дума; Фактурата и капацитетът винаги са в жетони, изчисляването с думи е подвеждащо.
- Мисля, че контекстният прозорец е безкраен: Всеки модел има ограничение; Ако документът не се побира, моделът не може да види целия.
- Използване на ненужен голям контекст: Закупуване на скъп модел с голям контекст за кратка работа; или попълвайте огромни документи за всяка заявка и плащайте напразно.
- Ако приемем мултимодалност: Не всеки модел може да обработва визуални изображения; За визуална работа започнете, без да потвърждавате, че моделът е мултимодален.
- Забравяйки натоварването на лексемите на турския: турските текстове обикновено консумират малко повече лексеми за същото значение; пренебрегвайки това при оценката на разходите.
В обобщение
- Токенът е малка единица, в която моделът обработва текст; входът и изходът се измерват и фактурират отделно като жетони.
- Контекстният прозорец е общият брой токени, които моделът може да има предвид в даден момент; Размерът на документа пряко влияе върху избора на модел.
- Мултимодалността е способността на модела да обработва нетекстови данни като визуални/аудио; Той е от съществено значение за визуални произведения.
- Тези три понятия са свързани с въпроса "кой модел?" както и „колко струва?“ Той формира основата на въпросите.
Задача за приложение
Изберете повтаряща се AI задача във вашия бизнес. Накарайте първия шаблон (предсказание на токени) да изчисли колко токена е типичен вход в тази задача. След това определете кое ниво е достатъчно с шаблон 2 (проверка на наличността на контекста). Ако имате визуална работа, изяснете дали е необходим мултимодален модел с 3-тия шаблон (диагностика на мултимодалност). Ще използваме получената оценка на токена при изчисляването на разходите на следващата единица.
контролен списък
- [ ] Знам концепцията за токен и как грубо да преценя колко токена има един текст.
- [ ] Мога да обясня контекстния прозорец с аналогия "таблица/памет".
- [ ] Мога да преценя дали даден документ ще се впише в модел.
- [ ] Мога да диагностицирам кога мултимодалността е от съществено значение.
- [ ] Вземам под внимание символичните режийни разходи на турски и цената на ненужния контекст.