Прибуток:
- Здатність пояснювати поняття токена, контекстного вікна та мультимодальності повсякденною мовою
- Діагностуйте, чи потребує завдання широкий контекст чи мультимодальність
- Здатність враховувати, як ці концепції впливають на вартість і вибір моделі
Наразі ми знайомі з постачальниками та типами моделей. Однак для правильного підбору моделі необхідно також розуміти, як моделі працюють «всередині»; тому що рішення про ціну, потужність і доступність базуються на трьох основних концепціях: маркер, вікно контексту та мультимодальність. Той, хто не знає цих понять, не може читати прайс-лист і запитувати себе: «Чи відповідатиме цей документ моделі?» не може відповісти на запитання та не може зрозуміти, коли візуальна обробка є важливою. До кінця цього розділу ви зможете пояснити ці три поняття повсякденною мовою, визначити, чи вимагає робота широкий контекст чи мультимодальність, і взяти до уваги їхній вплив на вартість.
Токен: одиниця, яка використовується моделлю замість Word
Моделі штучного інтелекту обробляють текст не слово за словом, а маленькими фрагментами, які називаються токенами. жетон; Це може бути слово, частина слова, розділовий знак або пробіл. Щоб зробити приблизний підрахунок: в англійській мові середній лексем складається з чотирьох символів, а 100 слів — це приблизно 130-150 токенів. У турецькій мові цей показник може бути трохи вищим через суфікси та довгі слова; Іншими словами, турецький текст з таким же значенням споживає трохи більше лексем, ніж англійський.
Чому це важливо знати? Тому що все тарифікується і вимірюється в жетонах. Текст (вхід), який ви надсилаєте в модель, і відповідь (вихід), створена моделлю, зараховуються як окремі маркери. І ваш рахунок, і місткість моделі вказуються в жетонах.
Порада. Щоб отримати приблизну оцінку кількості токенів у тексті, розділіть кількість символів на чотири. Електронний лист із 4000 символів – це приблизно 1000 токенів. У турецькій мові припускайте, що трохи вище, щоб бути в безпеці.
Контекстне вікно: "Короткочасна пам'ять" моделі
Контекстне вікно — це загальна кількість токенів, які модель може зберігати в пам’яті одночасно. Введення та вихід мають збігатися в цьому вікні. Подумайте про це як про кількість паперу, яку ви можете розкласти на столі за один раз: папір, який не поміщається на столі, у цей момент знаходиться поза вашим полем зору.
Якщо контекстне вікно моделі становить 200 000 токенів, це дорівнює приблизно 150 000 слів або кільком книгам середнього розміру. 1 мільйон токенів може обробляти набагато більші документи в цілому. Деякі потужні моделі сьогодні (наприклад, Claude Opus 4.8 і Sonnet 5) пропонують 1 мільйон контекстів токенів, тоді як легкі моделі часто мають менші вікна (наприклад, 200 000 токенів для Haiku 4.5).
Чому це важливо? Тому що, якщо документ не поміщається в контекстному вікні, модель не зможе побачити його весь разом. Ви не можете надати повністю 500-сторінковий контракт моделі з 200 000 токенів; Ви або розділяєте документ на частини (що може втратити зв’язок між частинами), або вибираєте модель із ширшим контекстом.
Застереження: нерозумно заповнювати кожен документ, тому що контекстне вікно велике. Чим більше токенів ви покладете у вікно, тим більше ви заплатите, і іноді модель може пропускати середні деталі в дуже довгих текстах. Часто дешевше і точніше відправити лише ту частину, яка працює.
Контекстне вікно є критерієм прийняття рішення
Квест
Приблизний необхідний контекст
Відповідний рівень
Коротка відповідь електронною поштою
кілька сотень жетонів
легкий
Резюме на одній сторінці
кілька тисяч жетонів
Легкий/збалансований
Аналіз звіту на 40 сторінках
~30 000 токенів
Збалансований/сильний
Огляд контракту на 300 сторінок
~250 000 токенів
Потужний із широким контекстом
Обробляйте сотні документів одночасно
500 000+ токенів
Найширший контекст
Ця таблиця відповідає на питання "яка модель?" Це показує, що на частину запитання відповідає безпосередньо розмір документа. Для коротких робіт марно купувати дорогу модель з великим контекстом; Для великих документів модель з маленьким віконцем не підходить.
Мультимодальність: вихід за межі тексту
Мультимодальність — це здатність моделі обробляти декілька типів даних (зображення, аудіо, іноді відео), а не лише текст. «Модальний» тут означає «тип даних»; мультимодальний означає «багато видів».
- Лише текстова модель: читає та записує лише письмовий текст.
- Мультимодальна модель: може прочитати фотографію купюри, інтерпретувати тенденцію на графіку, декодувати рукописну нотатку, іноді транскрибувати голосовий запис.
Чому це важливо? Оскільки характер вашого бізнесу може вимагати мультимодальності. Команда бухгалтерів, яка витягує суми із зображень рахунків-фактур, група електронної комерції, яка класифікує фотографії продуктів, або група страхування, яка оцінює фотографії пошкоджень, не можуть виконати цю роботу з моделлю, яка лише читає текст. Для виконання цих завдань важлива візуальна обробка.
Три реалістичні випадки
Випадок 1 — Сюрприз вартості токена. Команда контенту також надсилає моделі 20-сторінковий документ «бренд-гід» під час створення кожної публікації в блозі. Цей посібник містить близько 15 000 токенів. Вони випускають 2000 статей на місяць; Тож лише надсилання посібника знову й знову означає 30 мільйонів токенів введення. Скоротивши гайд і відправивши лише відповідний розділ (близько 2000 токенів), вони зменшують введення до однієї сьомої та значно зменшують рахунок.
Випадок 2 — контекстного вікна недостатньо. Юридична фірма хоче переглянути 280-сторінкову угоду про злиття. Перша модель, яку вони спробували, мала прив’язку 200 000 токенів, і документ не підходив; Коли документ розривається, модель не може помітити, що стаття в першому розділі суперечить статті в останньому розділі. Коли він перемикається на модель з 1 мільйоном контексту токенів, він читає документ загалом і вловлює протиріччя. Тут контекстне вікно безпосередньо визначає точність.
Випадок 3 — мультимодальність є обов’язковою. Страхова компанія хоче зробити попередню оцінку на основі фотографій пошкоджень автомобіля. Це неможливо з моделлю, яка лише читає текст; Потрібна мультимодальна модель, яка «бачить» фотографію. Коли вони переходять на мультимодальну модель, вони встановлюють систему попередньої перевірки, яка приблизно класифікує місце та серйозність пошкодження на фотографії та направляє експерта. Однак вони зазначають, що остаточне рішення приймає людина-експерт; оскільки модель є інструментом попереднього відбору, а не остаточним словом.
Слабка підказка / Сильна підказка
Слабка підказка:
Узагальніть цей документ. [вставлено надто довгий документ]
Потужна підказка:
Узагальніть 40-сторінковий звіт нижче. Спочатку оцініть приблизну кількість токенів у звіті та повідомте нам, чи підходить вона до вікна контексту типової збалансованої моделі. Потім надайте резюме в такому форматі: резюме з 5 пунктів + 3 ризиковані висновки. Використовувати лише інформацію у звіті; Позначте ту частину, у якій ви не впевнені, як «незрозуміло у звіті». [доповідь]
Потужна підказка підтримує маркер/контекст і контролює формат і можливість перевірки виводу.
Шаблони, які можна копіювати
1. Прогноз токенів:
Оцініть приблизну кількість токенів для наступного тексту та інтерпретуйте це в термінах вартості введення: "[ТЕКСТ]". Трохи округліть, враховуючи, що вона турецька.
2. Перевірка доступності контексту:
Моя робота полягає в обробці таких документів: у середньому [PAGES] з [QTY] документів на місяць. Яке контекстне вікно вимагає цього розміру? Який з легких/збалансованих/сильних рівнів буде достатнім? Який ризик виникає, якщо його потрібно демонтувати?
3. Мультимодальна діагностика:
Мій робочий процес: [ОПИС]. Чи відбувається обробка зображення, аудіо чи відео в цьому потоці? Якщо так, чи потрібна багатомодальна модель, чи її можна перетворити на текст (OCR/транскрипція) і вирішити за допомогою текстової моделі? Порівняйте переваги та недоліки двох шляхів.
4. Оптимізація контексту:
З кожним запитом я надсилаю моделі документ, але більшість із них непотрібні. Як мені витягти з цього документа ті частини, які насправді потрібні для [ЗАВДАННЯ]? Запропонуйте 3 конкретні способи зменшення вкладення та вкажіть приблизну економію токенів.
Поширені помилки
- Прийнявши лексему за слово: Лексема відрізняється від слова; Рахунок-фактура та потужність завжди в жетонах, розрахунок словами вводить в оману.
- Вважаючи, що контекстне вікно нескінченне: кожна модель має обмеження; Якщо документ не поміщається, модель не може побачити весь.
- Використання непотрібного великого контексту: купівля дорогої моделі з великим контекстом для короткої роботи; або заповнювати величезні документи на кожен запит і платити даремно.
- Припускаючи мультимодальність: не кожна модель може обробляти візуальні ефекти; Для візуальної роботи почніть без підтвердження того, що модель мультимодальна.
- Забувши про навантаження лексем у турецькій мові: турецькі тексти зазвичай споживають трохи більше лексем для того самого значення; ігноруючи це в оцінці вартості.
Підсумовуючи
- Токен — це маленький блок, у якому модель обробляє текст; вхідні та вихідні дані вимірюються та виставляються окремо як жетони.
- Контекстне вікно — це загальна кількість токенів, які модель може зберігати в пам’яті одночасно; розмір документа безпосередньо впливає на вибір моделі.
- Мультимодальність — це здатність моделі обробляти нетекстові дані, такі як візуальні/аудіо; Це необхідно для візуальних робіт.
- Ці три поняття стосуються питання "яка модель?" а також «скільки це коштує?» Він становить основу запитань.
Аплікаційне завдання
Виберіть повторюване завдання AI у вашому бізнесі. Нехай 1-й шаблон (прогнозування маркерів) обчислить, скільки маркерів є типовим введенням у цьому завданні. Потім визначте, якого рівня достатньо за допомогою шаблону 2 (перевірка доступності контексту). Якщо у вас візуальна робота, уточніть, чи потрібна мультимодальна модель, з 3-м шаблоном (діагностика мультимодальності). Ми використаємо отриману оцінку символів у розрахунку вартості наступного блоку.
контрольний список
- [ ] Я знаю концепцію лексем і те, як приблизно оцінити, скільки лексем містить текст.
- [ ] Я можу пояснити контекстне вікно за допомогою аналогії "таблиця/пам'ять".
- [ ] Я можу оцінити, чи підійде документ до моделі.
- [ ] Я можу діагностувати, коли важлива мультимодальність.
- [ ] Я беру до уваги накладні витрати на токени турецької мови та вартість непотрібного контексту.