Прибыль:
- Способность объяснить концепции токена, контекстного окна и мультимодальности на повседневном языке.
- Диагностируйте, требует ли задача широкого контекста или мультимодальности.
- Способность учитывать, как эти концепции влияют на стоимость и выбор модели.
На данный момент мы знакомы с поставщиками и типами моделей. Однако для правильного выбора модели необходимо также понимать, как модели работают «внутри»; поскольку решения о цене, емкости и доступности основаны на трех основных концепциях: токене, контекстном окне и мультимодальности. Тот, кто не знаком с этими понятиями, не сможет прочитать прайс-лист и задаться вопросом: «Подойдет ли этот документ к модели?» не может ответить на вопрос и не видит, когда необходима визуальная обработка. К концу этого модуля вы сможете объяснить эти три понятия повседневным языком, определить, требует ли работа широкого контекста или мультимодальности, и принять во внимание их влияние на стоимость.
Токен: единица измерения, используемая моделью вместо слова.
Модели искусственного интеллекта обрабатывают текст не слово за словом, а небольшими кусочками, называемыми токенами. жетон; Это может быть слово, часть слова, знак препинания или пробел. Чтобы сделать приблизительный подсчет: в английском языке средний токен составляет около четырех символов, а 100 слов — это около 130-150 токенов. В турецком языке этот показатель может быть немного выше из-за длинных слов и суффиксов; Другими словами, турецкий текст с тем же значением потребляет немного больше токенов, чем английский.
Почему это важно знать? Потому что все тарифицируется и измеряется в жетонах. Текст (ввод), который вы отправляете в модель, и ответ (выход), создаваемый моделью, считаются отдельными токенами. И ваш счет, и мощность модели указаны в токенах.
Совет: Чтобы получить приблизительную оценку количества токенов в тексте, разделите количество символов на четыре. Электронное письмо длиной 4000 символов составляет примерно 1000 токенов. По-турецки, на всякий случай предположите немного выше.
Контекстное окно: «Кратковременная память» модели.
Контекстное окно — это общее количество токенов, которые модель может хранить одновременно. Ввод и вывод должны соответствовать друг другу в этом окне. Думайте об этом как о количестве бумаги, которое вы можете разложить на столе: бумага, которая не помещается на столе, в этот момент находится вне вашего поля зрения.
Если контекстное окно модели составляет 200 000 токенов, это соответствует примерно 150 000 слов или нескольким книгам среднего размера. 1 миллион токенов в целом может обрабатывать гораздо более крупные документы. Некоторые мощные модели сегодня (например, Claude Opus 4.8 и Sonnet 5) предлагают 1 миллион контекстов токенов, тогда как легкие модели часто имеют меньшие окна (например, 200 000 токенов для Haiku 4.5).
Почему это важно? Потому что если документ не помещается в контекстное окно, модель не сможет увидеть его целиком. Вы не можете полностью передать 500-страничный контракт модели на 200 000 токенов; Вы либо делите документ на части (при этом связь между частями может потеряться), либо выбираете модель с более широким контекстом.
Внимание: нецелесообразно заполнять каждый документ только потому, что контекстное окно велико. Чем больше токенов вы кладете в окно, тем больше платите, а иногда модель может пропускать средние детали в очень длинных текстах. Часто дешевле и точнее отправить только ту часть, которая работает.
Контекстное окно — это критерий принятия решения
Квест
Примерный требуемый контекст
Соответствующий уровень
Короткий ответ по электронной почте
несколько сотен жетонов
легкий
Резюме на одной странице
несколько тысяч жетонов
Легкий/сбалансированный
Анализ отчета на 40 страниц
~30 000 токенов
Сбалансированный/сильный
Обзор контракта на 300 страниц
~250 000 токенов
Мощный с широким контекстом
Обрабатывайте сотни документов одновременно
500 000+ жетонов
Самый широкий контекст
Данная таблица отвечает на вопрос «какая модель?» Это показывает, что часть вопроса напрямую зависит от размера документа. Покупать дорогую модель с большим контекстом для коротких работ — расточительство; Модель с маленьким окном не подходит для больших документов.
Мультимодальность: выходя за рамки текста
Мультимодальность — это способность модели обрабатывать несколько типов данных (изображение, аудио, иногда видео), а не только текст. «Модальный» здесь означает «тип данных»; мультимодальный означает «много видов».
- Модель только для текста: читает и записывает только письменный текст.
- Мультимодальная модель: может читать фотографию счета, интерпретировать тенденцию на графике, декодировать рукописную заметку, иногда расшифровывать голосовую запись.
Почему это важно? Потому что характер вашего бизнеса может требовать мультимодальности. Команда бухгалтеров, которая извлекает суммы из изображений счетов, команда электронной коммерции, которая классифицирует фотографии продуктов, или команда страховщиков, которая оценивает фотографии повреждений, не могут выполнить эту работу с моделью, которая читает только текст. Визуальная обработка важна для этих задач.
Три реалистичных случая
Случай 1. Неожиданная стоимость токена. Команда по контенту также отправляет модели 20-страничный документ «Руководство по бренду» при создании каждого поста в блоге. Это руководство стоит около 15 000 токенов. Они производят 2000 статей в месяц; Таким образом, просто отправка руководства снова и снова означает 30 миллионов входных токенов. Сокращая руководство и отправляя только соответствующий раздел (около 2000 токенов), они сокращают ввод до одной седьмой и значительно уменьшают счет.
Случай 2. Контекстного окна недостаточно. Юридическая фирма хочет провести рассмотрение 280-страничного соглашения о слиянии. Первая опробованная модель имела привязку в 200 000 токенов и документ не подходил; Когда документ разорван, модель не может заметить, что статья в первом разделе противоречит статье в последнем разделе. Когда он переключается на модель с контекстом в 1 миллион токенов, он читает документ целиком и улавливает противоречие. Здесь контекстное окно напрямую определяет точность.
Случай 3. Мультимодальность обязательна. Страховая компания хочет провести предварительную оценку по фотографиям повреждений транспортного средства. Это невозможно с моделью, которая читает только текст; Требуется мультимодальная модель, которая «видит» фотографию. При переходе на мультимодальную модель устанавливается система предварительной проверки, которая примерно классифицирует место и тяжесть повреждений на фотографии и направляет эксперта. Однако они отмечают, что окончательное решение принимает человек-эксперт; потому что модель — это инструмент предварительного отбора, а не последнее слово.
Слабая подсказка/Сильная подсказка
Слабая подсказка:
Кратко изложите этот документ. [вставлен слишком длинный документ]
Мощная подсказка:
Кратко изложите 40-страничный отчет ниже. Сначала оцените приблизительное количество токенов в отчете и сообщите нам, вписывается ли оно в контекстное окно типичной сбалансированной модели. Затем дайте резюме в следующем формате: резюме из 5 пунктов + 3 рискованных вывода. Используйте только информацию из отчета; Отметьте ту часть отчета, в которой вы не уверены, как «непонятную». [отчет]
Мощное приглашение учитывает как маркеры, так и контекст, а также контролирует формат и проверяемость вывода.
Копируемые шаблоны
1. Прогнозирование токена:
Оцените приблизительное количество токенов для следующего текста и интерпретируйте его с точки зрения входной стоимости: «[ТЕКСТ]». Немного округлите, учитывая, что оно турецкое.
2. Проверка доступности контекста:
Моя работа заключается в обработке следующих документов: в среднем [СТРАНИЦ] [КОЛИЧЕСТВО] документов в месяц. Какое контекстное окно требуется для этого размера? Какой из легких/сбалансированных/сильных уровней будет достаточным? Какой риск возникает, если его необходимо демонтировать?
3. Мультимодальная диагностика:
Мой рабочий процесс: [ОПИСАНИЕ]. Есть ли в этом потоке визуальная, аудио или видео обработка? Если да, то требуется ли мультимодальная модель или ее можно преобразовать в текст (OCR/транскрипция) и решить с помощью текстовой модели? Сравните плюсы и минусы двух путей.
4. Оптимизация контекста:
Я отправляю документ модели с каждым запросом, но большая часть этого ненужна. Как мне извлечь из этого документа части, которые действительно необходимы для [ЗАДАЧИ]? Предложите 3 конкретных способа сокращения затрат и укажите предполагаемую экономию токенов.
Распространенные ошибки
- Принятие токена за слово: токен отличается от слова; Счет-фактура и мощность всегда указываются в жетонах, расчет словами вводит в заблуждение.
- Думая, что контекстное окно бесконечно: у каждой модели есть предел; Если документ не умещается, модель не сможет увидеть все целиком.
- Использование ненужного большого контекста: Покупка дорогой модели с большим контекстом для короткой работы; или заполнять огромные документы по каждому запросу и платить зря.
- Предполагая мультимодальность: не каждая модель может обрабатывать визуальные эффекты; Визуальную работу начните без подтверждения того, что модель мультимодальна.
- Забываем о токенах турецкого языка: турецкие тексты обычно используют немного больше токенов для того же значения; игнорируя это при оценке стоимости.
В заключение
- Токен — это небольшая единица, в которой модель обрабатывает текст; ввод и вывод измеряются и выставляются отдельно в виде токенов.
- Окно контекста — это общее количество токенов, которые модель может хранить одновременно; Размер документа напрямую влияет на выбор модели.
- Мультимодальность — это способность модели обрабатывать нетекстовые данные, такие как визуальные/аудио; Это необходимо для визуальных работ.
- Обе эти три концепции имеют отношение к вопросу «какая модель?» а также «сколько это стоит?» Это составляет основу вопросов.
Задача приложения
Выберите повторяющуюся задачу ИИ в своем бизнесе. Попросите первый шаблон (прогнозирование токенов) вычислить, сколько токенов является типичным вводом в этой задаче. Затем определите, какой уровень достаточен с помощью шаблона 2 (проверка доступности контекста). Если у вас визуальная работа, уточните, нужна ли мультимодальная модель с помощью 3-го шаблона (диагностика мультимодальности). Полученную оценку токена мы будем использовать при расчете стоимости следующей единицы.
контрольный список
- [ ] Я знаю концепцию токена и знаю, как примерно оценить, сколько токенов содержится в тексте.
- [ ] Я могу объяснить контекстное окно аналогией «таблица/память».
- [ ] Я могу оценить, вписывается ли документ в модель.
- [ ] Я могу диагностировать, когда мультимодальность необходима.
- [ ] Я учитываю накладные расходы на турецкий язык и стоимость ненужного контекста.