Прибыль:
- Может спроектировать, как системная подсказка будет вести модель на протяжении всего разговора.
- Понимает роль и влияние адаптивного мышления и параметров усилий на стоимость.
- реализует элементы управления выводом, такие как max_tokens, стоп-последовательности и структурированный вывод.
Два разных продукта одной и той же модели могут вести себя совершенно по-разному. Разница не в самой модели, а в системной подсказке и заданных ей параметрах. Системное приглашение — это «рабочий контракт» модели, а параметры — «рабочие настройки». В этом модуле вы узнаете, как создать мощную системную подсказку, что делают настройки мышления и усилий в современных моделях и как контролировать формат/длину вывода. Правильная настройка этих параметров позволяет одновременно управлять и качеством, и стоимостью.
Системная подсказка: постоянная директива модели
Системное приглашение — это инструкция высокого уровня, которая применяется на протяжении всего разговора. Эти правила остаются действительными независимо от того, что вводит пользователь. Хорошая системная подсказка включает в себя следующие компоненты:
- Роль/идентичность: Кто является моделью? («Вы помощник корпоративной службы поддержки».)
- Область действия и границы: что он делает и чего не делает? («Основываясь только на предоставленном политическом документе».)
- Правила формата: как должен выглядеть результат? («Максимум 3 статьи, официальный язык.»)
- Поведение в условиях неопределенности: что делать, если человек не уверен? («Если информации нет, добудьте ее, направьте в соответствующее подразделение».)
- Безопасность/конфиденциальность: Чего не хочет/не хочет? («Запросить персональные данные.»)
Совет: оставьте системное приглашение неизменным. Не встраивайте информацию, которая меняется при каждом запросе (текущая дата, имя пользователя, идентификатор сеанса). Это нарушает согласованность и делает недействительным кэш подсказок в модуле 6. Поместите информацию о переменной в сообщение пользователя.
Ловушка чрезмерно агрессивных инструкций
Современные модели очень четко следуют инструкции. Агрессивные фразы типа «ДОЛЖЕН», «ВСЕГДА», «ОБЯЗАТЕЛЬНО сделайте это» и т. д., которые работали в старых моделях, сегодня приводят к перезапуску: модель вызывает агента, когда он не нужен или работает неоправданно долго. Смягчите правило: вместо «ОБЯЗАТЕЛЬНО использовать инструмент поиска» более точным будет «Если ответа нет в разговоре, используйте инструмент поиска».
Параметры модели: мысль и усилие
Классические LLM имели температурный параметр: более низкое значение давало более конкретный/постоянный результат, более высокое значение давало более разнообразный/творческий результат. Модели современного поколения (такие как Opus 4.8, Sonnet 5) заменяют этот подход двумя более мощными механизмами и больше не принимают такие параметры выборки, как температура.
- Адаптивное мышление: модель шаг за шагом рассуждает в своей «голове», прежде чем ответить. Модель решает, сколько думать, исходя из сложности задачи. Значительно повышает точность решения сложных многоэтапных задач; Он меньше думает, чтобы избежать ненужных задержек в простых вопросах.
- Усилие: ручка высокого уровня, которая регулирует, насколько глубоко модель погружается в задачу и сколько жетонов она тратит в общей сложности. Типичные уровни: низкий, средний, высокий и выше. Большие усилия могут улучшить качество, но они также увеличивают задержки и затраты; Низкие усилия обеспечивают скорость и экономию.
Настройка
Что значит
когда
Отключить размышления/небольшие усилия
Быстро, дешево, поверхностно
Простая классификация, быстрый ответ, задачи, чувствительные к задержке
Адаптивное мышление + средние усилия
Сбалансированное качество/стоимость
Большинство задач общего назначения
Адаптивное мышление + большие усилия
высочайшая точность
Сложные рассуждения, кодирование, работа агентов дальнего действия.
Внимание: рефлекс «максимальное усилие несмотря ни на что» увеличивает затраты. Подстраивайте усилия под задачу; В простых задачах небольшие усилия часто дают тот же точный результат по гораздо более низкой цене. Поднимитесь выше, где необходима критическая точность.
Управление выводом: формат, длина, структура
Помимо параметров, вы также управляете самим выводом:
- max_tokens: жесткий потолок вывода (1-й и 3-й блоки).
- Последовательности остановки: остановка модели, когда она видит определенную строку. Полезно для установки точек останова в структурированном производстве.
- Структурированный вывод: приведите ответ модели в соответствие с предоставленной вами схемой JSON. Это гарантирует, что выходные данные программно анализируются и действительны. Это надежнее, чем сказать «просто верните JSON» с подсказкой.
{ "output_config": { "format": { "type": "json_schema", "schema": { "type": "object", "additionalProperties": false, "properties": { "category": { "type": "string", "enum": ["счет", "технический", "возврат", "другое"] }, "urgency": { "type": "string", "enum": ["низкий", "средний", "высокий"] } }, "required": ["категория", "срочность"] } } }}
Копируемые шаблоны системных подсказок
# Помощник по корпоративной поддержке. Вы являетесь помощником по корпоративной поддержке.- Полагайтесь исключительно на предоставленный политический документ; Если ее нет в документе, скажите «У меня нет этой информации». - Дайте формальный и четкий ответ максимум в 3 предложениях. - Запросите персональные данные (номер TC ID, номер карты) и не повторяйте их в ответе. - Если вы не уверены, не гадайте.
# Классификатор структурированного вывода Вы являетесь классификатором спроса. Входные данные — сообщение клиента. Возвращайте только запрошенные поля, не пишите комментарии. Если вы не уверены, используйте «другое».
# Аналитик с определенным поведением в условиях неопределенности. Вы аналитик данных. Делайте из представленной таблицы только проверяемые выводы. Никогда не делайте выводов, которых нет в данных. Если вывод неясен, напишите «данных недостаточно».
# Автор контента с контролем тона и длины. Вы — автор контента. Используйте теплый, но профессиональный тон. Ограничьте каждый текст 120 словами или меньше. Избегайте клише маркетингового языка.
Слабая подсказка / Сильная подсказка
# СЛАБЫЕ Будьте полезны и давайте хорошие ответы. Делайте все возможное.
# СИЛЬНАЯ Роль: Специалист технической поддержки. Объем: Предоставляется только руководство по продукту. Формат: Пошаговый, нумерованный список, максимум 5 шагов. Ограничение: Рекомендовать решение, которого нет в руководстве; Скажите: «Я не смог найти это в руководстве». Конфиденциальность: не повторяйте серийный номер, указанный пользователем в ответе.
Мощная версия; Он отдельно определяет роль, объем, формат, границы и конфиденциальность. Согласованность вывода напрямую зависит от этой ясности.
Три мини-кейса
Случай 1 — Снижение затрат за счет корректировки усилий. Одна команда проводила все свои звонки, прилагая большие усилия и обдумывая; Даже простые дайджесты электронной почты были дорогими и медленными в изготовлении. Они назначили простые задачи, такие как подведение итогов, для небольших усилий, а анализ контрактов — для высоких. Точность была сохранена, средняя задержка сократилась вдвое, а ежемесячные расходы сократились на треть.
Случай 2 — гарантия JSON. Операционная группа запросила выходные данные классификации с подсказкой «просто дайте JSON», но модель иногда писала «Вот результат:», и анализатор аварийно завершал работу. Когда я подключил настроенную схему вывода, каждый раз вывод возвращал действительный JSON; ошибки синтаксического анализа были сброшены.
Случай 3 — Агрессивная быстрая отдача. Подсказка помощника гласила: «НУЖНО искать КАЖДЫЙ ВОПРОС»; Модель делала ненужные поиски даже по простым вопросам, на которые уже знала ответ, замедляя и увеличивая затраты. Они смягчили правило: «Если ответ не в контексте, ищите»; Количество ненужных звонков сократилось на 70%, а ответы ускорились.
Распространенные ошибки
- Внедрение переменных данных в системную подсказку: нарушает согласованность и делает кэш недействительным.
- Чрезмерно агрессивная инструкция: чрезмерное срабатывание и ненужные затраты в современных моделях.
- Большие усилия при выполнении каждой задачи: растрата при выполнении простых задач; приспосабливать усилия к задаче.
- Запрос JSON только через приглашение: иногда он ломается; если это критично, используйте структурированный вывод.
- Отсутствие определения границ/неопределенности поведения: модель заполняет пробел выдумкой (галлюцинацией).
- Старая «температурная» привычка: современные модели этого не допускают; Направляйте поведение быстро и с усилием.
Глубже: написание приглашения как контракта
Опытные команды относятся к системной подсказке как к контракту, а не как к литературному тексту: четкие положения, измеримые правила, недвусмысленные границы. Этот подход имеет три конкретных преимущества. Во-первых, это последовательность: одни и те же входные данные дают одинаковый результат в разное время. Во-вторых, это проверяемость: вы можете протестировать каждый элемент отдельно на образце. В-третьих, простота обслуживания: если поведение неправильное, вы знаете, какой элемент заменить.
Хорошая практика – подавать положительные примеры. Вместо того, чтобы предоставлять список «не делайте этого», в современных моделях гораздо эффективнее предоставить пример, в котором говорится: «Именно так выглядит желаемый результат». Например, в классификаторе добавление в приглашение одного или двух образцов ожидаемого JSON значительно снижает количество ошибок форматирования.
Еще один мощный метод — явно описать поведение неопределенности. Такое предложение, как «Если не уверены, не предполагайте; скажите «недостаточно данных»» подавляет склонность модели заполнять пробелы выдумкой (галлюцинацией). Это единственное предложение разгружает уровень проверки, который мы рассмотрим в модуле 11: как только модель уже отметила неопределенность, становится легче провести проверку человеком.
Наконец, вместе обдумайте усилия и подскажите. При больших усилиях модель исследует больше и иногда выполняет нежелательную «дополнительную работу» (ненужные объяснения, дополнительные предложения). Сказав в подсказке «дайте только желаемый результат, не добавляйте дополнительные комментарии», компенсируется этот побочный эффект больших усилий.
В итоге
Системное приглашение — это постоянная директива модели: оно определяет роль, область действия, формат, скрытность и конфиденциальность. В современных моделях поведение определяется адаптивным мышлением и параметрами усилий, а не температурой; Согласование усилий с задачей позволяет одновременно управлять качеством и затратами. Вы защищаете вывод с помощью max_tokens, стоп-массивов и структурированного вывода.
Задача приложения
Выберите задачу. (1) Напишите системное приглашение, состоящее из пяти компонентов (роль, область действия, формат, двусмысленность, конфиденциальность). (2) Укажите, какой уровень усилий вы бы выбрали для выполнения этой задачи и почему. (3) Если вывод должен быть структурирован, нарисуйте небольшую схему JSON. (4) Проверьте, нет ли в вашем подсказке чрезмерно агрессивного шаблона, и смягчите его.
контрольный список
- [ ] Я могу назвать пять составляющих хорошей системной подсказки.
- [ ] Я могу объяснить, что делают параметры адаптивного мышления и усилий.
- [ ] Я могу сбалансировать качество и стоимость, регулируя усилия в соответствии с задачей.
- [ ] Я знаю, почему структурированный вывод безопаснее, чем запрос JSON через приглашение.
- [ ] Я могу признать риск в современных моделях чрезмерно агрессивных инструкций.