одиниця 10 / 10

Наскрізна програма: оцінка, перевірка, етика та межі

Прибуток:

  • Можливість налаштувати невеликий тестовий набір (eval), який оцінює модель за вашими власними даними
  • Вбудуйте перевірку людиною, обмеження та політику відповідального використання в робочий процес
  • Розпізнавати галюцинації, конфіденційність та етичні ризики та вживати заходів для пом’якшення

Ви вибрали правильну модель; Чи зроблено роботу? Ні, справжня робота починається зараз. Впровадження моделі у ваш бізнес зводиться до перевірки її на основі ваших власних даних, перевірки результатів і відповідального формування. Цей останній розділ перетворює весь модуль на наскрізну програму: ви дізнаєтесь, як налаштувати невеликий набір тестів (eval), вбудувати перевірку людиною в робочий процес, керувати галюцинаціями та ризиками конфіденційності, а також встановити етичні межі. Після того, як пристрій буде закінчено, ви зможете не тільки вибрати модель, але й з упевненістю ввести його в експлуатацію.

Оцінка (Eval): тестування за допомогою власних даних

Тепер ви знаєте, що лише ваші фактичні дані, а не оголошення, можуть визначити, чи підходить модель вашому бізнесу. Щоб виміряти це, створіть набір оцінок (eval): невелику колекцію зразків із вашої роботи, для яких відома правильна відповідь.

Простий eval налаштовується так:

  1. Зберіть 10-30 реальних зразків. Вибирайте вхідні дані, типові для вашої роботи (поєднуйте важкі та легкі).
  2. Визначте «правильний/очікуваний результат» для кожного прикладу. Що б відповів експерт?
  3. Проведіть кандидатів через однакові приклади. Протестуйте моделі, які ви порівнюєте, одну за одною з одним набором.
  4. Оцініть результати. У скількох прикладах це правда? Де він помилився? Чи допустимі помилки?
  5. Порівнюйте і вибирайте. Вибирайте не найвищий загальний бал, а той, який є найнадійнішим у найбільш критичних для вас прикладах.
Порада: не довіряйте сліпо таблицям лідерів. Модель може займати перше місце в усьому світі, але працювати гірше, ніж модель, що посідає друге місце у ваших конкретних турецьких правових текстах. Ваша власна оцінка 20 зразків коштує більше, ніж сотні публічних тестів.

Галюцинація: найпідступніший ризик моделі

Галюцинація — це коли модель видає інформацію, яка насправді не відповідає дійсності, впевненою мовою. Замість того, щоб сказати «Я не знаю», модель може створити неіснуючий законодавчий акт, вигадану статистику або фальшиву дату; Причому робить це надзвичайно переконливою мовою. Це найнебезпечніший аспект ШІ, оскільки помилка маскується під правду.

Ви не можете повністю усунути галюцинацію, але можете зменшити її і зловити:

  • Базуйтеся на джерелі: попросіть модель створити відповіді з наданих вами документів, а не з власної «пам’яті» (логіка RAG).
  • Джерела запиту: Скажіть: «Поруч із кожною претензією напишіть документ/розділ, на якому вона базується»; Якщо він не може вказати джерело, будьте підозрілі.
  • Змусити людей сказати, що вони не впевнені: інструкція «Якщо ви не впевнені, напишіть «незрозуміло»» зменшує підгонку моделі.
  • Перевірка людиною: критичні результати має перевіряти людина.
Застереження. Ніколи не використовуйте результати моделі без перевірки для юридичних, медичних чи фінансових рішень. «Стаття закону» або «інформація про дозу», створена моделлю, може бути повністю сфабрикованою. У цих областях ШІ є чернеткою/попереднім інструментом; Останнє слово завжди за компетентною людиною.

Вимоги до перевірки людиною

Штучний інтелект найкраще працює як інструмент, який прискорює роботу людей, а не позбавляє їх роботи. Правильне налаштування виглядає наступним чином: створює або попередньо перевіряє проект моделі; людина переглядає, виправляє та затверджує. Наскільки суворою повинна бути перевірка, залежить від вартості помилки.

Квест

Вартість помилки

перевірка людиною

Проект опису товару

низький

Вибіркового контролю достатньо

Відповідь клієнта електронною поштою

середній

Огляд перед поданням

Аналіз контрактного ризику

висока

Постатейне експертне підтвердження

Медичні/фінансові консультації

дуже високий

Повна експертна перевірка, лише підтримка AI

Ця таблиця встановлює баланс між «перевіркою кожного виводу вручну» та «неперевіркою взагалі». У той час як вибірковий контроль є достатнім для робіт з низькою вартістю, кожен результат повинен бути перевірений для робіт з високою вартістю.

Етичне та відповідальне використання

Хоча вибір моделі може здатися технічним рішенням, за ним стоїть етична відповідальність:

  • Прозорість: повідомляйте своїм клієнтам або співробітникам, що ви використовуєте ШІ у відповідних місцях. Клієнт має право знати, чи розмовляє він з людиною чи ШІ.
  • Зміщення: моделі можуть успадкувати зміщення від даних, на яких вони навчаються. Контролюйте справедливість результатів у делікатних сферах, таких як підбір персоналу та кредитна оцінка.
  • Конфіденційність: вбудуйте в робочий процес принципи захисту даних, які ви вивчали в блоці 8; Не надсилайте особисті дані необачно.
  • Підзвітність: коли сталася помилка, захисту «ШІ зробив це» недостатньо. Відповідальність несе установа, яка використовує транспортний засіб. Тож процеси перевірки документів.
Порада: впишіть невелику «політику відповідального використання» у свій робочий процес: для яких завдань можна використовувати штучний інтелект, які дані не можна надсилати, хто їх перевірятиме та як повідомлятиметься про помилки. Цей односторінковий документ запобігає серйозним проблемам у майбутньому.

Три реалістичні випадки

Випадок 1 — Жаль без встановлення оцінки. Страхова команда починає підсумовувати претензії без тестування найпопулярнішої моделі. Через два тижні вони зрозуміли, що модель часто помиляється в турецьких технічних термінах і невірно читає деякі суми. Коли вони встановлюють оцінку з 20 зразків і порівнюють три моделі, вони переходять на модель, яка не є найпопулярнішою, але більш точною в турецьких технічних текстах. Втрата: два тижні та коректорська робота. Урок: спочатку eval, потім розгорнути.

Випадок 2 — Процес, який фіксує галюцинацію. Помічник юриста бачить у зразку роздруківки посилання на «рішення Верховного суду». Оскільки їх процес має правило «перевіряти кожне посилання», він шукає рішення та виявляє, що такого рішення не існує; Він вигадав модель. Завдяки людській перевірці сфабрикована інформація ніколи не доходить до клієнта. Без правила перевірки втрата репутації могла бути серйозною.

Випадок 3 — Довіра з прозорістю. Компанія електронної комерції створює відповіді служби підтримки клієнтів за допомогою ШІ, але додає примітку під кожною відповіддю: «Цю відповідь було підготовлено за допомогою штучного інтелекту та переглянуто одним із наших представників». Клієнти більше задоволені як швидкою реакцією, так і впевненістю, коли бачать, що людина залучена. Прозорість – це не слабкість, яку потрібно приховувати, а джерело довіри.

Слабка підказка / Сильна підказка: результат, який можна перевірити

Слабка підказка:

Розкажіть мені про ризикові пункти цього контракту.

Підходить під модель; немає джерела, немає ознак невизначеності.

Потужна підказка:

Ваша роль: контрактний аналітик (остаточне рішення за юристом). Завдання: виділіть потенційно ризиковані пункти в наступному контракті. Для кожного висновку: (1) номер пункту та дослівна цитата, (2) чому це ризиковано, (3) ваш рівень впевненості (високий/середній/низький). Покладайтеся лише на речення в тексті; Не вигадуй нічого, чого немає в тексті. Якщо ви не впевнені, напишіть «потрібне підтвердження юриста». [контракт]

Надійна підказка пов’язує кожну заяву з джерелом (номер статті + цитування), вимагає рівня достовірності та забороняє фабрикацію; Це робить галюцинацію уловлюваною.

Шаблони, які можна копіювати

1. Оцінка сценографії:

Створіть набір оцінок для наступного завдання [ЗАВДАННЯ]. Запропонуйте 15 зразків вхідних даних (змішаних легких-середніх-складних), як буде визначено «очікуваний правильний результат» для кожного, і визначте критерій оцінки (1-5).

2. Обгортання для зменшення галюцинацій:

Перепишіть наступну підказку, щоб зменшити виготовлення: "[PROMPT]". Додайте правила цитування джерел, визначення рівнів надійності та «скажи мені, якщо ти не впевнений».

3. Дизайн потоку перевірки:

У наведеному нижче робочому процесі [WORKFLOW] Розробіть етап перевірки людиною для результату ШІ. Визначте, наскільки суворою має бути перевірка на основі вартості помилки; напишіть хто що перевірить коли.

4. Розробити політику відповідального використання:

Створіть одну сторінку «політики відповідального використання штучного інтелекту» для команди в [ГАЛУЗІ]. Додайте такі заголовки: дозволене використання, заборонені дані, відповідальність за перевірку, звіт про прозорість, звіт про помилки.

Поширені помилки

  • Розгортання без Eval: запуск моделі без її тестування з вашими власними даними та помічення помилок після того, як вони відображені в клієнті/завданні.
  • Покладаючись на галюцинації: використання впевненої мови моделі як істини без перевірки посилань.
  • Обхід перевірки людиною: вихід не перевіряється у дороговартісних рішеннях; Спираючись на захист «ШІ зробив це».
  • Уникайте прозорості: приховуйте використання ШІ; відчувати втрату впевненості, коли це відбувається.
  • Ігнорування етики та упередженості: використання делікатних рішень (наймання, кредитування) без моніторингу справедливості результату.

Підсумовуючи

  • Перед розгортанням моделі створіть невеликий набір оцінок із вашими власними даними та протестуйте кандидатів; загальний рейтинг не відображає ваш бізнес.
  • Галюцинація — це впевнене продукування моделлю фальшивих слів; Зафіксовано за допомогою атрибуції джерела, рівня довіри та перевірки людиною.
  • Суворість перевірки людиною регулюється відповідно до вартості помилки; У критичних областях ШІ є лише підтримкою, рішення приймає людина.
  • Прозорість, контроль упередженості, конфіденційність і підзвітність; це чотири стовпи відповідального використання ШІ. Політика однієї сторінки запобігає серйозним ризикам.

Аплікаційне завдання

Налаштуйте оцінювальний набір із 15 прикладів із шаблоном 1 у цьому розділі (eval set design) для моделі-кандидата, яку ви вибрали протягом усього модуля, і порівняйте принаймні дві моделі з цим набором. Потім розробіть спосіб перевірки результатів людьми за допомогою шаблону 3 (потік перевірки) і накресліть односторінкову політику для вашої команди за допомогою шаблону 4 (політика відповідального використання). Ці три результати перетворюють весь модуль у дієвий план розгортання.

контрольний список

  • [ ] За допомогою власних даних я можу створити невеликий набір оцінок і порівняти моделі.
  • [ ] Я можу розпізнавати галюцинації та застосовувати заходи пом'якшення та зупинки.
  • [ ] Я можу налаштувати суворість перевірки людиною на основі вартості помилки.
  • [ ] Я можу впровадити принципи прозорості, упередженості, конфіденційності та підзвітності в робочий процес.
  • [ ] Я можу скласти одну сторінку політики відповідального використання ШІ.

Модульний екзамен

1. Яка різниця між «постачальником» ШІ та «сімейством моделей»?

  • A) Постачальник — це компанія, яка розробляє модель, а сімейство моделей — це група моделей цієї компанії під брендом ✔
  • B) Це те саме і використовується як взаємозамінний
  • C) Постачальник – ціна моделі, сімейство моделей – швидкість моделі.
  • D) Сімейство моделі відноситься до компанії, постачальник відноситься до однієї версії моделі

Опис: постачальником є компанія, яка розробила модель (наприклад, Anthropic); Сімейство моделей — це модельна група, яку ця компанія збирає під брендом (наприклад, Claude). Модельна версія – це окрема версія в сімействі.

2. Як найбільш точно можна визначити «ваги» моделі?

  • A) Це кількість жетонів, які модель може виробляти за хвилину
  • B) Це мільярди числових параметрів, які модель вивчає під час навчання та зберігає свою інформацію. ✔
  • C) Це щомісячна абонентська плата моделі
  • D) Це кількість мов, які підтримує модель

Опис: ваги - це мільярди числових параметрів, які модель вивчає під час навчання; Тут зберігається «все, що знає модель». Розрізнення закритих/явних ваг залежить від того, чи можна завантажити та запустити ці параметри.

3. Яке твердження є правильним щодо «відкритого коду» та «відкритого коду»?

  • A) Це абсолютно однакові поняття, і обидві дають необмежене комерційне використання
  • B) Відкрита вага завжди робить дані тренувань загальнодоступними
  • В) Це не одне й те саме; У відкритому зважуванні зазвичай використовуються лише параметри, а умови ліцензії можуть обмежувати комерційне використання ✔
  • D) Моделі з відкритим кодом не можна завантажити, відкриті моделі ваги можна завантажити

Пояснення: у відкритому зважуванні спільно використовуються лише параметри моделі; навчальні дані та процес часто не розголошуються, а деякі ліцензії обмежують комерційне використання. Отже, «відкрита вага» не зовсім те саме, що «відкритий код».

4. Що з наведеного нижче є найбільш вирішальною модельною характеристикою для юридичної групи, яка читає та аналізує довгострокові контракти?

  • A) Найнижча ціна токена
  • B) Наявність здатності до візуальної (мультимодальної) обробки
  • C) Наявність ліцензії на відкриту вагу
  • D) Наявність широкого контекстного вікна ✔

Пояснення: моделі потрібне велике контекстне вікно для обробки довгих документів у цілому; Контекстне вікно — це загальна кількість токенів, які модель може зберігати в пам’яті одночасно.

5. Що вірно щодо ціноутворення токенів для закритих моделей ваги?

  • A) Вихідний токен зазвичай значно дорожчий, ніж вхідний токен ✔
  • B) Вхід і вихід завжди однакові
  • C) Стягується лише фіксована щомісячна плата, сума використання не має значення
  • D) Вхідний токен завжди у багато разів дорожчий за вихідний

Пояснення: ціна розраховується за токен, а вихідний токен, який створює модель, зазвичай у кілька разів дорожчий, ніж вхідний токен, який ви надсилаєте. Тому довгі та непотрібні роздруківки швидко збільшують витрати.

6. Яка функція в моделі є важливою для бухгалтерської групи, яка хоче автоматично отримувати дані із зображень рахунків-фактур?

  • A) Максимально широке контекстне вікно
  • B) Мультимодальність (здатність візуальної обробки) ✔
  • C) Ліцензія на відкриту вагу
  • Г) Найвищий рівень аргументації

Пояснення: щоб зрозуміти візуальний вміст, модель повинна мати можливість обробляти зображення, а також текст, тобто вона має бути мультимодальною. Мультимодальність — це здатність моделі обробляти кілька типів даних, таких як текст, зображення та іноді аудіо.

7. Який вибір є найбільш логічним для великого, простого завдання (наприклад, позитивна/негативна класифікація тисяч відгуків)?

  • A) Завжди найсильніша та найдорожча модель аргументації
  • Б) Модель, яка працює тільки на відкритій вазі і на своєму сервері
  • В) Легка і недорога модель, тому що завдання просте, а обсяг великий ✔
  • D) Модель із найширшим контекстним вікном

Опис: легка недорога модель справляється з простими завданнями великого обсягу; Використання найпотужнішої і дорогої моделі створює тут зайві витрати. Правильний підхід полягає в тому, щоб зіставити складність завдання з рівнем моделі.

8. Що ініціює надсилання тексту, що містить персональні дані, іноземному постачальнику ШІ з точки зору KVKK?

  • A) Це не створює жодної юридичної відповідальності
  • B) Має значення лише якщо постачальник знаходиться в ЄС, ні в якому іншому випадку
  • C) Це суворо заборонено за будь-яких обставин, незалежно від того, чи є дані анонімними чи ні
  • Г) Передача даних за кордон розглядається та регулюється спеціальними умовами КВКК ✔

Пояснення: Операційні дані на серверах постачальника за кордоном вважаються «передачею даних за кордон» і підпадають під дію особливих умов KVKK щодо цього питання (таких як явна згода, рішення щодо адекватності, відповідні гарантії).

9. Що робить режим «обґрунтування» моделі та як він впливає на вартість?

  • A) Це підвищує точність складних проблем, але збільшує вартість і затримку, оскільки генерує більше токенів ✔
  • B) Завжди робить модель вільною
  • C) Збільшує лише кількість мов, які підтримує модель
  • D) Завжди скорочуйте відповіді та зменшуйте вартість

Опис: режим міркування дозволяє моделі «подумати» крок за кроком, перш ніж дати відповідь; Це підвищує точність у багатоетапних і складних задачах, але також збільшує вартість і затримку, оскільки генерує більше токенів.

10. Який підхід є найнадійнішим при оцінці (оцінці) моделі для власного бізнесу?

  • А) Просто вибрати найпопулярнішу модель і використовувати її без тестування
  • Б) Створіть невеликий тестовий набір власних реальних завдань і порівняйте з ним моделі ✔
  • C) Просто дивлячись на контрольний показник, згаданий у рекламі
  • D) Автоматично приймати модель із найвищим контекстним вікном як найкращу

Пояснення: замість того, щоб сліпо покладатися на таблиці лідерів, створіть невеликий тестовий набір власних реальних завдань і порівняйте моделі в цьому наборі, щоб виявити ту, яка справді підходить вашому бізнесу.

11. Як знання про те, що вихідні дані моделі можуть містити «галюцинації», впливає на ваш робочий процес?

  • A) Вихід завжди слід вважати правильним і публікувати безпосередньо
  • B) Галюцинації спостерігаються лише в безкоштовних моделях, а не в платних
  • C) У критичних рішеннях вихідні дані повинні бути перевірені людиною, а джерела мають бути підтверджені ✔
  • Г) Галюцинацію можна повністю усунути, просто змінивши модель

Пояснення: галюцинація — це коли модель видає інформацію, яка насправді не відповідає дійсності, впевненою мовою. Через цей ризик необхідна перевірка вихідних даних людиною, особливо для юридичних, медичних і фінансових рішень.

12. Яка основна логіка підходу «модельного портфеля», прийнятого зрілими установами?

  • A) Щоб забезпечити простоту, виконуючи кожну роботу однією найдорожчою моделлю.
  • B) Використання лише найдешевшої моделі та повне ігнорування якості
  • В) Не використовуйте жодних моделей і виконуйте всю роботу вручну
  • D) Оптимізація витрат і зменшення залежності від одного провайдера шляхом використання різних моделей відповідно до завдання ✔

Опис: портфоліо моделей передбачає використання різних моделей відповідно до завдання: дешева модель для простих і громіздких робіт, потужна модель для складних робіт, відкрита модель/регіональна модель для конфіденційних даних. Це оптимізує витрати та зменшує залежність від одного постачальника.

13. Чому країна походження та політика збереження даних можуть бути критерієм вибору моделі?

  • A) Оскільки це безпосередньо впливає на нормативні вимоги, вимоги до суверенітету даних і конфіденційності ✔
  • Б) Тільки тому, що він визначає швидкість відгуку моделі
  • C) Оскільки він визначає формати файлів, які підтримує модель
  • Г) Тому що це не має практичного ефекту, це лише маркетингова деталь

Опис: Країна, де знаходиться розробник моделі та де/скільки даних зберігається; Це має вирішальне значення з точки зору правового регулювання, суверенітету даних і конфіденційності. Наприклад, для організації, яка хоче розмістити в ЄС, регіональний постачальник або опція нульового зберігання стає важливою.

14. Що найкраще пояснює, чому пошук «єдиної найкращої моделі» в завданні вводить в оману?

  • A) Усі моделі фактично мають однакові можливості
  • B) Моделі міцні в різних розмірах, тому «найкращий» залежить від вимог роботи ✔
  • C) Найдорожча модель автоматично є найкращою у кожному завданні
  • D) Вибір моделі має бути абсолютно випадковим

Опис: моделі сильні за різними вимірами, такими як швидкість, вартість, контекст, мультимодальність, конфіденційність і міркування. Модель, яка є лідером за одним виміром, може бути слабкою за іншим; тому «найкращий» завжди залежить від вимог роботи.