единица 10 / 10

Приложение от край до край: оценка, валидиране, етика и граници

Печалби:

  • Възможност за създаване на малък тестов набор (eval), който оценява модел с вашите собствени данни
  • Вградете човешка проверка, ограничения и политика за отговорно използване в работния процес
  • Разпознайте халюцинациите, неприкосновеността на личния живот и етичните рискове и приложете смекчаващи мерки

Избрали сте правилния модел; Свършена ли е работата? Не, истинската работа започва сега. Поставянето на модел във вашия бизнес се свежда до тестването му спрямо вашите собствени данни, валидиране на изхода му и отговорно рамкиране. Тази последна единица превръща целия модул в приложение от край до край: ще научите как да настроите малък пакет от тестове (eval), да вградите човешка проверка в работния процес, да управлявате халюцинации и рискове за поверителност и да начертаете етични граници. След като устройството бъде завършено, вие ще сте подготвени не само да изберете модел, но и да го пуснете в експлоатация с увереност.

Оценка (Eval): Тестване с вашите собствени данни

Сега знаете, че само вашите действителни данни, а не реклами, могат да разберат дали даден модел пасва на вашия бизнес. Начинът да измерите това е да създадете набор за оценка (eval): малка колекция от образци от вашата работа, за които е известен правилният отговор.

Проста оценка се настройва по следния начин:

  1. Съберете 10-30 реални проби. Изберете входове, които са типични за вашата работа (комбинирайте трудни и лесни).
  2. Определете "правилния/очакван резултат" за всеки пример. Какво би отговорил един експерт?
  3. Прекарайте кандидатите през същите примери. Тествайте моделите, които сравнявате един по един с един и същ комплект.
  4. Оценете резултатите. В колко примера е вярно? Къде сгреши? Допустими ли са грешките?
  5. Сравнете и изберете. Изберете не най-високия общ резултат, а този, който е най-надежден в най-критичните за вас примери.
Съвет: Не се доверявайте сляпо на класациите. Един модел може да се класира на първо място в световен мащаб, но да се представи по-лошо от модела на второ място във вашите конкретни турски правни текстове. Вашата собствена оценка на 20 проби струва повече от стотици публични тестове.

Халюцинация: Най-коварният риск на модела

Халюцинация е, когато моделът произвежда информация, която всъщност не е вярна, на уверен език. Вместо да каже „не знам“, моделът може да създаде несъществуващ законодателен акт, измислена статистика или фалшива дата; Освен това той прави това на изключително убедителен език. Това е най-опасният аспект на ИИ, защото грешката се маскира като истина.

Не можете напълно да премахнете халюцинацията, но можете да я намалите и да я хванете:

  • Базирайте го на източника: Помолете модела да генерира отговори от предоставените от вас документи, а не от собствената си „памет“ (RAG логика).
  • Поискайте източници: Кажете „До всяко твърдение напишете документа/раздела, на който се основава“; Ако не може да даде източник, бъдете подозрителни.
  • Да накарате хората да кажат, че не са сигурни: Инструкцията „Ако не сте сигурни, напишете „не е ясно““ намалява напасването на модела.
  • Човешка проверка: Критичните резултати трябва да бъдат проверени от човек.
Внимание: Никога не използвайте изходен модел, без да го валидирате за правни, медицински или финансови решения. „Законна статия“ или „информация за дозата“, произведени от модела, може да са напълно измислени. В тези области AI е чернова/предварителен инструмент; Компетентният човек винаги има последната дума.

Изискване за човешка проверка

Изкуственият интелект работи най-добре като инструмент, който ускорява хората, а не ги оставя без работа. Правилната настройка е както следва: произвежда или предварително квалифицира черновата на модела; човекът преглежда, коригира и одобрява. Колко строга трябва да бъде проверката зависи от цената на грешката.

Мисия

Цена на грешката

човешка проверка

Проект на описание на продукта

ниско

Пробният контрол е достатъчен

Отговор на имейл на клиента

среден

Преглед преди подаване

Анализ на договорния риск

високо

Експертно потвърждение статия по статия

Медицински/финансови съвети

много високо

Пълна експертна проверка, само поддръжка на AI

Тази таблица постига баланса между „ръчна проверка на всеки изход“ и „без проверка изобщо“. Докато пробният контрол е достатъчен за евтини работни места, всеки резултат трябва да бъде проверен за скъпи работни места.

Етична и отговорна употреба

Въпреки че изборът на модел може да изглежда като техническо решение, зад него стоят етични отговорности:

  • Прозрачност: Уведомете вашите клиенти или служители, че използвате AI на подходящи места. Клиентът има право да знае дали говори с човек или AI.
  • Пристрастие: Моделите могат да наследят пристрастия от данните, на които са обучени. Наблюдавайте справедливостта на резултатите в чувствителни области като набиране на персонал и кредитна оценка.
  • Поверителност: Вградете в работния процес принципите за защита на данните, които научихте в раздел 8; Не изпращайте лични данни безразсъдно.
  • Отговорност: Когато възникне грешка, защитата „AI успя“ не е достатъчна. Отговорността е на институцията, използваща автомобила. Така че процесите на проверка на документи.
Съвет: Напишете малка „политика за отговорно използване“ във вашия работен процес: кои задачи могат да използват AI, какви данни не могат да се изпращат, кой ще ги проверява и как ще се докладват грешките. Този документ от една страница предотвратява големи проблеми в бъдеще.

Три реалистични случая

Случай 1 — Съжаление без установяване на оценка. Застрахователен екип започва да обобщава искове, без да тества най-популярния модел. След две седмици разбират, че моделът често греши в турските технически термини и разчита някои суми неправилно. Когато зададат оценка от 20 проби и сравнят трите модела, те преминават към модела, който не е най-популярният, но е по-точен в турските технически текстове. Загубата: две седмици и коректорски труд. Урок: първо eval, разгръщане по-късно.

Случай 2 — Процесът, който улавя халюцинацията. Помощник-юрист вижда препратка към „решение на Върховния съд“ в разпечатката на модела. Тъй като техният процес има правило за „проверка на всяка препратка“, той търси решението и установява, че такова решение не съществува; Той измисли модел. Благодарение на човешката проверка изфабрикуваната информация никога не достига до клиента. Без правилото за проверка загубата на репутация можеше да бъде сериозна.

Случай 3 — Доверие с прозрачност. Компания за електронна търговия произвежда отговори за поддръжка на клиенти с AI, но добавя бележка под всеки отговор: „Този ​​отговор беше подготвен с поддръжка на изкуствен интелект и беше прегледан от един от нашите представители.“ Клиентите са по-доволни както от бързата реакция, така и от увереността да видят ангажирано човешко същество. Прозрачността не е слабост, която трябва да се крие, а източник на доверие.

Слаба подкана/Силна подкана: Проверим резултат

Слаба подкана:

Разкажете ми за рисковите клаузи на този договор.

Може да пасне на модел; няма източник, няма признаци на несигурност.

Мощна подкана:

Вашата роля: анализатор по договори (окончателното решение е на адвокат). Задача: Маркирайте потенциално рискови клаузи в следния договор. За всяка констатация: (1) номер на клауза и дословен цитат, (2) защо е рисковано, (3) вашето ниво на увереност (високо/средно/ниско). Разчитайте само на клаузи в текста; Не измисляйте нищо, което го няма в текста. Когато не сте сигурни, напишете „изисква се потвърждение от адвокат“. [договор]

Силно бързо свързва всяко твърдение с източника (номер на статия + цитат), изисква ниво на увереност и забранява фабрикуването; Това прави халюцинацията уловима.

Копируеми шаблони

1. Eval сценография:

Проектирайте набор за оценка за следната задача [ЗАДАЧА]. Предложете 15 примерни входни данни (смесени лесни-средно-трудни), как ще бъде дефиниран „очакваният правилен изход“ за всеки и определете критерий за оценяване (1-5).

2. Обвивка за намаляване на халюцинациите:

Пренапишете следната подкана, за да намалите производството: "[PROMPT]". Добавете правила за цитиране на източници, посочване на нива на доверие и „кажете ми, ако не сте сигурни“.

3. Дизайн на потока на проверка:

В следния работен процес [WORKFLOW] Проектирайте стъпка за човешка проверка за AI изхода. Определете колко строга трябва да бъде проверката въз основа на цената на грешката; пишете кой какво ще проверява кога.

4. Проект на политика за отговорна употреба:

Направете проект на една страница за „политика за отговорно използване на AI“ за екип в [INDUSTRY]. Включете следните заглавия: разрешени употреби, забранени данни, отговорност за проверка, докладване за прозрачност, докладване за грешки.

Често срещани грешки

  • Внедряване без Eval: Стартиране на модела, без да го тествате с вашите собствени данни и забелязване на грешки, след като са отразени в клиента/работата.
  • Разчитане на халюцинации: Използване на уверения език на модела като истина, без да се проверяват препратките.
  • Заобикаляне на човешка проверка: Оставяне на изхода непроверен при решения с висока цена; Опирайки се на защитата „ИИ го направи“.
  • Избягване на прозрачност: Скриване на използването на AI; изпитват загуба на увереност, когато това се случи.
  • Пренебрегване на етиката и пристрастията: Използване на чувствителни решения (наемане, кредит) без наблюдение на справедливостта на изхода.

В обобщение

  • Преди да разгърнете модел, създайте малък набор от оценки с вашите собствени данни и тествайте кандидатите; общото класиране не представя вашия бизнес.
  • Халюцинацията е увереното производство на фалшив език от модела; Уловен чрез приписване на източник, ниво на доверие и човешка проверка.
  • Строгостта на човешката проверка се коригира според цената на грешката; В критични области AI е само подкрепа, решението е на човека.
  • Прозрачност, контрол на пристрастията, поверителност и отчетност; са четирите стълба на отговорното използване на AI. Политиката за една страница предотвратява големи рискове.

Задача за приложение

Настройте набор за оценка от 15 примера с шаблон 1 в този модул (дизайн на комплект за оценка) за кандидат модела(ите), който сте избрали в целия модул, и сравнете поне два модела с този набор. След това проектирайте как изходът ще бъде проверен от хората с шаблон 3 (поток на валидиране) и начертайте политика от една страница за вашия екип с шаблон 4 (политика за отговорно използване). Тези три резултата превръщат целия модул в работещ план за внедряване.

контролен списък

  • [ ] С моите собствени данни мога да създам малък набор от оценки и да сравня модели.
  • [ ] Мога да разпознавам халюцинации и да прилагам смекчаващи и спиращи мерки.
  • [ ] Мога да коригирам строгостта на човешката проверка въз основа на цената на грешката.
  • [ ] Мога да вградя принципите на прозрачност, пристрастност, поверителност и отчетност в работния процес.
  • [ ] Мога да изготвя една страница политика за отговорно използване на AI.

Изпит по модул

1. Каква е разликата между AI „доставчик“ и „моделно семейство“?

  • A) Доставчикът е компанията, която разработва модела, а моделното семейство е моделната група на тази компания под марка ✔
  • Б) Те са абсолютно едно и също нещо и се използват взаимозаменяемо
  • C) Доставчикът е цената на модела, семейството на модела е скоростта на модела.
  • D) Семейство модели се отнася за компанията, доставчикът се отнася до версия на един модел

Описание: Доставчикът е компанията, разработила модела (напр. Anthropic); Моделното семейство е моделната група, която тази компания събира под марка (например Claude). Моделната версия е специфична версия в семейството.

2. Как могат най-точно да се дефинират „теглата“ на един модел?

  • A) Това е броят жетони, които моделът може да произведе на минута
  • B) Това са милиардите числови параметри, които моделът научава по време на обучение и съхранява своята информация. ✔
  • В) Това е месечната абонаментна такса на модела
  • D) Това е броят на езиците, поддържани от модела

Описание: Теглата са милиарди числени параметри, които моделът научава по време на обучение; Това е мястото, където се съхранява „всичко, което моделът знае“. Разграничението на затворено/изрично тегло зависи от това дали тези параметри могат да бъдат изтеглени и стартирани.

3. Кое твърдение е вярно за „open-weight“ и „open-source“?

  • A) Те са абсолютно еднакви концепции и двете предоставят неограничена търговска употреба
  • B) Откритото тегло винаги прави данните за тренировките публични
  • В) Не е едно и също нещо; При отворено претегляне обикновено се споделят само параметри и лицензионните условия може да ограничат търговската употреба ✔
  • D) Моделите с отворен код не могат да бъдат изтеглени, моделите с отворено тегло могат да бъдат изтеглени

Обяснение: При отворено претегляне се споделят само параметри на модела; данните и процесът на обучение често не се разкриват, а някои лицензи ограничават търговската употреба. Така че „отворено тегло“ не е точно същото като „отворен код“.

4. Кое от следните е най-решаващата характеристика на модела за правен екип, който чете и анализира дълги договори?

  • A) Има най-ниската цена на токена
  • B) Притежаване на визуална (мултимодална) способност за обработка
  • В) Притежаване на лиценз за открито тегло
  • Г) Имате широк контекстен прозорец ✔

Обяснение: Моделът се нуждае от голям контекстен прозорец, за да обработва дълги документи като цяло; Контекстният прозорец е общото количество токени, които моделът може да има предвид в даден момент.

5. Кое е вярно за ценообразуването на токени за модели със затворено тегло?

  • A) Изходният токен обикновено е значително по-скъп от входния токен ✔
  • B) Входът и изходът са винаги еднакви цени
  • C) Начислява се само фиксирана месечна такса, сумата за използване е без значение
  • Г) Входният токен винаги е многократно по-скъп от изходния

Обяснение: Цената се изчислява за токен и изходният токен, който моделът произвежда, обикновено е няколко пъти по-скъп от входния токен, който изпращате. Поради това дългите и ненужни разпечатки бързо увеличават разходите.

6. Коя функция в модела е от съществено значение за счетоводен екип, който иска автоматично да извлича данни от изображения на фактури?

  • A) Възможно най-широк контекстен прозорец
  • B) Мултимодалност (способност за визуална обработка) ✔
  • C) Лиценз за отворено тегло
  • Г) Най-високо ниво на разсъждение

Обяснение: За да разбере визуалното съдържание, моделът трябва да може да обработва изображения, както и текст, тоест трябва да бъде мултимодален. Мултимодалността е способността на модела да обработва множество типове данни, като текст, изображения и понякога аудио.

7. Кой е най-логичният избор за проста задача с голям обем (напр. положителна/отрицателна класификация на хиляди отзиви)?

  • A) Винаги най-силният и най-скъп модел на разсъждение
  • Б) Модел, който работи само на открито тегло и на собствен сървър
  • C) Лек и евтин модел, защото задачата е проста и обемът е голям ✔
  • D) Моделът с най-широк контекстен прозорец

Описание: Лек, евтин модел върши работа за прости задачи с голям обем; Използването на най-мощния и скъп модел създава ненужни разходи тук. Правилният подход е да съпоставите трудността на задачата с нивото на модела.

8. Какво задейства изпращането на текст, съдържащ лични данни, до чуждестранен доставчик на AI по отношение на KVKK?

  • А) Не поражда правна отговорност
  • B) Има значение само ако доставчикът е в ЕС, в никакъв друг случай
  • C) Строго е забранено при всякакви обстоятелства, независимо дали данните са анонимни или не
  • Г) Прехвърлянето на данни в чужбина се разглежда и е предмет на специалните условия на KVKK ✔

Обяснение: Оперативните данни на сървърите на доставчик в чужбина се считат за „пренос на данни в чужбина“ и са предмет на специалните условия на KVKK по този въпрос (като изрично съгласие, решение за адекватност, подходящи гаранции).

9. Какво прави режимът на „разсъждение“ на модела и как влияе върху разходите?

  • A) Повишава точността при сложни проблеми, но увеличава разходите и забавянето, тъй като генерира повече токени ✔
  • B) Винаги прави модела свободен
  • C) Само увеличава броя на езиците, поддържани от модела
  • Г) Винаги съкращавайте отговорите и намалете разходите

Описание: Режимът на разсъждение позволява на модела да "мисли" стъпка по стъпка, преди да даде отговор; Повишава точността при многоетапни и сложни проблеми, но също така увеличава разходите и забавянето, защото генерира повече токени.

10. Кой е най-надеждният подход, когато оценявате (оценявате) модел за вашия собствен бизнес?

  • А) Просто изберете най-популярния модел и го използвайте без тестване
  • B) Създайте малък тестов набор от ваши собствени реални задачи и сравнете модели с него ✔
  • В) Просто гледам сравнителния резултат, споменат в рекламите
  • D) Автоматично приемане на модела с най-висок контекстен прозорец като най-добър

Обяснение: Вместо сляпо да разчитате на класации, създаването на малък тестов набор от вашите собствени реални задачи и сравняването на модели в този набор ще разкрие този, който наистина подхожда на вашия бизнес.

11. Как знанието, че резултатът от модела може да съдържа „халюцинации“, трябва да оформи вашия работен процес?

  • A) Резултатът винаги трябва да се счита за правилен и публикуван директно
  • B) Халюцинации се наблюдават само при безплатните модели, но не и при платените
  • C) При критични решения изходът трябва да бъде проверен от човек и източниците трябва да бъдат потвърдени ✔
  • Г) Халюцинацията може да бъде напълно елиминирана чрез проста смяна на модела

Обяснение: Халюцинация е, когато моделът произвежда информация, която всъщност не е вярна, на уверен език. Поради този риск трябва да се изисква проверка на резултата от човек, особено за правни, медицински и финансови решения.

12. Каква е основната логика на подхода на „моделно портфолио“, възприет от зрелите институции?

  • A) За да се осигури простота, като всяка работа се извършва от един, най-скъп модел.
  • Б) Използване само на най-евтиния модел и пълно пренебрегване на качеството
  • В) Не използвайте никакви модели и извършвайте цялата работа ръчно
  • D) Оптимизиране на разходите и намаляване на зависимостта от един доставчик чрез използване на различни модели според задачата ✔

Описание: Портфолиото от модели е да използва различни модели според задачата: евтин модел за прости и обемисти работни места, мощен модел за сложни работни места, модел с отворено тегло/регионален модел за поверителни данни. Това едновременно оптимизира разходите и намалява зависимостта от един доставчик.

13. Защо страната на произход и политиката за запазване на данни могат да бъдат критерий за избор на модел?

  • A) Защото пряко засяга регулаторните изисквания, изискванията за суверенитет на данните и поверителност ✔
  • Б) Само защото определя скоростта на реакция на модела
  • C) Защото определя файловите формати, поддържани от модела
  • Г) Защото няма практически ефект, това е просто маркетингов детайл

Описание: Държава, в която се намира разработчикът на модела и къде/колко данни се съхраняват; Той е решаващ по отношение на правното регулиране, суверенитета на данните и поверителността. Например, за организация, която иска да хоства в рамките на ЕС, регионален доставчик или опция за нулево съхранение стават важни.

14. Кое най-добре обяснява защо търсенето на „единствен най-добър модел“ в дадена задача е подвеждащо?

  • A) Всички модели всъщност имат абсолютно еднакви възможности
  • B) Моделите са здрави в различни размери, така че „най-доброто“ зависи от изискванията за работа ✔
  • В) Най-скъпият модел автоматично е най-добрият за всяка задача
  • Г) Изборът на модел трябва да бъде направен напълно на случаен принцип

Описание: Моделите са силни в различни измерения като скорост, цена, контекст, мултимодалност, поверителност и логика. Модел, който е лидер в едно измерение, може да е слаб в друго; така че „най-доброто“ винаги зависи от изискванията на работата.