Добивки:
- Способност за поставување на мал тест сет (eval) кој проценува модел со ваши сопствени податоци
- Вметнете ја човечката верификација, ограничувањата и политиката за одговорна употреба во работниот тек
- Препознајте ги халуцинациите, приватноста и етичките ризици и спроведете мерки за ублажување
Го избравте вистинскиот модел; Дали работата е завршена? Не, вистинската работа започнува сега. Ставањето модел во вашиот бизнис се сведува на тестирање според вашите сопствени податоци, потврдување на неговиот излез и одговорно врамување. Оваа последна единица го претвора целиот модул во апликација од крај до крај: ќе научите како да поставите мал тест пакет (eval), да ја вградите човечката верификација во работниот тек, да управувате со ризиците од халуцинации и приватноста и да нацртате етички граници. Штом единицата ќе биде завршена, ќе бидете опремени не само да изберете модел, туку и да го нарачате со сигурност.
Евалуација (Eval): Тестирање со сопствени податоци
Сега знаете дека само вашите вистински податоци, а не рекламите, можат да кажат дали моделот одговара на вашиот бизнис. Начинот на мерење на ова е да поставите сет за евалуација (eval): мала колекција на примероци од вашата работа за која е познат точниот одговор.
Едноставна евалуација е поставена вака:
- Соберете 10-30 вистински примероци. Изберете влезови кои се типични за вашата работа (измешајте тешко и лесно).
- Определете го „точниот/очекуваниот излез“ за секој пример. Што би одговорил експерт?
- Водете ги кандидатите преку истите примери. Тестирајте ги моделите што ги споредувате еден по еден со истиот сет.
- Постигнете ги резултатите. Во колку примери е вистина? Каде згреши? Дали грешките се прифатливи?
- Споредете и изберете. Изберете не највисокиот вкупен резултат, туку оној што е најсигурен во најкритичните примери за вас.
Совет: Не им верувајте слепо на таблите на водачи. Моделот може да се рангира на првото место на глобално ниво, но има полоши резултати од моделот на второто место во вашите специфични турски правни текстови. Вашата сопствена евалуација од 20 примероци вреди повеќе од стотици јавни тестови.
Халуцинација: Најподмолниот ризик на моделот
Халуцинација е кога моделот произведува информации кои всушност не се вистинити, на сигурен јазик. Наместо да каже „не знам“, моделот може да произведе непостоечка легислатива, измислена статистика или лажен датум; Згора на тоа, тој го прави тоа на исклучително убедлив јазик. Ова е најопасниот аспект на вештачката интелигенција затоа што грешката се маскира како вистина.
Не можете целосно да ја елиминирате халуцинацијата, но можете да ја намалите и да ја фатите:
- Засновајте го на изворот: Побарајте од моделот да генерира одговори од документите што ги давате, а не од сопствената „меморија“ (RAG логика).
- Побарајте извори: Кажете: „До секое тврдење, напишете го документот/делот на кој се базира“; Ако не може да даде извор, бидете сомнителни.
- Да ги натерате луѓето да кажат дека не се сигурни: Упатството „Ако не сте сигурни, напишете „не е јасно““ го намалува приспособувањето на моделот.
- Човечка верификација: Критичните резултати мора да бидат потврдени од човек.
Внимание: Никогаш не користете излез од моделот без да го потврдите за правни, медицински или финансиски одлуки. „Законска статија“ или „информации за дозата“ произведени од моделот може да бидат целосно измислени. Во овие области, вештачката интелигенција е нацрт/прелиминарна алатка; Компетентната личност секогаш го има последниот збор.
Услов за човечка верификација
Вештачката интелигенција најдобро функционира како алатка која ги забрзува луѓето, а не ги остава без работа. Правилното поставување е како што следува: го произведува или однапред го квалификува нацртот на моделот; човечкото прегледува, поправа и одобрува. Колку треба да биде строга проверката зависи од цената на грешката.
Потрага
Цена за грешка
човечка верификација
Нацрт опис на производот
низок
Контролата на примерокот е доволна
Одговор на е-пошта на клиентите
средно
Преглед пред поднесување
Анализа на ризик од договорот
високо
Член по член стручна потврда
Медицински/финансиски совети
многу високо
Целосна експертска верификација, само поддршка за вештачка интелигенција
Оваа табела прави рамнотежа помеѓу „рачно проверување на секој излез“ и „воопшто непроверување“. Додека контролата на примерокот е доволна за евтини работни места, секој излез мора да биде потврден за работни места со високи цени.
Етичка и одговорна употреба
Иако изборот на модел може да изгледа како техничка одлука, зад него има етички одговорности:
- Транспарентност: кажете им на вашите клиенти или вработени дека користите вештачка интелигенција на соодветни места. Клиентот има право да знае дали разговара со човек или со вештачка интелигенција.
- Пристрасност: Моделите можат да наследат пристрасност од податоците за кои се обучени. Следете ја правичноста на резултатите во чувствителните области како што се регрутирањето и кредитната проценка.
- Приватност: Вградете ги принципите за заштита на податоците што ги научивте во единицата 8 во работниот тек; Не испраќајте лични податоци непромислено.
- Одговорност: Кога ќе се случи грешка, одбраната „Ви го направи тоа“ не е доволна. Одговорноста е на институцијата што го користи возилото. Значи, процесите за верификација на документите.
Совет: напишете малку „политика за одговорна употреба“ во вашиот работен тек: кои работни места може да користат вештачка интелигенција, кои податоци не може да се испраќаат, кој ќе ги потврди и како ќе се пријават грешките. Овој документ на една страница спречува големи проблеми во иднина.
Три реални случаи
Случај 1 - Жалење без воспоставување евалуација. Тим за осигурување започнува со сумирање на штети без тестирање на најпопуларниот модел. По две недели сфаќаат дека манекенката често греши во турски технички термини и погрешно чита некои суми. Кога ќе постават евал од 20 примероци и ќе ги споредат трите модели, тие се префрлаат на моделот кој не е најпопуларен, но е попрецизен во турските технички текстови. Загубата: две недели и лекторска работа. Лекција: евал прво, распореди подоцна.
Случај 2 - Процесот што ја доловува халуцинацијата. Параправникот гледа референца „Одлука на Врховниот суд“ во отпечатокот на моделот. Бидејќи нивниот процес има правило „провери ја секоја референца“, тој ја бара одлуката и открива дека таква одлука не постои; Измислил модел. Благодарение на човечката проверка, фабрикуваните информации никогаш не стигнуваат до клиентот. Без правилото за верификација, губењето на угледот можеше да биде сериозно.
Случај 3 - Доверба со транспарентност. Компанија за е-трговија произведува одговори за поддршка на клиентите со вештачка интелигенција, но додава белешка под секој одговор: „Овој одговор беше подготвен со поддршка за вештачка интелигенција и беше прегледан од еден од нашите претставници“. Клиентите се позадоволни и од брзиот одговор и од самодовербата да видат ангажирано човечко суштество. Транспарентноста не е слабост за криење, туку извор на доверба.
Слаб промпт / Силен потсетник: проверлив излез
Слаба навестување:
Кажете ми за ризичните клаузули од овој договор.
Може да одговара на моделот; без извор, без знак на неизвесност.
Моќен потсетник:
Вашата улога: договорен аналитичар (конечната одлука му припаѓа на адвокат). Задача: Означете ги потенцијално ризичните клаузули во следниот договор. За секој наод: (1) број на клаузула и дословно цитат, (2) зошто е ризично, (3) вашето ниво на доверба (високо/средно/ниско). Потпрете се само на клаузули во текстот; Не фабрикувај ништо што го нема во текстот. Онаму каде што не сте сигурни, напишете „потребна е потврда од адвокат“. [договор]
Силниот промпт го поврзува секое тврдење со изворот (број на статија + цитат), бара ниво на доверба и забранува изработка; Ова ја прави халуцинацијата фатлива.
Шаблони за копирање
1. Евален сценографија:
Дизајнирајте сет за евалуација за следната задача [TASK]. Предложете 15 влезни примероци (мешани лесно-средно-тешко), како би се дефинирал „очекуваниот правилен резултат“ за секој и определете критериум за бодување (1-5).
2. Обвивка за намалување на халуцинации:
Повторно напишете го следново барање за да ја намалите изработката: „[PROMPT]“. Додадете правила за наведување извори, специфицирање на нивоата на доверба и „кажи ми ако не си сигурен“.
3. Дизајн на проток на верификација:
Во следниот работен тек [WORKFLOW] Дизајнирајте чекор за верификација на човекот за излезот со вештачка интелигенција. Определете колку строга треба да се заснова верификацијата на цената на грешката; пишете кој што, кога ќе провери.
4. Нацрт политика за одговорна употреба:
Нацртај „политика за одговорна употреба на вештачка интелигенција“ на една страница за тим во [ИНДУСТРИЈА]. Вклучете ги следните наслови: дозволена употреба, забранети податоци, одговорност за верификација, известување за транспарентност, известување за грешки.
Вообичаени грешки
- Распоредување без Eval: Стартување на моделот без тестирање со ваши податоци и забележување грешки откако ќе се одразат на клиентот/работата.
- Потпирајќи се на халуцинација: Користење на самоуверениот јазик на моделот како вистина без проверка на референците.
- Заобиколување на човечката верификација: Оставајќи го резултатот неконтролиран во одлуките со високи трошоци; Потпирајќи се на одбраната „ВИ го направи тоа“.
- Избегнување на транспарентност: криење на вашата употреба на вештачка интелигенција; доживување губење на довербата кога ќе се појави.
- Игнорирање на етиката и пристрасноста: Користење чувствителни одлуки (вработување, кредитирање) без следење на правичноста на резултатот.
Сумирано
- Пред да распоредите модел, поставете мал евалент сет со свои податоци и тестирајте ги кандидатите; целокупното рангирање не го претставува вашиот бизнис.
- Халуцинацијата е самоуверено производство на лажен јазик на моделот; Забележано со изворна атрибуција, ниво на доверба и човечка потврда.
- Строгоста на човечката верификација се прилагодува според цената на грешката; Во критичните области вештачката интелигенција е само поддршка, одлуката е човечка.
- Транспарентност, контрола на пристрасност, доверливост и одговорност; се четирите столбови на одговорното користење на вештачката интелигенција. Политиката на една страница спречува големи ризици.
Задача за апликација
Поставете сет за оценување од 15 примери со шаблон 1 во оваа единица (дизајн на евална гарнитура) за моделот/кандидатите што сте ги избрале низ модулот и споредете најмалку два модели со овој сет. Потоа дизајнирајте како луѓето ќе го потврдат резултатот со шаблон 3 (проток на валидација) и нацртајте политика на една страница за вашиот тим со шаблон 4 (политика за одговорна употреба). Овие три резултати го претвораат целиот модул во функционален план за распоредување.
листа за проверка
- [ ] Со мои сопствени податоци, можам да поставам мал евал сет и да споредувам модели.
- [ ] Можам да препознаам халуцинации и да применувам мерки за ублажување и апсење.
- [ ] Можам да ја прилагодам строгоста на човечката верификација врз основа на цената на грешката.
- [ ] Можам да ги вградам принципите на транспарентност, пристрасност, доверливост и одговорност во работниот тек.
- [ ] Можам да нацртам политика за одговорна употреба на вештачка интелигенција на една страница.
Модул испит
1. Која е разликата помеѓу „провајдер“ со вештачка интелигенција и „семејство модели“?
- А) Давателот е компанијата што го развива моделот, а семејството на модели е модел група на таа компанија под бренд ✔
- Б) Тие се сосема иста работа и се користат наизменично
- В) Провајдер е цената на моделот, семејството на моделот е брзината на моделот.
- Г) Семејството на модели се однесува на компанијата, добавувачот се однесува на верзијата на еден модел
Опис: Давателот е компанијата што го развила моделот (на пр. Anthropic); Семејството на модели е моделска група што таа компанија ја собира под бренд (на пример, Клод). Модел верзијата е специфична верзија во семејството.
2. Како може најпрецизно да се дефинираат „тежините“ на моделот?
- А) Тоа е бројот на токени што моделот може да ги произведе во минута
- Б) Тоа се милијардите нумерички параметри што моделот ги учи за време на обуката и ги складира неговите информации. ✔
- В) Тоа е месечна претплата на моделот
- Г) Тоа е бројот на јазици поддржани од моделот
Опис: Тежините се милијарди нумерички параметри што моделот ги учи за време на обуката; Тоа е местото каде што се складира „сè што моделот знае“. Затворената/експлицитната разлика на тежината зависи од тоа дали овие параметри може да се преземат и стартуваат.
3. Која изјава е точна за „отворена тежина“ и „отворен извор“?
- А) Тие се сосема исти концепти и двата даваат неограничена комерцијална употреба
- Б) Отворената тежина секогаш ги објавува и податоците за обуката
- В) Не е иста работа; Во отвореното пондерирање, обично се споделуваат само параметри и условите за лиценца може да ја ограничат комерцијалната употреба ✔
- Г) Моделите со отворен код не можат да се преземат, моделите со отворен код може да се преземат
Објаснување: Во отвореното пондерирање, се споделуваат само параметрите на моделот; Податоците и процесот за обука често не се откриваат, а некои лиценци ја ограничуваат комерцијалната употреба. Значи, „отворената тежина“ не е сосема исто како „отворен извор“.
4. Која од наведеното е најодлучна карактеристика на моделот за правен тим кој чита и анализира долги договори?
- А) Имајќи најниска токена цена
- Б) Имајќи визуелна (мултимодална) способност за обработка
- В) Поседување лиценца за отворена тежина
- Г) Имајќи широк контекстен прозорец ✔
Објаснување: На моделот му треба голем контекстен прозорец за да обработува долги документи како целина; Контексниот прозорец е вкупната количина на токени што моделот може да ги има на ум во исто време.
5. Што е точно за токенните цени за моделите со затворена тежина?
- А) Излезниот токен обично е значително поскап од влезниот токен ✔
- Б) Влезот и излезот се секогаш иста цена
- В) Се наплаќа само фиксна месечна претплата, износот на користење е ирелевантен
- Г) Влезниот токен е секогаш многу пати поскап од излезниот
Објаснување: Цената се пресметува по токен, а излезниот токен што го произведува моделот е обично неколку пати поскап од влезниот токен што го испраќате. Затоа, долгите и непотребни отпечатоци брзо ги зголемуваат трошоците.
6. Која карактеристика во моделот е од суштинско значење за сметководствениот тим кој сака автоматски да извлекува податоци од сликите на фактурата?
- А) Најширок можен контекстен прозорец
- Б) Мултимодалност (способност за визуелна обработка) ✔
- В) Лиценца за отворена тежина
- Г) Највисоко ниво на расудување
Објаснување: За да се разбере визуелната содржина, моделот мора да може да обработува слики како и текст, односно да биде мултимодален. Мултимодалноста е способност на моделот да ракува со повеќе типови податоци, како што се текст, слики, а понекогаш и аудио.
7. Кој е најлогичниот избор за голема обемна, едноставна задача (на пр. позитивна/негативна класификација на илјадници критики)?
- А) Секогаш најсилниот и најскапиот модел на расудување
- Б) Модел кој работи само на отворена тежина и на свој сервер
- В) Лесен и евтин модел, бидејќи задачата е едноставна, а јачината на звукот е висока ✔
- Г) Моделот со најширок контекстен прозорец
Опис: Лесниот, евтин модел го прави трикот за едноставни задачи со голем обем; Користењето на најмоќниот и најскапиот модел овде создава непотребни трошоци. Точниот пристап е да се усогласи тежината на задачата со нивото на моделот.
8. Што го активира испраќањето на текст кој содржи лични податоци до давател на вештачка интелигенција со седиште во странство во однос на KVKK?
- А) Не создава никаква правна одговорност
- Б) Важно е само ако давателот е во ЕУ, во ниеден друг случај
- В) Строго е забрането под сите околности, без разлика дали податоците се анонимни или не
- Г) Преносот на податоци во странство се смета и подлежи на посебните услови на KVKK ✔
Објаснување: Оперативните податоци на серверите на провајдер во странство се сметаат за „пренос на податоци во странство“ и подлежат на посебните услови на KVKK за оваа тема (како што се експлицитна согласност, одлука за соодветност, соодветни гаранции).
9. Што прави режимот на „расудување“ на моделот и како тоа влијае на цената?
- А) Ја зголемува прецизноста во сложените проблеми, но ги зголемува трошоците и доцнењето бидејќи генерира повеќе токени ✔
- Б) Секогаш го прави моделот бесплатен
- В) Само го зголемува бројот на јазици поддржани од моделот
- Г) Секогаш скратувајте ги одговорите и намалете ги трошоците
Опис: Режимот на расудување му овозможува на моделот да „размислува“ чекор по чекор пред да го даде одговорот; Ја зголемува прецизноста во повеќестепените и сложени проблеми, но исто така ги зголемува трошоците и доцнењето бидејќи генерира повеќе токени.
10. Кој е најсигурниот пристап при евалуација (евалуација) на модел за сопствен бизнис?
- А) Само избирање на најпопуларниот модел и користење без тестирање
- Б) Поставете мал тест сет на вашите сопствени вистински задачи и споредете ги моделите со него ✔
- В) Само гледајќи го репер резултатот споменат во рекламите
- Г) Автоматски прифатете го моделот со највисок контекст на прозорецот како најдобар
Објаснување: Наместо слепо да се потпирате на таблите на водачи, креирањето на мал тест сет на сопствени вистински задачи и споредувањето на моделите на овој сет ќе го открие оној кој навистина одговара на вашиот бизнис.
11. Како знаењето дека излезот од моделот може да содржи „халуцинации“ треба да го обликува вашиот работен тек?
- А) Излезот секогаш треба да се смета за точен и директно објавен
- Б) Халуцинацијата се гледа само кај бесплатните модели, не и кај платените модели
- В) Во критичните одлуки, излезот мора да биде потврден од човек и изворите мора да бидат потврдени ✔
- Г) Халуцинацијата може целосно да се елиминира со едноставно менување на моделот
Објаснување: Халуцинација е кога моделот произведува информации што всушност не се вистинити, на сигурен јазик. Поради овој ризик, треба да се бара верификација на резултатот од човек, особено за правни, медицински и финансиски одлуки.
12. Која е основната логика на пристапот на „модел портфолио“ усвоен од зрели институции?
- А) Да се обезбеди едноставност со тоа што секоја работа ќе ја заврши еден, најскап модел.
- Б) Користење само на најевтиниот модел и целосно игнорирање на квалитетот
- В) Не користете никакви модели и извршете ја целата работа рачно
- Г) Оптимизирање на трошоците и намалување на зависноста од еден провајдер со користење на различни модели според задачата ✔
Опис: Моделното портфолио е да се користат различни модели според задачата: евтин модел за едноставни и обемни работни места, моќен модел за сложени работи, отворена тежина/регионален модел за доверливи податоци. Ова и ги оптимизира трошоците и ја намалува зависноста од еден провајдер.
13. Зошто земјата на потекло и политиката за задржување податоци може да бидат критериум за избор на модел?
- А) Затоа што директно влијае на регулаторните, суверенитет на податоците и барањата за приватност ✔
- Б) Само затоа што ја одредува брзината на одговор на моделот
- В) Затоа што ги одредува форматите на датотеки поддржани од моделот
- Г) Бидејќи нема практичен ефект, тоа е само маркетиншки детал
Опис: Земја каде што се наоѓа развивачот на моделот и каде/колку податоци се складирани; Тој е одлучувачки во однос на законската регулатива, суверенитетот на податоците и приватноста. На пример, за организација која сака да биде домаќин во ЕУ, регионален добавувач или опција за складирање нула станува важна.
14. Што најдобро објаснува зошто барањето „еден најдобар модел“ во задача е погрешно?
- А) Сите модели всушност ги имаат токму истите способности
- Б) Моделите се силни во различни големини, така што „најдоброто“ зависи од барањето за работа ✔
- В) Најскапиот модел автоматски е најдобар во секоја задача
- Г) Изборот на моделот треба да се направи сосема случајно
Опис: Моделите се силни во различни димензии како што се брзина, цена, контекст, мултимодалност, приватност и расудување. Моделот кој е лидер во една димензија може да биде слаб во друга; така што „најдоброто“ секогаш зависи од барањето за работа.