Добици:
- Могућност постављања малог скупа тестова (евал) који процењује модел са вашим сопственим подацима
- Уградите људску верификацију, ограничења и политику одговорног коришћења у ток посла
- Препознајте халуцинације, приватност и етичке ризике и примените мере за ублажавање
Изабрали сте прави модел; Да ли је посао обављен? Не, прави посао почиње сада. Постављање модела у ваше пословање своди се на његово тестирање у односу на сопствене податке, валидацију његових резултата и одговорно уоквиривање. Ова завршна јединица претвара цео модул у апликацију од краја до краја: научићете како да подесите мали тест пакет (евал), уградите људску верификацију у ток посла, управљате халуцинацијама и ризицима приватности и повучете етичке границе. Када се јединица заврши, бићете опремљени не само да изаберете модел већ и да га са поверењем ставите у рад.
Евалуација (Евал): Тестирање са сопственим подацима
Сада знате да само ваши стварни подаци, а не огласи, могу рећи да ли модел одговара вашем пословању. Начин да се ово измери је постављање евалуационог скупа (евал): мала колекција узорака из вашег рада за које је познат тачан одговор.
Једноставна евалуација је постављена овако:
- Сакупите 10-30 правих узорака. Изаберите уносе који су типични за ваш посао (помешајте тешко и лако).
- Одредите "тачан/очекивани резултат" за сваки пример. Шта би стручњак одговорио?
- Прођите кандидате кроз исте примере. Тестирајте моделе које упоређујете један по један са истим комплетом.
- Оцените резултате. У колико примера је то тачно? Где је погрешио? Да ли су грешке прихватљиве?
- Упоредите и изаберите. Изаберите не највиши укупни резултат, већ онај који је најпоузданији у најкритичнијим примерима за вас.
Савет: Не верујте слепо ранг листама. Модел може бити први на глобалном нивоу, али има лошији учинак од модела на другом месту у вашим специфичним турским правним текстовима. Ваша сопствена процена од 20 узорака вреди више од стотина јавних тестова.
Халуцинације: Најподмуклији ризик модела
Халуцинација је када модел произведе информације које заправо нису истините, на поузданом језику. Уместо да каже „не знам“, модел би могао да произведе непостојећи закон, измишљену статистику или лажан датум; Штавише, он то ради на изузетно убедљивом језику. Ово је најопаснији аспект АИ јер се грешка маскира као истина.
Не можете потпуно елиминисати халуцинацију, али је можете смањити и ухватити:
- Засновајте на извору: Замолите модел да генерише одговоре из докумената које дате, а не из сопствене „меморије“ (РАГ логика).
- Извори захтева: Реците: „Поред сваке тврдње напишите документ/одељак на коме се заснива“; Ако не може да наведе извор, будите сумњичави.
- Навести људе да кажу да нису сигурни: Упутство „Ако нисте сигурни, напишите „није јасно““ смањује прилагођавање модела.
- Људска верификација: Критични резултати морају бити верификовани од стране људи.
Опрез: Никада не користите излаз модела без валидације за правне, медицинске или финансијске одлуке. „Чланак закона“ или „информација о дози“ коју производи модел могу бити потпуно измишљени. У овим областима, АИ је нацрт/прелиминарни алат; Компетентна особа увек има последњу реч.
Захтев за верификацију људи
Вештачка интелигенција најбоље функционише као средство које убрзава људе, а не оставља их без посла. Исправно подешавање је следеће: производи или унапред квалификује нацрт модела; људи прегледају, исправљају и одобравају. Колико строга верификација треба да буде зависи од цене грешке.
Куест
Цена грешке
људска верификација
Нацрт описа производа
ниско
Контрола узорка је довољна
Одговор корисника путем е-поште
средње
Преглед пре подношења
Анализа ризика уговора
висока
Члан по чланак стручна потврда
Медицински/финансијски савети
веома високо
Потпуна стручна верификација, само подршка за вештачку интелигенцију
Ова табела успоставља равнотежу између „ручне провере сваког излаза“ и „уопште не провере“. Док је контрола узорка довољна за јефтине послове, сваки излаз мора бити верификован за послове са високим ценама.
Етичко и одговорно коришћење
Иако избор модела може изгледати као техничка одлука, иза тога стоје етичке одговорности:
- Транспарентност: Обавестите своје клијенте или запослене да користите вештачку интелигенцију на одговарајућим местима. Купац има право да зна да ли разговара са човеком или АИ.
- Пристрасност: Модели могу наследити пристрасност из података на којима су обучени. Пратите праведност исхода у осетљивим областима као што су запошљавање и кредитна процена.
- Приватност: Уградите принципе заштите података које сте научили у јединици 8 у ток рада; Не шаљите личне податке непромишљено.
- Одговорност: Када дође до грешке, одбрана „АИ је успела“ није довољна. Одговорност сноси установа која користи возило. Дакле, процеси верификације докумената.
Савет: Упишите малу „политику одговорног коришћења“ у свој ток посла: који послови могу да користе вештачку интелигенцију, који подаци не могу да се шаљу, ко ће то верификовати и како ће се грешке пријављивати. Овај документ на једној страници спречава велике проблеме у будућности.
Три реална случаја
Случај 1 — Жаљење без утврђивања евал. Тим осигурања почиње са сумирањем потраживања без тестирања најпопуларнијег модела. После две недеље схватају да модел често прави грешке у турским техничким терминима и да неке износе чита погрешно. Када подесе оцену од 20 узорака и упореде три модела, прелазе на модел који није најпопуларнији, али је тачнији у турским техничким текстовима. Губитак: две недеље и лекторски рад. Лекција: прво процените, а касније примените.
Случај 2 — Процес који обухвата халуцинацију. Паралегал види референцу на "одлуку Врховног суда" у моделу отиска. Пошто њихов процес има правило „провери сваку референцу“, он тражи одлуку и открива да таква одлука не постоји; Измислио је модел. Захваљујући људској провери, измишљене информације никада не стигну до клијента. Без правила верификације, губитак угледа могао би бити озбиљан.
Случај 3 — Поверење са транспарентношћу. Компанија за е-трговину производи одговоре корисничке подршке помоћу вештачке интелигенције, али додаје напомену испод сваког одговора: „Овај одговор је припремљен уз подршку вештачке интелигенције и прегледао га је један од наших представника.“ Купци су задовољнији и брзим одговором и самопоуздањем да виде људско биће које је ангажовано. Транспарентност није слабост коју треба сакрити, већ извор поверења.
Слаба порука / јака промпт: Проверљиви излаз
Слабо обавештење:
Реците ми о ризичним клаузулама овог уговора.
Може одговарати моделу; нема извора, нема знакова неизвесности.
Снажан упит:
Ваша улога: аналитичар уговора (коначна одлука припада адвокату). Задатак: Истакните потенцијално ризичне клаузуле у следећем уговору. За сваки налаз: (1) број клаузуле и дословни цитат, (2) зашто је ризично, (3) ниво вашег поверења (висок/средњи/низак). Ослоните се само на клаузуле у тексту; Не измишљајте ништа чега нема у тексту. Где нисте сигурни, напишите „потребна је потврда адвоката“. [уговор]
Јака брза веза сваке тврдње са извором (број чланка + цитат), захтева ниво поверења и забрањује измишљање; Ово чини халуцинацију ухватљивом.
Цопиабле Темплатес
1. Евал сценографија:
Дизајнирајте скуп евалуације за следећи задатак [ЗАДАЋАК]. Предложите 15 узорака уноса (мешовити лако-средње-тешко), како би се дефинисао „очекивани тачан резултат“ за сваки и одредите критеријум за бодовање (1-5).
2. Облог за смањење халуцинација:
Поново напишите следећу промпт да бисте смањили фабриковање: „[ПРОМПТ]“. Додајте правила за цитирање извора, наводећи нивое поузданости и „реците ми ако нисте сигурни“.
3. Дизајн тока верификације:
У следећем току рада [ВОРКФЛОВ] Дизајнирајте корак људске верификације за АИ излаз. Одредите колико строга верификација треба да буде заснована на цени грешке; напиши ко ће шта, када да проверава.
4. Нацрт политике одговорног коришћења:
Направите нацрт „политике одговорног коришћења вештачке интелигенције“ на једној страници за тим у [ИНДУСТРИЈА]. Укључите следеће наслове: дозвољене употребе, забрањени подаци, одговорност верификације, транспарентност извештавања, извештавање о грешкама.
Уобичајене грешке
- Примена без Евал-а: Покретање модела без тестирања са сопственим подацима и уочавања грешака након што се одразе на клијента/посла.
- Ослањање на халуцинације: Коришћење поузданог језика модела као истине без провере референци.
- Заобилазећи људску верификацију: остављајући излаз непровереним у одлукама са високим трошковима; Ослањајући се на одбрану „АИ је то урадила“.
- Избегавање транспарентности: скривање ваше употребе АИ; доживљава губитак самопоуздања када се то догоди.
- Игнорисање етике и пристрасности: Коришћење осетљивих одлука (запошљавање, кредит) без праћења праведности резултата.
Укратко
- Пре него што примените модел, поставите мали скуп за процену са сопственим подацима и тестирајте кандидате; укупна рангирања не представљају ваше пословање.
- Халуцинација је моделова самоуверена производња лажног језика; Ухваћено приписивањем извора, нивоом поверења и људском верификацијом.
- Строгост људске верификације се прилагођава према цени грешке; У критичним областима АИ је само подршка, одлука је људска.
- Транспарентност, контрола пристрасности, поверљивост и одговорност; су четири стуба одговорне употребе вештачке интелигенције. Политика једне странице спречава велике ризике.
Задатак апликације
Подесите скуп за евалуацију од 15 примера са шаблоном 1 у овој јединици (процена сета дизајна) за модел(е) кандидата које сте изабрали током модула и упоредите најмање два модела са овим скупом. Затим дизајнирајте начин на који ће људи верификовати излаз помоћу шаблона 3 (ток провере ваљаности) и нацртајте политику на једној страници за ваш тим са шаблоном 4 (смерница одговорног коришћења). Ова три резултата претварају цео модул у изводљив план примене.
контролна листа
- [ ] Са сопственим подацима, могу да поставим мали скуп за процену и упоредим моделе.
- [ ] Могу да препознам халуцинације и применим мере ублажавања и хапшења.
- [ ] Могу да прилагодим строгост људске верификације на основу цене грешке.
- [ ] Могу да уградим принципе транспарентности, пристрасности, поверљивости и одговорности у ток посла.
- [ ] Могу да нацртам политику одговорне употребе вештачке интелигенције на једној страници.
Модул Екам
1. Која је разлика између АИ „провајдера“ и „породице модела“?
- А) Провајдер је компанија која развија модел, а породица модела је група модела те компаније под брендом ✔
- Б) Они су потпуно иста ствар и користе се наизменично
- Ц) Провајдер је цена модела, породица модела је брзина модела.
- Д) Породица модела се односи на компанију, добављач се односи на једну верзију модела
Опис: Провајдер је компанија која је развила модел (нпр. Антхропиц); Породица модела је група модела коју та компанија прикупља под брендом (на пример, Цлауде). Верзија модела је посебна верзија унутар породице.
2. Како се 'тежине' модела најтачније дефинишу?
- А) То је број токена које модел може произвести у минути
- Б) То су милијарде нумеричких параметара које модел учи током тренинга и чува своје информације. ✔
- Ц) То је месечна претплата модела
- Д) То је број језика које модел подржава
Опис: Тежине су милијарде нумеричких параметара које модел учи током тренинга; Ту се чува 'све што модел зна'. Затворено/експлицитно разликовање тежине зависи од тога да ли се ови параметри могу преузети и покренути.
3. Која је тврдња тачна у вези са 'опен-веигхт' и 'опен-соурце'?
- А) То су потпуно исти концепти и оба дају неограничену комерцијалну употребу
- Б) Отворена тежина увек објављује и податке о тренингу
- В) Није иста ствар; Код отвореног пондерисања, обично се деле само параметри и услови лиценце могу ограничити комерцијалну употребу ✔
- Д) Модели отвореног кода се не могу преузети, модели отворених тежина се могу преузети
Објашњење: У отвореном пондерисању, деле се само параметри модела; подаци и процес обуке се често не откривају, а неке лиценце ограничавају комерцијалну употребу. Дакле, 'отворена тежина' није потпуно исто што и 'отворени извор'.
4. Шта је од следећег најодлучнија карактеристика модела за правни тим који чита и анализира дуге уговоре?
- А) Имају најнижу цену токена
- Б) Имати визуелну (мултимодалну) способност обраде
- Ц) Имати отворену лиценцу за тежину
- Д) Имати широк прозор контекста ✔
Објашњење: Моделу је потребан велики прозор контекста за обраду дугих докумената као целине; Прозор контекста је укупна количина токена које модел може имати на уму у једном тренутку.
5. Шта је тачно о ценама токена за затворене моделе тежине?
- А) Излазни токен је обично знатно скупљи од улазног токена ✔
- Б) Улаз и излаз су увек потпуно исте цене
- Ц) Наплаћује се само фиксна месечна накнада, износ коришћења није битан
- Д) Улазни токен је увек много пута скупљи од излазног
Објашњење: Цена се израчунава по токену, а излазни токен који модел производи је обично неколико пута скупљи од улазног токена који шаљете. Због тога дуги и непотребни исписи брзо повећавају трошкове.
6. Која карактеристика модела је неопходна за рачуноводствени тим који жели аутоматски да издвоји податке из слика фактура?
- А) Најшири могући контекстни прозор
- Б) Мултимодалност (способност визуелне обраде) ✔
- Ц) Отворена лиценца за тежину
- Г) Највиши ниво расуђивања
Објашњење: Да би разумео визуелни садржај, модел мора бити у стању да обрађује слике као и текст, односно мора бити мултимодалан. Мултимодалност је способност модела да рукује више врста података, као што су текст, слике, а понекад и аудио.
7. Шта је најлогичнији избор за велики, једноставан задатак (нпр. позитивна/негативна класификација хиљада рецензија)?
- А) Увек најјачи и најскупљи модел расуђивања
- Б) Модел који ради само на отвореној тежини и на сопственом серверу
- Ц) Лаган и јефтин модел, јер је задатак једноставан, а запремина велика ✔
- Д) Модел са најширим контекстним прозором
Опис: Лагани модел са ниском ценом ради трик за једноставне задатке великог обима; Коришћење најмоћнијег и најскупљег модела овде ствара непотребне трошкове. Исправан приступ је ускладити тежину задатка са нивоом модела.
8. Шта покреће слање текста који садржи личне податке страном АИ провајдеру у смислу КВКК?
- А) Не ствара никакву правну одговорност
- Б) Важно је само ако је провајдер у ЕУ, ни у ком другом случају
- Ц) Строго је забрањено под свим околностима, без обзира да ли су подаци анонимни или не
- Д) Пренос података у иностранство се сматра и подлеже посебним условима КВКК ✔
Објашњење: Оперативни подаци на серверима провајдера у иностранству сматрају се 'преносом података у иностранство' и подлежу посебним условима КВКК-а о овој теми (као што је експлицитна сагласност, одлука о адекватности, одговарајућа уверења).
9. Шта ради модус 'реасонинг' модела и како утиче на цену?
- А) Повећава прецизност у сложеним проблемима, али повећава трошкове и кашњење јер генерише више токена ✔
- Б) Увек чини модел слободним
- Ц) Само повећава број језика које модел подржава
- Д) Увек скратите одговоре и смањите цену
Опис: Реасонинг моде омогућава моделу да 'размишља' корак по корак пре него што да одговор; Повећава прецизност у вишестепеним и сложеним проблемима, али такође повећава трошкове и кашњење јер генерише више токена.
10. Који је најпоузданији приступ приликом евалуације (евалуације) модела за сопствени бизнис?
- А) Само изабрати најпопуларнији модел и користити га без тестирања
- Б) Подесите мали сет тестова сопствених стварних задатака и упоредите моделе са њим ✔
- Ц) Само гледајући референтни резултат који се помиње у рекламама
- Д) Аутоматски прихватите модел са највишим контекстом прозора као најбољи
Објашњење: Уместо да се слепо ослањате на ранг листе, креирање малог скупа тестова сопствених стварних задатака и упоређивање модела на овом скупу откриће онај који заиста одговара вашем послу.
11. Како сазнање да резултат модела може да садржи 'халуцинације' треба да обликује ваш ток посла?
- А) Резултат треба увек сматрати тачним и директно објављивати
- Б) Халуцинације се виде само код бесплатних модела, а не код плаћених модела
- Ц) У критичним одлукама, излаз мора бити верификован од стране човека, а извори морају бити потврђени ✔
- Д) Халуцинација се може потпуно елиминисати једноставном променом модела
Објашњење: Халуцинација је када модел произведе информације које заправо нису истините, на поузданом језику. Због овог ризика, верификација резултата од стране човека треба да буде потребна, посебно за правне, медицинске и финансијске одлуке.
12. Која је основна логика приступа 'модел портфолиа' који су усвојиле зреле институције?
- А) Да би се обезбедила једноставност тако што ће сваки посао обавити један, најскупљи модел.
- Б) Коришћење само најјефтинијег модела и потпуно игнорисање квалитета
- Ц) Немојте користити никакве моделе и све радите ручно
- Д) Оптимизација трошкова и смањење зависности од једног добављача коришћењем различитих модела у складу са задатком ✔
Опис: Портфолио модела је коришћење различитих модела према задатку: јефтини модел за једноставне и обимне послове, моћан модел за сложене послове, отворени тежински/регионални модел за поверљиве податке. Ово истовремено оптимизује трошкове и смањује зависност од једног провајдера.
13. Зашто би земља порекла и политика задржавања података могли бити критеријум за избор модела?
- А) Зато што директно утиче на захтеве прописа, суверенитета података и приватности ✔
- Б) Само зато што одређује брзину одзива модела
- Ц) Зато што одређује формате датотека које модел подржава
- Д) Пошто нема практичног ефекта, то је само маркетиншки детаљ
Опис: Земља у којој се налази програмер модела и где/колико података се чува; Одлучујућа је у погледу правне регулативе, суверенитета података и приватности. На пример, за организацију која жели да буде домаћин у ЕУ, регионални провајдер или опција без складиштења постају важни.
14. Шта најбоље објашњава зашто је тражење 'једног најбољег модела' у задатку погрешно?
- А) Сви модели заправо имају потпуно исте могућности
- Б) Модели су јаки у различитим величинама, тако да 'најбољи' зависи од захтева посла ✔
- Ц) Најскупљи модел је аутоматски најбољи у сваком задатку
- Д) Избор модела треба да буде потпуно насумичан
Опис: Модели су јаки у различитим димензијама као што су брзина, цена, контекст, мултимодалност, приватност и образложење. Модел који је лидер у једној димензији може бити слаб у другој; тако да 'најбољи' увек зависи од захтева посла.