Добивки:
- Способност да се разликува работниот тек од шест фази на науката за податоци (дефиниција на проблем, собирање, чистење, откривање, моделирање, комуникација) и авторитетот под кој работи вештачката интелигенција во секоја фаза, според нивото на ризик на задачата
- Способност да се примени дисциплина која го потврдува секој излез на вештачка интелигенција со поврзување со изворот, извршување и споредување и поминување низ стручно филтрирање.
- Способност да се претворат принципите на репродуктивност и приватност (пишување во код, анонимизација) во навики за анализа од првиот ден
Необработени, неуредни и често „лажечки“ податоци секојдневно се спуштаат на бирото на научникот за податоци. Во табелата за продажба, колоната за датум е напишана во три различни формати; броевите на клиентите се празни во некои линии; Името на колоната е „приход“, но содржи и вредности на TL и USD. Работата на науката за податоци е да донесе сигурна одлука од овој хаос: да ги собере податоците, да ги исчисти, да ги истражи, да изгради модел, да го потврди резултатот и да го претвори во приказна. Вештачката интелигенција (ВИ, или скратено вештачка интелигенција - компјутерски системи што можат да генерираат текст и код, да препознаваат шеми, да резимираат и да прават предвидувања) може да ја допре секоја алка во овој синџир: пишување код за чистење за неколку минути, препорачување графикони за истражувачка анализа, толкување на метрика на моделот, корекција на SQL барање. Но, истата вештачка интелигенција може да ви даде и сигурна измислица како што е „корелација 0,72“ за податоци што никогаш не ги видел.
Оваа прва единица не е вовед во библиотека. Неговата цел е да разјасни каде да ја ставите вештачката интелигенција во работниот тек на науката за податоци и каде никогаш да не ја ставите. Ајде да го поставиме основниот принцип од почеток: ВИ е асистент, а не научник за податоци. Одлуката за тоа кои податоци да се соберат, за која метрика да се одлучи, дали да се стави модел во производство и каде да се постават етичките граници зависи од надлежниот експерт. Непроверениот излез на вештачката интелигенција е ризичен, како и непотпишан извештај за анализа.
Работен тек на науката за податоци: карта од крај до крај
За да се разбере проект со податоци, корисно е да се подели во шест фази. Целиот овој модул ја следи оваа карта.
1. Дефиниција на проблемот: Што мериме, зошто, за да поддржиме која одлука? Оваа фаза не е делегирана на вештачката интелигенција; Личноста е таа што ја дефинира работата.
2. Собирање податоци: Идентификување извори, вадење податоци, земање примероци. (Единица 2)
3. Чистење и претходна обработка на податоци: Недостасува вредност, оддалеченост, конверзија на тип. (Единица 3)
4. Истражувачка анализа на податоци (EDA - Exploratory Data Analysis, фаза на препознавање на дистрибуцијата и односите на податоците „од око“): (Unit 4)
5. Инженеринг на карактеристики и моделирање: Генерирање на променливи, избор на алгоритам, обука, евалуација. (Единица 5, 6, 7)
6. Комуникација и продукција: Визуелизација, приказна, MLOps (дисциплина на преземање на моделот во живо и негово следење). (Единица 8, 11)
ВИ работи со различен авторитет во секоја од овие шест фази. Табелата подолу ја резимира оваа распределба на овластувањата; Ова е единствената најважна табела на модулот.
Фаза
Улогата на вештачката интелигенција
Ниво на ризик
Кој одобрува
Дефиниција на проблемот
партнер за бура на идеи
низок
Научник за податоци + засегнати страни
Напишете код за чистење
Генератор на скици на кодови
средно
Научник за податоци (чита код)
Коментар на ЕДА
предлагач на шаблони
средно
научник за податоци
Генерирање карактеристики
Генератор на идеи и кодови
средно-висока
Контролата на истекување е задолжителна
Избор/метрика на модел
консултант
високо
научник за податоци
Одлука за пуштање во производство
помошен влез
многу високо
Тим + сопственик на бизнис
Одобрување за етика/приватност
стимуланс
многу високо
човек, секогаш
Имајте на ум една реченица од оваа табела: како што се зголемуваат влоговите, улогата на вештачката интелигенција се намалува и човечкото одобрување расте.
Зошто потврдата е срцето на овој бизнис
Моделите на јазик со вештачка интелигенција изгледаат сигурно, но можеби не се сигурни. На технички јазик, тоа се нарекува халуцинација: тоа е измислување на непостоечки информации од моделот во течна реченица како да е вистинита. Во науката за податоци, ова доаѓа во три форми. Првиот е лажен број: ако го прашате моделот „која е просечната сума на нарачката“ без да дадете никакви податоци, тој самоуверено ќе ви каже број, иако никогаш не ги видел вашите податоци. Втората е функција која не постои: моделот може да предложи функција која воопшто не постои, како што е pandas.read_excel_fast(). Трето, неточна статистичка интерпретација: моделот може непречено да повтори класична статистичка грешка како што е „p-вредноста е 0,04, така што хипотезата е 96% точна“.
Дисциплината за верификација се состои од три чекори:
- Врска до изворот: Секој број, стапка и тренд треба да потекнуваат од вашите податоци, а не од меморијата на вештачката интелигенција. Користете вештачка интелигенција за код што работи на податоци, а не за да запомни податоци.
- Стартувај и споредувај: Изврши го секое парче код дадено од ВИ самиот; Споредете ја секоја метрика што ја произведува со независна основна линија.
- Експертски филтер: тестирајте сами дали излезот е во спротивност со статистиката и знаењето за доменот.
Внимание: Ставањето анализа напишана од вештачката интелигенција во презентација без да ја извршите и да ја прочитате е како да презентирате непотпишан извештај. Само затоа што кодот работи не значи дека е точен; Кодот што ја сумира погрешната колона исто така работи без грешки.
Репродуктивност: можност да се произведе ист резултат двапати
Тивкиот, но критичен принцип на науката за податоци е репродуктивноста: кога повторно ќе извршите анализа шест месеци подоцна или на друг компјутер, го добивате истиот резултат. Овој ризик се зголемува кога работите со вештачка интелигенција, бидејќи кога ќе ѝ кажете на вештачката интелигенција да го „направи овој графикон“ и да го пушти рачно, чекорите исчезнуваат. Правило: секој чекор мора да биде регистриран во кодот и контролата на верзијата (како Git); Во чекорите што вклучуваат случајност, случајното семе (почетната вредност на генераторот на случаен број; ако е фиксно, резултатот ќе може да се повтори) треба да се поправи. Оваа тема ќе ја продлабочиме во целина 10; Засега, стекнете ја оваа навика: „Не кликајте со рака, пишувајте со код“.
три мини футроли
Случај 1 - Безбедно забрзување. Аналитичарот за е-трговија вообичаено би поминал половина ден расчистувајќи табела за нарачки од 240 илјади редови. Тој ги дал имињата на колоните и првите 5 реда (без лични податоци) на вештачката интелигенција и побарал код за чистење на пандите. ВИ произведе нацрт за 8 секунди; Аналитичарот го прочита кодот ред по ред, поправи грешка во парсирањето на датумите и го изврши. Времетраење: 35 минути наместо 4 часа. Вештачката интелигенција обезбеди код, а верификацијата остана кај човекот.
Случај 2 - Направена метричка замка. Практикантот ја праша вештачката интелигенција: „Колку е точна случајната шума на овие податоци? без воопшто да го тренирате моделот. „Околу 89%,“ рече вештачката интелигенција. Практикантот го стави ова во презентацијата; Кога беше обучен вистинскиот модел, точноста беше 71%. Грешка: чекање метрика без давање податоци и модели на вештачката интелигенција.
Случај 3 - Тивко истекување. Еден тим ја имплементираше идејата предложена од вештачката интелигенција за „додавање на средната вредност на целната променлива како карактеристика“ без да ја преиспитува. Моделот изведе 98% на тест сет, но падна во производството бидејќи функцијата протекуваше идни информации (протекување на податоци, единица 10). Грешка: Не статистички филтрирање на препораката за вештачка интелигенција.
Слаб промпт / Силен промпт
Слаба навестување:
Анализирајте ги овие податоци за продажба и кажете ми го просечниот приход.
Ова тврдење е погрешно: на вештачката интелигенција не и беа дадени податоци, така што „просечниот приход“ може да се измисли само. Не се јасни ниту колоните, ниту периодот, ниту валутата.
Моќен потсетник:
Вашата улога: асистент кој му помага на научник за податоци. Имам панди DataFrame: df. Колони: - order_date (текст, во формат „2024-03-01“) - износ_tl (децимална, NaN во некои редови) - клиент_ид (цел број) Задача: (1) напишете код за панди што ја пресметува просечната сума, (2) објасни како се справува со вредностите на NaN, (3) наведете ја шифрата што прави претпоставки. Не ја измислувајте содржината на податоците; само генерирај код и јас ќе стартувам и ќе го потврдам резултатот.
Во ова барање јасна е шемата, очекувањето и „забраната за фабрикување“. Сè уште трчате и сами го потврдувате излезот.
Почетоците на етиката и приватноста
Науката за податоци често работи со лични податоци: евиденција на клиенти, пациенти, вработени. KVKK (Закон за заштита на лични податоци) во Турција и GDPR во Европа ги штитат овие податоци. Вметнувањето на вашето вистинско име, лична карта, е-пошта или адреса во јавна алатка за вештачка интелигенција е прекршување. Правило: анонимизирајте ги податоците пред да ги споделите, само наведете шема (имиња на колони, типови) и лажен пример ред ако е потребно. Темата за етика ќе ја продлабочиме во целина 11; Да го поставиме принципот од почеток: за да се разберат податоците, често е доволно споделување на нивната структура, а не нивната содржина.
Вообичаени грешки
- Се чекаат бројки/метрика без давање податоци на вештачката интелигенција. Моделот не може да пристапи до податоците; Бројот што го дава е лажен. Секогаш имајте го резултатот пресметан и стартувајте.
- Мислејќи дека работниот код е точен. Кодот што манипулира со погрешна колона исто така работи без грешки; Не верувајте без да ја прочитате логиката.
- Вметнување вистински лични податоци во отворената алатка. Името, матичен број, е-пошта никогаш не се споделуваат; Дијаграмот е доволен.
- Правете ги чекорите рачно и не ги запишувате во кодот. Анализата што не може да се репродуцира е неверодостојна.
- Прифаќање на интерпретацијата на статистиката на вештачката интелигенција без прашање. Вештачката интелигенција може да повтори класични грешки во концепти како што се p-вредност и корелација.
Совет: вклучете кратка „линија на правила“ во секоја од вашите сесии за вештачка интелигенција: „Не измислувајте ја содржината на податоците; само генерирај код/анализа и јас ќе извршам и ќе го потврдам резултатот; означете „не сум сигурен“ каде не сте сигурни“. Оваа единствена реченица значително го намалува ризикот од халуцинации.
Сумирано
Вештачката интелигенција е моќен асистент во науката за податоци: го забрзува кодот за чистење, толкувањето на EDA, препораките за модели и визуелизацијата. Но, дефиницијата на проблемот, метричкиот избор, одлуката за производство и етичките граници припаѓаат на луѓето. Работниот тек има шест фази, а улогата на вештачката интелигенција станува помала како што се зголемува ризикот. Три навики се основата на сè: поврзување на изворот (валидација), репродуктивност (кодирање) и анонимизација (доверливост). Откако ќе ги интернализирате овие три, секоја алатка во остатокот од модулот станува безбеден акцелератор за вас.
Задача за апликација
Само направете шема на мала табела што ја имате (или хипотетичка): имиња на колони, типови и 2-3 лажни примери на редови (без вистински лични податоци). Прашајте ја вештачката интелигенција за резиме код за статистика користејќи го шаблонот „Моќен промпт“ погоре. Вклучете го кодот, споредете го излезот со рачна вредност, проверете дали има лажни претпоставки и забележете ги вашите наоди во 5 точки.
листа за проверка
- [ ] Дали само и дадов шема на вештачката интелигенција и лажен примерок наместо вистински лични податоци?
- [ ] Дали го прочитав и го извршив кодот што го произведе ред по ред?
- [ ] Дали независно го потврдив секој број на излезот?
- [ ] Дали го напишав секој чекор од анализата во кодот и го направив повторлив?
- [ ] Дали го одредив нивото на ризик на мисијата и му ја доделив конечната одлука на човек?