единици
1. Въведение в изкуствения интелект в науката за данните и анализа: работен процес, роли, граници, валидиране и етика 2. Събиране на данни и разбиране на източника: схема, вземане на проби, качество и информираност за течове 3. Почистване и предварителна обработка на данни: Липсваща стойност, отклонение и преобразуване на типа 4. Проучвателен анализ на данни (EDA): Разпределения, връзки и първоначални прозрения 5. Инженеринг на функции: Генериране на варианти, кодиране, мащабиране и избягване на изтичане 6. Изграждане на модел: дефиниране на проблем, избор на алгоритъм и разделяне на обучение/тест 7. Оценка на модела: показатели, кръстосано валидиране и екстремно обучение 8. Визуализация и разказване на истории: точни графики, честни графики 9. Генериране на код: AI-подпомогнат анализ с Python (pandas) и SQL 10. Изтичане на данни и възпроизводимост: тихи бедствия и дисциплина 11. Фондация MLOps, етика, поверителност и отговорен анализ
единица 1 / 11

Въведение в изкуствения интелект в науката за данните и анализа: работен процес, роли, граници, валидиране и етика

Печалби:

  • Способност за разграничаване на шестетапния работен процес на науката за данни (дефиниране на проблем, събиране, почистване, откриване, моделиране, комуникация) и органа, под който изкуственият интелект работи на всеки етап, според нивото на риск на задачата
  • Възможност за прилагане на дисциплина, която проверява всеки изход от изкуствен интелект, като го свързва с източника, стартира и сравнява и го предава през експертно филтриране.
  • Способност за превръщане на принципите за възпроизводимост и поверителност (писане в код, анонимизиране) в навици за анализ от първия ден

Сурови, разхвърляни и често „лъжливи“ данни попадат на бюрото на учените по данни всеки ден. В таблицата за продажби колоната за дата е написана в три различни формата; клиентските номера са празни в някои редове; Името на колона е „доход“, но съдържа стойности както в TL, така и в USD. Работата на науката за данните е да вземе надеждно решение от този хаос: да събере данните, да ги почисти, да ги проучи, да изгради модел, да потвърди резултата и да го превърне в история. Изкуственият интелект (AI или накратко AI—компютърни системи, които могат да генерират текст и код, да разпознават модели, да обобщават и да правят прогнози) може да докосне всяко звено в тази верига: писане на почистващ код за минути, препоръчване на графики за проучвателен анализ, интерпретиране на показател на модел, коригиране на SQL заявка. Но същият AI може също да ви даде уверена измислица като „корелация 0,72“ за данни, които никога не е виждал.

Тази първа част не е въведение в библиотеката. Целта му е да изясни къде да поставим AI в работния процес на науката за данни и къде никога да не го поставяме. Нека изложим основния принцип от самото начало: AI е асистент, а не специалист по данни. Решението какви данни да се съберат, какъв показател да се вземе решение, дали да се пусне модел в производство и къде да се начертаят етични граници, остава на компетентния експерт. Непроверен изход от AI е рискован, както и неподписан доклад за анализ.

Работен поток за наука за данни: карта от край до край

За да разберете проект с данни, е полезно да го разделите на шест фази. Целият този модул следва тази карта.

1. Дефиниране на проблема: Какво измерваме, защо, за да подкрепим кое решение? Тази фаза не е делегирана на AI; Човекът е този, който определя работата.

2. Събиране на данни: Идентифициране на източници, извличане на данни, вземане на проби. (Единица 2)

3. Почистване и предварителна обработка на данни: Липсваща стойност, отклонение, преобразуване на типа. (Единица 3)

4. Проучвателен анализ на данни (EDA - Exploratory Data Analysis, етапът на разпознаване на разпределението и връзките на данните "на око"): (Единица 4)

5. Инженеринг и моделиране на характеристики: Генериране на променливи, избор на алгоритъм, обучение, оценка. (Единица 5, 6, 7)

6. Комуникация и производство: Визуализация, история, MLOps (дисциплина за вземане на модела на живо и наблюдението му). (Единица 8, 11)

AI работи с различен авторитет във всеки от тези шест етапа. Таблицата по-долу обобщава това разпределение на правомощията; Това е най-важната таблица на модула.

Етап

Роля на AI

Ниво на риск

Кой одобрява

Дефиниране на проблема

мозъчна атака партньор

ниско

Учен по данни + заинтересована страна

Напишете код за почистване

Генератор на скици на кодове

среден

Учен по данни (чете код)

Коментар на EDA

шаблон сугестор

среден

учен по данни

Генериране на функции

Генератор на идеи и кодове

средно-висока

Контролът на течовете е задължителен

Избор на модел/метрика

консултант

високо

учен по данни

Решение за пускане в производство

спомагателен вход

много високо

Екип + собственик на бизнес

Одобрение за етика/поверителност

стимулант

много високо

човешки, винаги

Имайте предвид едно изречение от тази диаграма: с нарастването на залозите ролята на ИИ се свива и одобрението на хората расте.

Защо проверката е сърцето на този бизнес

Езиковите модели на AI изглеждат сигурни, но може и да не са сигурни. На технически език това се нарича халюцинация: това е измислянето от модела на несъществуваща информация в плавно изречение, сякаш е истина. В науката за данните това се предлага в три форми. Първият е фалшив номер: ако попитате модела „каква е средната сума на поръчката“, без да дадете никакви данни, той уверено ще ви каже число, въпреки че никога не е виждал вашите данни. Втората е функция, която не съществува: моделът може да предложи функция, която изобщо не съществува, като pandas.read_excel_fast(). Трето, неправилна статистическа интерпретация: моделът може гладко да повтори класическа статистическа грешка като „p-стойността е 0,04, така че хипотезата е 96% правилна“.

Дисциплината за проверка се състои от три стъпки:

  1. Връзка към източника: Всяко число, процент и тенденция трябва да идват от вашите данни, а не от паметта на AI. Използвайте AI за код, който работи с данни, а не за запомняне на данни.
  2. Стартирайте и сравнете: Стартирайте сами всяка част от кода, дадена от AI; Сравнете всеки показател, който произвежда, с независима базова линия.
  3. Експертен филтър: Тествайте сами дали резултатът противоречи на статистиката и познанията за домейна.
Внимание: Поставянето на анализ, написан от AI в презентация, без да се изпълнява и чете, е като представяне на неподписан доклад. Това, че кодът работи, не означава, че е правилен; Код, който сумира грешната колона, също работи без грешки.

Възпроизводимост: възможност за получаване на същия резултат два пъти

Тихият, но критичен принцип на науката за данните е възпроизводимостта: когато стартирате анализ отново шест месеца по-късно или на различен компютър, получавате същия резултат. Този риск се увеличава, когато работите с AI, защото когато кажете на AI "направи тази графика" и я възпроизведете ръчно, стъпките изчезват. Правило: всяка стъпка трябва да бъде регистрирана в кода и контрола на версиите (като Git); При стъпки, включващи произволност, произволното начално число (първоначалната стойност на генератора на произволни числа; ако е фиксирано, резултатът ще бъде повторим) трябва да бъде фиксирано. Ще задълбочим тази тема в Раздел 10; Засега придобийте този навик: „Не щракайте на ръка, пишете с код“.

три мини калъфа

Случай 1 — Безопасно ускоряване. Един анализатор на електронната търговия обикновено би прекарал половин ден в изчистване на таблица с поръчки от 240 хиляди реда. Той даде имената на колоните и първите 5 реда (без лични данни) на AI ​​и поиска кода за почистване на pandas. AI създаде газ за 8 секунди; Анализаторът прочете кода ред по ред, поправи грешка в анализирането на датата и го пусна. Продължителност: 35 минути вместо 4 часа. AI предостави код, проверката остана при човека.

Случай 2 — Измисленият метричен капан. Стажант попита изкуствения интелект: „Колко точна е случайната гора на тези данни?“ без изобщо да тренирате модела. „Около 89%“, каза AI. Стажантът постави това в презентацията; Когато истинският модел беше обучен, точността беше 71%. Грешка: Изчакване на показатели без предоставяне на данни и модели на AI.

Случай 3 — Безшумен теч. Един екип приложи предложената от AI идея за „добавяне на средната стойност на целевата променлива като характеристика“, без да я поставя под въпрос. Моделът се представи 98% на тестовия набор, но се срина в производството, защото функцията изтичаше бъдеща информация (изтичане на данни, модул 10). Грешка: Не филтрира статистически препоръката на AI.

Слаба подкана / Силна подкана

Слаба подкана:

Анализирайте тези данни за продажбите и ми кажете средния приход.

Това твърдение е погрешно: на AI не са дадени данни, така че „средният доход“ може да бъде само компенсиран. Нито колоните, нито периодът, нито валутата са ясни.

Мощна подкана:

Вашата роля: асистент, помагащ на специалист по данни. Имам pandas DataFrame: df. Колони:- order_date (текст, във формат "2024-03-01")- amount_tl (десетичен, NaN в някои редове)- customer_id (цяло число) Задача: (1) напишете кода на pandas, който изчислява средната сума, (2) обяснете как борави с NaN стойности, (3) избройте предположенията, които кодът прави. Не измисляйте съдържанието на данните; просто генерирайте код и аз ще стартирам и ще проверя резултата.

В това искане схемата, очакването и "забраната за измислици" са ясни. Все още изпълнявате и проверявате изхода сами.

Началото на етиката и неприкосновеността на личния живот

Науката за данни често работи с лични данни: записи на клиенти, пациенти, служители. KVKK (Закон за защита на личните данни) в Турция и GDPR в Европа защитават тези данни. Поставянето на вашето истинско име, лична карта, имейл или адрес в публичен AI инструмент е нарушение. Правило: анонимизирайте данните преди споделяне, предоставяйте само схема (имена на колони, типове) и фиктивен примерен ред, ако е необходимо. Ще задълбочим темата за етиката в Раздел 11; Нека поставим принципа от самото начало: За да разберем данните, често е достатъчно да споделим тяхната структура, а не тяхното съдържание.

Често срещани грешки

  • Изчакване на числа/метрики, без да се предоставят данни на AI. Моделът няма достъп до данните; Номерът, който дава е фалшив. Винаги изчислявайте и изпълнявайте резултата.
  • Мисля, че работният код е правилен. Кодът, който манипулира грешната колона, също се изпълнява без грешки; Не се доверявайте без да прочетете логиката.
  • Поставяне на реални лични данни в отворения инструмент. Никога не се споделя име, личен номер, имейл; Диаграмата е достатъчна.
  • Изпълнение на стъпките ръчно и не записването им в кода. Анализът, който не е възпроизводим, е ненадежден.
  • Приемане на интерпретацията на статистиката от AI без съмнение. AI може да повтаря класически грешки в понятия като p-стойност и корелация.
Съвет: Включете кратък „ред с правила“ във всяка от вашите AI сесии: „Не измисляйте съдържанието на данните; просто генерирайте код/анализ и аз ще стартирам и ще проверя резултата; посочете „не съм сигурен“ там, където не сте сигурни.“ Това едно изречение значително намалява риска от халюцинации.

В обобщение

AI е мощен помощник в науката за данни: той ускорява почистването на кода, EDA интерпретацията, препоръчването на модела и визуализацията. Но дефинирането на проблема, изборът на метрика, производственото решение и етичните граници принадлежат на хората. Работният процес има шест етапа и ролята на AI става по-малка с нарастването на риска. Три навика са в основата на всичко: свързване на източници (валидиране), възпроизводимост (кодиране) и анонимизиране (конфиденциалност). След като усвоите тези три, всеки инструмент в останалата част от модула се превръща в безопасен ускорител за вас.

Задача за приложение

Просто направете схема на малка таблица, която имате (или хипотетична): имена на колони, типове и 2-3 фиктивни примерни реда (без реални лични данни). Помолете AI за обобщен статистически код, като използвате шаблона „Мощна подкана“ по-горе. Стартирайте кода, сравнете изхода с ръчна стойност, проверете за фалшиви предположения и отбележете констатациите си в 5 точки.

контролен списък

  • [ ] Току-що дадох на AI схема и фалшива извадка вместо истински лични данни?
  • [ ] Прочетох ли и стартирах ли кода, който той създаде ред по ред?
  • [ ] Проверил ли съм независимо всяко число в изхода?
  • [ ] Записах ли всяка стъпка от анализа в кода и направих ли го повторим?
  • [ ] Определих ли нивото на риск на мисията и възложих ли окончателното решение на човек?