одиниці
1. Вступ до штучного інтелекту в науці про дані та аналітиці: робочий процес, ролі, межі, перевірка та етика 2. Збір даних і розуміння джерела: схема, вибірка, якість і усвідомлення витоків 3. Очищення та попередня обробка даних: відсутнє значення, перетворення викидів і типів 4. Дослідницький аналіз даних (EDA): розподіли, взаємозв’язки та початкове розуміння 5. Розробка функцій: генерація варіантів, кодування, масштабування та уникнення витоку 6. Побудова моделі: визначення проблеми, вибір алгоритму та розділення на навчання/тест 7. Оцінка моделі: показники, перехресна перевірка та екстремальне навчання 8. Візуалізація та оповідання: точна графіка, чесна графіка 9. Генерація коду: аналіз за допомогою ШІ за допомогою Python (pandas) і SQL 10. Витік даних і відтворюваність: тихі катастрофи та дисципліна 11. MLOps Foundation, етика, конфіденційність і відповідальна аналітика
одиниця 1 / 11

Вступ до штучного інтелекту в науці про дані та аналітиці: робочий процес, ролі, межі, перевірка та етика

Прибуток:

  • Здатність розрізняти шестиетапний робочий процес науки про дані (визначення проблеми, збір, очищення, виявлення, моделювання, комунікація) і повноваження, під керівництвом яких працює штучний інтелект на кожному етапі, відповідно до рівня ризику завдання
  • Можливість застосовувати дисципліну, яка перевіряє кожен результат штучного інтелекту, підключаючи його до джерела, запускаючи та порівнюючи, а також пропускаючи через експертну фільтрацію.
  • Здатність перетворити принципи відтворюваності та конфіденційності (запис у код, анонімність) у звички аналізу з першого дня

Необроблені, брудні та часто «брехливі» дані щодня потрапляють на стіл спеціаліста з обробки даних. У таблиці продажів стовпець дати записується в трьох різних форматах; у деяких рядках номери клієнтів порожні; Ім’я стовпця – «дохід», але він містить значення TL і USD. Робота Data Science полягає в тому, щоб прийняти надійне рішення з цього хаосу: зібрати дані, очистити їх, дослідити, створити модель, перевірити результат і перетворити його на історію. Штучний інтелект (штучний інтелект або скорочено AI — комп’ютерні системи, які можуть генерувати текст і код, розпізнавати шаблони, узагальнювати та робити прогнози) може торкнутися кожної ланки цього ланцюга: написати код очищення за лічені хвилини, порекомендувати графіки для дослідницького аналізу, інтерпретувати показники моделі, виправити SQL-запит. Але той самий штучний інтелект також може дати вам впевнену фабрикацію, наприклад «кореляцію 0,72», для даних, які він ніколи не бачив.

Цей перший розділ не є вступом до бібліотеки. Його мета полягає в тому, щоб роз’яснити, де розміщувати ШІ в робочому процесі обробки даних, а де ніколи. Давайте викладемо основний принцип із самого початку: ШІ — це помічник, а не дослідник даних. Рішення про те, які дані збирати, який показник вибрати, чи запускати модель у виробництво та де провести етичні межі, залежить від компетентного експерта. Неперевірений вихід ШІ ризикований, як і непідписаний звіт про аналіз.

Робочий процес науки про дані: наскрізна карта

Щоб зрозуміти проект даних, корисно розбити його на шість етапів. Весь цей модуль відповідає цій карті.

1. Визначення проблеми: що ми вимірюємо, чому, щоб підтримати яке рішення? Ця фаза не делегована ШІ; Це людина, яка визначає роботу.

2. Збір даних: визначення джерел, вилучення даних, вибірка. (Блок 2)

3. Очищення та попередня обробка даних: відсутнє значення, викид, перетворення типу. (Блок 3)

4. Дослідницький аналіз даних (EDA - Exploratory Data Analysis, етап розпізнавання розподілу та зв'язків даних «на око»): (Unit 4)

5. Розробка функцій і моделювання: генерація змінних, вибір алгоритму, навчання, оцінка. (Блок 5, 6, 7)

6. Комунікація та виробництво: Візуалізація, історія, MLOps (дисципліна взяття моделі в реальному часі та моніторингу). (Блок 8, 11)

ШІ працює з різними повноваженнями на кожному з цих шести етапів. У наведеній нижче таблиці підсумовано цей розподіл повноважень; Це єдина найважливіша таблиця модуля.

етап

Роль ШІ

Рівень ризику

Хто затверджує

Визначення проблеми

партнер по мозковому штурму

низький

Науковий спеціаліст з даних + зацікавлена сторона

Напишіть код очищення

Генератор ескізу коду

середній

Науковий спеціаліст (читає код)

Коментар EDA

сугестор шаблону

середній

науковець даних

Генерація ознак

Генератор ідей і коду

середньо-високий

Контроль витоку обов’язковий

Вибір моделі/метрика

консультант

висока

науковець даних

Рішення про запуск у виробництво

допоміжний вхід

дуже високий

Команда + власник бізнесу

Схвалення етики/конфіденційності

стимулятор

дуже високий

людина, завжди

Майте на увазі одне речення з цієї таблиці: у міру зростання ставок роль штучного інтелекту зменшується, а схвалення людей зростає.

Чому перевірка є серцем цього бізнесу

Мовні моделі ШІ виглядають надійно, але вони можуть бути невпевненими. На технічній мові це називається галюцинацією: це фабрикація неіснуючої інформації моделлю в плавному реченні, ніби це правда. У науці про дані це має три форми. По-перше, це фальшиве число: якщо ви запитаєте модель «яка середня сума замовлення», не надавши жодних даних, вона впевнено повідомить вам число, навіть якщо ніколи не бачила ваших даних. Друга — функція, якої не існує: модель може запропонувати функцію, якої взагалі не існує, наприклад pandas.read_excel_fast(). По-третє, неправильна статистична інтерпретація: модель може плавно повторювати класичну статистичну помилку, наприклад «p-value 0,04, тому гіпотеза правильна на 96%».

Дисципліна перевірки складається з трьох етапів:

  1. Посилання на джерело: кожне число, показник і тенденція мають надходити з ваших даних, а не з пам’яті штучного інтелекту. Використовуйте ШІ для коду, який працює з даними, а не для запам’ятовування даних.
  2. Запустіть і порівняйте: запустіть кожен фрагмент коду, наданий штучним інтелектом, самостійно; Порівняйте кожен отриманий показник із незалежною базовою лінією.
  3. Експертний фільтр: перевірте самі, чи суперечить результат статистиці та знанням домену.
Застереження: розміщення аналізу, написаного штучним інтелектом, у презентацію, не запускаючи та не читаючи його, схоже на представлення непідписаного звіту. Те, що код працює, не означає, що він правильний; Код, який підсумовує неправильний стовпець, також працює без помилок.

Відтворюваність: можливість отримати той самий результат двічі

Безшумний, але важливий принцип науки про дані — це відтворюваність: коли ви знову запускаєте аналіз через шість місяців або на іншому комп’ютері, ви отримуєте той самий результат. Цей ризик зростає під час роботи зі штучним інтелектом, тому що коли ви говорите ШІ «зробити цей графік» і відтворюєте його вручну, кроки зникають. Правило: кожен крок має бути зареєстрований у коді та контролі версій (як Git); На етапах, що включають випадковість, слід зафіксувати випадкове початкове значення (початкове значення генератора випадкових чисел; якщо його зафіксувати, результат буде повторюваним). Ми поглибимо цю тему в розділі 10; А поки візьміть за звичку: «Не клацайте вручну, пишіть кодом».

три міні-чохла

Випадок 1 — безпечне прискорення. Аналітик електронної комерції зазвичай витрачає півдня на очищення таблиці замовлень із 240 тисяч рядків. Він передав ШІ назви стовпців і перші 5 рядків (без особистих даних) і попросив код очищення панди. AI створив тягу за 8 секунд; Аналітик прочитав код рядок за рядком, виправив помилку в аналізі дати та запустив його. Тривалість: 35 хвилин замість 4 годин. ШІ надав код, перевірка залишилася за людиною.

Випадок 2 — вигадана метрична пастка. Стажер запитав ШІ: «Наскільки точні дані випадкового лісу?» без навчання моделі взагалі. «Близько 89%», — сказав AI. Інтерн включив це в презентацію; Коли справжня модель була навчена, точність становила 71%. Помилка: очікування показників без надання даних і моделей ШІ.

Випадок 3 — Тихий витік. Одна команда реалізувала запропоновану ШІ ідею «додати середнє значення цільової змінної як функцію», не ставлячи під сумнів це. Модель виконала 98% на тестовому наборі, але сталася збій у виробництві, оскільки ця функція пропускала майбутню інформацію (витік даних, блок 10). Помилка: не фільтрується статистично рекомендація AI.

Слабка підказка / Сильна підказка

Слабка підказка:

Проаналізуйте дані про продажі та скажіть мені середній дохід.

Це твердження є помилковим: штучному інтелекту не було надано даних, тому «середній дохід» можна лише вигадати. Не зрозумілі ні стовпці, ні період, ні валюта.

Потужна підказка:

Ваша роль: помічник, який допомагає досліднику даних. У мене є pandas DataFrame: df. Стовпці:- order_date (текст, у форматі "2024-03-01")- сума_tl (десятковий, NaN у деяких рядках)- customer_id (ціле число) Завдання: (1) написати код pandas, який обчислює середню суму, (2) пояснити, як він обробляє значення NaN, (3) перелічити припущення, які робить код. Не вигадуйте вміст даних; просто згенеруйте код, і я запусту та перевірю результат.

У цьому запиті зрозуміла схема, очікування та «заборона фабрикації». Ви все ще запускаєте та перевіряєте вихід самостійно.

Початки етики та конфіденційності

Наука про дані часто працює з особистими даними: записами клієнтів, пацієнтів, співробітників. KVKK (Закон про захист персональних даних) у Туреччині та GDPR у Європі захищають ці дані. Вставлення вашого справжнього імені, ідентифікатора, електронної пошти чи адреси в загальнодоступний інструмент ШІ є порушенням. Правило: анонімізуйте дані перед наданням спільного доступу, за потреби надайте лише схему (імена стовпців, типи) і фіктивний приклад рядка. Ми поглибимо тему етики в розділі 11; Давайте викладемо принцип із самого початку: щоб зрозуміти дані, часто достатньо поділитися їх структурою, а не змістом.

Поширені помилки

  • Очікування чисел/метрик без надання даних ШІ. Модель не може отримати доступ до даних; Номер, який він дає, фальшивий. Завжди обчислюйте та запускайте результат.
  • Думаючи, що робочий код правильний. Код, який обробляє неправильний стовпець, також працює без помилок; Не довіряй, не читаючи логіки.
  • Вставлення справжніх персональних даних у відкритий інструмент. Ім'я, ідентифікаційний номер, електронна пошта ніколи не розголошуються; Діаграми достатньо.
  • Виконання кроків вручну, а не записування їх у код. Аналіз, який не можна відтворити, є ненадійним.
  • Беззаперечно приймати інтерпретацію статистики ШІ. ШІ може повторювати класичні помилки в таких поняттях, як p-value і кореляція.
Порада: додайте короткий «рядок правила» до кожного сеансу штучного інтелекту: «Не вигадуйте вміст даних; просто згенеруйте код/аналіз, і я запусту та перевірю результат; укажіть «не впевнений», якщо ви не впевнені». Це одне речення значно знижує ризик галюцинацій.

Підсумовуючи

ШІ є потужним помічником у науці про дані: він прискорює очищення коду, інтерпретацію EDA, рекомендації моделей і візуалізацію. Але визначення проблеми, вибір показників, виробничі рішення та етичні межі належать людям. Робочий процес має шість етапів, і роль штучного інтелекту зменшується зі збільшенням ризику. Три звички є основою всього: зв’язування джерел (перевірка), відтворюваність (кодування) та анонімізація (конфіденційність). Після того, як ви засвоїте ці три, кожен інструмент у решті модуля стане для вас безпечним прискорювачем.

Аплікаційне завдання

Просто створіть схему маленької таблиці, яка у вас є (або гіпотетичної): назви стовпців, типи та 2-3 фіктивні приклади рядків (без реальних персональних даних). Попросіть штучного інтелекту надати код підсумкової статистики за допомогою шаблону «Потужна підказка» вище. Запустіть код, порівняйте вихідні дані з ручним значенням, перевірте наявність помилкових припущень і запишіть свої висновки в 5 пунктах.

контрольний список

  • [ ] Я щойно надав штучному інтелекту схему та підроблений зразок замість справжніх особистих даних?
  • [ ] Чи я прочитав і запустив створений код рядок за рядком?
  • [ ] Чи я самостійно перевіряв кожне число у вихідних даних?
  • [ ] Чи записав я кожен крок аналізу в код і зробив його повторюваним?
  • [ ] Чи я визначив рівень ризику місії та доручив остаточне рішення людині?