Единицы
1. Введение в искусственный интеллект в науке о данных и аналитике: рабочий процесс, роли, границы, проверка и этика 2. Сбор данных и понимание источников: схема, выборка, качество и осведомленность об утечках 3. Очистка и предварительная обработка данных: отсутствующее значение, выбросы и преобразование типов 4. Исследовательский анализ данных (EDA): распределения, взаимосвязи и первоначальные выводы 5. Разработка функций: создание вариантов, кодирование, масштабирование и предотвращение утечек 6. Построение модели: постановка задачи, выбор алгоритма и разделение обучения/тестирования 7. Оценка модели: метрики, перекрестная проверка и экстремальное обучение 8. Визуализация и рассказывание историй: точная графика, честная графика 9. Генерация кода: анализ с помощью искусственного интеллекта с помощью Python (Pandas) и SQL 10. Утечка данных и воспроизводимость: тихие катастрофы и дисциплина 11. Фонд MLOps, этика, конфиденциальность и ответственная аналитика
Единица 1 / 11

Введение в искусственный интеллект в науке о данных и аналитике: рабочий процесс, роли, границы, проверка и этика

Прибыль:

  • Способность различать шестиэтапный рабочий процесс обработки данных (определение проблемы, сбор, очистка, обнаружение, моделирование, коммуникация) и полномочия, под которыми искусственный интеллект работает на каждом этапе, в зависимости от уровня риска задачи.
  • Способность применять дисциплину, которая проверяет каждый вывод искусственного интеллекта, подключая его к источнику, запуская и сравнивая его, а также пропуская через экспертную фильтрацию.
  • Возможность превратить принципы воспроизводимости и конфиденциальности (запись в код, анонимизация) в привычки анализа с первого дня.

Необработанные, беспорядочные и часто «лживые» данные каждый день попадают на стол специалиста по обработке данных. В таблице продаж столбец даты записывается в трех разных форматах; номера клиентов в некоторых строках пусты; Название столбца — «доход», но он содержит значения как в TL, так и в долларах США. Задача науки о данных — принять надежное решение из этого хаоса: собрать данные, очистить их, изучить, построить модель, проверить результат и превратить его в историю. Искусственный интеллект (ИИ или сокращенно ИИ — компьютерные системы, которые могут генерировать текст и код, распознавать закономерности, суммировать и делать прогнозы) может коснуться каждого звена в этой цепочке: написать код очистки за считанные минуты, рекомендовать графики для исследовательского анализа, интерпретировать метрики модели, исправить SQL-запрос. Но тот же ИИ может также дать вам уверенную выдумку, такую ​​как «корреляция 0,72», для данных, которых он никогда не видел.

Этот первый раздел не является введением в библиотеку. Его цель — прояснить, где использовать ИИ в рабочем процессе обработки данных, а где его никогда не использовать. Давайте с самого начала изложим основной принцип: ИИ — помощник, а не специалист по обработке данных. Решение о том, какие данные собирать, какую метрику выбрать, запускать ли модель в производство и где провести этические границы, остается за компетентным экспертом. Непроверенные данные ИИ представляют опасность, как и неподписанный аналитический отчет.

Рабочий процесс обработки данных: комплексная карта

Чтобы понять проект обработки данных, полезно разбить его на шесть этапов. Весь этот модуль следует этой карте.

1. Определение проблемы: что мы измеряем, почему и для поддержки какого решения? Этот этап не делегируется ИИ; Именно человек определяет работу.

2. Сбор данных: определение источников, извлечение данных, отбор проб. (Блок 2)

3. Очистка и предварительная обработка данных: пропущенное значение, выбросы, преобразование типов. (Блок 3)

4. Исследовательский анализ данных (EDA – Exploratory Data Analysis, этап распознавания распределения и взаимосвязей данных «на глаз»): (Блок 4)

5. Разработка функций и моделирование: генерация переменных, выбор алгоритма, обучение, оценка. (Блок 5, 6, 7)

6. Коммуникация и производство: визуализация, история, MLOps (дисциплина запуска модели в эксплуатацию и ее мониторинга). (блок 8, 11)

На каждом из этих шести этапов ИИ действует с разными полномочиями. В таблице ниже суммировано это распределение полномочий; Это самая важная таблица модуля.

Этап

Роль ИИ

Уровень риска

Кто одобряет

Определение проблемы

партнер по мозговому штурму

низкий

Специалист по данным + заинтересованная сторона

Напишите код очистки

Генератор эскизов кода

средний

Специалист по данным (читает код)

Комментарий EDA

подсказчик шаблона

средний

специалист по данным

Генерация функций

Генератор идей и кода

средне-высокий

Контроль утечек обязателен

Выбор модели/показатель

консультант

высокий

специалист по данным

Решение о запуске в производство

вспомогательный вход

очень высокий

Команда + владелец бизнеса

Одобрение этики/конфиденциальности

стимулятор

очень высокий

человек, всегда

Имейте в виду одно предложение из этой таблицы: по мере того, как ставки растут, роль ИИ уменьшается, а одобрение людей растет.

Почему проверка — это сердце этого бизнеса

Модели языка ИИ выглядят надежными, но они могут быть и ненадежными. На техническом языке это называется галлюцинацией: это выдумка модели несуществующей информации в беглом предложении, как если бы она была правдой. В науке о данных это происходит в трех формах. Первый — фейковый номер: если вы спросите модель «какова средняя сумма заказа», не сообщая никаких данных, она уверенно назовет вам цифру, хотя никогда не видела ваших данных. Вторая — это функция, которой не существует: модель может предлагать функцию, которая вообще не существует, например pandas.read_excel_fast(). В-третьих, неверная статистическая интерпретация: модель может плавно повторять классическую статистическую ошибку, например, «значение p равно 0,04, значит, гипотеза верна на 96%».

Проверочная дисциплина состоит из трех этапов:

  1. Ссылка на источник: каждое число, скорость и тенденция должны быть получены из ваших данных, а не из памяти ИИ. Используйте ИИ для кода, который работает с данными, а не для его запоминания.
  2. Запустите и сравните: запустите каждый фрагмент кода, заданный ИИ, самостоятельно; Сравните каждую метрику, которую он производит, с независимым базовым уровнем.
  3. Экспертный фильтр: проверьте сами, противоречат ли полученные результаты статистике и знанию предметной области.
Внимание: помещать анализ, написанный ИИ, в презентацию, не запуская и не читая его, — это все равно, что представлять неподписанный отчет. Тот факт, что код работает, не означает, что он правильный; Код, суммирующий неправильный столбец, также работает без ошибок.

Воспроизводимость: возможность дважды получить один и тот же результат.

Молчаливый, но важнейший принцип науки о данных — это воспроизводимость: если вы проведете анализ еще раз через шесть месяцев или на другом компьютере, вы получите тот же результат. Этот риск увеличивается при работе с ИИ, потому что когда вы говорите ИИ «сделать этот график» и воспроизвести его вручную, шаги исчезают. Правило: каждый шаг должен быть прописан в системе контроля версий и кода (например, в Git); На этапах, связанных со случайностью, должно быть зафиксировано случайное начальное число (начальное значение генератора случайных чисел; если оно фиксировано, результат будет повторяемым). Мы углубим эту тему в модуле 10; А пока выработайте себе привычку: «Не нажимайте вручную, пишите в коде».

три мини-кейса

Случай 1. Безопасное ускорение. Аналитик электронной коммерции обычно тратит полдня на очистку таблицы заказов из 240 тысяч строк. Он отдал ИИ названия столбцов и первые 5 строк (без личных данных) и запросил код очистки панды. ИИ произвел черновик за 8 секунд; Аналитик прочитал код построчно, исправил ошибку в парсинге даты и запустил его. Продолжительность: 35 минут вместо 4 часов. ИИ предоставил код, проверка осталась за человеком.

Случай 2. Выдуманная метрическая ловушка. Стажер спросил ИИ: «Насколько точен случайный лес в этих данных?» без обучения модели вообще. «Около 89%», — сказал AI. Стажер включил это в презентацию; При обучении реальной модели точность составила 71%. Ошибка: ждать метрик, не предоставляя данные и модели ИИ.

Случай 3 — Тихая утечка. Одна команда реализовала предложенную ИИ идею «добавить среднее значение целевой переменной в качестве признака», не подвергая ее сомнению. Модель работала на тестовом наборе на 98 %, но в рабочей среде произошел сбой из-за утечки информации о будущем (утечка данных, модуль 10). Ошибка: Не проводить статистическую фильтрацию рекомендаций ИИ.

Слабая подсказка / Сильная подсказка

Слабая подсказка:

Проанализируйте эти данные о продажах и сообщите мне средний доход.

Это утверждение ошибочно: ИИ не предоставил данных, поэтому «средний доход» можно только вычислить. Ни столбцы, ни период, ни валюта не ясны.

Мощная подсказка:

Ваша роль: помощник специалиста по обработке данных. У меня есть DataFrame pandas: df. Столбцы: — order_date (текст, в формате «2024-03-01») — sum_tl (десятичное число, NaN в некоторых строках) — customer_id (целое число). Задача: (1) написать код pandas, который вычисляет среднюю сумму, (2) объяснить, как он обрабатывает значения NaN, (3) перечислить предположения, которые делает код. Не выдумывайте содержание данных; просто сгенерируйте код, а я запущу и проверю результат.

В этом запросе понятны схема, ожидание и «запрет фабрикации». Вы все равно запускаете и проверяете вывод самостоятельно.

Начало этики и конфиденциальности

Наука о данных часто работает с личными данными: записями клиентов, пациентов, сотрудников. KVKK (Закон о защите персональных данных) в Турции и GDPR в Европе защищают эти данные. Вставка вашего настоящего имени, идентификатора, адреса электронной почты или адреса в общедоступный инструмент искусственного интеллекта является нарушением. Правило: анонимизируйте данные перед отправкой, при необходимости предоставляйте только схему (имена столбцов, типы) и фиктивную строку примера. Мы углубим тему этики в модуле 11; Давайте изложим принцип с самого начала: чтобы понять данные, часто достаточно поделиться их структурой, а не содержанием.

Распространенные ошибки

  • Ожидание чисел/показателей без передачи данных ИИ. Модель не может получить доступ к данным; Номер, который он дает, фейковый. Всегда рассчитывайте результат и запускайте его.
  • Думая, что рабочий код правильный. Код, который обрабатывает не тот столбец, также выполняется без ошибок; Не доверяйте, не прочитав логику.
  • Вставка реальных личных данных в открытый инструмент. Имя, идентификационный номер, адрес электронной почты никогда не разглашаются; Схемы достаточно.
  • Выполнение шагов вручную, а не прописывание их в коде. Анализ, который не воспроизводится, ненадежен.
  • Безоговорочное принятие интерпретации статистики ИИ. ИИ может повторять классические ошибки в таких понятиях, как p-значение и корреляция.
Совет: Включите короткую «строку правила» в каждый сеанс ИИ: «Не придумывайте содержание данных; просто сгенерируйте код/анализ, а я запущу и проверю результат; укажите «не уверен», где вы не уверены». Это единственное предложение значительно снижает риск возникновения галлюцинаций.

В итоге

ИИ — мощный помощник в науке о данных: он ускоряет очистку кода, интерпретацию EDA, рекомендации моделей и визуализацию. Но определение проблемы, выбор показателей, производственные решения и этические границы принадлежат людям. Рабочий процесс состоит из шести этапов, и роль ИИ становится меньше по мере увеличения риска. В основе всего лежат три привычки: связывание источников (проверка), воспроизводимость (кодирование) и анонимизация (конфиденциальность). Как только вы усвоите эти три, каждый инструмент в остальной части модуля станет для вас безопасным ускорителем.

Задача приложения

Просто создайте схему небольшой таблицы, которая у вас есть (или гипотетическая): имена столбцов, типы и 2-3 фиктивные строки-примеры (без реальных личных данных). Попросите у ИИ код сводной статистики, используя приведенный выше шаблон «Мощная подсказка». Запустите код, сравните выходные данные с заданным вручную значением, проверьте наличие ложных предположений и запишите свои выводы в 5 пунктах списка.

контрольный список

  • [ ] Я только что дал ИИ схему и поддельный образец вместо реальных личных данных?
  • [ ] Прочитал ли я и запустил созданный им код построчно?
  • [ ] Проверил ли я независимо каждое число в выходных данных?
  • [ ] Записал ли я каждый этап анализа в код и сделал ли его повторяемым?
  • [ ] Определил ли я уровень риска миссии и поручил ли окончательное решение человеку?