Прибыль:
- Способность различать шестиэтапный рабочий процесс обработки данных (определение проблемы, сбор, очистка, обнаружение, моделирование, коммуникация) и полномочия, под которыми искусственный интеллект работает на каждом этапе, в зависимости от уровня риска задачи.
- Способность применять дисциплину, которая проверяет каждый вывод искусственного интеллекта, подключая его к источнику, запуская и сравнивая его, а также пропуская через экспертную фильтрацию.
- Возможность превратить принципы воспроизводимости и конфиденциальности (запись в код, анонимизация) в привычки анализа с первого дня.
Необработанные, беспорядочные и часто «лживые» данные каждый день попадают на стол специалиста по обработке данных. В таблице продаж столбец даты записывается в трех разных форматах; номера клиентов в некоторых строках пусты; Название столбца — «доход», но он содержит значения как в TL, так и в долларах США. Задача науки о данных — принять надежное решение из этого хаоса: собрать данные, очистить их, изучить, построить модель, проверить результат и превратить его в историю. Искусственный интеллект (ИИ или сокращенно ИИ — компьютерные системы, которые могут генерировать текст и код, распознавать закономерности, суммировать и делать прогнозы) может коснуться каждого звена в этой цепочке: написать код очистки за считанные минуты, рекомендовать графики для исследовательского анализа, интерпретировать метрики модели, исправить SQL-запрос. Но тот же ИИ может также дать вам уверенную выдумку, такую как «корреляция 0,72», для данных, которых он никогда не видел.
Этот первый раздел не является введением в библиотеку. Его цель — прояснить, где использовать ИИ в рабочем процессе обработки данных, а где его никогда не использовать. Давайте с самого начала изложим основной принцип: ИИ — помощник, а не специалист по обработке данных. Решение о том, какие данные собирать, какую метрику выбрать, запускать ли модель в производство и где провести этические границы, остается за компетентным экспертом. Непроверенные данные ИИ представляют опасность, как и неподписанный аналитический отчет.
Рабочий процесс обработки данных: комплексная карта
Чтобы понять проект обработки данных, полезно разбить его на шесть этапов. Весь этот модуль следует этой карте.
1. Определение проблемы: что мы измеряем, почему и для поддержки какого решения? Этот этап не делегируется ИИ; Именно человек определяет работу.
2. Сбор данных: определение источников, извлечение данных, отбор проб. (Блок 2)
3. Очистка и предварительная обработка данных: пропущенное значение, выбросы, преобразование типов. (Блок 3)
4. Исследовательский анализ данных (EDA – Exploratory Data Analysis, этап распознавания распределения и взаимосвязей данных «на глаз»): (Блок 4)
5. Разработка функций и моделирование: генерация переменных, выбор алгоритма, обучение, оценка. (Блок 5, 6, 7)
6. Коммуникация и производство: визуализация, история, MLOps (дисциплина запуска модели в эксплуатацию и ее мониторинга). (блок 8, 11)
На каждом из этих шести этапов ИИ действует с разными полномочиями. В таблице ниже суммировано это распределение полномочий; Это самая важная таблица модуля.
Этап
Роль ИИ
Уровень риска
Кто одобряет
Определение проблемы
партнер по мозговому штурму
низкий
Специалист по данным + заинтересованная сторона
Напишите код очистки
Генератор эскизов кода
средний
Специалист по данным (читает код)
Комментарий EDA
подсказчик шаблона
средний
специалист по данным
Генерация функций
Генератор идей и кода
средне-высокий
Контроль утечек обязателен
Выбор модели/показатель
консультант
высокий
специалист по данным
Решение о запуске в производство
вспомогательный вход
очень высокий
Команда + владелец бизнеса
Одобрение этики/конфиденциальности
стимулятор
очень высокий
человек, всегда
Имейте в виду одно предложение из этой таблицы: по мере того, как ставки растут, роль ИИ уменьшается, а одобрение людей растет.
Почему проверка — это сердце этого бизнеса
Модели языка ИИ выглядят надежными, но они могут быть и ненадежными. На техническом языке это называется галлюцинацией: это выдумка модели несуществующей информации в беглом предложении, как если бы она была правдой. В науке о данных это происходит в трех формах. Первый — фейковый номер: если вы спросите модель «какова средняя сумма заказа», не сообщая никаких данных, она уверенно назовет вам цифру, хотя никогда не видела ваших данных. Вторая — это функция, которой не существует: модель может предлагать функцию, которая вообще не существует, например pandas.read_excel_fast(). В-третьих, неверная статистическая интерпретация: модель может плавно повторять классическую статистическую ошибку, например, «значение p равно 0,04, значит, гипотеза верна на 96%».
Проверочная дисциплина состоит из трех этапов:
- Ссылка на источник: каждое число, скорость и тенденция должны быть получены из ваших данных, а не из памяти ИИ. Используйте ИИ для кода, который работает с данными, а не для его запоминания.
- Запустите и сравните: запустите каждый фрагмент кода, заданный ИИ, самостоятельно; Сравните каждую метрику, которую он производит, с независимым базовым уровнем.
- Экспертный фильтр: проверьте сами, противоречат ли полученные результаты статистике и знанию предметной области.
Внимание: помещать анализ, написанный ИИ, в презентацию, не запуская и не читая его, — это все равно, что представлять неподписанный отчет. Тот факт, что код работает, не означает, что он правильный; Код, суммирующий неправильный столбец, также работает без ошибок.
Воспроизводимость: возможность дважды получить один и тот же результат.
Молчаливый, но важнейший принцип науки о данных — это воспроизводимость: если вы проведете анализ еще раз через шесть месяцев или на другом компьютере, вы получите тот же результат. Этот риск увеличивается при работе с ИИ, потому что когда вы говорите ИИ «сделать этот график» и воспроизвести его вручную, шаги исчезают. Правило: каждый шаг должен быть прописан в системе контроля версий и кода (например, в Git); На этапах, связанных со случайностью, должно быть зафиксировано случайное начальное число (начальное значение генератора случайных чисел; если оно фиксировано, результат будет повторяемым). Мы углубим эту тему в модуле 10; А пока выработайте себе привычку: «Не нажимайте вручную, пишите в коде».
три мини-кейса
Случай 1. Безопасное ускорение. Аналитик электронной коммерции обычно тратит полдня на очистку таблицы заказов из 240 тысяч строк. Он отдал ИИ названия столбцов и первые 5 строк (без личных данных) и запросил код очистки панды. ИИ произвел черновик за 8 секунд; Аналитик прочитал код построчно, исправил ошибку в парсинге даты и запустил его. Продолжительность: 35 минут вместо 4 часов. ИИ предоставил код, проверка осталась за человеком.
Случай 2. Выдуманная метрическая ловушка. Стажер спросил ИИ: «Насколько точен случайный лес в этих данных?» без обучения модели вообще. «Около 89%», — сказал AI. Стажер включил это в презентацию; При обучении реальной модели точность составила 71%. Ошибка: ждать метрик, не предоставляя данные и модели ИИ.
Случай 3 — Тихая утечка. Одна команда реализовала предложенную ИИ идею «добавить среднее значение целевой переменной в качестве признака», не подвергая ее сомнению. Модель работала на тестовом наборе на 98 %, но в рабочей среде произошел сбой из-за утечки информации о будущем (утечка данных, модуль 10). Ошибка: Не проводить статистическую фильтрацию рекомендаций ИИ.
Слабая подсказка / Сильная подсказка
Слабая подсказка:
Проанализируйте эти данные о продажах и сообщите мне средний доход.
Это утверждение ошибочно: ИИ не предоставил данных, поэтому «средний доход» можно только вычислить. Ни столбцы, ни период, ни валюта не ясны.
Мощная подсказка:
Ваша роль: помощник специалиста по обработке данных. У меня есть DataFrame pandas: df. Столбцы: — order_date (текст, в формате «2024-03-01») — sum_tl (десятичное число, NaN в некоторых строках) — customer_id (целое число). Задача: (1) написать код pandas, который вычисляет среднюю сумму, (2) объяснить, как он обрабатывает значения NaN, (3) перечислить предположения, которые делает код. Не выдумывайте содержание данных; просто сгенерируйте код, а я запущу и проверю результат.
В этом запросе понятны схема, ожидание и «запрет фабрикации». Вы все равно запускаете и проверяете вывод самостоятельно.
Начало этики и конфиденциальности
Наука о данных часто работает с личными данными: записями клиентов, пациентов, сотрудников. KVKK (Закон о защите персональных данных) в Турции и GDPR в Европе защищают эти данные. Вставка вашего настоящего имени, идентификатора, адреса электронной почты или адреса в общедоступный инструмент искусственного интеллекта является нарушением. Правило: анонимизируйте данные перед отправкой, при необходимости предоставляйте только схему (имена столбцов, типы) и фиктивную строку примера. Мы углубим тему этики в модуле 11; Давайте изложим принцип с самого начала: чтобы понять данные, часто достаточно поделиться их структурой, а не содержанием.
Распространенные ошибки
- Ожидание чисел/показателей без передачи данных ИИ. Модель не может получить доступ к данным; Номер, который он дает, фейковый. Всегда рассчитывайте результат и запускайте его.
- Думая, что рабочий код правильный. Код, который обрабатывает не тот столбец, также выполняется без ошибок; Не доверяйте, не прочитав логику.
- Вставка реальных личных данных в открытый инструмент. Имя, идентификационный номер, адрес электронной почты никогда не разглашаются; Схемы достаточно.
- Выполнение шагов вручную, а не прописывание их в коде. Анализ, который не воспроизводится, ненадежен.
- Безоговорочное принятие интерпретации статистики ИИ. ИИ может повторять классические ошибки в таких понятиях, как p-значение и корреляция.
Совет: Включите короткую «строку правила» в каждый сеанс ИИ: «Не придумывайте содержание данных; просто сгенерируйте код/анализ, а я запущу и проверю результат; укажите «не уверен», где вы не уверены». Это единственное предложение значительно снижает риск возникновения галлюцинаций.
В итоге
ИИ — мощный помощник в науке о данных: он ускоряет очистку кода, интерпретацию EDA, рекомендации моделей и визуализацию. Но определение проблемы, выбор показателей, производственные решения и этические границы принадлежат людям. Рабочий процесс состоит из шести этапов, и роль ИИ становится меньше по мере увеличения риска. В основе всего лежат три привычки: связывание источников (проверка), воспроизводимость (кодирование) и анонимизация (конфиденциальность). Как только вы усвоите эти три, каждый инструмент в остальной части модуля станет для вас безопасным ускорителем.
Задача приложения
Просто создайте схему небольшой таблицы, которая у вас есть (или гипотетическая): имена столбцов, типы и 2-3 фиктивные строки-примеры (без реальных личных данных). Попросите у ИИ код сводной статистики, используя приведенный выше шаблон «Мощная подсказка». Запустите код, сравните выходные данные с заданным вручную значением, проверьте наличие ложных предположений и запишите свои выводы в 5 пунктах списка.
контрольный список
- [ ] Я только что дал ИИ схему и поддельный образец вместо реальных личных данных?
- [ ] Прочитал ли я и запустил созданный им код построчно?
- [ ] Проверил ли я независимо каждое число в выходных данных?
- [ ] Записал ли я каждый этап анализа в код и сделал ли его повторяемым?
- [ ] Определил ли я уровень риска миссии и поручил ли окончательное решение человеку?