收益:
- 能够根据任务风险级别区分数据科学的六阶段工作流程(问题定义、收集、清理、发现、建模、沟通)以及人工智能在每个阶段工作的权限
- 能够应用一门学科,通过将每个人工智能输出连接到源、运行和比较它并通过专家过滤来验证它。
- 从第一天起就能够将可重复性和隐私原则(写入代码、匿名化)转化为分析习惯
原始、混乱且经常“撒谎”的数据每天都会出现在数据科学家的办公桌上。在销售表中,日期列以三种不同的格式编写;某些行中的客户编号为空白;列的名称是“收入”,但它同时包含 TL 和 USD 值。数据科学的工作就是从这种混乱中做出可靠的决策:收集数据、清理数据、探索数据、构建模型、验证结果并将其变成故事。人工智能(AI,简称 AI——可以生成文本和代码、识别模式、总结和预测的计算机系统)可以触及这个链条中的每个环节:在几分钟内编写清理代码、推荐用于探索性分析的图表、解释模型的指标、纠正 SQL 查询。但同样的人工智能也可以给你一个自信的捏造,比如它从未见过的数据的“相关性 0.72”。
第一个单元不是图书馆简介。其目的是阐明在数据科学工作流程中哪些地方应该放置人工智能,哪些地方不应该放置人工智能。让我们从一开始就阐明基本原则:人工智能是助手,而不是数据科学家。收集什么数据、决定什么指标、是否将模型投入生产以及在哪里划定道德界限,都取决于有能力的专家。未经验证的人工智能输出是有风险的,未经签名的分析报告也是如此。
数据科学工作流程:端到端地图
要理解数据项目,将其分为六个阶段会很有帮助。整个模块遵循这张地图。
1. 问题定义:我们衡量什么、为什么衡量、支持哪个决策?这个阶段没有委托给人工智能;是由人来定义工作。
2. 数据收集:识别来源、提取数据、抽样。 (第二单元)
3.数据清理和预处理:缺失值、离群值、类型转换。 (第三单元)
4.探索性数据分析(EDA - Exploratory Data Analysis,“通过眼睛”识别数据的分布和关系的阶段):(第4单元)
5.特征工程和建模:变量生成、算法选择、训练、评估。 (第 5、6、7 单元)
6. 沟通和制作:可视化、故事、MLOps(实时模型并对其进行监控的规则)。 (第 8、11 单元)
人工智能在这六个阶段中的每一个阶段都以不同的权威运作。下表总结了这种权力分配;这是该模块中最重要的一个表。
舞台
人工智能的作用
风险等级
谁批准
问题定义
头脑风暴伙伴
低
数据科学家+利益相关者
编写清理代码
代码草图生成器
中等
数据科学家(阅读代码)
EDA评论
模式建议者
中等
数据科学家
特征生成
想法和代码生成器
中高
泄漏控制是必须的
型号选择/公制
顾问
高
数据科学家
决定投产
辅助输入
非常高
团队+企业主
道德/隐私批准
兴奋剂
非常高
人类,永远
请记住该图表中的一句话:随着风险的增加,人工智能的角色会缩小,而人类的认可度会增加。
为什么验证是该业务的核心
人工智能语言模型看起来很确定,但实际上可能并不确定。用技术语言来说,这称为幻觉:这是模型用流利的句子捏造不存在的信息,就好像它是真的一样。在数据科学中,这有三种形式。第一个是假数字:如果你在没有提供任何数据的情况下询问模型“平均订单金额是多少”,它会自信地告诉你一个数字,即使它从未见过你的数据。第二个是不存在的函数:模型可能会建议一个根本不存在的函数,例如 pandas.read_excel_fast()。第三,错误的统计解释:模型可以顺利地重复一个经典的统计错误,例如“p值为0.04,因此假设有96%正确”。
验证规则包括三个步骤:
- 来源链接:每个数字、比率和趋势都应该来自您的数据,而不是人工智能的内存。将人工智能用于对数据进行操作的代码,而不是让它记住数据。
- 运行对比:自己运行AI给出的每一段代码;将其生成的每个指标与独立基线进行比较。
- 专家过滤器:自己测试输出是否与统计数据和领域知识相矛盾。
注意:将人工智能编写的分析放入演示文稿中而不运行和阅读它就像呈现未签名的报告一样。仅仅因为代码有效并不意味着它是正确的;对错误列求和的代码也可以正常工作。
再现性:能够两次产生相同的结果
数据科学的沉默但关键的原则是可重复性:当您六个月后或在不同的计算机上再次运行分析时,您会得到相同的结果。当与人工智能一起工作时,这种风险会增加,因为当你告诉人工智能“制作这个图表”并手动播放时,步骤就会消失。规则:每一步都必须在代码和版本控制中注册(如Git);在涉及随机性的步骤中,随机种子(随机数生成器的初始值;如果固定,结果将是可重复的)应该是固定的。我们将在第 10 单元深化这个主题;现在,养成这个习惯:“不要手动点击,用代码编写。”
三个迷你箱子
案例 1——安全加速。一个电商分析师一般要花半天的时间来清理一个24万行的订单表。他将列名和前 5 行(不含个人数据)提供给 AI,并要求提供 pandas 清洁代码。 AI 8秒出稿;分析师逐行读取代码,修复日期解析中的错误,然后运行它。持续时间:35 分钟而不是 4 小时。人工智能提供代码,验证仍由人类完成。
案例 2——虚构的度量陷阱。一名实习生问 AI:“随机森林对这些数据的准确度如何?”根本不需要训练模型。 “大约 89%,”AI 说。实习生把这个放到了演讲中;训练真实模型时,准确率为 71%。错误:等待指标而不向人工智能提供数据和模型。
案例 3 — 无声泄漏。一个团队毫无疑问地实现了人工智能建议的“将目标变量的平均值添加为特征”的想法。该模型在测试集上的执行率为 98%,但在生产中崩溃,因为该功能泄漏了未来信息(数据泄漏,第 10 单元)。错误:没有对AI推荐进行统计过滤。
弱提示/强提示
弱提示:
分析这些销售数据并告诉我平均收入。
这种说法是有缺陷的:人工智能没有得到数据,因此“平均收入”只能是弥补。栏目、期间和货币都不清楚。
强力提示:
您的角色:帮助数据科学家的助手。我有一个 pandas DataFrame:df。列:- order_date(文本,格式为“2024-03-01”)- amount_tl(十进制,某些行中为 NaN)- customer_id(整数)任务:(1) 编写计算平均金额的 pandas 代码,(2) 解释它如何处理 NaN 值,(3) 列出代码所做的假设。不要编造数据内容;只需生成代码,我将运行并验证结果。
在这份请求中,方案、期望和“禁止捏造”都明确。您仍然可以自己运行并验证输出。
道德和隐私的起源
数据科学通常涉及个人数据:客户、患者、员工记录。土耳其的 KVKK(个人数据保护法)和欧洲的 GDPR 保护这些数据。将您的真实姓名、ID、电子邮件或地址粘贴到公共人工智能工具中属于违规行为。规则:在共享之前对数据进行匿名化,仅在必要时提供架构(列名称、类型)和虚拟示例行。我们将在第11单元深化道德主题;让我们从头开始讲原则:要理解数据,共享其结构而不是其内容通常就足够了。
常见错误
- 等待数字/指标而不向人工智能提供数据。模型无法访问数据;他给的号码是假的。始终计算并运行结果。
- 认为工作代码是正确的。操作错误列的代码运行时也没有错误;没有读懂逻辑就不要轻易相信。
- 将真实的个人数据粘贴到打开的工具中。姓名、身份证号码、电子邮件绝不会被泄露;有图就够了。
- 手动执行这些步骤,而不是将它们写入代码中。不可重现的分析是不可靠的。
- 毫无疑问地接受人工智能对统计数据的解释。人工智能可能会重复 p 值和相关性等概念上的经典错误。
提示:在每个人工智能会话中包含一个简短的“规则线”:“不要编造数据内容;只需生成代码/分析,我将运行并验证结果;在您不确定的地方指出‘不确定’。”这一句话就显着降低了产生幻觉的风险。
总之
人工智能是数据科学领域的强大助手:它加速清理代码、EDA 解释、模型推荐和可视化。但问题定义、度量选择、生产决策和道德界限属于人类。工作流程有六个阶段,随着风险的增加,人工智能的作用变得越来越小。三个习惯是一切的基础:源链接(验证)、可重复性(编码)和匿名化(保密)。一旦您内化了这三个工具,该模块其余部分中的每个工具都将成为您的安全加速器。
应用任务
只需为您拥有的一个小表(或假设的表)创建一个架构:列名称、类型和 2-3 个虚拟示例行(没有真实的个人数据)。使用上面的“强大提示”模板向 AI 询问摘要统计代码。运行代码,将输出与手动值进行比较,检查是否有任何虚假假设,并用 5 个要点记下您的发现。
清单
- [ ] 我是否只是给了人工智能一个模式和一个假样本而不是真实的个人数据?
- [ ] 我是否逐行读取并运行了它生成的代码?
- [ ] 我是否独立验证了输出中的每个数字?
- [ ] 我是否将分析的每一步都写入代码中并使其可重复?
- [ ] 我是否确定了任务的风险级别并将最终决定权交给了人?