单位 3 / 11

探索性数据分析和可视化:利用人工智能进行绘图和解释

收益:

  • 能够在人工智能支持下生成描述性统计和分布/关系图表,并根据数据和问题选择正确的图表类型
  • 能够识别人工智能生成的图像中的误导性选择(虚线轴、不适当的比例、过度平滑)并应用诚实的可视化原则
  • 能够区分探索性分析是为了生成假设,也是为了使用相同的数据进行发现和确认的陷阱(这为 p-hacking 打开了大门)。

清理数据后,实证研究人员的首要工作就是了解它。这个阶段称为探索性数据分析(EDA - 探索性数据分析):它是用图表和汇总统计数据检查数据并查看其结构、模式和惊喜的过程。目的还不是检验假设,而是熟悉数据、提出问题并为将来构建的模型奠定基础。在本单元中,我们将了解人工智能 (AI) 如何加速 EDA 和可视化,但为什么必须仔细审核它生成的图形。

让我们首先做两个基本的区别。首先,描述性统计(总结平均值、中位数、标准差、四分位数等数据的数字)和可视化(以图形方式显示相同信息)相辅相成;它们一起描述数据。其次,也是最关键的:必须区分发现和确认。探索性分析是为了产生假设;使用相同的数据探索假设并说“我测试了它并发现它很重要”打开了 p-hacking 的大门,我们将在下一个单元中看到。可以免费查看数据并查看模式;但宣称该模式是同一数据中“经过验证的发现”是具有误导性的。

逐步探索性分析

1.单变量观点。单独检查每个变量:其分布是对称的还是偏斜的?有多少座山;异常值在哪里?对于数值变量,直方图(通过将值划分为范围来显示频率的图)和箱线图(箱线图 - 显示中位数、四分位数和极值的图表);对于分类变量,请使用频率表和条形图。

2.双变量观点。查看两个变量之间的关系:两个数值变量的散点图(将每个观测值显示为 x-y 平面上的一个点)、数值分类的分组箱形图、两个分类的交叉表。在查看相关系数之前,请务必查看散点图:相同的相关性可能会显示出非常不同的模式(著名的 Anscombe 四重奏证明了这一点;四个数据集具有几乎相同的统计数据,但在绘制时它们却完全不同)。

3. 选择正确的图表类型。图表类型取决于您的问题和数据类型。分布直方图;关系的分散;随时间变化的折线图;用于类别比较的条形图; (小心地)堆叠条形图以表示部分与整体的比例。人工智能可以快速为您生成代码,但“哪个图表针对哪个问题”的决定权在您手中。

4. 注意模式,不要声明结果。将您看到的任何有趣的模式记录为“发现笔记”,但不要将其视为已确认的发现。确认是在单独的步骤中完成的,最好使用单独的数据或预定的时间表。

诚实的可视化原则

图形令人信服;因此,其误导力也很高。人工智能可以做出美观但有时会产生误导的选择。检查这些政策:

  • 在条形图中,y 轴必须从零开始。虚线轴显示了小的差异和大的差异。
  • 比例尺应一致。如果要比较两个图表,请使用相同的轴范围。
  • 过度平滑会隐藏真实图案。趋势线看起来不错,但如果它过度“平滑”数据,则可能会产生误导。
  • 颜色和 3D 装饰扭曲了注意力,而不是数据。选择简单。
  • 缺失的数据和样本量应该是可见的。 “n=12”和“n=12,000”看起来不应该相同。
注意:人工智能生成的图形很漂亮,但它们并不真实。他最常犯的错误是没有从条形图中的零开始轴并夸大了两组之间的差异。经常检查轴。

对比图:问题→图表

询问

正确的图表

常见错误

这个变量是如何分布的?

直方图/箱线图

使用饼图

两个数值变量相关吗?

散点图

只看相关性的数量

随着时间的推移它发生了怎样的变化?

折线图

用条形图讲述趋势

群体之间有什么区别?

分组框/条(从头开始)

截轴杆

部分与整体的比例?

堆积条(谨慎使用)

多扇形饼图

四个可复制的提示

1.自动发现代码:

您的角色:EDA 助理。我不共享数据,我想要 R (ggplot2) 代码。 “数据”数据框中有数值变量(收入、年龄、支出)和分类变量(地区、教育)。任务:编写代码,生成每个数字的直方图、每个校准类别的条形图以及收入~年龄的散点图。在条形图中,让 y 轴从零开始。添加注释行。

2.相关性回顾(相关性+视觉结合):

编写代码来计算收入和支出的皮尔逊相关性并绘制散点图+线性趋势。添加注释行,提醒我在信任相关计数之前检查图表(Anscombe 警告)。不要过度平滑趋势线。

3、诚信审核:

检查以下 ggplot 代码以实现诚实的可视化:[代码]。检查并纠正以下内容:y 轴是否从零开始、比例是否一致、样本大小是否可见、是否存在过度平滑?解释您所做的每项更正的理由。

4. 制作发现记录(不是发现):

根据我制作的图表,将观察结果列为“发现笔记”;用“待检验的假设”而不是“结论性发现”的语言来写每一项。示例:“高等教育中的收入似乎更加分散;应该用单独的数据进行测试。避免因果性和明确性的陈述。

弱提示/强提示

弱提示:

根据产量制作漂亮的图表并告诉我它们的含义。

这个提示会导致误导性的输出:“美丽”侧重于美学,而“它意味着什么”则推动人工智能从发现跳转到明确的结论。接下来是因果的、夸张的评论。

强力提示:

你的角色:诚实的 EDA 助理。任务:(1)选择适合我的问题的图表类型并写出理由,(2)在条形图中从零开始轴,(3)用 DISCOVERY NOTE 语言解释输出:没有明确/因果声明以“必须测试”语言提出假设,(4)如果样本很小(n<30),则警告我。我将在自己的环境中运行图表并验证它。

区别:强烈的意愿证明了图表类型的合理性,施加诚实的规则,并且不混淆发现与确认。

三个迷你箱子

情况 1 — 离散轴夸大。一位分析师在条形图中显示了两个分支机构的满意度得分(7.8 和 8.0;满分 10 分)。当从 7.5 开始 YZ 轴时,第二个分支出现的高度几乎是第一个分支的两倍;而差异仅为2.5%。管理层原本打算奖励一家分公司,但误以为这是错误的。当我从头开始创建轴时,差异几乎是看不见的。教训:轴的选择本身就改变了感知。

案例 2 — 相信相关性并跳过图表。一位研究人员发现两个变量之间的 r = 0.81,并写道“强线性关系”。当他的顾问要求提供散点图时,发现这种关系实际上是由于单个极端观察造成的,当删除该点时,相关性下降到 0.12。教训:相关计数不能替代图表;始终关注分散情况。

案例 3——混淆发现与确认。一名学生查看了 40 个变量数据集中的所有成对相关性,选择了最高的一个 (r=0.52) 并写道,“我们发现教育和储蓄之间存在显着关系 (p=0.004)。”然而,40 个变量中有数百对;由于偶然性,选择最高的结果是错误的。教训:发现的模式不能在相同的数据中“测试并声明显着”;需要单独确认。

常见错误

  • 条形图中的轴不从零开始。它夸大了微小的差异;最常见的视觉谎言。经常检查。
  • 查看相关性并跳过图表。相同的相关性来自于截然不同的模式;可以拟合异常值关系。第一,分散。
  • 将发现中发现的模式视为同一数据中的“证据”。这是 p-hacking 的门户;确认是单独进行的。
  • 图表类型错误。诸如趋势条形图和分布饼图之类的匹配具有误导性。根据问题选择类型。
  • 隐藏样本大小。 n=8 和 n=8,000 在同一张图上看起来不应该相同;必须显示出不确定性。
提示:在发布图表之前,问问自己:“如果我更改轴,故事会改变吗?”如果答案是肯定的,那么您可能是从不诚实的地方开始转型的。

总之

探索性数据分析是满足数据、发现模式并生成假设的阶段;这不是确认。 AI快速生成描述性统计数据和图形代码,但你根据你的问题选择图形类型并控制公平性原则(零轴、尺度一致、明显的不确定性)。在相信相关数之前先看看分散度;不要将您在发现中发现的模式声明为同一数据中的“证据”。漂亮的人工智能图表并不意味着正确的图表。

应用任务

在数据集中至少选择三个变量。向人工智能询问并运行代码,生成探索性图表(直方图、散点图、盒装图),并提示执行诚实规则。对于每个图表:检查 (1) 图表类型与问题的适当性,(2) 轴的诚实性,(3) 样本量的可见性。用假设语言写出至少一个“发现笔记”(“……似乎是单独测试的”)。检查计数和散点的相关性,并报告它们之间是否存在差异。

清单

  • [ ] 我根据我的问题和数据类型选择了图表类型。
  • [ ] 在条形图中,我从零开始 y 轴;我检查了轴的诚实度。
  • [ ] 在相信相关性之前我查看了散点图。
  • [ ] 我在图表上反映了样本量和不确定性。
  • [ ] 我将在探索中发现的模式写为“待检验的假设”而不是“证据”。
  • [ ] 我注意到我不会使用相同的数据进行确认,并且需要单独的步骤。