单位 11 / 11

报告写作、沟通和道德:呈现结果和沟通界限

收益:

  • 能够在人工智能的支持下,以诚实、明确的语言向目标受众(学术、政策、管理)报告实证结果
  • 能够完整撰写结论、限制和道德声明(数据保密、利益冲突、人工智能使用披露)并避免误导性表述
  • 人工智能能够识别产生夸大、片面或因果语言的报告草稿,并坚持认为最终文本和主张的责任在于研究人员。

模块考试

1. 一位研究人员问“2015年至2020年土耳其失业率和通货膨胀之间的相关系数是多少?”无需向人工智能提供任何数据。他询问并直接将数字 0.62 写到他的文章中。这种方法的根本错误是什么?

  • A)期望人工智能提供具体统计数据,但不提供经过验证的数据; ✔ 使用可能未经验证而编造的数字
  • B) 相关系数不应在文章中使用。
  • C)无法计算失业率和通货膨胀之间的相关性
  • D)人工智能只能在2020年后访问数据

说明:AI语言模型在不访问数据集的情况下无法生成统计数据;他给出的数字很可能是幻觉(捏造的)。系数、比率和测试结果应根据研究人员自己验证的数据计算,而不是从模型的内存中获取。

2. 缺失数据“非随机缺失”(MNAR) 是什么意思?为什么它很重要?

  • A) 缺陷是由于未观察到的值本身造成的;这就是为什么简单的分配会产生偏差 ✔
  • B)数据完全随机消失,不会产生任何偏差。
  • C) 丢失数据应始终通过删除行来解决。
  • D) 缺失数据不会以任何方式影响分析。

解释:在 MNAR(非随机缺失)的情况下,缺失本身取决于未观察值的大小(例如高收入者不报告其收入)。在这种情况下,简单的删除或平均分配会产生有偏差的结果;必须对缺陷的机制进行建模。在不了解这一机制的情况下,不应盲目应用人工智能建议的分配方法。

3. 分析师让 AI 制作一个条形图,AI 将 y 轴从 40 开始,而不是从 0 开始。两组之间 2% 的实际差异在图表上看起来很大。什么是正确的做法?

  • A) 从头开始​​轴或更改图表类型; ✔ 显示真实的差异大小,不产生误导
  • B)按原样使用图表,因为人工智能做出了最佳选择
  • C) 从 45 开始轴,使差异更大
  • D)切勿使用视觉效果代替条形图

说明:在条形图中,虚线轴(不从零开始的 y 轴)会夸大微小差异,从而产生误导。在诚实的可视化中,条形图的轴应该从零开始,或者应该有意识地清楚地说明差异。分析师有责任验证图像并在必要时进行纠正。

4. 线性回归中系数“显着”(p<0.05)这一事实为何在人工智能的解释中经常被曲解?

  • A) 由于影响巨大且重要或因果关系已确立,夸大其重要性 ✔
  • B) 显着性总是表明影响很小
  • C) p<0.05证明系数绝对正确
  • D) 不应报告显着系数。

解释:统计显着性与效应不为零的证据强度有关;这并不意味着影响很大、很重要或有因果关系。人工智能经常将“重大”一词表示为“重大/强烈影响”。研究人员还应该评估效应大小、置信区间和背景。

5.“p-hacking”一词指的是什么?为什么人工智能可以让它变得更容易?

  • A) 尝试多种分析,直到有意义;人工智能的速度非常快,从而增加了风险 ✔
  • B) 按预定计划分析一次数据
  • C) 扩大样本以增加 p 值
  • D) 仅报告描述性统计数据

说明:p-hacking 正在尝试不同的变量、子样本、转换或模型,直到出现有意义的结果;这会产生基于偶然的虚假发现。由于人工智能可以在几秒钟内尝试数十种模型变体,因此它可以在没有诚实计划的情况下加速 p-hacking。防御;预注册、固定分析计划和多重比较校正。

6. 为什么在两个非平稳(单位根)时间序列之间发现高 R 平方回归可能会产生误导?

  • A) 由于共同趋势,可能会出现虚假回归; ✔ 高 R 方输出,无实际关系
  • B) 高 R 平方总是证明很强的因果关系。
  • C) 非平稳序列根本不能进入回归。
  • D) R平方无法在时间序列中计算

说明:如果非平稳序列之间不存在共同的协整关系,则伪回归可能仅由于共同趋势而产生高R平方和显着系数;而没有真正的关系。因此,应先进行平稳性和单位根检验,必要时进行差分或协整检验。

7. 双重差分设计的有效性基于什么基本假设?

  • A) 平行趋势假设:如果没有干预,群体将遵循相同的方向 ✔
  • B) 治疗组和对照组在开始时完全相同
  • C) 样本的正态分布
  • D)变量不包含任何缺失数据

解释:DiD 假设在没有干预的情况下,治疗组和对照组的结果变量将随着时间的推移平行变化(平行趋势假设)。如果不满足这一假设,则估计存在偏差。人工智能可以生成 DiD 代码,但研究人员的工作是捍卫和测试并行趋势。

8. 以下哪一项是可重复分析的强制做法?

  • A) 以随机步骤修复种子,记录软件包版本和代码 ✔
  • B) 手动将结果复制到电子表格并删除代码
  • C) 每次运行看到不同的结果是正常的。
  • D)仅保留最终图形,不共享数据和代码

描述:再现性;使用相同的数据和代码再次可以得到相同的结果。以随机步骤修复种子、保存包版本以及执行文档中的代码(文学编程)是其基石。手动复制结果或基于点击的非记录步骤会损害再现性。

9. 异方差性会扭曲线性回归吗?它的常见解决方案是什么?

  • A)它扭曲了标准误差;解决方案是稳健的标准误差或适当的转换 ✔
  • B)它完全使系数估计无效并且无解
  • C) 总是将 R 平方减小到零
  • D) 仅当样本非常小时才会发生,可以忽略

解释:异方差使系数估计无偏,但错误计算标准误差;这使得 p 值和置信区间不可靠。常见的解决方案是使用稳健/HC 标准错误或适当的转换。必须验证AI建议的解决方案是否确实解决了问题而不是隐藏问题。

10. 一名研究人员将包含患者级别身份信息和收入的微数据上传到公共人工智能聊天工具中,并说“进行回归”。这种行为的主要问题是什么?

  • A) 将个人/许可数据上传到外部工具构成违反保密和合同行为 ✔
  • B)人工智能根本无法完成回归
  • C) 微观数据根本不适合回归
  • D)人工智能总是错误地计算回归

说明:身份和收入等个人/特殊数据受 KVKK/GDPR 和大多数数据使用协议的保护;将它们上传到可以存储数据的外部设备是一种违规行为。正确的方法;匿名数据,使用本地/机构安全工具,或者简单地从人工智能请求代码并在自己的环境中运行代码。

11. 当多重共线性较高时会观察到什么?

  • A) 系数变得不稳定,标准误差增大;个别系数可能变得毫无意义✔
  • B) R 平方总是减小到零
  • C) 系数估计变得更加精确
  • D)因变量变化的规模

说明:在高度多重共线性时,自变量彼此强相关;系数估计变得不稳定,标准误差变得夸大,个别系数可能变得微不足道,而整体模型可能很重要。通过 VIF 等标准进行诊断。人工智能可能会建议消除变量,但由研究人员决定哪些变量应保持理论值。

12.什么是统计功效以及低功效研究的风险是什么?

  • A) 检测现有效果的可能性;低功率会错过真实效果并使研究结果不可靠 ✔
  • B) 降低 p 值的概率;较低的功率总是能提供更可靠的结果
  • C) 与样本大小无关的常数值
  • D)只有在使用人工智能时才有效的概念

解释:功效是检测到实际存在的效应的概率(1 减去 II 类误差)。低能力的研究可能会错过真实的效果;此外,少数显着结果可能会带来夸大的效应大小(“胜利者的诅咒”)并且误报率增加。因此,分析前功率/样本计算很重要。

13. 为什么在道德上有必要披露文章中人工智能的使用?

  • A) 透明度和问责制; ✔ 读者和审稿人可以评估整个过程,责任由作者承担
  • B)人工智能的使用自动使结果失效
  • C) 杂志要求仅用于广告目的
  • D)将解释权转让给人工智能

披露:透明度是必要的,以便读者和审稿人可以评估结果是如何产生的;许多期刊和机构现在要求披露人工智能的使用情况。此外,由于人工智能可能会产生错误/幻觉,因此诚实地声明作者的责任以及哪些步骤经过了审核是一个诚实的问题。

14. 工具变量(IV)方法中的“排除限制”有何要求?

  • A) 工具仅通过内部变量影响结果,没有其他直接方式 ✔
  • B) 工具与结果变量没有关系。
  • C) 该工具与内生变量无关。
  • D) Means 始终是二进制 (0/1) 变量

解释:排除约束要求工具仅通过内生解释变量而不是通过任何其他直接手段或未观察到的因素影响结果变量。这一假设无法从数据中得到充分检验;它在理论和制度上得到辩护。 AI可能会编写IV代码,但捍卫工具的有效性是研究人员的工作。

15. 在无需预先注册的灵活分析中,“岔路花园”问题意味着什么?

  • A) 根据数据做出太多合理的分析选择会增加误报率,甚至是无意的 ✔
  • B) 分析方法必须单一且强制性
  • C) 仅当故意作弊发生时才会出现的问题。
  • D) 随着样本增大而自发消失的情况

解释:查看数据后,研究人员可以对使用哪个变量、子组、转换或阈值做出许多合理的选择。即使没有单一的“故意 p-hacking”,这种灵活性也会增加误报率,因为重要的一个是从大量分析中有效选择的。预注册和固定的分析计划限制了这种灵活性。