单位 1 / 11

计量经济学和统计学中的人工智能:角色、边界、身份验证和隐私

收益:

  • 根据任务风险级别,能够区分实证工作流程(数据清理、代码、可视化、草稿解释)中人工智能的哪些部分可以实时节省时间,以及模型选择、因果关系声明和发布决策等决策哪些部分留给专家处理
  • 能够应用一门学科,通过重新计算、链接到源和统计过滤的步骤来验证每个人工智能输出(数字、系数、代码、注释)。
  • 能够在 KVKK/GDPR 和数据使用协议范围内安全地处理微数据和机密/许可数据集,并养成选择适当工具的习惯。

同样的问题每天都会出现在计量经济学家或应用统计学家的办公桌上:这个数据集可靠吗?如何处理这些缺失值?这个回归的系数到底说明了什么?这种关系是因果关系还是仅仅是相关关系?由于该 p 值很重要,我可以将其写在文章或政策简报中吗?其中一些问题是重复性的、代码密集型的且耗时的:清理数据、绘制同一个图形十次、调试 R 或 Python 代码、将结果串入表中。其他人直接决定调查结果的有效性、出版物的诚实性或政策决定的准确性。

人工智能(简称 AI,即能够像人类一样生成文本和代码、识别模式、总结数据和编写注释的计算机系统;当今最常用的形式是大型语言模型,即接受巨大文本训练并通过预测下一个单词来构建句子的系统)位于该表的中间。如果使用正确,它可以将数据清理代码的时间缩短为几分钟,提醒您复杂统计测试的语法,或起草系数的解释。如果使用不当,它会呈现出看似确定但完全捏造的数字、错误的意义或非因果关系作为“发现”。

第一个单元不是软件介绍。其目的是阐明在您的经验工作流程中哪些地方应该放置人工智能,哪些地方不应该放置人工智能。计量经济学既是一个“方法关键”领域,又是一个间接“决策关键”领域:你构建的模型的系数可以是央行利率决策、监管机构政策变化或公司百万美元投资的输入。让我们从一开始就摆出基本原理:人工智能是一个分析助手,而不是一个研究员。模型选择、识别策略、因果关系断言、出版和政策决策的责任和最终批准由有能力的专家承担。

经验工作流程的层次和人工智能的地位

将实证研究分为三个层次是有用的。执行层是日常的技术工作:数据清理代码、图形绘制、表格格式化、语法调试。方法层是分析决策:哪个​​模型、哪个识别策略、哪个测试、哪个假设检查。解释和决策层是研究结果的意义:系数表示什么,是否有因果关系,对政策意味着什么,是否应该发布。人工智能涉及所有三个层面,但每个层面都有不同的权威。在执行层,AI快速起草并生成代码;在解释和决策层,仅给出输入并由专家做出决策。

让我们从一开始就定义一些基本术语。计量经济学是用统计方法分析经济和社会数据并衡量关系的学科。回归是一种对结果变量(因变量)与一个或多个解释变量(自变量)之间的关系进行数值建模的方法。系数是显示解释变量的一单位变化与结果变量相关的平均变化单位数的数字。 p 值是当实际不存在影响时观察到的结果(或更极端的结果)偶然发生的概率。我们将在以下单元中一一解释这些概念;现在,请知道这一点:在所有这些中,人工智能为您提供蓝图、代码和解释,但它不会做出科学决策。

下表按任务总结了人工智能的作用和风险级别:

任务

人工智能的作用

风险等级

谁批准

编写数据清理代码

代码生成器

分析师本人(带代码测试)

图表/表格草案

草图生成器

分析师

测试/模型语法提醒

参考助理

低中

分析师

吃水系数解释

起草人

中等

计量经济学家

模型/识别策略选择

辅助输入

专家研究员

因果关系主张

只是草稿,不是最终定稿

非常高

专家+同行评审

出版物/政策决定

仅输入

非常高

负责调查员/机构

请记住该表中的一行:随着风险的上升,人工智能的作用会缩小,而专家的认可度会增加。

为什么“验证”是这项业务的核心

语言模型似乎对他们的答案充满信心,但他们可能并不确定。用技术语言来说,这被称为幻觉:这是模型用流利的句子捏造了不存在的信息,就好像它是真的一样。对于计量经济学家来说,这是一个致命的陷阱。该模型可以给您一个准确的数字,例如“2015-2020 年土耳其失业率与通货膨胀之间的相关性为 0.62”;但是,他从来没有见过你的数据,这个数字完全是编造的。或者它可能会说,“White 测试 p 值为 0.03”;而它没有运行任何测试。它可以使用实际不存在的参数调用 R 函数。他把这三首歌曲都唱得同样流利;唯一区分对错的是你的知识和你验证的习惯。

验证规则包括三个步骤:

  1. 在您自己的环境中重新计算/运行:用您自己的数据,而不是从AI的内存中,计算R/Python中AI给出的每个数字、比率、测试结果和系数。用AI来写代码,而不是记住结果。运行代码,您会产生输出。
  2. 来源链接:方法规则、公式和定义依赖教科书、方法文章和官方文档。通过可靠来源确认人工智能的声明“本次测试的假设是”。
  3. 统计过滤器:用专家的眼光测试输出是否与统计逻辑(假设、样本、效应大小、不确定性)相矛盾。拒绝“有意义但荒谬”的结果。
注意:在没有验证的情况下将人工智能生成的系数、测试或解释放入文章、论文或政策说明中就像发布未经审查的发现一样。仅仅因为输出流畅是不正确的;仅仅因为这个数字看起来是确定的,但它并不是真实的。

隐私:微数据和许可数据受到私密保护

微观数据(个人、家庭、公司或患者层面的单一记录)在计量经济学中经常使用。这些数据大部分是个人数据,受土耳其 KVKK(个人数据保护法)和欧洲 GDPR 的保护。此外,TurkStat、中央银行、面板数据提供商和商业来源通常会在提供数据时签订数据使用协议;这些协议禁止将数据传输给第三方。将包含身份信息、收入、健康或公司机密的表格粘贴到公共 AI 聊天工具中既违反 KVKK/GDPR,又违反合同;因为数据会发送到外部服务器,并且可以用于某些工具中的模型训练。

规则很简单:将数据保存在自己的安全环境中,仅向人工智能询问代码和方法。理想的工作流程是这样的:向 AI 询问分析代码,你在自己的计算机/企业服务器上用真实数据运行代码。如果您确实必须共享数据,请匿名(删除 ID 字段)、聚合(平均/计数而不是个体),并选择机构性工具、签订数据处理协议,并且不要在教育中使用您的数据。

三个迷你箱子

案例1——安全高效的使用。一位研究人员首先花了 6 个小时手动清理 40,000 行家庭预算数据。他根本没有共享数据,只是向 AI 描述了变量名称和结构,并要求提供清理代码。 AI生成了R脚本;研究人员在自己的环境中运行了代码,检查了每一步的行数和汇总统计,并修复了两个逻辑错误。持续时间:70 分钟而不是 6 小时。数据永远不会消失;责任仍由研究人员承担。

案例 2 — 未经验证的号码陷阱。 “GDP增长与外国直接投资之间的弹性是多少?”一名研究生向AI提问。尽管无法访问任何数据,AI仍自信地给出了“大约0.34”的数字。学生在文献综述中写到了这一点;当他的顾问询问来源时,发现这个数字毫无根据,完全是捏造的。错误:期望人工智能提供具体的统计数据,而不向其提供数据和资源。

案例 3——保密和违约。一名分析师将他从获得许可的公司小组收到的包含公司名称和营业额的 Excel 上传到公开可用的人工智能工具,并说“进行小组回归”。数据提供者的合同禁止将数据传输到第三方系统;该事件引发了合规审查。正确的方法是用匿名代码替换公司名称,或者不共享数据,仅请求面板回归代码并在自己的环境中运行它。

弱提示/强提示

弱提示:

分析通货膨胀与失业之间的关系并给出系数。

这种说法是错误的:没有向人工智能提供数据,不清楚哪个国家、哪个时期、哪个模型。 AI只能用一个虚构的系数来回答。

强力提示:

您的角色:您是协助计量经济学研究员的分析助理。我不会与您分享数据;我只想要可运行的 R 代码。我有年度面板:变量国家、年份、失业、通货膨胀(均为数字)。任务:1)编写失业〜通货膨胀的固定效应面板回归代码(plm包),2)用注释行解释代码中的每个步骤,3)注意系数应该解释为关系,而不是因果关系,4)弥补你不确定的函数参数;我将在自己的环境中运行并验证结果。

在这个请求中,没有共享任何数据,角色、软件包、评论期望和禁止“捏造”都是明确的。您仍然可以自己运行并验证输出。

下表总结了本课中的一句话规则:

原则

这是什么意思

AI是助手

科学决策,责任属于专家

请求代码,产生结果

人工智能不记得号码;你运行它并计算

保留数据

微/许可数据不会离开安全环境

验证

每个问题、代码、评论都会被检查;捏造被拒绝

常见错误

  • 期待人工智能给出具体的统计数据,但不提供数据。模型无法访问数据;它给出的系数、相关性和 p 值都是假的。始终请求代码并自行生成结果。
  • 依靠幻觉功能。 AI 可能会建议不存在的 R/Python 函数或参数。未经运行和验证,请勿接受该代码。
  • 将微数据上传到公共工具。这违反了 KVKK/GDPR 和数据使用协议。匿名数据或根本不共享数据。
  • 将流畅性误认为准确性。一篇写得很好的评论可能是不准确的。句子的优美是无法证明的。
  • 不受控制地接受因果语言。 YZ常说“X增加Y”;而大多数回归仅显示关系。用设计来捍卫因果关系。
提示:在使用人工智能时,问自己这个问题:“如果裁判员或审计员要求提供此输出,我可以显示来源和帐户吗?”如果答案是否定的,则输出尚未准备好可供使用。

总之

人工智能在计量经济学和统计工作流程的执行层(代码、清理、图形、草稿)提供了真正的、大规模的加速;然而,模型选择、因果关系、解释、发布和政策决定属于专家。三个基本纪律:不要提醒AI数字,索要代码并自己生成和验证结果;不要从安全环境中删除微/许可数据;统计过滤每个输出。未经验证的人工智能输出与未经审查的发现一样有风险。

应用任务

考虑您自己的(或示例)数据集。向 AI 请求 R 或 Python 代码,通过简单地描述变量结构来生成描述性统计数据和简单的图表,而无需共享数据。在您自己的环境中运行传入的代码。然后保留一个清单:(1) 代码运行时是否没有错误,(2) 是您预期的行数/观察数,(3) 人工智能的哪些注释句子使用了因果语言,应该修复。在一段中写下人工智能为你节省的时间以及你至少发现的一个错误。

清单

  • [ ] 我没有让AI要求具体的统计数据;我请求了代码并自己生成了结果。
  • [ ] 我在自己的环境中重新计算了它给出的每个数字和测试结果。
  • [ ] 我验证了它使用的函数/参数确实存在。
  • [ ] 我没有将微/个人/许可数据上传到公共工具。
  • [ ] 我标记了包含因果语言的评论并将其移至关系语言。
  • [ ] 我能够向审核员展示输出的来源和会计。