单位 5 / 11

回归诊断和违规:共线性、异方差、自相关

收益:

  • 能够通过人工智能支持的诊断测试和图形来检测多重共线性、异方差和自相关等违规行为
  • 能够区分每次违规是否扭曲了系数估计或标准误差,并选择适当的校正(稳健的标准误差、转换、模型修订)
  • 能够验证人工智能建议的修复是否解决了问题而不是隐藏问题,并且诊断是基于对生成数据的过程的理解

读取回归的输出很容易;很难相信他。因为系数是无偏的,标准误是正确的,p值是有效的,这取决于我们在上一单元中引入的假设是否得到满足。在本单元中,我们将介绍三种最常见的违规行为:多重共线性、异方差和自相关。我们将为每个问题回答三个问题:如何诊断它、它破坏了什么(系数或标准误差)以及如何修复它。人工智能(AI)生成用于诊断测试和纠正的代码;但您可以决定哪个违规才是真正的问题以及修复是否可以解决问题。

让我们首先做出最关键的区别:违规是否会扭曲系数估计值或仅扭曲标准误差?这种区别决定了解决方案。扭曲系数的问题(例如外生性违规)需要重新考虑模型;仅扭曲标准误差(异方差、自相关)的问题通常可以通过标准误差校正来解决。人工智能的一个常见错误是应用一种技术来纠正标准错误,然后宣布问题“已解决”;而底层结构可能仍然存在。

违规1:多重共线性

为什么?两个或多个解释变量彼此密切相关;例如,将“总经验年数”和“年龄”都放入模型中。由于这些变量携带几乎相同的信息,因此模型很难将它们分开。

它会破坏什么?系数估计保持无偏,但变得不稳定:标准误差增大、置信区间变宽、个别系数可能不显着,而模型总体上可能显着(F 检验)。微小的数据变化会显着改变系数。

如何诊断? VIF(方差膨胀因子):对于每个变量,它衡量该变量被其他变量解释的程度。作为一个粗略的阈值,VIF > 5(约 10)值得谨慎对待。此外,还检查了解释变量之间的相关矩阵。

如何修复?删除相关变量之一,将它们组合起来(制作索引),或者(如果理论需要)保留这两个变量并避免解释单个系数。保留哪个变量是一个理论决定,而不是统计决定——人工智能建议消除,你提供理由。

违规2:异方差

为什么?误差项的方差在观测值中不是恒定的。典型例子:随着收入的增加,支出的分散度也随之增加;形成“漏斗”模式,低收入时窄,高收入时宽。

它会破坏什么?系数估计再次是无偏的——这一点很重要。被扭曲的是标准误差:它们的计算不正确,因此 p 值和置信区间变得不可靠。所以你的系数位于正确的中心,但“你有多大信心”这个问题的答案是错误的。

如何诊断?残差与预测值的散点图(寻求漏斗模式)和正式测试:Breusch-Pagan 测试、White 测试。小 p 值表示“没有恒定方差”。

如何修复?最常见和实用的解决方案是使用鲁棒标准误差(鲁棒/异方差一致,HC 标准误差):它不会更改系数,而是纠正违反的标准误差。替代方案:转换因变量(如对数)或加权 LCM。稳健的标准误几乎已成为当今实证研究中的默认值。

违规行为 3:自相关

为什么?误差项不是相互独立的;它在时间序列中最常见:一个时期的误差影响下一个时期(例如,在冲击后的时期内残差保持为正)。

它会破坏什么?同样,它主要扭曲了标准误差(通常低估了标准误差,造成了错误的重要性); LCC 中的系数保持无偏,但失去了有效性。

如何诊断? Durbin-Watson 检验(用于一阶自相关)、Breusch-Godfrey 检验(更一般)以及残差与滞后值的图。

如何修复? Newey-West(HAC — 抵抗自相关和异方差)标准误差,向模型添加滞后项,或切换到适当的时间序列模型(单元 8)。

注意:异方差和自相关会扭曲标准误差,而不是系数。因此,在说“系数显着”之前,请确保标准误差计算正确;否则,意义可能只是一种幻觉。

对比图

违规

什么打破了

诊断

通用解决方案

多链接

夸大标准误差,使系数不稳定

VIF,相关矩阵

减去/组合变量(按理论)

异方差性

标准误(系数无偏)

布劳施-异教徒,怀特,残差情节

稳健 (HC) 标准错误、转换

自相关

标准误(系数无偏)

杜宾-沃森、布劳施-戈弗雷

Newey-West (HAC),延迟学期

四个可复制的提示

1. 完整的诊断包:

您的角色:回归诊断助理。我想要 R 代码,我不共享数据。模型:lm(支出~收入+年龄+地区,数据=数据)。任务:(1) 计算 VIF,(2) 使用 Breusch-Pagan 和残差估计图测试异方差,(3) 使用 Durbin-Watson 测试自相关。在注释行中解释每个测试测量的违规情况以及如何解释 p 值。更正申请;产生诊断。

2.稳健的标准误:

编写 R 代码,为同一模型(三明治 + lmtest 包)重现具有异方差鲁棒性 (HC3) 标准误差的系数表。制作一个表格,并排显示经典标准误和稳健标准误,以便我可以看到差异。在注释行中强调系数不会改变,只有标准误差会改变。

3.多链接审核:

给我一个具有高 VIF 的变量列表:哪些变量理论上可以测量相同的事物,哪些变量有充分的理由保留它们。不要自动获得资格;我会根据理论做出决定。还要解释为什么只查看 VIF 并分配变量可能是错误的。

4、自相关校正:

在我的时间序列回归中,Breusch-Godfrey p 值为 0.001。编写 R 代码,生成具有 Newey-West (HAC) 标准误差的系数表,并解释如何选择滞后。请注意,此修正并不能解决自相关的原因,它只是修正了推论。

弱提示/强提示

弱提示:

我的回归有问题吗?如果是这样,请修复它。

这个提示使人工智能处于盲目的“修复”模式:它可以跳过测试并应用直接转换或变量消除,而不向您显示实际存在哪些违规以及它破坏了什么。

强力提示:

你的角色:诊断助手,而不是自动更正器。首先分别测试三个违规行为(多重共线性、异方差、自相关)以及每个违规行为:哪个测试、如何读取结果、它是否破坏系数或标准误差。然后仅建议修复实际检测到的违规行为,并解释我如何验证该修复是否解决了问题。

差异:坚强的意志迫使在纠正之前进行诊断,并要求明确区分“它破坏了什么”。

三个迷你箱子

案例 1 — 虚假显着性(异方差)。一位分析师发现支出~收入模型中的收入系数“显着”,p=0.01。但现在他的图表上出现了明显的漏斗模式。当应用稳健标准误差时,p 值增加到 0.09;意义就丧失了。第一个结果是错误计算的标准误差造成的错觉。教训:如果不纠正标准错误,就无法相信显着性。

情况 2 — 盲目变量消除。一名学生从模型中删除了“经验”变量,因为他的 VIF 很高;系数被“清理”,但模型的理论意义被扭曲,因为经验是主要的兴趣变量。正确的做法:减去年龄并保留经验,或者将两者结合起来。教训:VIF 阈值本身并不能成为消除的理由;理论决定。

案例 3 — 自相关隐藏的不确定性。在时间序列研究中,Durbin-Watson 被忽略了;该系数似乎非常“精确”(置信区间窄)。当应用 Newey-West 标准误时,置信区间加倍,政策建议变得更加保守。教训:自相关可能会低估不确定性。

常见错误

  • 将扭曲标准误差的违规误认为是系数问题。异方差和自相关不会扭曲系数;不要惊慌并不必要地重建模型,首先纠正标准错误。
  • 看VIF,盲目赋值变量。仅仅因为 VIF 高而删除理论上必要的变量会使模型变得毫无意义。
  • 不验证修复。应用稳健的标准误差后,检查违规行为是否确实纠正了推论;不要说“我应用了它,完成了”。
  • 无需诊断即可修复。在不测试存在哪种违规的情况下应用转换/消除可以“解决”不存在的问题并隐藏存在的问题。
  • 修复原因。 Newey-West 没有解决自相关的原因;它只是修正了推论。如果存在结构性问题,则必须更改模型。
提示:对于每次违规,问问自己“这是否破坏了系数或我对它的信心?”如果答案是“信心”,那么解决方案几乎总是标准误差校正,而不是重建模型。

综上所述

回归诊断是信任输出的先决条件。在三种常见的违规行为中,多重共线性使系数不稳定并夸大标准误差;另一方面,异方差和自相关使系数保持无偏,只会扭曲标准误差。 AI 生成诊断和修复代码,但您可以决定哪种违规是真正的问题,哪种变体仍然是理论上的,以及修复是否解决了问题。如果不明确“正在发生的事情”之间的区别,恐慌和盲目纠正都是不正确的。

应用任务

设置多元回归,并向 AI 询问仅产生诊断(无校正)的代码:VIF、Breusch-Pagan/White 和 Durbin-Watson/Breusch-Godfrey。对于每个测试,解释结果并指出违规是否扭曲了系数或标准误差。对于您检测到的真实违规(例如异方差),应用稳健的标准误差并将经典结果和稳健结果并列;证明系数没有变化,但标准误差发生了变化。在一段中,报告修正对显着性结果的影响。

清单

  • [ ] 我分别测试了三种违规行为(多重共线性、异方差、自相关)。
  • [ ] 对于每次违规,我区分了它是否扭曲了系数或标准误差。
  • [ ] 我基于多重共线性中的变量消除理论,而不仅仅是 VIF。
  • [ ] 我使用了对异方差/自相关 (HC/HAC) 具有鲁棒性的标准误差。
  • [ ] 更正后,我检查并验证了违规行为对我的推论的影响。
  • [ ] 我报告标准误差校正如何影响我的显着性结果。