收益:
- 能够根据目的、范围、更新频率和可靠性比较主要经济数据源(TURKSTAT、CBRT EVDS、IMF WEO、世界银行、欧盟统计局、FRED)并选择正确的数据源
- 能够利用人工智能进行数据源查找、序列码/描述匹配和下载代码生成,并与官方来源确认每个结果
- 能够查看版本(修订版)、基准年、单位和定义差异如何扰乱分析并养成验证元数据的习惯
每一次经济分析都是从数据开始的,分析的质量永远不能超过数据的质量。 “垃圾进,垃圾出”的原则在经济学中无情地运作:即使是最优雅的模型,如果基于错误的基础、错误的定义或错误的时期,也是错误的。在本单元中,我们将使用人工智能来查找正确的数据、匹配串行代码并编写下载代码;但一条黄金法则不会改变:该数字来自官方主要来源,而不是来自人工智能。 AI可以为你指明源头之路;您可以从该源获取数据本身。
我们来了解一下主要来源
经济学家的指南针包括以下资源。每个的目的、范围和更新节奏都不同。
TURKSTAT(土耳其统计局)。土耳其的官方统计机构。通货膨胀(CPI/PPI)、GDP、劳动力、对外贸易、工业生产、人口。这是土耳其特定数据的主要来源。
CBRT EVDS(电子数据分发系统)。央行数据门户。汇率、利息、货币供应量、国际收支、经常余额、储备、预期调查。金融和货币数据的第一站。
国际货币基金组织(国际货币基金组织)。特别是WEO(世界经济展望)数据库:跨国比较GDP、通货膨胀、债务、经常账户余额和预测。非常适合国际比较;但预测只是预测,而不是实现。
世界银行(世界银行 - WDI)。世界发展指标:发展、贫困、教育、健康、基础设施指标;长期历史系列和国家比较。
欧盟统计局。欧盟统计局;欧盟国家的统一(可比较)数据。 HICP(统一通货膨胀)等系列用于欧盟基准测试。
FRED(美联储经济数据)。圣路易斯联储的大规模系列;为美国和全球宏观金融数据提供快速且可编程的访问 (API)。
经合组织。发达经济体的比较指标、领先指标、生产率和福利系列。
提示:“正确来源”问题的答案取决于目的。土耳其官方通货膨胀率的 TURKSTAT;国际货币基金组织/世界银行将土耳其与 30 个国家进行比较; FRED为了美国的利益。从错误的来源获取相同的指标是一个无声的错误。
无提示错误来源:修订、基准年、单位、描述
经济数据中最危险的错误是无声的。认识四:
- 修订版(版本)。许多指标(国内生产总值、国际收支平衡)在首次公布几个月后都会进行修订。今天的“临时”数字,三个月后的“最终”数字将会有所不同。了解您使用的是哪个年份(版本)。
- 基准年。指数是根据基准年(=100)建立的。直接比较两个不同基年的系列是错误的。
- 单元。百万还是十亿,里拉还是美元,当前价格还是固定价格?单位混淆是最常见的分析错误。
- 定义/范围。 “失业”的定义是什么? “核心通胀”不包括哪些项目?两个同名系列可能会衡量不同的事物。
注意:如果两个来源的同一指标的数字不匹配,您的第一个假设不应该是“有人在撒谎”,而是“定义/基础/范围/修订存在差异”。首先对齐元数据(数据引用)。
一步一步:人工智能驱动的数据收集
- 明确需求。哪个指标、哪个国家/省、哪个时期、哪个频率(月度/季度/年度)、哪个定义?
- 选择来源。向 AI 解释目的并建议适当的主要来源和完整系列名称。
- 验证元数据。在官方页面确认所选系列的单位、基准年、描述和更新日期。
- 生成下载代码。对于那些拥有 API 的机构,例如 FRED/世界银行,可以向 AI 编写 Python 代码;删除 TURKSTAT/EVDS 的下载步骤。
- 首先检查。数据到达后,检查行/列数、缺失值、异常值和日期范围。
- 来源确认。至少将一些观察结果与官方出版物进行比较;完全匹配吗?
三个迷你箱子
案例 1——基准年陷阱。一位分析师从两项独立的研究中获得了工业生产指数;一个是基于 2015=100,另一个是基于 2021=100。 “把这些结合起来,”他告诉人工智能。如果他跳过元数据检查,他会将索引并排放置并看到假跳转。他抓住了控制步骤中的基数差异,将两者变成了共同的基数,然后将它们组合起来。假弹跳消失了。
案例 2 — 伪造的 API 输出。一位研究员对人工智能说,“从世界银行提取土耳其的人均GDP”;人工智能返回代码和数字表作为“样本输出”。研究人员没有使用该表;只是运行代码并从真实的 API 获取数据。然后他意识到人工智能写的“示例”数字实际上有 10-15% 的折扣。代码工具,不是数字;这是正确的行为。
案例 3 — 修订差异。在六个月前发布的一份报告中,一家机构写道,季度增长率为4.0%;在目前的TÜıK数据中,同季度修正为3.5%。在新报告中,分析师在脚注中说明了他使用的版本,并通过修订解释了两个数字之间的差异。透明度保留了可信度。
来源选择表
目的
适当的主要来源
注意
土耳其通货膨胀(CPI/PPI)
土耳其统计局
基准年、核心/标题区别
汇率、利息、经常余额、储备金
CBRT EVDS
修订、系列定义
各国国内生产总值/通货膨胀比较
国际货币基金组织《世界经济展望》
预测≠实现
发展/长期历史系列
世界银行世界发展指数
覆盖范围、缺失年份
欧盟统一指标
欧盟统计局
HICP定义
美国/全球宏观金融、API
弗雷德
季节调整状况
四个可复制模板
1)来源及系列匹配:
我需要以下指标:[指标、国家/省、周期、频率、描述]。为此推荐最合适的主要官方来源和完整系列名称。列出我需要验证的有关该系列的单位、基准年和描述的要点。不要给出数字;只要告诉我在哪里以及如何购买即可。
2)FRED/世界银行下载代码:
使用 [FRED/世界银行] API 在 Python 中编写代码,下载以下系列:[系列代码/名称],[日期范围]。该代码将数据放入 pandasDataFrame,打印前/后 5 行以及缺失值的数量。不要给我一个例子/虚构的人物;只需提供工作代码。
3)元数据验证列表:
我将使用以下系列:[系列]。创建使用前需要验证的元数据清单:数量、基准年、季节性调整状态、定义/范围、更新日期、修订状态。对于每一项,用一句话写下“确认内容和地点”。
4)两个资源不匹配诊断:
我从两个来源获得了相同的指标,但数字不同:来源 A:[值,印记]。来源 B:[价值,印记]。列出造成这种差异的可能的无害原因(定义、基础、范围、季节性调整、修订、货币),并告诉我如何检查每个原因。不要说“一个人错了”;首先帮我解释一下差异。
弱提示/强提示
弱提示:
请给我土耳其过去 10 年的增长数据。
人工智能从记忆中倒出一张图片,可能是旧的并且部分是捏造的;没有来源或印记。
强力提示:
我将使用 2014-2023 年土耳其年度实际 GDP 增长率。告诉我这个的主要来源(TURKSTAT)和完整的系列名称;告诉我该系列是否是固定价格以及在哪里可以验证基准年。还提供下载此数据的步骤/代码。不要自己产生数字。
常见错误
- 将人工智能的“样本输出”表误认为是真实数据。这些数字可能是捏造的;只需使用代码/指南即可。
- 比较两个系列而不对齐元数据。基础/单位/定义的差异会产生虚假结果。
- 将投影误认为现实。国际货币基金组织《世界经济展望》明年的数字是估计值。
- 忽略修改。没有说明您使用的是哪个版本。
- 频率不匹配。将月度系列与季度系列相结合,无需更正。
- 未在脚注中引用来源。无法追踪的数字是站不住脚的数字。
综上所述
分析的力量就是数据的力量。使用AI寻找合适的源码,匹配系列并编写下载代码;但始终从主要官方来源(TURKSTAT、EVDS、IMF、世界银行、欧盟统计局、FRED)获取数据。通过调整元数据来消除无声错误源,例如修订、基准年、数量和描述。如果两个来源发生冲突,请先比较来源。
应用任务
选择您在业务中经常使用的指标。让 AI 使用上面的模板 1 和 3 提取源和元数据清单。然后从两个不同来源(例如TURKSTAT和世界银行)找到相同的指标并比较数字;如果存在差异,请使用模板 4 诊断原因并用三句话记下您的发现。
清单
- [ ] 我选择了适合我目的的主要来源(我区分了土耳其的官方/国际比较)。
- [ ] 我从官方页面验证了该系列的单位、基准年、描述和更新日期。
- [ ] 我使用的是从真实来源获取的数据,而不是人工智能给出的“样本数据”。
- [ ] 我至少将一些观察结果与官方出版物进行了逐字比较。
- [ ] 我检查了修订/版本状态并记下我正在使用的版本。
- [ ] 我通过对齐元数据解释了两个源冲突。
- [ ] 我使用脚注使我使用的每个图形的来源都可追溯。