单位 7 / 11

基于数据的决策和公共数据分析

收益:

  • 认识到处理数据的质量、保密性和解释风险,并建立安全的分析流程。
  • 它根据目的选择正确的指标,区分误导性的单一指标和易于操纵的测量结果。
  • 它识别误导性的图表技术(轴不从零开始,选择范围)并观察诚实的可视化。

公众每天都会产生数据:申请数量、解决时间、预算项目、人口流动、服务请求、审计结果、满意度调查。大多数数据位于 Excel 电子表格、表单和记录系统中,但不会转化为决策,因为分析这些数据需要专业知识和时间。基于数据的决策(一种根据测量的证据而不是意见或习惯来分配资源和制定政策的方法)提高了公共部门的效率和公平性:资源根据数字分配到最需要的地方。在这里,人工智能是理解表格、查找模式和异常、提取汇总统计数据以及将结果转化为简单句子的强大助手。在本单元中,您将了解如何利用人工智能缩短从原始公共数据到可靠决策的路径,并在最关键的方面(对数字的正确解释)保持纪律。

使用数据的三大危险

数据很强大,但它也存在三个陷阱,而人工智能既可以减轻也可以放大这些陷阱:

  1. 相关性≠因果性。仅仅因为两件事一起改变并不意味着其中一件事会导致另一件事。冰淇淋销量和溺水事件都在增加,因为它们都与夏季炎热有关,而不是其中之一造成另一个。人工智能可以流畅地构建“因为”句子;质疑每一个因果关系的主张。
  2. 数据有偏差/缺失。数据是从谁那里收集的以及如何收集的?投诉数据仅反映可以投诉的人;能够访问互联网的数字应用程序数据。如果你没有看到缺失的群体,那么这个决定就会有偏见。
  3. 没有上下文的数字。单纯“增加30%”是没有意义的:根据什么、在什么时期、绝对数字是多少?向 AI 询问上下文。
注意:当人工智能分析您提供的表格时,它有时会添加表格之外的“合理”但虚构的数字,或者默默地填充缺失的单元格。将每个输出数字与源表进行比较;给人工智能规则“仅使用我给你的表中的值,如果缺少则说‘没有数据’”。

逐步数据分析流程

  1. 澄清问题。我们正在寻找什么问题的答案来做出决定? (“哪个邻域的求解时间最长?”)
  2. 了解数据。列是什么,单位是什么,周期是什么,是否有任何缺失/不正确的值?
  3. 提取个人数据。如果分析不需要个人身份识别,则进行匿名/汇总(参见第 11 单元)。
  4. 总结和模式出现。让AI执行基本统计、分组和异常标记。
  5. 质疑评论。相关性还是因果关系?另一种解释?缺群吗?
  6. 可视化并简化。决策者可以理解的简单摘要和图表。
  7. 记录决定及其推理。根据什么数据做出什么决定?审计追踪。

三个迷你箱子

案例 1 — 来源到达了正确的地方。过去,市政府将公园维护预算“平均分配给每个社区”。通过人工智能分析18个月的需求和使用数据,三个街区的人均需求是平均值的2.4倍。根据需要重新分配预算;总体满意度提高,且无需额外费用。

案例 2——注意到有偏差的数据。一个机构会查看数字应用程序数据并得出结论:“公民不再来到收费站”。但当分析中要求按年龄细分时,发现65岁以上的申请仍然大部分来自柜台。如果只看数字数据,这一群体就会被忽略;票房服务得以保留。

案例 3——人为的因果关系停止了。 YZ在解读表格时表示,“事故减少是因为检查次数增加了。”分析师提醒,同期天气也发生变化,客流量减少;将其归因于单一原因是具有误导性的。该报告被更正为“存在相关性,但因果关系尚未得到证实”。

四个可复制模板

1)认识表格:

您的角色:数据分析师。检查下表,并仅基于此表中的值:(1) 总结每列的含义、单位和周期,(2) 任何出现缺失/不正确的单元格,(3) 总结最突出的前 3 个模式。添加表外的数字;如果缺失,请说“无数据”。表:[粘贴数据]

2) 带有上下文的汇总统计数据:

回答下表中的问题:[问题]。必须给出带有上下文的结果:绝对数量+比率+比较周期。当您说“增加 X%”时,请具体说明增加的程度和时间段。只需使用给定的数据。表:[数据]问题:[问题]

3)因果关系提问者:

解释以下发现,但注意:不要混淆相关性和因果关系。为这种关系生成至少 3 个替代解释(第三个变量、相反方向、巧合)。告诉我需要哪些额外数据来证明因果关系。发现:[关系]

4)该决定的简单总结:

为非数据专家的决策者简化以下分析:不超过 5 个项目,每个项目一个发现和“这意味着什么”解释。还要清楚地写下数据的不确定性和限制。添加新信息。分析:[文本]

弱提示/强提示

弱:“分析这张图表并告诉我们应该做什么。”

Strong:“你的角色是数据分析师。只使用下表;不要从外部添加数字,对缺失的单元格说‘没有数据’。首先,了解列、单位和周期。然后用绝对数+比率+比较周期回答‘哪个邻域的求解时间最长’的问题。如果你找到了一个模式,在用因果关系解释之前,想出 3 种替代解释。最后,列出数据的点和边界(缺失组、短周期),让决策由我们。”

差异:强提示将数据保真度、上下文、因果关系规则和决策边界共同建立起来;输出是一个站得住脚的分析。

数据业务中人工智能在哪些方面值得信赖?

商业

人工智能信任

规则

表格汇总、分组

仅给出数据

异常/模式标记

中等

人工确认

因果解释

需要替代解释

填写缺失数据

太低

不要让它发生; “没有数据”

简化/可视化总结

意义必须被保留

指标设计和误导性图表陷阱

利用数据做出决策的最关键步骤是选择正确的指标(使现象可测量的数值表达式,例如“平均处理时间”或“每个应用程序的成本”)。即使数据准确,错误的指标也会导致错误的决定:虽然“已解决的索赔总数”似乎在增加,但“每个公民的等待时间”可能正在恶化。人工智能可以列出某个主题的候选指标以及每个指标衡量和隐藏的内容;但你决定哪个指标真正代表公共利益。此外,请注意人工智能建议或描述的图表中存在误导性可视化的风险(使用轴不从零开始、不成比例的比例、选定的时间间隔等技术扭曲感知);公共数据中诚实的视觉是治理的一部分。

迷你案例——错误的标志,错误的夸耀。 1个单位“每月结案数”指标打破记录;但公民投诉有所增加。从准确的指标“首次联系解决率”来看,该比率从 58% 下降到 44%——文件被迅速关闭并重新打开。当指标发生变化时,管理优先级也发生变化。

迷你案例——不从零开始的轴。在演示文稿中描述的 AI 图表中,纵轴从 40 开始,2% 的增长似乎是一个巨大的跳跃。当轴移至零时,真实的画面浮现出来,决策从夸张的感知中消除。

支持指标选择的模板:

任务:为以下目的提出 5 个候选指标。 目的:[例如提高公民服务质量]对于每个指标:它衡量什么|它能隐藏什么|操纵的开放性|建议阅读频率。下一步:写下 3 个警告(本身具有误导性的警告)来一起阅读这些指标。规则:不要产生数字;只是建议指标设计。

注意:不要误以为“数字是客观的”。您测量的数字、显示的方式以及选择的范围都取决于解释。透明和诚实的公众解释与准确的数据同样重要。

常见错误

  • 将相关性误认为因果关系。 “一起增加”不是原因,而是原因。寻找替代解释。
  • 让人工智能填补缺失的数据。分析因虚构的值而崩溃;让失踪者失踪。
  • 概括有偏见的数据。投诉/数字数据并不代表所有人;查询缺失的组。
  • 在没有上下文的情况下呈现数字。比率旁边应该有绝对数字和比较期。
  • 不必要地分析个人数据。如果汇总数据足够,请勿使用个人身份识别。
  • 没有记录该决定。根据应记录哪些数据以供审计而做出何种决定。

总之

基于数据的决策是公共部门公平、高效分配资源的最有力方式;人工智能是这个行业的快速助手,它可以理解图片、发现模式并简化查找过程。但不要让人工智能编造数字,不要让它填写缺失的数据,不要让它混淆相关性与因果关系,并避免概括有偏见/不完整的数据。人多力量大;正确解释并记录决定的人更强大。

应用任务

从您的单位获取真实的(去除个人数据的)表格。使用“了解表格”模板引入数据,然后使用“上下文摘要统计”模板回答重要的决策问题。将“因果关系提问者”模板应用于新兴关系,并找到至少一个替代解释。检查AI是否正在添加表外的数字。

清单

  • [ ] AI仅使用给定的表;他没有添加来自外部的号码。
  • [ ] 我没有填写缺失的数据;我将其保留为“无数据”。
  • [ ] 我为每个结果提供了上下文(绝对数字 + 比率 + 周期)。
  • [ ] 我对因果关系主张提出了另一种解释。
  • [ ] 我评估了有偏差/缺失数据和缺失组的风险。
  • [ ] 我记录了该决定及其所依据的数据。