单位 3 / 12

通过数据分析进行全面群体测试:从样本到整体

收益:

  • 了解抽样风险和全人群测试(100% 测试)的逻辑,并能够使用人工智能进行数据准备、规则编写和结果解释。
  • 能够在人工智能支持下设计和实施大数据集中的匹配、完整性和准确性测试
  • 能够理解全群体测试中的例外清单不是结果,而是审核员将检查的开始,并且最终评估属于审核员。

审计行业最基本的限制之一是审计师必须多年从事抽样工作。您无法手动审核企业一年内开具的 180,000 张发票;因此,您使用统计或判断方法选择数百条记录,对其进行测试,并将结果推广到整个群体。抽样是一种强大且合法的技术,但它具有固有的风险:抽样风险——您选择的样本可能无法代表总体,并且其中的真正误差可能并不完全落在您所寻找的地方。

数据分析和人工智能改变了这一情况:您现在可以测试整个人群,即 100%。这称为全面人口测试。我们致力于了解从“样本到整体”的转变、它带来的力量以及许多人忽视的新责任。因为全人群检测不利于检查;它改变了考试的性质,给考官带来了新的负担。

抽样和全面人口测试之间的差异

在经典抽样中,逻辑是:“让我彻底测试一个小但具有代表性的群体,并从整体上解释结果。”在全人口测试中,逻辑是相反的:“让我按照一定的规则扫描整体,找到不符合规则的例外,并彻底检查它们。”第一种方法的风险是“选择错误的样本”;第二,风险是“编写错误的规则”和“使用不完整/错误的数据”。

下表对这两种方法进行了比较:

尺寸

抽样

全面人群测试(100%)

适用范围

部分人口

全体人口

主要风险

抽样风险(表示误差)

规则错误+数据完整性错误

输出

测试结果数量有限

不符合规则的例外情况列表

审计师的负担

选择+测试

规则设计+异常评估

人工智能的作用

帮助选择样品

数据准备、规则编写、异常标记

注意:全面人口测试并不意味着“我测试了所有内容,工作完成”。相反,它通常会给你更多的检查项目。当您通过日期金额审批规则运行所有 180,000 张发票时,您可能会发现 900 个例外。这些都是一个问题;不是答案。这就是司法审计发挥作用的地方。

数据完整性:测试的隐形基础

全民测试的最大陷阱是测试的质量取决于数据的质量。仅当您拥有的数据实际上是 100% 的总体时,“我测试了 100% 的数据”才有意义。如果从系统中提取数据时过滤器不正确,遗漏了一些记录,或者传输的金额列带有小数错误,则实际上将在不完整或损坏的数据上执行“完整”测试。因此,确认数据的完整性和准确性是全人群检测的第一步,也是不可或缺的一步。

完整性验证的实际检查:

  • 记录计数调节:您提取的数据集中的行数与系统中的记录总数是否匹配?
  • 金额对账:数据集中的总金额与试算表/子公司中的相关账户总额是否一致?
  • 日期范围:数据中是否包含该期间的第一天和最后一天;是否缺少月份/日期?
  • 空坏空间扫描:必填字段(日期、金额、账户代码)中是否有空格或无意义的值?

人工智能可以帮助完成所有这些检查:抓取数据、获取总数、计算空白空间、报告日期范围。但由审计员决定协议是否“成立”,调查差异,并确认数据适合审计目的。

注意:在未验证数据完整性的情况下,请勿在工作表上写下“我测试了所有数据”。对缺失数据进行的全面总体测试提供了看似完整但具有误导性的保证。

使用人工智能进行全面人口测试:一步一步

  1. 安全地准备数据。将个人/私有字段匿名或用占位符替换。如果可能,请使用公司签约车辆。
  2. 确认完整性。核对记录数量和金额。
  3. 明确定义测试规则。什么算作“例外”? (例如:未批准的发票、周末开具的发票、大额付款、截止日期之后记录的收入。)
  4. 通过人工智能应用规则。人工智能将规则应用于数据并生成例外列表;把规则写清楚,以便审核。
  5. 确定优先级并审查例外情况。用证据调查每一个异常情况;解决误报,证明实际发现的合理性。
  6. 记录结果。将规则、例外数量、检查的项目和结论链接到工作表。

三个迷你箱子

案例 1——切割测试。审计员想要测试年终收入截止点。他将 42,000 张销售发票作为全部数据,并让 AI 强制执行“发票日期在 12 月 31 日之前列出记录,但发货/交货日期在 1 月 1 日或之后”。 YZ标记了118条记录。审计员检查了这些:96 项是合法交易,没有时间差异(当天交付),22 项实际上是下一年的收入并记录在上一期间。报告这 22 项是因为它们显示出一种模式,尽管显着性较低。 AI问了118个问题;审计员找到了 22 个答案。

情况 2 — 省略完整性时。一名团队成员表示,他对 180,000 张发票进行了全面人口测试;没有任何例外,他松了口气。负责人将数据集总量与试算表进行了对比:数据1.55亿里拉,试算表2.1亿里拉。事实证明,当从系统中提取数据时,一个分支被过滤并遗漏了。 “完整”测试实际上遗漏了四分之一的数据。使用正确的数据运行了测试。教训:没有完整性确认就没有完整的人群测试。

情况 3 — 规则错误。审计员让 AI 编写规则“列出超过 50,000 TL 的未批准付款”,但没有意识到“批准”字段保留在系统中的两个不同列中(电子批准和手动批准)。 AI 将 300 笔付款标记为“未批准”,因为它只检查了一笔;经检查,大部分都在另一栏获得批准。错误的规则产生了数百个误报。审计员更正了规则以包含这两列。教训:审核员验证规则是否符合数据和业务流程。

弱提示/强提示

弱提示:

在此发票数据中查找有问题的记录。

问题:没有“问题”的定义。人工智能不知道什么是例外;他要么根据随机信号,要么根据他制定的标准工作。它不可重复且不可审计。

强力提示:

您的角色:您是独立审计师的数据分析助理。判断是我的;您将应用规则并生成例外列表。上下文:以下是匿名销售发票数据(列:发票编号、发票日期、交货日期、金额、审批状态、分支)。年末:31.12.STEP 1 - 完整性:给出记录总数和总金额,以便我可以将其与试算表进行比较。报告是否有任何空白/缺失空间。第 2 步 - 切割测试规则:列出发票日期 <= 31.12 且交货日期 >= 01.01 的记录作为“截止例外”。第 3 步 - 以纯文本形式编写规则(您应用什么条件),以便对其进行审核。规则:我给出了规则,不要更改它。提交您标记为“审核例外”的记录;不要说“错误/发现”。无法从数据中推断出的内容就不要编造。

该请求非常强大,因为它首先确认完整性,明确定义异常规则,需要规则的明文(可审计性),并将输出定位为“异常”。

常见错误

  • 跳过完整性验证。对不完整/损坏的数据执行“完整”测试并给出错误的保证。
  • 将异常误认为是发现。在不验证AI标记记录的情况下计算错误;避免消除误报。
  • 不检查规则。生成数百个错误标记,而不检查规则是否符合数据和业务流程。
  • 编写模糊的规则。通过未定义的提示(例如“查找有问题的记录”)获得不可重复的结果。
  • 满足于单一的开始。如果异常数量与预期相差很大,则不查询规则或数据。
提示:如果异常数量太小(接近于零)或太大,请警惕。零通常意味着“规则写得不正确”或“数据丢失”;数字过大表明规则过于宽泛。优秀的审计师会怀疑“没有例外”和“一切都是例外”。

总之

全面人群测试是审计领域的巨大飞跃:它消除了抽样风险,筛选了 100% 的数据。但它不是免费的。它带来了两项新的职责:(1)验证数据的完整性和准确性,(2)评估出现的个别异常。人工智能准备数据、应用规则、标记异常并将扫描时间缩短至几秒钟;但规则的准确性、数据的完整性以及例外情况的评估属于审核员。例外不是结果,而是开始。

应用任务

考虑现有(或假设)的交易数据集。首先定义两个完整性检查(记录数量和金额对账)。然后出于审计目的编写明确的例外规则(例如周末开具发票,或减少例外情况)。通过上面强大的提示模式,让AI先执行完整性,然后再执行规则。出现的前 10 个异常是“真实发现还是误报?”按如下方式练习分类,并写下您要为每个分类寻找的证据。

清单

  • [ ] 我对数据进行了匿名处理并安全驾驶。
  • [ ] 我通过核对记录数和金额来确认数据完整性。
  • [ ] 我扫描了可用/坏空间。
  • [ ] 我以清晰、可重复的方式定义了例外规则。
  • [ ] 我从AI那里收到了规则的明文,并验证了其与数据和业务流程的符合性。
  • [ ] 我质疑例外数量的合理性(太少/不是太多)。
  • [ ] 我将每个异常视为要检查的问题,而不是发现;我消除了误报。