单位 4 / 11

大数据分类:优先考虑 TB 级数据

收益:

  • 了解分诊是在不删除任何内容的情况下确定检查顺序的学科,并能够利用人工智能进行语义搜索和内容聚类。
  • 能够通过基于散列的消除 (NSRL) 和重复数据删除来减少噪声,并观察这些方法的限制(单个位更改)
  • 能够手动确认语义搜索和文档分类决策的误报,并提供合理的理由,使其具有防御性

现代法医调查不再局限于一台计算机。在公司事件中,您可能会遇到数十个磁盘、数百 GB 的电子邮件存档、云备份、聊天应用程序和 TB 的文件。从物理上来说,从头到尾一一检查它们是不可能的。这就是分类(借用医学的概念;首先将有限的资源分配给最关键的病例,即快速决定“首先看什么”)发挥作用的地方。在本单元中,我们将了解人工智能如何智能地对大量数据进行优先级排序、容易出现哪些错误,以及分类如何与取证完整性相协调。

为什么需要分诊?

在计算机取证中,两个现实是相互冲突的:(1)所有证据都是有价值的,任何证据都不应被遗漏; (2)时间和人力有限。分类解决了这个冲突——不删除任何内容,只是确定检查的顺序。换句话说,分类不是“排除”,而是“优先”。首先检查具有最高证据概率的数据;低概率数据被存储,但稍后进入队列。

分类发生在两个级别:实时分类(在现场决定首先对哪个设备进行成像)和数据分类(捕获图像后,首先检查哪个文件/数据集)。人工智能在后者中尤其强大,即大型数据集基于内容的优先级。

分诊的法医敏感方面是排序决定决定调查的方向。集群优先级不正确可能会导致关键证据晚几周才被发现,甚至因为调查已过期而根本没有得到检查。因此,分类不是“速度技巧”,而是一种方法决定,应该有合理的理由记录下来,就像任何其他取证步骤一样。在高风险病例中,分诊并不能取代全面调查;它只是确定首先考虑哪一部分,保留最终评估整个集合的原则。

提示:记录您的分类决定及其原因。 “为什么我们先看这个集群,为什么我们把它留到最后呢?”这个问题可以在法庭上提出。在该记录中包含人工智能的优先顺序理由;透明度就是防御性。

利用人工智能进行基于内容的优先级排序

经典分类会查看文件名、大小和日期。人工智能为此添加了上下文理解:它可以理解文档的内容、图像包含的内容以及对话的语气。这样:

  • 语义搜索 - 即使单词不完全匹配,也能找到含义相似的内容:搜索“汇款”也会返回包含“汇款”、“发货”、“付款指令”的文档。
  • 主题聚类:自动将数千个文档分类为主题(财务、人力资源、技术、个人)。
  • 情绪/语气标记:突出显示威胁、恐慌、侵犯隐私等语气的消息。
  • 视觉分类:按对象/场景标签对数千张图像进行分组(在法律限制内,例如仅授权和适当的内容)。
  • 重复和垃圾消除:将相同文件和系统文件(使用已知的哈希列表)的重复数据删除分开,并将人们的目光引导到真正的新内容。

已知文件消除:NSRL 和哈希集

大数据分类最实用的加速器是已知的好/坏哈希列表。 NSRL(国家软件参考图书馆)等图书馆保存了数百万个标准操作系统和应用程序文件的哈希值。这些“已知良好”的文件在分类中被消除,从而使人们能够只关注用户生成的和可疑的文件。同样,“已知不良”哈希值(已知恶意软件)也会被自动标记。人工智能在淘汰后的剩余集群中发挥作用,这确实需要意义。

注意:基于哈希的消除功能很强大,但是单个位的更改会完全改变哈希。通过稍微修改标准文件,攻击者可以将其从“已知良好”列表中删除,或者相反,隐藏坏文件。消除不是绝对​​的,而是一种优先手段。

三个迷你箱子

案例 1 — 语义搜索将时间除以 20。内部调查发现了 480GB 的电子邮件。经典关键词搜索返回了 3 个“贿赂”结果。人工智能驱动的语义搜索还捕获了诸如“咨询费”、“便利”、“感谢付款”等委婉语,并提取了 61 条相关消息。审核在两天内完成,而不是几周;每个结果均经过手动确认。

案例 2 — 重复数据删除节省了人力。在包含 170 万个文件的集群中,经过基于哈希的重复清理和 NSRL 消除后,需要检查的唯一用户文件减少到 92,000 个。该团队专注于实际内容,而不是 95% 的系统噪音。

案例 3——过度自信的代价。有一个团队从未开放过人工智能所说的“非金融”集群。事实证明,一份重要的合同隐藏在个人相册中(不是隐写术,只是错误的文件夹)。由于未对低优先级集群进行采样,因此证据被延迟。教训:分诊决定顺序,而不是取消考试。

四个可复制模板

1) 分流策略草案:

您的角色:高级法医分诊专家。数据:[例如480GB电子邮件+1.2TB文件共享]。查询主题:[例如数据泄露+贿赂]。为我制定一个分类策略:应该以什么顺序、什么标准来查看哪个集群;如何使用哈希消除和语义搜索。强调不会“取消”任何簇,它们只会被排序。

2)语义搜索词扩展:

主题:[贿赂/数据泄露/骚扰]。要查找与此主题相关的文档,请列出隐式/同义表达(包括俚语、代码词、间接引语)以及文字关键字。目的是扩大搜索范围;对每个术语进行分类。

3)内容聚类:

我会给你文件标题/摘要。将它们分为有意义的主题(财务、人力资源、技术、法律、个人),并为每个文档提供主题 + 简要理由。单独标记无法融入主题的“不明确”簇;该簇不会被跳过,它将被手动检查。

4)淘汰后优先报告:

已知良好 (NSRL) 和重复文件被消除。对于剩余的唯一用户文件:根据调查主题分配高/中/低优先级并写入 JUSTIFICATION。扩展名内容不匹配、加密/密码文件以及过去 30 天内更改的文件也会突出显示。

弱提示/强提示

弱提示:

在此数据中查找重要文件。

没有主题、范围和优先级的逻辑;人工智能可能会错过其自己对“重要”的定义所定义的关键内容。

强力提示:

您的角色:法医分类分析师。调查:据称一名员工在离职前泄露了一份客户名单。我将为您提供文件元数据(名称、大小、日期、扩展名、路径)和简短的内容摘要。任务:将客户数据、导出/归档、云上传轨迹、USB/外盘、最近60天内更改的文件标记为高优先级;写下每个决定的理由。不要说任何簇都不能被检查;只是排序。单独列出不确定性。

具体的主题、有针对性的标准和“无审查”约束使输出既高效又安全。

分诊方法对照表

方法

什么是

强项

风险

哈希消除 (NSRL)

分配已知文件

非常快速、精确

修改后的文件转义

重复数据删除

一份一份地复印

节省人力

可以跳过关闭副本

关键词

搜索确切的术语

简单、可审计

错过了隐含的陈述

语义搜索(AI)

查找含义最接近的

捕获隐含内容

产生误报

内容聚类(AI)

分为主题

提供概述

主题错误的风险

常见错误

  • 将分类误认为消除。低优先级并非“不予审查”;抽样是必不可少的。
  • 对哈希消除的绝对信任。单个位的改变会改变哈希值;危急情况可能需要全面扫描。
  • 只需依靠关键字即可。隐式和编码语句转义;完成语义搜索。
  • 不确认语义搜索的误报。人工智能可以将不相关的文档显示为“相关”;阅读并验证。
  • 未能记录分类理由。在法庭上“你为什么首先看这个?”你必须有这个问题的答案。

综上所述

大数据分类是一种将有限的时间用于最可能的证据的学科——不删除任何内容,只确定顺序。人工智能;它在语义搜索、内容聚类、音调标记和消除后的优先级排序方面提供了极快的速度。但专家观察到哈希消除的局限性、误报/漏报的风险以及“低优先级并非未经审查”的原则。记录分流决定的合理性可以使结果在法庭上站得住脚。

应用任务

准备 30-40 行的示例文件元数据列表(名称、大小、日期、扩展名、简要摘要);在其中放入一些“误导性”文件(关键文档位于错误的文件夹中,文件扩展名已更改)。使用“淘汰后优先级报告”模板进行优先级排序,然后从低优先级集群中采样至少 15%,看看 AI 是否遗漏了任何内容。

清单

  • [ ] 我将分类设置为优先级;我没有取消任何集群。
  • [ ] 我通过散列消除和重复数据删除来减少噪音,同时牢记其局限性。
  • [ ] 我用语义搜索完成了关键字。
  • [ ] 我手动确认了语义/聚类输出的误报。
  • [ ] 我记录了分类决定及其理由。