收益:
- 了解分诊是在不删除任何内容的情况下确定检查顺序的学科,并能够利用人工智能进行语义搜索和内容聚类。
- 能够通过基于散列的消除 (NSRL) 和重复数据删除来减少噪声,并观察这些方法的限制(单个位更改)
- 能够手动确认语义搜索和文档分类决策的误报,并提供合理的理由,使其具有防御性
现代法医调查不再局限于一台计算机。在公司事件中,您可能会遇到数十个磁盘、数百 GB 的电子邮件存档、云备份、聊天应用程序和 TB 的文件。从物理上来说,从头到尾一一检查它们是不可能的。这就是分类(借用医学的概念;首先将有限的资源分配给最关键的病例,即快速决定“首先看什么”)发挥作用的地方。在本单元中,我们将了解人工智能如何智能地对大量数据进行优先级排序、容易出现哪些错误,以及分类如何与取证完整性相协调。
为什么需要分诊?
在计算机取证中,两个现实是相互冲突的:(1)所有证据都是有价值的,任何证据都不应被遗漏; (2)时间和人力有限。分类解决了这个冲突——不删除任何内容,只是确定检查的顺序。换句话说,分类不是“排除”,而是“优先”。首先检查具有最高证据概率的数据;低概率数据被存储,但稍后进入队列。
分类发生在两个级别:实时分类(在现场决定首先对哪个设备进行成像)和数据分类(捕获图像后,首先检查哪个文件/数据集)。人工智能在后者中尤其强大,即大型数据集基于内容的优先级。
分诊的法医敏感方面是排序决定决定调查的方向。集群优先级不正确可能会导致关键证据晚几周才被发现,甚至因为调查已过期而根本没有得到检查。因此,分类不是“速度技巧”,而是一种方法决定,应该有合理的理由记录下来,就像任何其他取证步骤一样。在高风险病例中,分诊并不能取代全面调查;它只是确定首先考虑哪一部分,保留最终评估整个集合的原则。
提示:记录您的分类决定及其原因。 “为什么我们先看这个集群,为什么我们把它留到最后呢?”这个问题可以在法庭上提出。在该记录中包含人工智能的优先顺序理由;透明度就是防御性。
利用人工智能进行基于内容的优先级排序
经典分类会查看文件名、大小和日期。人工智能为此添加了上下文理解:它可以理解文档的内容、图像包含的内容以及对话的语气。这样:
- 语义搜索 - 即使单词不完全匹配,也能找到含义相似的内容:搜索“汇款”也会返回包含“汇款”、“发货”、“付款指令”的文档。
- 主题聚类:自动将数千个文档分类为主题(财务、人力资源、技术、个人)。
- 情绪/语气标记:突出显示威胁、恐慌、侵犯隐私等语气的消息。
- 视觉分类:按对象/场景标签对数千张图像进行分组(在法律限制内,例如仅授权和适当的内容)。
- 重复和垃圾消除:将相同文件和系统文件(使用已知的哈希列表)的重复数据删除分开,并将人们的目光引导到真正的新内容。
已知文件消除:NSRL 和哈希集
大数据分类最实用的加速器是已知的好/坏哈希列表。 NSRL(国家软件参考图书馆)等图书馆保存了数百万个标准操作系统和应用程序文件的哈希值。这些“已知良好”的文件在分类中被消除,从而使人们能够只关注用户生成的和可疑的文件。同样,“已知不良”哈希值(已知恶意软件)也会被自动标记。人工智能在淘汰后的剩余集群中发挥作用,这确实需要意义。
注意:基于哈希的消除功能很强大,但是单个位的更改会完全改变哈希。通过稍微修改标准文件,攻击者可以将其从“已知良好”列表中删除,或者相反,隐藏坏文件。消除不是绝对的,而是一种优先手段。
三个迷你箱子
案例 1 — 语义搜索将时间除以 20。内部调查发现了 480GB 的电子邮件。经典关键词搜索返回了 3 个“贿赂”结果。人工智能驱动的语义搜索还捕获了诸如“咨询费”、“便利”、“感谢付款”等委婉语,并提取了 61 条相关消息。审核在两天内完成,而不是几周;每个结果均经过手动确认。
案例 2 — 重复数据删除节省了人力。在包含 170 万个文件的集群中,经过基于哈希的重复清理和 NSRL 消除后,需要检查的唯一用户文件减少到 92,000 个。该团队专注于实际内容,而不是 95% 的系统噪音。
案例 3——过度自信的代价。有一个团队从未开放过人工智能所说的“非金融”集群。事实证明,一份重要的合同隐藏在个人相册中(不是隐写术,只是错误的文件夹)。由于未对低优先级集群进行采样,因此证据被延迟。教训:分诊决定顺序,而不是取消考试。
四个可复制模板
1) 分流策略草案:
您的角色:高级法医分诊专家。数据:[例如480GB电子邮件+1.2TB文件共享]。查询主题:[例如数据泄露+贿赂]。为我制定一个分类策略:应该以什么顺序、什么标准来查看哪个集群;如何使用哈希消除和语义搜索。强调不会“取消”任何簇,它们只会被排序。
2)语义搜索词扩展:
主题:[贿赂/数据泄露/骚扰]。要查找与此主题相关的文档,请列出隐式/同义表达(包括俚语、代码词、间接引语)以及文字关键字。目的是扩大搜索范围;对每个术语进行分类。
3)内容聚类:
我会给你文件标题/摘要。将它们分为有意义的主题(财务、人力资源、技术、法律、个人),并为每个文档提供主题 + 简要理由。单独标记无法融入主题的“不明确”簇;该簇不会被跳过,它将被手动检查。
4)淘汰后优先报告:
已知良好 (NSRL) 和重复文件被消除。对于剩余的唯一用户文件:根据调查主题分配高/中/低优先级并写入 JUSTIFICATION。扩展名内容不匹配、加密/密码文件以及过去 30 天内更改的文件也会突出显示。
弱提示/强提示
弱提示:
在此数据中查找重要文件。
没有主题、范围和优先级的逻辑;人工智能可能会错过其自己对“重要”的定义所定义的关键内容。
强力提示:
您的角色:法医分类分析师。调查:据称一名员工在离职前泄露了一份客户名单。我将为您提供文件元数据(名称、大小、日期、扩展名、路径)和简短的内容摘要。任务:将客户数据、导出/归档、云上传轨迹、USB/外盘、最近60天内更改的文件标记为高优先级;写下每个决定的理由。不要说任何簇都不能被检查;只是排序。单独列出不确定性。
具体的主题、有针对性的标准和“无审查”约束使输出既高效又安全。
分诊方法对照表
方法
什么是
强项
风险
哈希消除 (NSRL)
分配已知文件
非常快速、精确
修改后的文件转义
重复数据删除
一份一份地复印
节省人力
可以跳过关闭副本
关键词
搜索确切的术语
简单、可审计
错过了隐含的陈述
语义搜索(AI)
查找含义最接近的
捕获隐含内容
产生误报
内容聚类(AI)
分为主题
提供概述
主题错误的风险
常见错误
- 将分类误认为消除。低优先级并非“不予审查”;抽样是必不可少的。
- 对哈希消除的绝对信任。单个位的改变会改变哈希值;危急情况可能需要全面扫描。
- 只需依靠关键字即可。隐式和编码语句转义;完成语义搜索。
- 不确认语义搜索的误报。人工智能可以将不相关的文档显示为“相关”;阅读并验证。
- 未能记录分类理由。在法庭上“你为什么首先看这个?”你必须有这个问题的答案。
综上所述
大数据分类是一种将有限的时间用于最可能的证据的学科——不删除任何内容,只确定顺序。人工智能;它在语义搜索、内容聚类、音调标记和消除后的优先级排序方面提供了极快的速度。但专家观察到哈希消除的局限性、误报/漏报的风险以及“低优先级并非未经审查”的原则。记录分流决定的合理性可以使结果在法庭上站得住脚。
应用任务
准备 30-40 行的示例文件元数据列表(名称、大小、日期、扩展名、简要摘要);在其中放入一些“误导性”文件(关键文档位于错误的文件夹中,文件扩展名已更改)。使用“淘汰后优先级报告”模板进行优先级排序,然后从低优先级集群中采样至少 15%,看看 AI 是否遗漏了任何内容。
清单
- [ ] 我将分类设置为优先级;我没有取消任何集群。
- [ ] 我通过散列消除和重复数据删除来减少噪音,同时牢记其局限性。
- [ ] 我用语义搜索完成了关键字。
- [ ] 我手动确认了语义/聚类输出的误报。
- [ ] 我记录了分类决定及其理由。