单位 5 / 11

电子发现:在公司数据中查找相关证据

收益:

  • 能够理解 EDRM 工作流程和 TAR/预测编码概念,并利用人工智能加速审核阶段
  • 能够理解召回率和精确度的平衡,并通过在取证环境中优先考虑高召回率来确保不会错过相关文档
  • 了解特权和个人数据决策的法律责任由人类律师承担,并且需要方法透明

在民事诉讼或监管调查中,一方请求另一方持有的电子文件:电子邮件、合同、聊天记录、文件。依法收集这些文件、审查、整理相关文件并交付对方/法院的过程称为电子证据发现,即在法律纠纷范围内查找、审查和出示电子证据。电子取证是计算机取证与法律联系最紧密的领域,也可能是人工智能最成熟、最广泛的应用。在本单元中,您将学习 EDRM 工作流程、TAR/预测编码的概念以及 AI 如何转变此流程。

EDRM:电子证据开示的标准工作流程

世界上的电子发现主要在 EDRM(电子发现参考模型 - 定义电子发现过程的标准阶段的参考模型)框架内运行。主要阶段:

  1. 信息管理和识别:确定哪些数据在哪里。
  2. 保存和收集:防止删除相关数据(合法保留——因诉讼而停止删除数据的义务)并完整地收集数据。
  3. 处理:使数据可搜索、删除重复项、格式转换。
  4. 审查:决定文件是否属于敏感文件或特权文件——受律师-委托人特权保护且不会被移交。
  5. 制作:将相关文件交付给对方/法院。

最昂贵、最需要人力的阶段是审查。让律师一份一份地阅读数十万份文件既非常昂贵,又非常缓慢。这正是人工智能创造革命的地方。

TAR 和预测编码

加快审评速度的关键技术是TAR(技术辅助审评)。最常见的形式是预测编码:专家律师将样本文档标记为“相关/不相关”;系统从这些示例中学习,并自动对剩余的数十万个文档进行分类。因此,人们只阅读最有可能相关的文档,并通过抽样检查其余的文档。

现代人工智能(大型语言模型)更进一步:它可以解释为什么文档是相关的、主题总结、特权标志,而不仅仅是“相关/不相关”。但基本原则没有改变:AI建议,相关性和特权决定的法律责任在于律师。

TAR 的防御性取决于流程的可审计性。循环重复由专家律师标记的训练样本,系统从这些样本中学习并对剩余文档进行分类;准确性是通过每轮抽样来衡量的。这个周期为“机器看了什么、学到了什么、准确度如何?”等问题提供了可记录的答案。对方经常质疑这种方法;因此,从一开始就记录训练集大小、决策阈值和验证样本率。过程越透明和可重复,结果就越有可能在法庭上被接受。

提示:为了使您的 TAR 流程具有防御性,请记录您的“训练”样本、验证指标(召回率/精度)和决策阈值。对方问“机器漏了什么?”他可能会问;透明的方法确保信任。

两个指标:召回率和精确率

有两个概念在电子证据开示中至关重要。召回率(敏感性——您实际上能够找到多少相关文档)衡量丢失的风险;这在法律上至关重要,因为未能提交相关文件可能会导致制裁。精确度——你发现的内容有多少是真正相关的——衡量不必要的阅读负担;影响成本。两者之间有一个平衡:如果放宽阈值,召回率会增加,但不必要的文档也会增加。在法医/法律背景下,高召回率通常是优先考虑的——不遗漏比过度阅读更重要。

特权和隐私:红线

电子取证中最危险的错误是意外地将特权文件移交给另一方(特权放弃)。律师与委托人的信件一旦送达,就很难检索。人工智能有助于标记特权,但每个特权决定都必须得到人类律师的确认。此外,包含个人数据的文档可能需要进行编辑(KVKK/GDPR 范围);人工智能标记屏蔽候选人,最终控制权在人类手中。

注意:将原始企业数据加载到人工智能中时,请遵守数据隐私和管辖权(哪个国家的数据,去哪里)规则。特权数据和个人数据必须根据合同并在适当的管辖范围内,在数据不用于模型培训的车辆上进行处理。

三个迷你箱子

案例 1 — TAR 降低成本。在一个包含 130 万份文档的商业案例中,经典的线性审查估计时间为 14 个月。通过预测编码,律师标记了 8,000 个文档;系统对剩余文件进行分类,人工审查减少至 90,000 份文件。该过程缩短至 6 周,92% 通过召回抽样得到确认。

情况 2 — 特权已保存。预制作 AI 将交付集中的 240 个文档标记为“可能有特权”。律师团队审查; 210 封实际上是律师与委托人的信件,并未送达。如果没有人工智能,这些文件可能会意外传给对方。

案例 3——过度自信的风险。一个团队严格设定 TAR 阈值以实现高精度;该系统在没有抽样的情况下剔除了那些它认为“不相关”的内容。随后的审计发现,由于严格的阈值,有几封关键电子邮件被遗漏。由于未执行调用采样,该错误被发现较晚。

四个可复制模板

1) 审查方案草案:

您的角色:电子取证顾问。案件主题:【违约】。为我起草一份审查协议:响应标准、特权标志、个人数据屏蔽规则和 TAR 验证步骤(召回/精确采样)。声明每项决定均须经过律师确认。

2)相关性初步分类:

主题和相关性标准:[此处]。我会给你文件摘要。对于每个文件:相关/不相关/不确定,并给出简短的理由。突出显示“不清楚”的内容;这些将提交给律师审查。那些你认为不相关的会通过抽样检查,这并不是彻底消除。

3)权限扫描:

勾选以下可能构成律师-委托人特权的文件:律师姓名、“机密/特权”语言、法律意见内容。这些不是最终决定,它们是有待律师确认的候选决定。给出每个标志的理由和相关行。

4) 个人数据脱敏候选者:

列出在生产前交付的这些文档中需要屏蔽的个人数据候选人:TR、IBAN、健康、第三方私人数据。仅标记为候选人;我将做出最终的屏蔽决定。更改文本。

弱提示/强提示

弱提示:

从这些文件中,选择与案件相关的文件。

没有相关性标准,没有排他性,也没有验证;人工智能做出主观决定,可能会错过关键文件或泄露特权。

强力提示:

您的角色:电子证据开示审查助理。案例:指控X公司违反了与Y公司的供货合同。相关标准:交货日期、价格变化、质量投诉、终止谈判。我会给你文件摘要。为每个文档提供相关/不相关/不确定+理由。还将包含律师姓名或法律意见的内容标记为“可能享有特权”。不要将任何决定视为最终决定;所有内容均须经律师确认。

实质性标准、特权筛选和“律师验证”约束使这一过程具有正当性。

EDRM 阶段和 AI 表

舞台

人工智能贡献

人类责任

收藏

模板、计划

合法持有,诚信

加工

重复数据删除、格式化、目录

质量控制

评论

TAR,相关性推荐

相关性决策

特权

标记候选者

最终决定、确认

生产

掩蔽候选者

最终检查、交付

常见错误

  • 让 TAR 无人看管。在不执行调用示例的情况下说“机器表示不感兴趣”将导致劫持。
  • 将特权决定权留给人工智能。错误交付可能导致不可撤销的弃权。
  • 只关注精确率而不是召回率。门槛太紧错过了相关文件;在法律上,召回具有优先权。
  • 没有记录方法。对方可能会对TAR流程提出质疑;透明度是必须的。
  • 将个人/特权数据上传到不适当的工具。遵守管辖权和保密规则。

综上所述

电子取证是指以合法方式从企业电子数据中查找并提供相关证据的过程,并在EDRM的框架内运作。人工智能通过 TAR/预测编码改变了最昂贵的阶段——审查:人类只阅读最有可能相关和最模糊的文档。但相关性、特别是特权的决定的法律责任在于律师;召回抽样、方法透明度和个人数据保护由人类纪律确保。

应用任务

定义一个虚构案例和 4-5 项相关标准。准备 20-25 个文档摘要(一些是特权的,一些是晦涩难懂的)。应用“相关性预分类”和“权限筛选”模板;然后通过从“不相关”集合中采样来手动检查召回情况,并确认人工智能已标记的特权候选者。

清单

  • [ ] 我观察了 EDRM 阶段和法定保留义务。
  • [ ] 我通过召回抽样检查了 TAR/预分类结果。
  • [ ] 我已将每项特权决定与人类律师确认联系起来。
  • [ ] 我已通过最终检查批准了个人数据屏蔽候选人。
  • [ ] 我记录了我使用的方法和阈值。