Прибыль:
- Способность понимать рабочий процесс EDRM и концепцию TAR/предиктивного кодирования, а также ускорять этап проверки с помощью искусственного интеллекта.
- Способность понимать баланс отзыва и точности и гарантировать, что не пропустите соответствующие документы, отдавая приоритет высокому отзыву в криминалистическом контексте.
- Понимание того, что юридическая ответственность за решения о привилегиях и персональных данных лежит на юристе-человеке и что необходима прозрачность методологии.
В гражданском иске или расследовании регулирующих органов одна сторона запрашивает электронные документы, находящиеся у другой: электронные письма, контракты, журналы чата, файлы. Процесс сбора этих документов в соответствии с законом, их изучения, сортировки соответствующих документов и доставки их другой стороне/суду называется электронным обнаружением - поиском, проверкой и представлением электронных доказательств в рамках юридического спора. Электронное обнаружение — это область, в которой компьютерная криминалистика наиболее тесно переплетена с правом и, возможно, является наиболее зрелым и широко распространенным применением ИИ. В этом модуле вы изучите рабочий процесс EDRM, концепцию TAR/предсказывающего кодирования и то, как ИИ преобразует этот процесс.
EDRM: стандартный рабочий процесс обнаружения электронных данных
E-discovery в мире в основном работает в рамках EDRM (Electronic Discovery Reference Model – эталонная модель, определяющая стандартные этапы процесса e-discovery). Основные этапы:
- Управление информацией и идентификация: определение того, какие данные где находятся.
- Сохранение и сбор: предотвращение удаления соответствующих данных (юридическое удержание — обязательство прекратить удаление данных в ожидании судебного разбирательства) и сбор их с соблюдением целостности.
- Обработка: Обеспечение возможности поиска данных, удаление дубликатов, преобразование формата.
- Обзор: принятие решения о том, являются ли документы конфиденциальными или конфиденциальными — на них распространяется адвокатская тайна и они не будут переданы.
- Производство: Доставка соответствующих документов другой стороне/суду.
Самый затратный и трудоёмкий этап – рассмотрение. Заставлять юристов читать сотни тысяч документов один за другим — это очень дорого и очень медленно. Именно здесь ИИ творит революцию.
TAR и прогнозирующее кодирование
Ключевой технологией, ускоряющей рассмотрение, является TAR (Technology Assisted Review). Наиболее распространенной формой является прогнозирующее кодирование: адвокат-эксперт помечает образцы документов как «релевантные/нерелевантные»; Система учится на этих примерах и автоматически классифицирует оставшиеся сотни тысяч документов. Таким образом, читаются только те документы, которые, скорее всего, имеют отношение к делу, а остальные проверяются путем выборки.
Современный ИИ (большие языковые модели) делает еще один шаг вперед: он может объяснить, почему документ актуален, кратко изложить тему, указать привилегию, а не просто «релевантный/нерелевантный». Но основной принцип не меняется: ИИ предполагает, что юридическая ответственность за решение об актуальности и привилегированности лежит на юристе.
Защищенность TAR зависит от возможности аудита процесса. Обучающие примеры, размеченные экспертом-юристом, система, обучающаяся на этих примерах и классифицирующая оставшиеся документы, повторяется в цикле; Точность измеряется путем отбора проб в каждом раунде. Этот цикл дает документированные ответы на вопросы «на что смотрела машина, чему она научилась, насколько она точна?» Другая сторона часто подвергает сомнению эту методологию; Таким образом, размер обучающего набора, пороги принятия решений и частота выборки для проверки записываются с самого начала. Чем прозрачнее и повторяемее процесс, тем больше вероятность того, что его результат будет принят в суде.
Совет: Чтобы сделать процесс TAR оправданным, задокументируйте свои «обучающие» выборки, показатели проверки (отзыв/точность) и пороговые значения принятия решений. Другая сторона спрашивает: «Что пропустила машина?» он может спросить; Прозрачная методология обеспечивает доверие.
Две метрики: отзыв и точность
Две концепции имеют жизненно важное значение для обнаружения электронных данных. Напомним (чувствительность — сколько всех соответствующих документов вы действительно смогли найти) измеряет риск пропажи; Это крайне важно с юридической точки зрения, поскольку непредставление соответствующего документа может повлечь за собой санкции. Точность (сколько из того, что вы считаете действительно важным), измеряет ненужную нагрузку при чтении; влияет на стоимость. Между ними существует баланс: если снизить порог, отзыв увеличивается, но и ненужных документов также увеличивается. В криминалистическом/юридическом контексте часто приоритет отдается хорошему запоминанию — не пропустить важнее, чем перечитать.
Привилегии и конфиденциальность: красная линия
Самая опасная ошибка при раскрытии электронных данных — это случайная передача конфиденциального документа другой стороне (отказ от привилегий). После того как переписка адвоката с клиентом доставлена, ее очень сложно получить. ИИ помогает отмечать привилегии, но каждое решение о привилегиях должно быть подтверждено адвокатом-человеком. Кроме того, редактирование может потребоваться для документов, содержащих персональные данные (область действия KVKK/GDPR); ИИ помечает кандидатов, маскируя их, окончательный контроль за человеком.
Внимание: соблюдайте правила конфиденциальности данных и юрисдикции (данные какой страны, куда они отправляются) при загрузке необработанных корпоративных данных в AI. Привилегированные и персональные данные должны обрабатываться на транспортных средствах, данные которых не проходят обучение модели, по контракту и в соответствующей юрисдикции.
три мини-кейса
Случай 1 — снижение стоимости TAR. В коммерческом случае с 1,3 миллионами документов классическая оценка линейного рассмотрения составила 14 месяцев. С помощью предиктивного кодирования юристы пометили 8000 документов; система классифицировала остаток, а человеческая проверка сократилась до 90 000 документов. Процесс сократился до 6 недель, что подтвердили 92% выборок из воспоминаний.
Случай 2. Привилегии сохранены. Предварительный образец ИИ пометил 240 документов в комплекте поставки как «возможно привилегированные». Команда юристов осмотрела; 210 писем фактически представляли собой переписку адвоката с клиентом и не были доставлены. Без ИИ эти документы могли случайно попасть к другой стороне.
Случай 3 — Риск самоуверенности. Одна команда жестко установила порог TAR для обеспечения высокой точности; Система исключила тех, кого она сочла «нерелевантными», без выборки. Последующий аудит показал, что несколько важных электронных писем были пропущены из-за строгого порога. Ошибка была замечена поздно, так как выборка вызовов не производилась.
Четыре копируемых шаблона
1) Проект протокола рассмотрения:
Ваша роль: консультант по электронному обнаружению. Предмет дела: [нарушение договора]. Составьте для меня протокол проверки: критерии реагирования, флаги привилегий, правила маскировки личных данных и этапы проверки TAR (отзыв/точная выборка). Заявите, что каждое решение подлежит утверждению адвокатом.
2) Соответствующая предварительная классификация:
Тематика и критерии релевантности: [здесь]. Я дам вам резюме документов. Для каждого документа: актуально/нерелевантно/неопределенно и дайте КРАТКОЕ обоснование. Выделите «непонятные»; они пойдут на рассмотрение адвоката. Те, кого вы называете нерелевантными, будут проверены путем выборки, а не окончательного исключения.
3) Сканирование привилегий:
Отметьте следующие документы, которые ВОЗМОЖНО создают адвокатскую тайну: имена адвокатов, «конфиденциальный/привилегированный» язык, содержание юридического заключения. Это не ОКОНЧАТЕЛЬНЫЕ решения, это кандидаты, которые должны быть утверждены юристом. Дайте обоснование и соответствующую строку для каждого знака.
4) Кандидаты на сокрытие персональных данных:
Перечислите кандидаты на персональные данные, которые необходимо замаскировать в этих документах для их доставки перед производством: TR, IBAN, здоровье, личные данные третьих лиц. Отметить только как кандидата; Я приму окончательное решение по маскировке. Изменить текст.
Слабая подсказка / Сильная подсказка
Слабая подсказка:
Из этих документов выберите те, которые имеют значение для дела.
Никаких критериев релевантности, никакой эксклюзивности и никакой проверки; ИИ принимает субъективные решения, может пропустить важный документ или утечь конфиденциальную информацию.
Мощная подсказка:
Ваша роль: помощник по проверке электронных документов. Кейс: Утверждение о том, что компания X нарушила договор поставки с Y. Критерии значимости: сроки поставки, изменение цен, жалобы на качество, переговоры о расторжении договора. Я дам вам резюме документов. Дайте актуальное/нерелевантное/неопределенное + обоснование для каждого документа. ТАКЖЕ отмечайте как «возможно привилегированные» те, которые содержат имя юриста или юридическое мнение. Не считайте какое-либо решение окончательным; Все подлежат утверждению адвокатом.
Критерии по существу, проверка привилегий и ограничение «проверки адвоката» делают этот процесс оправданным.
Этапы EDRM и таблица AI
Этап
Вклад ИИ
человеческая ответственность
коллекция
шаблон, план
Юридическая фиксация, целостность
Обработка
Дедупликация, формат, каталог
контроль качества
обзор
TAR, рекомендация по актуальности
Соответствующее решение
привилегия
Маркировка кандидата
окончательное решение, подтверждение
Производство
маскирующий кандидат
Финальная проверка, доставка
Распространенные ошибки
- Оставляя ТАР без присмотра. Сказать «машина сказала, что она не заинтересована» без выполнения выборки вызова приведет к перехвату соединения.
- Оставляя решение о привилегиях ИИ. Неправильная доставка грозит безвозвратным отказом.
- Сосредоточение внимания только на точности, а не на отзыве. Жесткий порог пропускает соответствующий документ; По закону отзыв имеет приоритет.
- Не документирование методологии. Другая сторона может поставить под сомнение процесс TAR; прозрачность обязательна.
- Загрузка личных/привилегированных данных в неподходящий инструмент. Соблюдайте правила юрисдикции и конфиденциальности.
В заключение
E-discovery — это процесс поиска и предоставления соответствующих доказательств из корпоративных электронных данных законным способом, который действует в рамках EDRM. ИИ преобразует самый дорогостоящий этап — анализ — с помощью TAR/предсказывающего кодирования: человек читает только наиболее релевантные и неоднозначные документы. Но юридическая ответственность за решение, имеющее отношение к делу и особенно привилегированное, лежит на юристе; Отзыв выборки, прозрачность методологии и защита персональных данных обеспечиваются человеческой дисциплиной.
Задача приложения
Определите вымышленное дело и 4-5 пунктов критериев значимости. Подготовьте 20–25 резюме документов (несколько особо важных, несколько малоизвестных). Примените шаблоны «Предварительная классификация релевантности» и «Проверка привилегий»; Затем вручную проверьте отзыв, выбрав образцы из «нерелевантного» набора и подтвердите кандидатов на привилегии, отмеченных ИИ.
контрольный список
- [ ] Я рассмотрел этапы EDRM и юридическое обязательство по удержанию.
- [ ] Я проверил результат TAR/предварительной классификации с помощью выборки из отзыва.
- [ ] Я привязывал каждое решение о привилегиях к утверждению адвоката.
- [ ] Кандидаты на сокрытие персональных данных мною утверждены с итоговой проверкой.
- [ ] Я задокументировал использованную методологию и пороговые значения.