Guadagni:
- Capacità di comprendere il flusso di lavoro EDRM e il concetto di codifica TAR/predittiva e di accelerare la fase di revisione con l'intelligenza artificiale
- Capacità di comprendere l'equilibrio tra richiamo e precisione e garantire di non perdere documenti rilevanti dando priorità ad un elevato richiamo in un contesto forense
- Comprendere che la responsabilità legale per le decisioni relative ai privilegi e ai dati personali spetta all'avvocato umano e che è necessaria la trasparenza della metodologia
In una causa civile o in un'indagine normativa, una parte richiede documenti elettronici detenuti dall'altra: e-mail, contratti, registri di chat, file. Il processo di raccolta di questi documenti in conformità con la legge, di esame, di selezione di quelli rilevanti e di consegnarli all'altra parte/tribunale è chiamato e-discovery: ricerca, revisione e presentazione di prove elettroniche nell'ambito di una controversia legale. L’e-discovery è l’area in cui l’informatica forense è maggiormente intrecciata con il diritto ed è forse l’uso più maturo e diffuso dell’intelligenza artificiale. In questa unità imparerai il flusso di lavoro EDRM, il concetto di TAR/codifica predittiva e come l'intelligenza artificiale trasforma questo processo.
EDRM: flusso di lavoro standard di e-discovery
L'e-discovery nel mondo opera in gran parte nell'ambito dell'EDRM (Electronic Discovery Reference Model - il modello di riferimento che definisce le fasi standard del processo di e-discovery). Fasi principali:
- Gestione e identificazione delle informazioni: determinare quali dati si trovano e dove.
- Conservazione e raccolta: impedire la cancellazione dei dati rilevanti (conservazione legale: obbligo di interrompere la cancellazione dei dati in previsione di un contenzioso) e raccoglierli con integrità.
- Elaborazione: rendere i dati ricercabili, rimuovere duplicati, conversione di formato.
- Revisione: decidere se i documenti sono sensibili o riservati: coperti dal segreto professionale avvocato-cliente e non verranno consegnati.
- Produzione: consegna dei documenti rilevanti all'altra parte/tribunale.
La fase più costosa e che richiede manodopera è la revisione. Far leggere agli avvocati centinaia di migliaia di documenti uno per uno è molto costoso e molto lento. È proprio qui che l’intelligenza artificiale crea una rivoluzione.
TAR e codifica predittiva
La tecnologia chiave che accelera la revisione è TAR (Technology Assisted Review). La forma più comune è la codifica predittiva: un avvocato esperto etichetta i documenti campione come "rilevanti/irrilevanti"; Il sistema impara da questi esempi e classifica automaticamente le restanti centinaia di migliaia di documenti. Pertanto si leggono solo i documenti più probabilmente rilevanti e si controlla il resto mediante campionamento.
L'intelligenza artificiale moderna (modelli linguistici di grandi dimensioni) fa un ulteriore passo avanti: può spiegare perché il documento è rilevante, riepilogare l'argomento, contrassegnare i privilegi, non solo "rilevante/irrilevante". Ma il principio fondamentale non cambia: secondo l’AI, la responsabilità giuridica della decisione di pertinenza e privilegio spetta all’avvocato.
La difendibilità del TAR dipende dalla verificabilità del processo. Gli esempi formativi etichettati dall'esperto avvocato, il sistema che apprende da questi esempi e classifica i restanti documenti si ripetono in un ciclo; La precisione viene misurata campionando in ogni round. Questo ciclo fornisce risposte documentabili alle domande "cosa ha guardato la macchina, cosa ha imparato, quanto era precisa?" L'altra parte spesso mette in dubbio questa metodologia; Pertanto, la dimensione del set di addestramento, le soglie decisionali e le frequenze di campionamento di convalida vengono registrate dall'inizio. Più il processo è trasparente e ripetibile, più è probabile che il risultato venga accettato in tribunale.
Suggerimento: per rendere difendibile il processo TAR, documenta i campioni di "addestramento", le metriche di convalida (richiamo/precisione) e le soglie decisionali. L'altra parte chiede "cosa ha mancato la macchina?" potrebbe chiedere; La metodologia trasparente garantisce la fiducia.
Due metriche: richiamo e precisione
Due concetti sono vitali nell'e-discovery. Il richiamo (sensibilità: quanti documenti rilevanti sei stato effettivamente in grado di trovare) misura il rischio di smarrimento; È giuridicamente fondamentale perché la mancata presentazione di un documento pertinente può comportare sanzioni. La precisione (quanto di ciò che trovi è effettivamente rilevante) misura il carico di lettura non necessario; incide sul costo. C'è un equilibrio tra i due: se si abbassa la soglia, aumentano i richiami, ma aumentano anche i documenti non necessari. In un contesto forense/legale, spesso viene data la priorità a un elevato ricordo: non sbagliare è più importante che leggere troppo.
Privilegio e privacy: la linea rossa
L'errore più pericoloso nell'e-discovery è la consegna accidentale di un documento privilegiato all'altra parte (rinuncia al privilegio). Una volta consegnata la corrispondenza avvocato-cliente, è molto difficile recuperarla. L’intelligenza artificiale aiuta a segnalare i privilegi, ma ogni decisione sui privilegi deve essere confermata da un avvocato umano. Inoltre, potrebbe essere necessaria la oscurazione di documenti contenenti dati personali (ambito KVKK/GDPR); Le bandiere dell'intelligenza artificiale mascherano i candidati, il controllo finale spetta all'umano.
Attenzione: rispettare le norme sulla privacy e sulla giurisdizione dei dati (di quale paese sono i dati, dove vanno) quando si caricano dati aziendali grezzi in AI. I dati privilegiati e personali devono essere trattati su veicoli i cui dati non vanno alla formazione del modello, sotto contratto e nella giurisdizione appropriata.
tre mini custodie
Caso 1 — Costo ridotto TAR. In un caso commerciale di 1,3 milioni di documenti, la stima classica della revisione lineare era di 14 mesi. Con la codifica predittiva, gli avvocati hanno taggato 8.000 documenti; il sistema ha classificato il resto e la revisione umana è scesa a 90.000 documenti. Il processo è stato ridotto a 6 settimane, confermato al 92% dal campionamento di richiamo.
Caso 2: privilegio salvato. L'intelligenza artificiale di pre-produzione ha contrassegnato 240 documenti nel set di consegna come "possibilmente privilegiati". Il team di avvocati ha esaminato; 210 erano in realtà corrispondenza avvocato-cliente e non furono consegnati. Senza l’intelligenza artificiale, questi documenti sarebbero potuti andare accidentalmente all’altra parte.
Caso 3 – Il rischio di eccessiva fiducia. Un team ha fissato rigorosamente la soglia TAR per un'elevata precisione; Il sistema ha eliminato quelli ritenuti "irrilevanti" senza campionamento. Il successivo controllo ha rilevato che diverse email critiche sono state perse a causa della soglia rigorosa. L'errore è stato notato tardi perché il campionamento delle chiamate non è stato eseguito.
Quattro modelli copiabili
1) Progetto di protocollo di revisione:
Il tuo ruolo: consulente di e-discovery. Oggetto del caso: [violazione del contratto]. Redigere per me un protocollo di revisione: criteri reattivi, indicatori di privilegio, regole di mascheramento dei dati personali e fasi di verifica TAR (richiamo/campionamento di precisione). Dichiarare che ogni decisione è soggetta alla conferma dell'avvocato.
2) Classificazione preliminare di rilevanza:
Oggetto e criteri di pertinenza: [qui]. Ti fornirò i riepiloghi dei documenti. Per ciascun documento: rilevante/irrilevante/incerto e fornire una BREVE motivazione. Evidenziare quelli "poco chiari"; questi andranno alla revisione dell'avvocato. Quelli che definite irrilevanti verranno controllati tramite campionamento, non si tratta di un'eliminazione definitiva.
3) Scansione dei privilegi:
Seleziona i seguenti documenti che POSSIBILMENTE rappresentano un privilegio avvocato-cliente: nomi degli avvocati, linguaggio "riservato/privilegiato", contenuto del parere legale. Queste non sono decisioni FINALI, sono candidati da confermare da un avvocato. Fornire la giustificazione e la riga pertinente per ciascun segno.
4) Candidati al mascheramento dei dati personali:
Elencare i dati anagrafici candidati da mascherare in questi documenti da consegnare prima della produzione: TR, IBAN, sanitari, dati privati di terzi. Segna solo come candidato; Prenderò la decisione finale sul mascheramento. Cambia testo.
Prompt debole / Prompt forte
Suggerimento debole:
Da questi documenti, seleziona quelli rilevanti per il caso.
Nessun criterio di pertinenza, nessuna esclusività e nessuna verifica; L'intelligenza artificiale prende decisioni soggettive, potrebbe perdere documenti critici o divulgare dati privilegiati.
Suggerimento potente:
Il tuo ruolo: assistente alla revisione di e-discovery. Caso: Accusa che la società X ha violato il contratto di fornitura con Y. Criteri di rilevanza: date di consegna, variazioni di prezzo, reclami sulla qualità, trattative di risoluzione. Ti fornirò i riepiloghi dei documenti. Fornire pertinente/irrilevante/incerto + giustificazione per ciascun documento. Contrassegnare ANCHE come "possibilmente privilegiati" quelli contenenti il nome dell'avvocato o il parere legale. Non considerare alcuna decisione come definitiva; Tutti sono soggetti alla conferma dell'avvocato.
I criteri sostanziali, lo screening dei privilegi e il vincolo della “verifica dell’avvocato” rendono il processo difendibile.
Fasi EDRM e tabella AI
Palcoscenico
Contributo dell'IA
responsabilità umana
raccolta
modello, piano
Tenuta legale, integrità
Elaborazione
Deduplicazione, formattazione, directory
controllo di qualità
revisione
TAR, raccomandazione di rilevanza
Decisione sulla pertinenza
privilegio
Candidato in fase di valutazione
decisione finale, conferma
Produzione
candidato mascherante
Controllo finale, consegna
Errori comuni
- Lasciando il TAR incustodito. Dire "la macchina ha detto che non è interessata" senza eseguire un esempio di chiamata causerà un dirottamento.
- Lasciando la decisione sui privilegi all'IA. Una consegna errata rischia la rinuncia irrevocabile.
- Concentrandosi solo sulla precisione invece che sul ricordo. La soglia stretta non consente il documento pertinente; In diritto, il richiamo ha la priorità.
- Non documentare la metodologia. La controparte può mettere in discussione il procedimento TAR; la trasparenza è un must.
- Caricamento di dati personali/privilegiati su uno strumento inappropriato. Rispettare le norme sulla giurisdizione e sulla riservatezza.
In sintesi
L'e-discovery è il processo di ricerca e fornitura di prove rilevanti dai dati elettronici aziendali in modo legale e opera nell'ambito dell'EDRM. L’intelligenza artificiale trasforma la fase più costosa, la revisione, con TAR/codifica predittiva: l’essere umano legge solo i documenti più probabilmente rilevanti e ambigui. Ma la responsabilità giuridica della decisione di rilevanza e soprattutto di privilegio spetta all'avvocato; Il campionamento del richiamo, la trasparenza della metodologia e la protezione dei dati personali sono garantiti dalla disciplina umana.
Compito dell'applicazione
Definire un caso fittizio e 4-5 elementi di criteri di rilevanza. Preparare 20-25 riassunti di documenti (alcuni privilegiati, altri oscuri). Applicare i modelli “Preclassificazione della pertinenza” e “Screening dei privilegi”; Quindi controlla manualmente il richiamo campionando dal set "irrilevante" e conferma i candidati ai privilegi contrassegnati dall'IA.
lista di controllo
- [ ] Ho rispettato le fasi EDRM e l'obbligo di conservazione legale.
- [ ] Ho controllato il risultato del TAR/pre-classificazione con il campionamento di richiamo.
- [] Ho legato ogni decisione sui privilegi alla conferma di un avvocato umano.
- [ ] Ho approvato la mascheratura dei dati personali dei candidati con il controllo finale.
- [ ] Ho documentato la metodologia e le soglie che ho utilizzato.