Единица 12 / 12

Комплексный проект: обработка архивной коллекции с помощью искусственного интеллекта

Прибыль:

  • Возможность обработки коллекции в 7-этапном рабочем процессе, от этической проверки до публикации, с контрольной точкой человека на каждом этапе.
  • Поймите, как ранние контрольные точки предотвращают распространение ошибки (неправильная дата/имя) по всей цепочке.
  • Возможность применять принципы сохранения мастер-файла, не экономить на проверке и декларировать использование ИИ в целостном проекте.

Предыдущие модули охватывали индивидуальные навыки: оцифровку, транскрипцию, метаданные, сканирование, перевод, проверку, анализ шаблонов, поиск, сохранение и этику. Этот последний блок объединяет все это. В настоящем архивном проекте эти этапы выполняются не отдельно, а как взаимосвязанный рабочий процесс. Здесь мы увидим, как можно обработать коллекцию от начала до конца с помощью процесса, поддерживаемого ИИ, но контролируемого человеком, шаг за шагом и с помощью цепочки управления.

Цель состоит в том, чтобы позиционировать ИИ как партнера, который «ускоряет каждый шаг, но не имеет окончательного слова ни по одному шагу». Когда вы закончите этот раздел, у вас останется целостный метод, который преобразует беспорядочную кучу документов в готовую к исследованию, проверенную и этически чистую коллекцию.

Сценарий: что мы имеем

Допустим, вы получаете коллекцию из 250 документов: некоторые напечатанные (печатная корреспонденция, рекламные объявления), некоторые рукописные (письма, блокноты), датированные разными датами, некоторые содержащие конфиденциальные личные данные. Цель: оцифровать, расшифровать, каталогизировать и сделать эту коллекцию доступной для исследователей. Давайте разобьем этот процесс на семь этапов.

Семиэтапный рабочий процесс

Этап 1 — Оценка и этический отбор. Сначала ознакомьтесь с коллекцией. Какие документы содержат конфиденциальные персональные данные? Каков статус авторских прав? Есть ли культурная чувствительность? Это сканирование определяет, какие документы можно передать в облачные инструменты искусственного интеллекта, а какие будут обрабатываться только в закрытой/утвержденной среде. Если этот этап пропускается, весь проект подвергается этическому риску.

Этап 2 — Цифровизация. Сканируйте документы в высоком разрешении (не менее 300-400 DPI, хороший контраст). Сохраняйте исходные (главные) файлы нетронутыми; Вся обработка будет производиться на копиях.

Этап 3 — Извлечение текста. Примените OCR для печатных документов и HTR для рукописей. Попросите ИИ очистить необработанный вывод с помощью инструкции «безопасной корректуры» — только ошибки оптического/распознавания, без комментариев к содержимому, нечитаемые места [?]. Альтернативное чтение и палеографический контроль османской рукописи.

Этап 4 — Метаданные и каталогизация. Подготовьте стандартные (Dublin Core/ISAD(G)) метаданные для каждого документа; С разрешения «оставить несуществующее поле пустым». Сопоставьте термины темы с контролируемым списком. Проверьте даты и имена с документацией.

Этап 5 — Обогащение и формирование рисунка. Извлеките объекты (человек/место/организация), нормализуйте, создайте схемы отношений и временных рамок. Проверьте каждый шаблон в документе; Никаких надуманных связей и никакой хронологии.

Этап 6 — Доступ к инструментам. Составьте план поиска помощи для сбора; Основывайте раздел истории только на проверенных заметках. Четко обозначьте ограничения доступа (конфиденциальность/авторское право).

Этап 7 — Проверка, декларирование и публикация. Проверьте важные поля (дата, имя, цитата, ссылка) в последний раз. Объявите об использовании ИИ. Эксперт дает окончательное одобрение; Коллекция открыта для исследования.

Совет: установите «человеческую контрольную точку» на каждом этапе: эксперт проверяет результаты работы ИИ, прежде чем перейти к следующему этапу. Без этих контрольных точек ошибка на первом этапе (неверно прочитанная дата) будет распространяться по всей цепочке и в конечном итоге просачиваться в каталог, шаблон и руководство.

Таблица цепей управления

Этап

работа ИИ

человеческий контрольно-пропускной пункт

1. Этическая проверка

Маркировка конфиденциальных данных

Решение по установке

2. Цифровизация

(Улучшение изображения)

Качество, мастер-защита

3. Извлечение текста

OCR/HTR + безопасное исправление

Проверка имени/даты/чтения

4. Метаданные

стандартный проект

Подтверждение поля, сопоставление терминов

5. Узор

сущность, отношения, временная шкала

Проверка в документе

6. Инструмент доступа

Поиск проекта помощи

История и утверждение ограничений

7. Выпуск

Окончательное утверждение, декларация

три мини-кейса

Случай 1 — Обнаружена ошибка цепочки. В одном проекте, на этапе 3, дата документа была «1868» вместо «1888». Если бы контрольная точка этапа 3 не обнаружила эту ошибку, дата была бы распределена по каталогу (4), временной шкале (5) и руководству (6). Благодаря чекпоинту баг исправили в одном месте. Урок: ранняя проверка предотвращает распространение ошибки вверх по цепочке.

Случай 2. Этическая проверка спасла проект. 18 из 250 документов содержали конфиденциальные данные о живых людях. Этическая проверка на этапе 1 выявила эти нарушения; эти 18 документов были обработаны в закрытой среде, остальные — стандартными средствами. Было бы серьезным нарушением, если бы сканирование было пропущено и все данные были загружены в облако. Урок: этическая проверка — это первый шаг, а не исправление, добавленное позже.

Случай 3 — Время и усилия. При использовании традиционного метода полная обработка коллекции из 250 документов займет примерно 8-10 месяцев. Благодаря рабочему процессу контрольных точек с поддержкой искусственного интеллекта этот процесс сократился примерно до 3 месяцев. Но экономия произошла не от того, что «ИИ сделал все», а от того, что «ИИ выполнил механическую работу, сосредоточившись на проверке человеком». Время, отведенное на проверку, не уменьшилось; Время, отводимое на механическую работу, сократилось.

Четыре копируемых шаблона

1) Первоначальный план проекта:

У меня есть коллекция [количество] документов: [сочетание печати и рукописи], [точка], некоторые из которых могут содержать конфиденциальные данные. Создайте план рабочего процесса из 7 шагов для оцифровки и каталогизации этой коллекции: укажите задачу ИИ и контрольную точку ЧЕЛОВЕКА на каждом этапе. Поставьте этическую проверку на первое место.

2) Контрольный список перехода к этапу:

Я закончил этап [сценическое имя]. Составьте контрольный список критических моментов, которые мне необходимо проверить, прежде чем перейти к следующему этапу: какие факты (дата/имя/ссылка) необходимо проверить, какие ошибки могут распространиться вверх по цепочке? Я получил окончательное одобрение; Вы даете мне контрольный список.

3) Сквозной контроль качества:

Ниже представлены все слои обработанного документа: транскрипция, метаданные, извлеченные ресурсы. РИСУНОК НЕПОНЯТИЯ между слоями: соответствует ли дата в транскрипции метаданным, существуют ли сущности в тексте? Наложение коррекции; Составьте список несоответствий. Слои: [здесь]

4) Закрытие проекта и декларация:

В этом проекте по сбору я использовал ИИ на следующих этапах: [список]. Для проектной документации: (1) какая поддержка ИИ использовалась на каком этапе, (2) как проводилась проверка человеком, (3) какие ограничения/ограничения существуют — напишите честную заключительную записку и черновик заявления об использовании ИИ, включающего их.

Слабая подсказка / Сильная подсказка

Слабый:

Тщательно обработайте эту коллекцию с помощью ИИ и подготовьте ее к исследованию.

Одна-единственная инструкция «сделай что-нибудь» обходит этическую проверку, контрольные точки и проверку; ошибки распространяются по цепочке.

Сильный:

Настройте для этой коллекции семиэтапный рабочий процесс с контрольной точкой на каждом этапе. Пусть первым этапом будет проверка этики/конфиденциальности. Результаты, полученные ИИ на каждом этапе, будут проверены перед переходом к следующему этапу; отмечайте важные факты (дата/имя/ссылка). Ни на каком этапе последнее слово не остается за ИИ.

Разница: поэтапная структура, этический приоритет, контрольные точки и принцип «последнее слово за людьми» делают весь проект безопасным и оправданным.

Распространенные ошибки

  • Оставляем этический скрининг на конец. Сканирование конфиденциальности/авторских прав — это первый шаг; Если он будет добавлен позже, нарушение уже произошло.
  • Обход КПП. Ошибка, оставшаяся непроверенной, распространяется по всей цепочке.
  • Не защищает мастер-файл. Если оригинал не будет сохранен в неприкосновенности, возврат становится невозможным.
  • Экономия на проверке. ИИ сокращает механическую работу; Если время проверки сокращается, качество снижается.
  • Не декларирование использования ИИ. Прозрачность является частью научной достоверности коллекции.

В итоге

Комплексный проект архивирования объединяет индивидуальные навыки в цепочку контроля: этическое сканирование, оцифровка, извлечение текста, метаданные, шаблоны, инструмент поиска и публикация. На каждом этапе ИИ ускоряет механическую работу; На каждом этапе последнее слово остается за человеческим контрольно-пропускным пунктом. Этическая проверка является первым этапом, главный файл защищен, ошибки выявляются на ранней стадии, чтобы они не распространялись по цепочке, а использование ИИ честно декларируется. Экономия достигается не за счет того, что все делает ИИ, а за счет того, что человек освобождается от механической работы и сосредоточивается на проверке. ИИ ускоряется; Человек обеспечивает точность и целостность истории.

Задача приложения

Выберите небольшую коллекцию (10–20 документов; собственный материал или набор образцов). Создайте рабочий процесс из 7 шагов с помощью шаблона «План запуска проекта». Пропустите через этот процесс как минимум два документа: этическое сканирование, извлечение текста, метаданные и слой шаблонов. Проверьте каждый этап с помощью «контрольного списка перехода к этапу». Наконец, задокументируйте использование ИИ с помощью шаблона «закрытие проекта и заявление». Обратите внимание, какие ошибки были обнаружены на ранних контрольных точках.

контрольный список

  • [ ] На первом этапе я прошел проверку этики/конфиденциальности.
  • [ ] Я сохранил мастер-файлы нетронутыми.
  • [ ] На каждом этапе я поставил человеческий контрольно-пропускной пункт.
  • [ ] Я проверял важные факты, прежде чем они были распространены по цепочке.
  • [ ] Я заявил об использовании ИИ при закрытии проекта.

Модульный экзамен

1. Какова наиболее подходящая позиция искусственного интеллекта в истории и архивном деле?

  • А) ИИ — это инструмент для обобщения, редактирования и составления чертежей; Комментарий, критика источника и окончательная ответственность принадлежат эксперту ✔
  • Б) Искусственный интеллект может самостоятельно определить подлинность и значение документа, подобно историку.
  • В) Искусственный интеллект работает только для перевода текста и не имеет никакого отношения к другим архивным задачам.
  • Г) Поскольку искусственный интеллект всегда более беспристрастен, чем человек, историческую интерпретацию следует оставить на его усмотрение.

Описание: Искусственный интеллект; Это помощник, который редактирует, сканирует, переводит и создает черновики текста. Исходная критика, интерпретация, установление причинно-следственной связи и окончательное решение принадлежат эксперту; Непроверенные данные могут привести к сфабрикованному источнику, ложной дате или анахронизму.

2. Что такое галлюцинация, создаваемая искусственным интеллектом в исторических исследованиях?

  • А) Искусственный интеллект обрабатывает документ очень медленно
  • Б) Искусственный интеллект выдает несуществующий источник, цитату или событие за реальные ✔
  • В) Документ физически поврежден.
  • D) Архивный каталог не обновлен.

Пояснение: Галлюцинация — это когда искусственный интеллект уверенно выдумывает информацию, источники, цитаты или события, которых на самом деле не существует. Хотя его форма кажется идеальной, его содержание нереально; Поэтому в каждом справочном каталоге каждая цитата должна быть проверена в первоисточнике.

3. Как лучше всего корректировать результаты оптического распознавания текста с помощью искусственного интеллекта?

  • А) Просить, чтобы текст был беглым и красивым и логически дополнял недостающие части.
  • Б) Разрешение исправлять все числа и даты в зависимости от контекста.
  • В) Попросить его исправить только ошибки оптического распознавания, оставить нечитаемые места [?] и не менять цифры/даты ✔
  • Г) Просить ученика заполнить нечитаемые слова наиболее вероятной догадкой.

Пояснение: Золотое правило коррекции OCR заключается в исправлении только очевидных ошибок оптического распознавания (например, rn на m, l на 1); не интерпретировать и не дополнять содержание текста. Нечитаемые области отмечены [?]; Цифры и даты не меняются, они сверены с изображением.

4. Что следует спросить у искусственного интеллекта, когда речь идет о чтении слова, гласная которого не написана в османском тексте?

  • А) Дайте одно точное показание, тем самым ускоряя работу.
  • Б) Выбор слова, значение которого будет наиболее понятным, и заполнение пропусков.
  • В) Дополнение нечитаемых частей на основе собственных общих знаний.
  • D) Предлагать возможные альтернативы чтения и отмечать неоднозначные места вместо навязывания однозначного прочтения ✔

Пояснение: В османском турецком языке краткие гласные в основном не пишутся; Разница в одну гласную/букву (абул и кабул, вали и вали) полностью меняет смысл. Поэтому вместо того, чтобы навязывать окончательное прочтение, следует задать возможные альтернативы, сохранить нечитаемые участки и оставить окончательное решение за палеографом.

5. Каков наиболее эффективный способ предотвратить галлюцинации, когда ИИ создает черновой вариант метаданных (запись в каталоге)?

  • А) Явно дайте разрешение оставить это поле пустым, если оно не включено в документ ✔
  • Б) Требовать, чтобы все поля были заполнены и не оставались незаполненными.
  • В) Оценка даты на основе содержания недатированных документов.
  • D) Разрешение искусственному интеллекту генерировать эталонный код.

Описание: Нажим при заполнении заставляет ИИ составить документ, угадав дату или автора, которого нет в документе. Самая надежная защита от этого — явное разрешение оставить поле пустым, если его нет в документе; Кроме того, термины темы сопоставляются с контролируемым словарем.

6. Как следует позиционировать краткое изложение документа, созданное искусственным интеллектом, в исторических исследованиях?

  • А) В качестве надежного доказательства, на которое можно прямо ссылаться
  • Б) В качестве карты обнаружения, которая направляет вас к реальному документу; Доказательства взяты из оригинального документа ✔
  • В) Как адекватный ресурс, способный заменить сам документ
  • Г) Как текст, который можно использовать в исследовании, никогда не возвращаясь к документу.

Описание: Краткое изложение — это карта открытий, а не доказательство. В этом документе есть что-то подобное: пойди и посмотри; Там не указано именно то, что написано в документе. Если событие, цитата или данные должны быть включены в исследование, они должны быть дословно взяты из исходного документа.

7. Как правильно избегать анахронизмов при переводе исторического документа для публикации?

  • А) Замена всех терминов периода ближайшим к сегодняшнему дню эквивалентом.
  • Б) Передать текст максимально бегло и современно.
  • В) Оставьте названия периодов и названия учреждений уникальными и добавьте пояснения ✔
  • Г) Адаптация имен собственных к их нынешнему использованию.

Пояснение: Анахронизм – это неправильный перенос элементов из одного периода в другой период. Изменение названий периодов, названий учреждений и личных имен на сегодняшние понятия переносит читателя в мир, который не принадлежит этому периоду. Правильный способ — сохранить термин периода и добавить рядом с ним пояснение.

8. Как убедиться, что предоставленная искусственным интеллектом ссылка на архив (название фонда, номер дела) реальна?

  • А) Доверие к ссылке, потому что ее формат кажется правильным
  • Б) Повторно спросив ИИ, верна ли ссылка
  • В) Принятие ссылки как правдивой, поскольку она убедительна и подробна.
  • Г) Лично найдя и проверив ссылку в каталоге архива или достоверном источнике ✔

Описание: Искусственный интеллект может создавать ссылки, которые идеальны по форме, но на самом деле не существуют; Фиктивная ссылка имеет ту же форму, что и реальная ссылка. Единственный способ доказать существование ссылки – найти ее там, где находится первоисточник (каталог архива, библиотека).

9. Как следует оценивать закономерность, обнаруженную при выполнении анализа закономерностей (NER, сеть, временная шкала) с помощью искусственного интеллекта?

  • А) Как гипотеза, которую необходимо проверить в документе; отправная точка, а не результат ✔
  • Б) Как окончательное заключение, не требующее проверки
  • В) Это неоспоримый объективный факт, поскольку он числовой.
  • Г) В результате это можно подвергнуть непосредственному изучению, поскольку обнаружен искусственный интеллект.

Пояснение: Каждая закономерность — это гипотеза, а не доказательство. Сущности должны быть связаны с источником, различные варианты написания (одного и того же человека/места) должны быть нормализованы с одобрения человека, цифры должны быть подвергнуты сомнению на предмет отсутствия данных и систематической ошибки выборки, а недатированные события не должны быть хронологизированы.

10. Почему раздел биографической/институциональной истории в справочнике требует особого внимания?

  • А) Данный раздел неважен и может быть опубликован без проверки
  • Б) Поскольку искусственный интеллект может добавлять в этот раздел сфабрикованные события, ложные даты и названия, следует полагаться только на проверенные источники ✔
  • В) Искусственный интеллект можно безопасно использовать, поскольку он не допускает ошибок при написании истории.
  • Г) Этот раздел заполняют только исследователи, архивариусу это не интересно

Описание: В разделе истории чаще всего закрадываются галлюцинации: ИИ может вставлять несуществующие события, ложные даты и вымышленные заголовки, одновременно составляя беглый текст на основе общей информации о человеке или учреждении. Этот раздел должен основываться только на проверенных источниках.

11. Как искусственный интеллект должен отвечать на фактический вопрос исследователя в справочной (консультационной) службе?

  • А) Ответ на вопрос должен быть дан прямо и как определенный факт.
  • Б) Должен назвать правдоподобную дату или имя и передать их исследователю.
  • В) Вместо прямого изложения фактов следует направить исследователя к соответствующему сборнику и источнику ✔
  • Г) Он должен давать полный ответ, чтобы исследователю не нужно было обращаться к первоисточнику.

Пояснение: В справочной службе искусственный интеллект не должен давать прямой ответ по факту, а должен направлять исследователя к источнику. Потому что прямой фактический ответ, данный искусственным интеллектом, может быть сфабрикован, и исследователь может принять его за источник. Вместо того, чтобы говорить «Ответ таков», следует сказать «Посмотрите на эти документы в этой коллекции».

12. Какие операции допустимы и нежелательны при обработке поврежденного изображения документа искусственным интеллектом?

  • А) Все виды операций бесплатны, включая заполнение недостающих частей.
  • Б) Никаких действий предпринимать нельзя, изображение ни в коем случае нельзя трогать.
  • В) Заполнение недостающих разделов – наиболее ценное действие, поскольку оно завершает документ.
  • D) Допускаются изменения читаемости, такие как контраст/шум; Догадками дополнять недостающие части неудобно ✔

Объяснение: Процессы, улучшающие читаемость (контраст, освещение, шумоподавление), приемлемы, поскольку они не меняют содержимое; Однако заполнение недостающих/нечитаемых частей догадками сопряжено с риском создания того, чего нет в документе, то есть исторической подделки. Оригинал сохраняется, транзакции фиксируются.

13. Что необходимо сделать перед обработкой архивного документа, содержащего конфиденциальные персональные данные?

  • А) Сканирование конфиденциальности и анонимизация при необходимости или использование закрытого/утвержденного инструмента ✔
  • Б) Загрузить документ прямо в общественный транспорт, даже не задумываясь об этом.
  • В) Игнорирование проблем конфиденциальности ради эффективности
  • D) Преодоление ограничений доступа по соображениям эффективности.

Раскрытие информации. Загрузка документов, содержащих конфиденциальные данные, идентифицирующие живых людей (здоровье, религия, этническая принадлежность, адрес), в общедоступные облачные инструменты может быть серьезным нарушением конфиденциальности. Сначала следует провести проверку конфиденциальности, при необходимости следует использовать анонимизацию или закрытый/утвержденный инструмент.

14. Какова основная цель человеческого контрольного пункта в проекте сквозного архивирования?

  • А) Замедление работы искусственного интеллекта и задержка проекта
  • Б) Чтобы ошибка (неправильная дата/название) на одном этапе не была связана со всеми последующими этапами ✔
  • В) Увеличение человеческого труда и полный отказ от автоматизации
  • D) Обеспечение того, чтобы последнее слово оставалось за искусственным интеллектом

Описание: Контрольно-пропускной пункт на каждом этапе обеспечивает проверку результатов ИИ перед переходом к следующему этапу. Без этого ошибка на первом этапе (неправильно прочитанная дата) распространилась бы вверх по цепочке через каталог, шаблон и справочник. Ранняя проверка гарантирует, что ошибка будет исправлена ​​в одном месте.

15. Что требуется прозрачности и достоверности при использовании искусственного интеллекта в гуманитарных и социальных науках?

  • А) Сохранение использования искусственного интеллекта в тайне, гарантируя, что никто не узнает
  • Б) Представлять каждый текст, созданный искусственным интеллектом, как собственную оригинальную идею.
  • В) Честно заявлять об использовании искусственного интеллекта и не представлять его результаты как собственную оригинальную работу ✔
  • D) Делимся только результатами без объяснения методов.

Описание: Прозрачность включает в себя запись того, что транскрипция, метаданные или перевод были созданы с помощью искусственного интеллекта; Оригинальность предполагает не выдавать комментарий искусственного интеллекта за собственную оригинальную идею. Это важно для проверки последующими исследователями и для академической честности.