Прибыль:
- Возможность обработки коллекции в 7-этапном рабочем процессе, от этической проверки до публикации, с контрольной точкой человека на каждом этапе.
- Поймите, как ранние контрольные точки предотвращают распространение ошибки (неправильная дата/имя) по всей цепочке.
- Возможность применять принципы сохранения мастер-файла, не экономить на проверке и декларировать использование ИИ в целостном проекте.
Предыдущие модули охватывали индивидуальные навыки: оцифровку, транскрипцию, метаданные, сканирование, перевод, проверку, анализ шаблонов, поиск, сохранение и этику. Этот последний блок объединяет все это. В настоящем архивном проекте эти этапы выполняются не отдельно, а как взаимосвязанный рабочий процесс. Здесь мы увидим, как можно обработать коллекцию от начала до конца с помощью процесса, поддерживаемого ИИ, но контролируемого человеком, шаг за шагом и с помощью цепочки управления.
Цель состоит в том, чтобы позиционировать ИИ как партнера, который «ускоряет каждый шаг, но не имеет окончательного слова ни по одному шагу». Когда вы закончите этот раздел, у вас останется целостный метод, который преобразует беспорядочную кучу документов в готовую к исследованию, проверенную и этически чистую коллекцию.
Сценарий: что мы имеем
Допустим, вы получаете коллекцию из 250 документов: некоторые напечатанные (печатная корреспонденция, рекламные объявления), некоторые рукописные (письма, блокноты), датированные разными датами, некоторые содержащие конфиденциальные личные данные. Цель: оцифровать, расшифровать, каталогизировать и сделать эту коллекцию доступной для исследователей. Давайте разобьем этот процесс на семь этапов.
Семиэтапный рабочий процесс
Этап 1 — Оценка и этический отбор. Сначала ознакомьтесь с коллекцией. Какие документы содержат конфиденциальные персональные данные? Каков статус авторских прав? Есть ли культурная чувствительность? Это сканирование определяет, какие документы можно передать в облачные инструменты искусственного интеллекта, а какие будут обрабатываться только в закрытой/утвержденной среде. Если этот этап пропускается, весь проект подвергается этическому риску.
Этап 2 — Цифровизация. Сканируйте документы в высоком разрешении (не менее 300-400 DPI, хороший контраст). Сохраняйте исходные (главные) файлы нетронутыми; Вся обработка будет производиться на копиях.
Этап 3 — Извлечение текста. Примените OCR для печатных документов и HTR для рукописей. Попросите ИИ очистить необработанный вывод с помощью инструкции «безопасной корректуры» — только ошибки оптического/распознавания, без комментариев к содержимому, нечитаемые места [?]. Альтернативное чтение и палеографический контроль османской рукописи.
Этап 4 — Метаданные и каталогизация. Подготовьте стандартные (Dublin Core/ISAD(G)) метаданные для каждого документа; С разрешения «оставить несуществующее поле пустым». Сопоставьте термины темы с контролируемым списком. Проверьте даты и имена с документацией.
Этап 5 — Обогащение и формирование рисунка. Извлеките объекты (человек/место/организация), нормализуйте, создайте схемы отношений и временных рамок. Проверьте каждый шаблон в документе; Никаких надуманных связей и никакой хронологии.
Этап 6 — Доступ к инструментам. Составьте план поиска помощи для сбора; Основывайте раздел истории только на проверенных заметках. Четко обозначьте ограничения доступа (конфиденциальность/авторское право).
Этап 7 — Проверка, декларирование и публикация. Проверьте важные поля (дата, имя, цитата, ссылка) в последний раз. Объявите об использовании ИИ. Эксперт дает окончательное одобрение; Коллекция открыта для исследования.
Совет: установите «человеческую контрольную точку» на каждом этапе: эксперт проверяет результаты работы ИИ, прежде чем перейти к следующему этапу. Без этих контрольных точек ошибка на первом этапе (неверно прочитанная дата) будет распространяться по всей цепочке и в конечном итоге просачиваться в каталог, шаблон и руководство.
Таблица цепей управления
Этап
работа ИИ
человеческий контрольно-пропускной пункт
1. Этическая проверка
Маркировка конфиденциальных данных
Решение по установке
2. Цифровизация
(Улучшение изображения)
Качество, мастер-защита
3. Извлечение текста
OCR/HTR + безопасное исправление
Проверка имени/даты/чтения
4. Метаданные
стандартный проект
Подтверждение поля, сопоставление терминов
5. Узор
сущность, отношения, временная шкала
Проверка в документе
6. Инструмент доступа
Поиск проекта помощи
История и утверждение ограничений
7. Выпуск
—
Окончательное утверждение, декларация
три мини-кейса
Случай 1 — Обнаружена ошибка цепочки. В одном проекте, на этапе 3, дата документа была «1868» вместо «1888». Если бы контрольная точка этапа 3 не обнаружила эту ошибку, дата была бы распределена по каталогу (4), временной шкале (5) и руководству (6). Благодаря чекпоинту баг исправили в одном месте. Урок: ранняя проверка предотвращает распространение ошибки вверх по цепочке.
Случай 2. Этическая проверка спасла проект. 18 из 250 документов содержали конфиденциальные данные о живых людях. Этическая проверка на этапе 1 выявила эти нарушения; эти 18 документов были обработаны в закрытой среде, остальные — стандартными средствами. Было бы серьезным нарушением, если бы сканирование было пропущено и все данные были загружены в облако. Урок: этическая проверка — это первый шаг, а не исправление, добавленное позже.
Случай 3 — Время и усилия. При использовании традиционного метода полная обработка коллекции из 250 документов займет примерно 8-10 месяцев. Благодаря рабочему процессу контрольных точек с поддержкой искусственного интеллекта этот процесс сократился примерно до 3 месяцев. Но экономия произошла не от того, что «ИИ сделал все», а от того, что «ИИ выполнил механическую работу, сосредоточившись на проверке человеком». Время, отведенное на проверку, не уменьшилось; Время, отводимое на механическую работу, сократилось.
Четыре копируемых шаблона
1) Первоначальный план проекта:
У меня есть коллекция [количество] документов: [сочетание печати и рукописи], [точка], некоторые из которых могут содержать конфиденциальные данные. Создайте план рабочего процесса из 7 шагов для оцифровки и каталогизации этой коллекции: укажите задачу ИИ и контрольную точку ЧЕЛОВЕКА на каждом этапе. Поставьте этическую проверку на первое место.
2) Контрольный список перехода к этапу:
Я закончил этап [сценическое имя]. Составьте контрольный список критических моментов, которые мне необходимо проверить, прежде чем перейти к следующему этапу: какие факты (дата/имя/ссылка) необходимо проверить, какие ошибки могут распространиться вверх по цепочке? Я получил окончательное одобрение; Вы даете мне контрольный список.
3) Сквозной контроль качества:
Ниже представлены все слои обработанного документа: транскрипция, метаданные, извлеченные ресурсы. РИСУНОК НЕПОНЯТИЯ между слоями: соответствует ли дата в транскрипции метаданным, существуют ли сущности в тексте? Наложение коррекции; Составьте список несоответствий. Слои: [здесь]
4) Закрытие проекта и декларация:
В этом проекте по сбору я использовал ИИ на следующих этапах: [список]. Для проектной документации: (1) какая поддержка ИИ использовалась на каком этапе, (2) как проводилась проверка человеком, (3) какие ограничения/ограничения существуют — напишите честную заключительную записку и черновик заявления об использовании ИИ, включающего их.
Слабая подсказка / Сильная подсказка
Слабый:
Тщательно обработайте эту коллекцию с помощью ИИ и подготовьте ее к исследованию.
Одна-единственная инструкция «сделай что-нибудь» обходит этическую проверку, контрольные точки и проверку; ошибки распространяются по цепочке.
Сильный:
Настройте для этой коллекции семиэтапный рабочий процесс с контрольной точкой на каждом этапе. Пусть первым этапом будет проверка этики/конфиденциальности. Результаты, полученные ИИ на каждом этапе, будут проверены перед переходом к следующему этапу; отмечайте важные факты (дата/имя/ссылка). Ни на каком этапе последнее слово не остается за ИИ.
Разница: поэтапная структура, этический приоритет, контрольные точки и принцип «последнее слово за людьми» делают весь проект безопасным и оправданным.
Распространенные ошибки
- Оставляем этический скрининг на конец. Сканирование конфиденциальности/авторских прав — это первый шаг; Если он будет добавлен позже, нарушение уже произошло.
- Обход КПП. Ошибка, оставшаяся непроверенной, распространяется по всей цепочке.
- Не защищает мастер-файл. Если оригинал не будет сохранен в неприкосновенности, возврат становится невозможным.
- Экономия на проверке. ИИ сокращает механическую работу; Если время проверки сокращается, качество снижается.
- Не декларирование использования ИИ. Прозрачность является частью научной достоверности коллекции.
В итоге
Комплексный проект архивирования объединяет индивидуальные навыки в цепочку контроля: этическое сканирование, оцифровка, извлечение текста, метаданные, шаблоны, инструмент поиска и публикация. На каждом этапе ИИ ускоряет механическую работу; На каждом этапе последнее слово остается за человеческим контрольно-пропускным пунктом. Этическая проверка является первым этапом, главный файл защищен, ошибки выявляются на ранней стадии, чтобы они не распространялись по цепочке, а использование ИИ честно декларируется. Экономия достигается не за счет того, что все делает ИИ, а за счет того, что человек освобождается от механической работы и сосредоточивается на проверке. ИИ ускоряется; Человек обеспечивает точность и целостность истории.
Задача приложения
Выберите небольшую коллекцию (10–20 документов; собственный материал или набор образцов). Создайте рабочий процесс из 7 шагов с помощью шаблона «План запуска проекта». Пропустите через этот процесс как минимум два документа: этическое сканирование, извлечение текста, метаданные и слой шаблонов. Проверьте каждый этап с помощью «контрольного списка перехода к этапу». Наконец, задокументируйте использование ИИ с помощью шаблона «закрытие проекта и заявление». Обратите внимание, какие ошибки были обнаружены на ранних контрольных точках.
контрольный список
- [ ] На первом этапе я прошел проверку этики/конфиденциальности.
- [ ] Я сохранил мастер-файлы нетронутыми.
- [ ] На каждом этапе я поставил человеческий контрольно-пропускной пункт.
- [ ] Я проверял важные факты, прежде чем они были распространены по цепочке.
- [ ] Я заявил об использовании ИИ при закрытии проекта.
Модульный экзамен
1. Какова наиболее подходящая позиция искусственного интеллекта в истории и архивном деле?
- А) ИИ — это инструмент для обобщения, редактирования и составления чертежей; Комментарий, критика источника и окончательная ответственность принадлежат эксперту ✔
- Б) Искусственный интеллект может самостоятельно определить подлинность и значение документа, подобно историку.
- В) Искусственный интеллект работает только для перевода текста и не имеет никакого отношения к другим архивным задачам.
- Г) Поскольку искусственный интеллект всегда более беспристрастен, чем человек, историческую интерпретацию следует оставить на его усмотрение.
Описание: Искусственный интеллект; Это помощник, который редактирует, сканирует, переводит и создает черновики текста. Исходная критика, интерпретация, установление причинно-следственной связи и окончательное решение принадлежат эксперту; Непроверенные данные могут привести к сфабрикованному источнику, ложной дате или анахронизму.
2. Что такое галлюцинация, создаваемая искусственным интеллектом в исторических исследованиях?
- А) Искусственный интеллект обрабатывает документ очень медленно
- Б) Искусственный интеллект выдает несуществующий источник, цитату или событие за реальные ✔
- В) Документ физически поврежден.
- D) Архивный каталог не обновлен.
Пояснение: Галлюцинация — это когда искусственный интеллект уверенно выдумывает информацию, источники, цитаты или события, которых на самом деле не существует. Хотя его форма кажется идеальной, его содержание нереально; Поэтому в каждом справочном каталоге каждая цитата должна быть проверена в первоисточнике.
3. Как лучше всего корректировать результаты оптического распознавания текста с помощью искусственного интеллекта?
- А) Просить, чтобы текст был беглым и красивым и логически дополнял недостающие части.
- Б) Разрешение исправлять все числа и даты в зависимости от контекста.
- В) Попросить его исправить только ошибки оптического распознавания, оставить нечитаемые места [?] и не менять цифры/даты ✔
- Г) Просить ученика заполнить нечитаемые слова наиболее вероятной догадкой.
Пояснение: Золотое правило коррекции OCR заключается в исправлении только очевидных ошибок оптического распознавания (например, rn на m, l на 1); не интерпретировать и не дополнять содержание текста. Нечитаемые области отмечены [?]; Цифры и даты не меняются, они сверены с изображением.
4. Что следует спросить у искусственного интеллекта, когда речь идет о чтении слова, гласная которого не написана в османском тексте?
- А) Дайте одно точное показание, тем самым ускоряя работу.
- Б) Выбор слова, значение которого будет наиболее понятным, и заполнение пропусков.
- В) Дополнение нечитаемых частей на основе собственных общих знаний.
- D) Предлагать возможные альтернативы чтения и отмечать неоднозначные места вместо навязывания однозначного прочтения ✔
Пояснение: В османском турецком языке краткие гласные в основном не пишутся; Разница в одну гласную/букву (абул и кабул, вали и вали) полностью меняет смысл. Поэтому вместо того, чтобы навязывать окончательное прочтение, следует задать возможные альтернативы, сохранить нечитаемые участки и оставить окончательное решение за палеографом.
5. Каков наиболее эффективный способ предотвратить галлюцинации, когда ИИ создает черновой вариант метаданных (запись в каталоге)?
- А) Явно дайте разрешение оставить это поле пустым, если оно не включено в документ ✔
- Б) Требовать, чтобы все поля были заполнены и не оставались незаполненными.
- В) Оценка даты на основе содержания недатированных документов.
- D) Разрешение искусственному интеллекту генерировать эталонный код.
Описание: Нажим при заполнении заставляет ИИ составить документ, угадав дату или автора, которого нет в документе. Самая надежная защита от этого — явное разрешение оставить поле пустым, если его нет в документе; Кроме того, термины темы сопоставляются с контролируемым словарем.
6. Как следует позиционировать краткое изложение документа, созданное искусственным интеллектом, в исторических исследованиях?
- А) В качестве надежного доказательства, на которое можно прямо ссылаться
- Б) В качестве карты обнаружения, которая направляет вас к реальному документу; Доказательства взяты из оригинального документа ✔
- В) Как адекватный ресурс, способный заменить сам документ
- Г) Как текст, который можно использовать в исследовании, никогда не возвращаясь к документу.
Описание: Краткое изложение — это карта открытий, а не доказательство. В этом документе есть что-то подобное: пойди и посмотри; Там не указано именно то, что написано в документе. Если событие, цитата или данные должны быть включены в исследование, они должны быть дословно взяты из исходного документа.
7. Как правильно избегать анахронизмов при переводе исторического документа для публикации?
- А) Замена всех терминов периода ближайшим к сегодняшнему дню эквивалентом.
- Б) Передать текст максимально бегло и современно.
- В) Оставьте названия периодов и названия учреждений уникальными и добавьте пояснения ✔
- Г) Адаптация имен собственных к их нынешнему использованию.
Пояснение: Анахронизм – это неправильный перенос элементов из одного периода в другой период. Изменение названий периодов, названий учреждений и личных имен на сегодняшние понятия переносит читателя в мир, который не принадлежит этому периоду. Правильный способ — сохранить термин периода и добавить рядом с ним пояснение.
8. Как убедиться, что предоставленная искусственным интеллектом ссылка на архив (название фонда, номер дела) реальна?
- А) Доверие к ссылке, потому что ее формат кажется правильным
- Б) Повторно спросив ИИ, верна ли ссылка
- В) Принятие ссылки как правдивой, поскольку она убедительна и подробна.
- Г) Лично найдя и проверив ссылку в каталоге архива или достоверном источнике ✔
Описание: Искусственный интеллект может создавать ссылки, которые идеальны по форме, но на самом деле не существуют; Фиктивная ссылка имеет ту же форму, что и реальная ссылка. Единственный способ доказать существование ссылки – найти ее там, где находится первоисточник (каталог архива, библиотека).
9. Как следует оценивать закономерность, обнаруженную при выполнении анализа закономерностей (NER, сеть, временная шкала) с помощью искусственного интеллекта?
- А) Как гипотеза, которую необходимо проверить в документе; отправная точка, а не результат ✔
- Б) Как окончательное заключение, не требующее проверки
- В) Это неоспоримый объективный факт, поскольку он числовой.
- Г) В результате это можно подвергнуть непосредственному изучению, поскольку обнаружен искусственный интеллект.
Пояснение: Каждая закономерность — это гипотеза, а не доказательство. Сущности должны быть связаны с источником, различные варианты написания (одного и того же человека/места) должны быть нормализованы с одобрения человека, цифры должны быть подвергнуты сомнению на предмет отсутствия данных и систематической ошибки выборки, а недатированные события не должны быть хронологизированы.
10. Почему раздел биографической/институциональной истории в справочнике требует особого внимания?
- А) Данный раздел неважен и может быть опубликован без проверки
- Б) Поскольку искусственный интеллект может добавлять в этот раздел сфабрикованные события, ложные даты и названия, следует полагаться только на проверенные источники ✔
- В) Искусственный интеллект можно безопасно использовать, поскольку он не допускает ошибок при написании истории.
- Г) Этот раздел заполняют только исследователи, архивариусу это не интересно
Описание: В разделе истории чаще всего закрадываются галлюцинации: ИИ может вставлять несуществующие события, ложные даты и вымышленные заголовки, одновременно составляя беглый текст на основе общей информации о человеке или учреждении. Этот раздел должен основываться только на проверенных источниках.
11. Как искусственный интеллект должен отвечать на фактический вопрос исследователя в справочной (консультационной) службе?
- А) Ответ на вопрос должен быть дан прямо и как определенный факт.
- Б) Должен назвать правдоподобную дату или имя и передать их исследователю.
- В) Вместо прямого изложения фактов следует направить исследователя к соответствующему сборнику и источнику ✔
- Г) Он должен давать полный ответ, чтобы исследователю не нужно было обращаться к первоисточнику.
Пояснение: В справочной службе искусственный интеллект не должен давать прямой ответ по факту, а должен направлять исследователя к источнику. Потому что прямой фактический ответ, данный искусственным интеллектом, может быть сфабрикован, и исследователь может принять его за источник. Вместо того, чтобы говорить «Ответ таков», следует сказать «Посмотрите на эти документы в этой коллекции».
12. Какие операции допустимы и нежелательны при обработке поврежденного изображения документа искусственным интеллектом?
- А) Все виды операций бесплатны, включая заполнение недостающих частей.
- Б) Никаких действий предпринимать нельзя, изображение ни в коем случае нельзя трогать.
- В) Заполнение недостающих разделов – наиболее ценное действие, поскольку оно завершает документ.
- D) Допускаются изменения читаемости, такие как контраст/шум; Догадками дополнять недостающие части неудобно ✔
Объяснение: Процессы, улучшающие читаемость (контраст, освещение, шумоподавление), приемлемы, поскольку они не меняют содержимое; Однако заполнение недостающих/нечитаемых частей догадками сопряжено с риском создания того, чего нет в документе, то есть исторической подделки. Оригинал сохраняется, транзакции фиксируются.
13. Что необходимо сделать перед обработкой архивного документа, содержащего конфиденциальные персональные данные?
- А) Сканирование конфиденциальности и анонимизация при необходимости или использование закрытого/утвержденного инструмента ✔
- Б) Загрузить документ прямо в общественный транспорт, даже не задумываясь об этом.
- В) Игнорирование проблем конфиденциальности ради эффективности
- D) Преодоление ограничений доступа по соображениям эффективности.
Раскрытие информации. Загрузка документов, содержащих конфиденциальные данные, идентифицирующие живых людей (здоровье, религия, этническая принадлежность, адрес), в общедоступные облачные инструменты может быть серьезным нарушением конфиденциальности. Сначала следует провести проверку конфиденциальности, при необходимости следует использовать анонимизацию или закрытый/утвержденный инструмент.
14. Какова основная цель человеческого контрольного пункта в проекте сквозного архивирования?
- А) Замедление работы искусственного интеллекта и задержка проекта
- Б) Чтобы ошибка (неправильная дата/название) на одном этапе не была связана со всеми последующими этапами ✔
- В) Увеличение человеческого труда и полный отказ от автоматизации
- D) Обеспечение того, чтобы последнее слово оставалось за искусственным интеллектом
Описание: Контрольно-пропускной пункт на каждом этапе обеспечивает проверку результатов ИИ перед переходом к следующему этапу. Без этого ошибка на первом этапе (неправильно прочитанная дата) распространилась бы вверх по цепочке через каталог, шаблон и справочник. Ранняя проверка гарантирует, что ошибка будет исправлена в одном месте.
15. Что требуется прозрачности и достоверности при использовании искусственного интеллекта в гуманитарных и социальных науках?
- А) Сохранение использования искусственного интеллекта в тайне, гарантируя, что никто не узнает
- Б) Представлять каждый текст, созданный искусственным интеллектом, как собственную оригинальную идею.
- В) Честно заявлять об использовании искусственного интеллекта и не представлять его результаты как собственную оригинальную работу ✔
- D) Делимся только результатами без объяснения методов.
Описание: Прозрачность включает в себя запись того, что транскрипция, метаданные или перевод были созданы с помощью искусственного интеллекта; Оригинальность предполагает не выдавать комментарий искусственного интеллекта за собственную оригинальную идею. Это важно для проверки последующими исследователями и для академической честности.