Единица 1 / 12

Введение в искусственный интеллект в истории и архивировании: роли, границы, проверка и этика

Прибыль:

  • Способность различать, где искусственный интеллект экономит время в исторической и архивной работе (расшифровка, редактирование, сканирование, черновик), а где интерпретация, критика источников и окончательное решение оставляются на усмотрение эксперта, в зависимости от уровня риска.
  • Способность применять дисциплину проверки против галлюцинаций, соединяя каждый вывод с источником, перекрестно подтверждая его и фильтруя на предмет анахронизма.
  • Понять, почему конфиденциальность, авторское право и культурная чувствительность должны учитываться в исторических и архивных материалах с самого начала.

Когда историк или архивариус сидит за своим столом, перед ним часто лежит огромная стопка: пожелтевшие блокноты, микрофильмированные газеты, тысячи цифровых фотографий, рукописные письма, официальная корреспонденция, поземельные книги. Чтение, систематизация, определение и осмысление этой кучи — труд, который занимает годы. Искусственный интеллект (сокращенно ИИ; компьютерные системы, которые изучают закономерности, генерируют и классифицируют текст из больших масс текста и изображений) может значительно ускорить механическую и повторяющуюся часть этого труда. Но именно в такой области, как история и архивирование, которая опирается на доказательства, источники и точность, вы должны с самого начала знать, где ИИ полезен, а где опасен.

Этот блок является компасом всего модуля. Здесь мы обсудим, где ИИ экономит время в истории и архивной работе, где мнение эксперта-человека незаменимо, почему каждый результат должен быть проверен, а также конкретные этические границы этой области.

Правильное позиционирование ИИ: помощник, а не лицо, принимающее решения

Самое основное правило таково: ИИ — помощник, а не историк или архивариус. ИИ; Это быстрый помощник, который расшифровывает документ, обобщает коллекцию, переводит текст, предлагает метаданные для коллекции и отмечает шаблоны. Но решения, требующие суждения, интерпретации и ответственности, такие как «реален ли этот документ», «что означает это событие», «достоверен ли этот источник», «как следует организовать этот сбор», принадлежат эксперту.

Поясним это различие с помощью таблицы:

тип бизнеса

Мощен ли ИИ?

Чья ответственность?

Преобразование печатного текста в машинный текст (OCR)

Да, очень быстро

люди правы

Черновик транскрипции рукописи

Частично, погрешность высока

Люди обязательно это исправят

Обобщить/сканировать тысячи документов

Да

Человек спускается к источнику

Схема метаданных (дата, место, тема)

Да

человек одобряет

Принятие решения о подлинности документа

нет

Только эксперт

Историческая интерпретация и установление причины и следствия

нет

только историк

Оцените достоверность источника

нет

Только эксперт

Подытожим эту картину в одном предложении: ИИ готовит данные, эксперт осмысливает и принимает решение.

Почему верификация важна: галлюцинации и анахронизм

Самая большая опасность использования ИИ в гуманитарных и социальных науках — это галлюцинации. Галлюцинация — это когда ИИ уверенно выдумывает информацию, источник или цитату, которой на самом деле не существует. Вместо того, чтобы сказать «Я не знаю», ИИ склонен заполнить пробел выдуманным ответом, который кажется правдоподобным. В истории это фатально: ссылка на несуществующий документ, вымышленную историю, непроизведенное на самом деле слово, событие, которого не было.

Вторая большая опасность – это анахронизм. Анахронизм — это перенесение элемента одного периода (слова, института, технологии, понятия) в другой период. Поскольку ИИ обучается с использованием сегодняшнего языка и концепций, он склонен объяснять прошлое сквозь призму сегодняшнего дня и переносить несуществующие институты или термины в прошлое. Например, при обобщении документа XVI века он может использовать титул или административную единицу, которых в то время не существовало.

Внимание: каждая дата, имя, номер, цитата и источник, которые предоставляет ИИ, является утверждением, а не фактом, пока вы не подтвердите это самостоятельно. «Так сказал ИИ» не является источником в историографии; это просто подсказка, которая направит вас к настоящему источнику.

Дисциплина проверки: три шага

Давайте предложим привычку проверки, которую мы будем повторять на протяжении всего этого модуля:

1. Подключитесь к источнику. Основывайте каждое серьезное утверждение ИИ на оригинальном документе, архивной ссылке или надежной публикации. Не используйте утверждение, у которого нет источника.

2. Перекрестное подтверждение. Для получения критического факта (даты, имени, события) обратитесь как минимум к двум независимым источникам. Соответствует ли краткое изложение ИИ тому, что говорится в фактическом документе?

3. Фильтруйте анахронизмы и последовательность. Есть ли в выводе термин, не соответствующий периоду, невозможная дата, противоречивое имя? Спросите: «Подходит ли это к этому периоду?» с экспертной точки зрения.

три мини-кейса

Случай 1 — Сфабрикованная ссылка на архив. Аспирант попросил у AI «архивные источники» по теме. YZ вернул 6 архивных ссылок, формат которых оказался идеальным: название фонда, номер дела, дата. Когда студент порылся в каталоге архива, он обнаружил, что 4 из 6 ссылок вообще не существовали. У оставшихся двух были неправильные номера. Урок: ни одна ссылка, созданная искусственным интеллектом, не может быть использована без проверки в каталоге.

Случай 2 — OCR сократилось с 40 часов до 6 часов. В период с 1950 по 1970 год муниципальный архив оцифровал 3200 страниц печатных протоколов совета. Переписывание вручную оценивалось в 40 рабочих дней. При использовании OCR необработанный текст получался за считанные минуты; Сотрудник исправил и проверил текст в течение 6 рабочих дней. ИИ сократил механическую работу на 85%, но окончательное чтение и редактирование оставалось за человеком.

Случай 3. Анахроническое резюме. Архивариус попросил YZ обобщить записи фонда XVIII века. Резюме было беглым, но в нем использовался современный административный термин, которого нет в документе и который не относится к тому периоду. Если бы архивариус не обратился к первоначальному документу, этот анахронизм был бы зафиксирован в каталожной записи. Урок: аннотацию всегда сравнивают с основным документом.

Четыре копируемых шаблона

1) Открытие, определяющее роли и границы:

Ваша роль: помощник по истории и архивам. В ваши задачи входит редактирование текста, создание контуров и разметка узоров. Строгие правила: (1) Опирайтесь только на тот текст, который я вам дал, не добавляйте факты, даты или источники из собственной «памяти». (2) Если не уверены, напишите «не уверен», не выдумывайте. (3) Не делайте никаких заявлений, не имеющих источника. Подтвердите, если вы поняли, то я дам текст.

2) Инструкция по борьбе с галлюцинациями:

Обобщите приведенный ниже текст. Правила: не добавляйте никаких имен, дат, мест или цифр, которые ЯВНО не упомянуты в тексте. Даже не добавляйте «вероятно» информацию, которой нет в тексте. Если информация не включена в текст, напишите «в тексте не указана». Текст: [здесь]

3) Проверка анахронизма:

Ознакомьтесь с проектом резюме [курсовой] работы ниже. Отметьте термины, учреждения, названия и понятия, которые могут не относиться к этому периоду. По каждому напишите кратко, почему это подозрительно. Не выносите окончательного решения; Перечислите только те моменты, которые должен проверить эксперт-человек. Черновик: [здесь]

4) Анализатор утверждений источника:

Разделите каждое предложение в следующем тексте на две категории: (А) Факт, записанный непосредственно в источнике, (Б) Интерпретация/вывод. Также отметьте каждое утверждение, источник которого неясен, как «требует проверки». Текст: [здесь]

Слабая подсказка / Сильная подсказка

Слабый:

Расскажите мне об этом османском документе.

Эта подсказка предлагает ИИ говорить по собственной «памяти», добавляя вымышленные детали и анахронизмы.

Сильный:

Ваша роль – помощник по истории. Основываясь ТОЛЬКО на документе, я вставил расшифровку ниже: (1) перечислите людей, места и даты, упомянутые в документе, (2) угадайте тип документа, но вы можете сказать «Я не уверен», (3) добавьте любую информацию, которой нет в тексте, (4) отметьте подозрительные/нечитаемые области знаком [?]. Документ: [здесь]

Разница очевидна: роль, зависимость от одного источника, запрет на фальсификацию, разрешение отмечать двусмысленность и четкая структура вывода делают вывод надежным.

Этика, конфиденциальность и культурная чувствительность

Исторический и архивный материал — это не невинная куча текста. Он может содержать личные данные людей (гражданские записи, медицинские файлы, судебные документы), конфиденциальные воспоминания сообщества, произведения, защищенные авторским правом, и материалы, учитывающие культурные особенности. Несколько принципов:

  • Конфиденциальность. Загрузка конфиденциальных документов, позволяющих идентифицировать живых людей (личные данные), в общедоступные инструменты искусственного интеллекта может быть как юридическим, так и этическим нарушением. Соблюдайте политику использования данных вашего учреждения и соответствующее законодательство.
  • Авторское право: не каждый документ, который вы оцифровываете, может находиться в общественном достоянии. Рассмотрите права, прежде чем передавать их ИИ.
  • Культурная чувствительность: некоторые сообщества имеют право голоса в том, как используются их исторические материалы. «Эффективное» предложение ИИ не может игнорировать чувствительность сообщества.
  • Прозрачность: зафиксируйте, что транскрипция или метаданные, созданные ИИ, были созданы с помощью ИИ. Это необходимо для того, чтобы последующие исследователи могли проверить.
Совет: Прежде чем загружать документ в облачный инструмент искусственного интеллекта, задайте один вопрос: «Кто пострадает, если содержимое этого документа появится в Интернете?» Если ответ «никто», сначала поищите корпоративное одобрение и безопасные инструменты.

Распространенные ошибки

  • Принимаем ИИ за историка. ИИ не интерпретирует и не решает; они готовы. Смысл и ответственность лежат на вас.
  • Использование вывода без его проверки. Каждая дата, имя, цитата и ссылка являются претензией; Это не факт, пока это не подтверждено источником.
  • Опираясь на сфабрикованные источники. ИИ может создавать достоверные, но несуществующие ссылки; Ищите в каталоге.
  • Не обращая внимания на анахронизм. Отфильтруйте результаты, которые описывают прошлое на сегодняшнем языке с точки зрения периода.
  • Беспорядочная загрузка конфиденциальных документов. С самого начала учитывайте личные данные, авторские права и культурную чувствительность.

В заключение

В истории и архивировании ИИ — мощный помощник, который значительно ускоряет механическую и повторяющуюся работу (расшифровку, редактирование, сканирование, составление метаданных). Но именно в этой области доказательств галлюцинации и анахронизм представляют реальную опасность. Свяжите каждый результат с источником, перекрестной проверкой и фильтром периода; Всегда оставляйте интерпретацию, решение и окончательную ответственность при себе. Соблюдайте конфиденциальность, авторские права и культурные особенности с первого дня. Благодаря этой дисциплине ИИ становится инструментом, который ускоряет исторические исследования, а не замедляет их.

Задача приложения

Выберите имеющийся у вас исторический документ, печатный или цифровой. Сначала расположите ИИ с помощью шаблона «Роль и граница открытия». Затем используйте «инструкцию по борьбе с галлюцинациями» при подведении итогов документа. Пометьте вывод тегом «анализатор утверждений источника» и сравните каждое утверждение, помеченное как «должно быть проверено», с реальным документом. Обратите внимание, сколько точек было добавлено или искажено ИИ.

контрольный список

  • [ ] Я позиционировал ИИ как помощника, а не как человека, принимающего решения.
  • [ ] Я просто хотел, чтобы это было основано на источнике, который я дал.
  • [ ] Я независимо проверил каждую дату, имя и ссылку.
  • [ ] Я отфильтровал вывод на предмет анахронизмов.
  • [ ] Я соблюдал конфиденциальность, соблюдение авторских прав и культурную чувствительность в конфиденциальных документах.