единица 12 / 12

Проект от край до край: Обработка на архивна колекция с изкуствен интелект

Печалби:

  • Възможност за обработка на колекция в 7-етапен работен процес, от етичен скрининг до публикуване, с човешка контролна точка на всеки етап
  • Разберете как ранните контролни точки предотвратяват разпространението на грешка (грешна дата/име) по веригата
  • Възможност за прилагане на принципите за запазване на главния файл, без спестяване на проверка и деклариране на използването на AI в холистичен проект

Предишните модули обхващаха индивидуални умения: дигитализация, транскрипция, метаданни, сканиране, превод, проверка, анализ на модели, извличане, съхранение и етика. Тази последна единица съчетава всичко. Един истински архивен проект преживява тези стъпки не отделно, а като взаимосвързан работен процес. Тук ще видим как можете да обработите колекция от началото до края с поддържан от AI, но контролиран от човека процес, стъпка по стъпка и с контролна верига.

Целта е AI да се позиционира като партньор, който „ускорява всяка стъпка, но няма последна дума за никоя стъпка“. Когато завършите тази част, ще ви остане холистичен метод, който трансформира разхвърляна купчина документи в готова за изследване, проверена, етично чиста колекция.

Сценарий: това, което имаме

Да приемем, че получавате колекция от 250 документа: някои отпечатани (печатна кореспонденция, реклами), някои ръкописи (писма, тетрадки), от различни дати, някои съдържат чувствителни лични данни. Цел: дигитализиране, транскрибиране, каталогизиране и предоставяне на тази колекция на изследователите. Нека разделим процеса на седем етапа.

Работен процес в седем стъпки

Фаза 1 — Оценка и етичен скрининг. Първо се запознайте с колекцията. Кои документи съдържат чувствителни лични данни? Какъв е статусът на авторското право? Има ли културна чувствителност? Това сканиране определя кои документи могат да бъдат предоставени на базирани в облака AI инструменти и кои ще бъдат обработвани само в затворена/одобрена среда. Ако този етап бъде пропуснат, целият проект е изложен на етичен риск.

Етап 2 — Дигитализация. Сканирайте документи с висока резолюция (поне 300-400 DPI, добър контраст). Съхранявайте оригиналните (главни) файлове недокоснати; Цялата обработка ще бъде извършена върху копията.

Етап 3 — Извличане на текст. Приложете OCR за документи на хартиен носител и HTR за ръкопис. Накарайте AI да изчисти необработения изход с инструкция за „безопасна корекция“ — само оптични грешки/грешки при разпознаване, без коментар на съдържанието, нечетливи места [?]. Алтернативно четене и палеографски контрол за османския/ръкопис.

Етап 4 — Метаданни и каталогизиране. Изготвяне на стандартни (Dublin Core/ISAD(G)) метаданни за всеки документ; С разрешение от „оставете несъществуващо поле празно“. Картирайте термините на темата към контролирания списък. Проверете датите и имената с документация.

Етап 5 — Обогатяване и моделиране. Извличане на обекти (човек/място/организация), нормализиране, създаване на взаимоотношения и очертания на времевата линия. Проверете всеки модел в документа; Няма измислени връзки и хронология.

Етап 6 — Инструменти за достъп. Създаване на план за помощ за намиране за събиране; Базирайте раздела с историята само на проверени бележки. Маркирайте ясно ограниченията за достъп (поверителност/авторски права).

Етап 7 — Проверка, деклариране и публикуване. Проверете критичните полета (дата, име, цитат, справка) за последен път. Декларирайте използването на AI. Експертът дава окончателно одобрение; Колекцията е отворена за изследване.

Съвет: Поставете „човешка контролна точка“ на всеки етап: Експерт проверява изхода на AI, преди да преминете към следващия етап. Без тези контролни точки, грешка на първия етап (грешно разчетена дата) ще се разпространи по цялата верига и в крайна сметка ще изтече в каталога, шаблона и ръководството.

Маса за контролна верига

Етап

Работа на AI

човешка контролна точка

1. Етичен скрининг

Маркиране на чувствителни данни

Решение за инсталиране

2. Дигитализация

(Подобряване на изображението)

Качество, майсторска защита

3. Извличане на текст

OCR/HTR + сигурна корекция

Име/дата/проверка на четене

4. Метаданни

стандартна чернова

Потвърждение на поле, съвпадение на термини

5. Десен

същност, връзка, времева линия

Валидиране в документ

6. Инструмент за достъп

Намиране на чернова на помощ

История и одобрение на ограниченията

7. Освобождаване

Окончателно одобрение, декларация

три мини калъфа

Случай 1 — Уловена грешка във веригата. В един проект, във фаза 3, датата на документ гласи "1868" вместо "1888". Ако контролната точка от етап 3 не беше уловила тази грешка, датата щеше да бъде разпределена в каталога (4), времевата линия (5) и ръководството (6). Благодарение на контролната точка грешката беше коригирана на едно място. Урок: ранната проверка предотвратява разпространението на грешката нагоре по веригата.

Случай 2 — Етичен скрининг спаси проекта. 18 от 250-те документа съдържат чувствителни данни на живи хора. Етичният скрининг във фаза 1 ги маркира; тези 18 документа са обработени в затворена среда, останалите със стандартни инструменти. Би било сериозно нарушение, ако сканирането беше пропуснато и всичко беше качено в облака. Поука: етичният скрининг е първата стъпка, а не поправка, добавена по-късно.

Случай 3 — Време и усилия. Използвайки традиционния метод, ще са необходими приблизително 8-10 месеца за пълна обработка на колекция от 250 документа. С поддържания от AI работен процес на контролни точки процесът беше намален до приблизително 3 месеца. Но спестяванията не дойдоха от „AI направи всичко“, а от „AI извърши механичната работа, фокусирана върху човешката проверка“. Времето, отделено за проверка, не е намаляло; Времето, посветено на механична работа, е намаляло.

Четири копируеми шаблона

1) Първоначален план на проекта:

Имам колекция от [брой] документи: [смес от печат/ръкопис], [период], някои от които може да съдържат чувствителни данни. Създайте план за работен процес в 7 стъпки, за да дигитализирате и каталогизирате тази колекция: посочете задачата на AI и контролната точка ЧОВЕК на всеки етап. Поставете етичния скрининг на първо място.

2) Контролен списък за преход на етапа:

Завърших етап [име на сцената]. Създайте контролен списък с критични точки, които трябва да проверя, преди да премина към следващия етап: какви факти (дата/име/референция) трябва да бъдат проверени, какви грешки могат да се разпространяват нагоре по веригата? Имам окончателното одобрение; Даваш ми контролния списък.

3) Контрол на качеството от край до край:

По-долу са всички слоеве на обработен документ: транскрипция, метаданни, извлечени активи. НЕПОНЯТИЯ НА ФИГУРАТА между слоевете: съвпада ли датата в транскрипцията с метаданните, действително ли съществуват обектите в текста? Налагане на корекция; Генерирайте списък с несъответствия. Слоеве: [тук]

4) Закриване на проекта и декларация:

В този проект за събиране използвах AI на следните етапи: [списък]. За документация на проекта: (1) каква поддръжка на AI е използвана на кой етап, (2) как е извършена човешка проверка, (3) какви ограничения/ограничения има — напишете честна заключителна бележка и проект на декларация за използване на AI, която включва тези.

Слаба подкана / Силна подкана

Слаб:

Обработете тази колекция старателно с AI и я подгответе за изследване.

Една-единствена инструкция „направи каквото и да било“ заобикаля етичния скрининг, контролните точки и проверката; грешките се разпространяват по веригата.

Силен:

Настройте 7-етапен работен процес за тази колекция, с човешка контролна точка на всеки етап. Нека първият етап да бъде скрининг за етика/поверителност. Резултатът, произведен от AI на всеки етап, ще бъде проверен преди преминаване към следващия етап; маркирайте критични факти (дата/име/референция). На нито един етап AI няма последната дума.

Разликата: поетапна структура, етичен приоритет, контролни точки и принципът „последната дума имат хората“ правят целия проект безопасен и защитим.

Често срещани грешки

  • Оставяме етичния преглед за края. Сканирането за поверителност/авторски права е първата стъпка; Ако се добави по-късно, нарушението вече е извършено.
  • Заобикаляне на контролно-пропускателни пунктове. Грешка, която остава непроверена, се разпространява по цялата верига.
  • Не защитава главния файл. Ако оригиналът не бъде запазен недокоснат, връщането става невъзможно.
  • Спестяване на проверка. AI съкращава механичната работа; Ако времето за проверка се съкрати, качеството се влошава.
  • Не се декларира използването на AI. Прозрачността е част от научната достоверност на колекцията.

В обобщение

Проектът за архивиране от край до край свързва индивидуалните умения във верига от контрол: етично сканиране, дигитализация, извличане на текст, метаданни, модел, инструмент за извличане и публикуване. На всеки етап AI ускорява механичната работа; На всеки етап човешката контролна точка има последната дума. Етичният преглед е първият етап, главният файл е защитен, грешките се улавят рано, за да не се разпространят нагоре по веригата, а използването на AI се декларира честно. Спестяванията идват не от AI, който прави всичко, а от човешкото същество, освободено от механична работа и фокусирано върху проверката. AI ускорява; Човекът осигурява точността и целостта на историята.

Задача за приложение

Изберете малка колекция (10-20 документа; ваш собствен материал или набор от проби). Създайте работен процес от 7 стъпки с шаблона „план за стартиране на проект“. Пуснете поне два документа през този поток: етично сканиране, извличане на текст, метаданни и слой с шаблони. Проверете всеки етап с „контролен списък за преход на етапи“. И накрая, документирайте използването на AI с шаблона „закриване на проекта и изявление“. Обърнете внимание кои грешки са открити в ранните контролни точки.

контролен списък

  • [ ] Направих проверка за етика/поверителност на първия етап.
  • [ ] Запазих главните файлове недокоснати.
  • [ ] Поставям човешка контролна точка на всеки етап.
  • [ ] Проверих критични факти, преди да бъдат разпространени нагоре по веригата.
  • [ ] Декларирах използването на AI при затварянето на проекта.

Изпит по модул

1. Кое е най-подходящото позициониране на изкуствения интелект в историята и архивирането?

  • A) AI е инструмент за обобщение, редактиране и изготвяне; Коментарът, критиката към източника и крайната отговорност принадлежат на експерта ✔
  • B) Изкуственият интелект може сам да реши автентичността и значението на документа, като историк
  • C) Изкуственият интелект работи само за превод на текст, няма нищо общо с други архивни задачи
  • Г) Тъй като изкуственият интелект винаги е по-безпристрастен от хората, историческата интерпретация трябва да бъде оставена на него.

Описание: Изкуствен интелект; Това е асистент, който редактира, сканира, превежда и създава чернови на текст. Критиката на източника, тълкуването, установяването на причината и следствието и окончателното решение принадлежат на експерта; Непроверен резултат може да доведе до изфабрикуван източник, фалшива дата или анахронизъм.

2. Каква е халюцинацията, произведена от изкуствения интелект в историческите изследвания?

  • А) Изкуственият интелект обработва документ много бавно
  • B) Изкуственият интелект измисля несъществуващ източник, цитат или събитие като истински ✔
  • В) Документът е физически повреден
  • Г) Архивният каталог не е актуален

Обяснение: Халюцинация е, когато изкуственият интелект уверено изфабрикува информация, източници, цитати или събития, които всъщност не съществуват. Въпреки че формата му изглежда съвършена, съдържанието му не е реално; Следователно във всеки справочен каталог всеки цитат трябва да бъде проверен в оригиналния източник.

3. Какъв е най-добрият подход за коригиране на OCR изход от изкуствен интелект?

  • А) Искане текстът да бъде гладък и красив и да допълва логически липсващите части.
  • B) Позволява му да коригира всички числа и дати въз основа на контекста
  • C) Помолете го да коригира само грешките при оптичното разпознаване, да остави нечетливи области [?] и да не променя числата/датите ✔
  • Г) Помолете ученика да попълни нечетливите думи с най-вероятното предположение.

Обяснение: Златното правило при корекцията на OCR е да се коригират само очевидни грешки при оптично разпознаване (като rn към m, l към 1); не тълкуване или допълване на съдържанието на текста. Нечетливите области са маркирани с [?]; Числата и датите не се променят, сверяват се със снимката.

4. Какво трябва да се иска от изкуствения интелект, когато става въпрос за четене на дума, чиято гласна не е написана в османски текст?

  • А) Дайте еднократно точно четене, като по този начин ускорявате работата
  • B) Избор на думата, която ще направи значението най-плавно и попълване на празните места
  • В) Допълване на нечетливите части от собствените му общи познания.
  • Г) Предлагане на възможни алтернативи за четене и маркиране на двусмислени области вместо налагане на окончателно четене ✔

Обяснение: В османотурския език кратките гласни предимно не се пишат; Една разлика в гласна/буква (abul и kabul, wali и vali) напълно променя значението. Следователно, вместо да се налага окончателно четене, трябва да се попитат възможните алтернативи, нечетливите области трябва да бъдат запазени и окончателното решение трябва да бъде оставено на палеографа.

5. Кой е най-ефективният начин за предотвратяване на халюцинации, когато изкуственият интелект създава чернова на метаданни (каталожен запис)?

  • A) Изрично дайте разрешение да оставите това поле празно, ако не е включено в документа ✔
  • B) Изискване всяко поле да бъде попълнено и да не остава непопълнено.
  • В) Определяне на дата въз основа на съдържанието на недатирани документи
  • Г) Позволяване на изкуствения интелект да генерира референтния код

Описание: Натиск за попълване принуждава AI да състави документа, като познае датата или създателя, който не е в документа. Най-силният щит срещу това е изричното даване на разрешение да оставите полето празно, ако не е в документа; Освен това тематичните термини се съпоставят с контролиран речник.

6. Как трябва да се позиционира резюмето на документа, създадено от изкуствения интелект, в историческите изследвания?

  • А) Като надеждно доказателство, което може да бъде директно цитирано
  • B) Като карта за откриване, която ви насочва към действителния документ; Доказателствата са взети от оригиналния документ ✔
  • В) Като адекватен ресурс, който може да замести самия документ
  • Г) Като текст, който може да се използва в изследването, без изобщо да се връщате към документа

Описание: Резюмето е карта на откритието, а не доказателство. Има нещо подобно в този документ, казва се иди и виж; Не пише точно какво пише в документа. Ако събитие, цитат или данни трябва да бъдат включени в изследването, те трябва да бъдат взети дословно от оригиналния документ.

7. Какъв е правилният начин да се избегнат анахронизми при превод на исторически документ за публикуване?

  • A) Замяна на всички периодични термини с днешния най-близък еквивалент
  • Б) Да предадат текста възможно най-плавно и модерно
  • C) Оставете заглавията на периодите и имената на институциите уникални и добавете обяснение ✔
  • Г) Адаптиране на собствените имена към текущата им употреба

Обяснение: Анахронизмът е погрешно пренасяне на елементи от един период в друг период. Промяната на заглавия на периоди, имена на институции и лични имена към днешните условия пренася читателя в свят, който не принадлежи на периода. Правилният начин е да запазите срока на периода и да добавите обяснение до него.

8. Как да се уверите, че препратка към архив (име на фонд, номер на файл), дадена от изкуствения интелект, е истинска?

  • A) Доверяване на препратката, защото форматът й изглежда правилен
  • B) Като попитате отново AI дали препратката е правилна
  • В) Приемане на препратката за вярна, защото е убедителна и подробна
  • Г) Чрез лично намиране и проверка на препратката в архивния каталог или надежден източник ✔

Описание: Изкуственият интелект може да създаде препратки, които са перфектни по форма, но всъщност не съществуват; Фиктивната справка е в същата форма като истинската справка. Единственият начин да се докаже съществуването на препратка е да се намери там, където се намира оригиналният източник (архивен каталог, библиотека).

9. Как трябва да бъде оценен модел, открит при извършване на анализ на шаблони (NER, мрежа, времева линия) с изкуствен интелект?

  • А) Като хипотеза, която трябва да бъде проверена в документа; начална точка, а не резултат ✔
  • Б) Като окончателна констатация, която не изисква проверка
  • В) Това е безспорен обективен факт, защото е числено.
  • Г) Като резултат, който може да бъде поставен в пряко изследване, защото е открил изкуствен интелект

Обяснение: Всеки модел е хипотеза, а не доказателство. Субектите трябва да бъдат свързани с източника, различните изписвания (на едно и също лице/място) трябва да бъдат нормализирани с одобрението на човека, числата трябва да бъдат поставени под въпрос за липсващи данни и пристрастия при вземане на проби, а събитията без дата не трябва да бъдат хронологизирани.

10. Защо разделът с биографична/институционална история в информационно помагало изисква специално внимание?

  • A) Този раздел е маловажен и може да бъде публикуван без проверка
  • B) Тъй като изкуственият интелект може да добавя измислени събития, фалшиви дати и заглавия в този раздел, той трябва да разчита само на проверени източници ✔
  • В) Изкуственият интелект може да се използва безопасно, защото не прави никакви грешки при писането на история.
  • Г) Само изследователи попълват този раздел, архивистът не се интересува

Описание: Разделът с историята е мястото, където най-често се прокрадват халюцинации: AI може да вмъква несъществуващи събития, фалшиви дати и измислени заглавия, докато пише гладък текст от обща информация за човек или институция. Този раздел трябва да се основава само на проверени източници.

11. Как трябва изкуственият интелект да отговори на въпрос на изследовател в справочна (консултативна) служба?

  • А) Отговорът на въпроса трябва да се даде директно и като категоричен факт.
  • B) Трябва да представи правдоподобна дата или име и да ги предаде на изследователя.
  • В) Вместо да дава факти директно, трябва да насочва изследователя към съответната колекция и източник ✔
  • Г) Трябва да дава пълен отговор, така че изследователят да не се налага да отива до източника.

Обяснение: В справочната служба изкуственият интелект не трябва да дава пряк отговор на факта, а трябва да насочва изследователя към източника. Тъй като прекият фактически отговор, даден от изкуствения интелект, може да бъде изфабрикуван и изследователят да го сбърка с източника. Вместо да казва „Отговорът е това“, трябва да казва „Вижте тези документи в тази колекция“.

12. Кои операции са приемливи и нежелателни при обработка на изображение на повреден документ с изкуствен интелект?

  • A) Всички видове операции са безплатни, включително попълване на липсващите части.
  • B) Не трябва да се предприемат никакви действия, изображението никога не трябва да се докосва
  • В) Попълването на липсващите секции е най-ценното действие, защото допълва документа.
  • D) Допустими са манипулации за четимост като контраст/шум; Неудобно е да попълвате липсващите части с предположения ✔

Обяснение: Процеси, които подобряват четливостта (контраст, осветление, намаляване на шума) са приемливи, защото не променят съдържанието; Въпреки това, попълването на липсващи/нечетливи части с предположения е рискът от създаване на това, което не е в документа, тоест историческа фалшификация. Оригиналът е запазен, транзакциите са записани.

13. Какво трябва да се направи преди обработката на архивен документ, съдържащ чувствителни лични данни?

  • A) Сканиране за поверителност и анонимизиране, ако е необходимо или използване на затворен/одобрен инструмент ✔
  • Б) Качване на документа директно в обществено превозно средство, без дори да мислите за това
  • В) Пренебрегване на опасенията за поверителност за ефективност
  • Г) Преодоляване на ограниченията за достъп от съображения за ефективност

Разкриване: Качването на документи, съдържащи чувствителни данни, идентифициращи живи хора (здраве, религия, етническа принадлежност, адрес) в публични, базирани на облак инструменти, може да бъде сериозно нарушение на поверителността. Първо трябва да се извърши проверка на поверителността, анонимизиране или да се използва затворен/одобрен инструмент, ако е необходимо.

14. Каква е основната цел на човешка контролна точка в проект за архивиране от край до край?

  • А) Забавяне на работата на изкуствения интелект и забавяне на проекта
  • B) За предотвратяване на грешка (неправилна дата/име) в един етап от верижно свързване към всички следващи етапи ✔
  • В) Увеличаване на човешкия труд и пълен отказ от автоматизацията
  • Г) Гарантиране, че изкуственият интелект има последната дума

Описание: Човешка контролна точка на всеки етап гарантира, че изходът на AI е проверен, преди да преминете към следващия етап. Без това грешка на първия етап (грешно разчетена дата) ще се разпространи нагоре по веригата през каталога, шаблона и ръководството. Ранната проверка гарантира, че грешката се коригира на едно място.

15. Какво изискват прозрачността и автентичността при използването на изкуствен интелект в хуманитарните и социалните науки?

  • А) Пазене на използването на изкуствен интелект в тайна, като се гарантира, че никой не знае
  • Б) Да представи всеки текст, създаден от изкуствения интелект, като собствена оригинална идея
  • C) Честно да декларирате използването на изкуствен интелект и да не представяте неговата продукция като собствена оригинална работа ✔
  • Г) Споделяне само на резултатите без обяснение на методите

Описание: Прозрачността включва записване, че транскрипция, метаданни или превод са произведени с помощта на изкуствен интелект; Оригиналността изисква да не представяте коментар, създаден от изкуствения интелект, като собствена оригинална идея. Това е от съществено значение за проверка от последващи изследователи и за академична почтеност.