одиниця 12 / 12

Наскрізний проект: обробка архівної колекції за допомогою штучного інтелекту

Прибуток:

  • Можливість обробляти колекцію в 7-етапному робочому процесі, від етичної перевірки до публікації, з контрольною точкою людини на кожному етапі
  • Зрозумійте, як ранні контрольні точки запобігають поширенню помилки (неправильна дата/назва) по ланцюжку
  • Можливість застосовувати принципи збереження майстер-файлу, не економити на верифікації та декларувати використання ШІ в цілісному проекті

Попередні розділи охоплювали окремі навички: оцифрування, транскрипція, метадані, сканування, переклад, перевірка, аналіз шаблонів, пошук, збереження та етика. Цей останній блок поєднує все це. У справжньому архівному проекті ці кроки відбуваються не окремо, а як взаємопов’язаний робочий процес. Тут ми побачимо, як ви можете обробити колекцію від початку до кінця за допомогою процесу, який підтримується ШІ, але керується людиною, крок за кроком і з ланцюжком керування.

Мета полягає в тому, щоб позиціонувати ШІ як партнера, який «прискорює кожен крок, але не має останнього слова на жодному». Коли ви закінчите цей розділ, у вас залишиться цілісний метод, який перетворює безладну купу документів у готову для дослідження, перевірену, етично чисту колекцію.

Сценарій: що маємо

Припустімо, ви отримуєте колекцію з 250 документів: деякі друковані (друкована кореспонденція, реклама), деякі рукописи (листи, блокноти) за різні дати, деякі містять конфіденційні особисті дані. Мета: оцифрувати, транскрибувати, каталогізувати та зробити цю колекцію доступною для дослідників. Давайте розберемо процес на сім етапів.

Семиетапний робочий процес

Етап 1 — Оцінка та етичний скринінг. Ознайомтеся з колекцією спочатку. Які документи містять конфіденційні персональні дані? Який статус авторського права? Чи існує культурна чутливість? Це сканування визначає, які документи можна надати хмарним інструментам ШІ, а які оброблятимуться лише в закритому/схваленому середовищі. Якщо цей етап пропущено, весь проект піддається етичному ризику.

Етап 2 — Оцифровка. Скануйте документи з високою роздільною здатністю (мінімум 300-400 DPI, хороший контраст). Зберігайте вихідні (основні) файли недоторканими; Вся обробка буде проводитися на копіях.

Етап 3 — Вилучення тексту. Застосуйте оптичне розпізнавання символів для паперових документів і HTR для рукописів. Попросіть штучний інтелект очистити необроблений вихід за допомогою інструкцій «безпечного вичитування» — лише оптичні помилки/помилки розпізнавання, відсутність коментарів до вмісту, нечитабельні місця [?]. Альтернативне читання та контроль палеографа для османського/рукопису.

Етап 4 — Метадані та каталогізація. Розробити стандартні (Dublin Core/ISAD(G)) метадані для кожного документа; З дозволу «залишити неіснуюче поле порожнім». Зіставте терміни теми з контрольованим списком. Перевірте дати та імена документально.

Етап 5 — Збагачення та візерунок. Витягніть сутності (особу/місце/організацію), нормалізуйте, створіть стосунки та часові рамки. Перевірте кожен шаблон у документі; Тут немає надуманих зв’язків і хронології.

Етап 6 — Інструменти доступу. Виготовити схему допомоги для пошуку для колекції; Базуйте розділ історії лише на перевірених нотатках. Чітко позначте обмеження доступу (конфіденційність/авторське право).

Етап 7 — Перевірка, декларація та публікація. Перевірте важливі поля (дата, ім’я, цитата, посилання) ще раз. Задекларувати використання ШІ. Експерт дає остаточне затвердження; Колекція відкрита для дослідження.

Порада: поставте «людську контрольну точку» на кожному етапі: експерт перевіряє результати штучного інтелекту перед переходом до наступного етапу. Без цих контрольних точок помилка на першому етапі (непрочитана дата) поширюватиметься по всьому ланцюжку та зрештою просочуватиметься до каталогу, шаблону та посібника.

Стіл ланцюга керування

етап

Робота ШІ

контрольно-пропускний пункт людини

1. Етичний скринінг

Маркування конфіденційних даних

Рішення про встановлення

2. Оцифровка

(Покращення зображення)

Якість, захист майстра

3. Вилучення тексту

OCR/HTR + безпечне виправлення

Ім'я/дата/перевірка читання

4. Метадані

стандартний проект

Підтвердження полів, збіг термінів

5. Візерунок

сутність, відношення, шкала часу

Перевірка в документі

6. Інструмент доступу

Пошук проекту допомоги

Історія та затвердження обмежень

7. Звільнення

Остаточне затвердження, декларація

три міні-чохла

Випадок 1 — Виявлено помилку ланцюжка. В одному проекті, на етапі 3, дата документа була "1868" замість "1888". Якби контрольна точка етапу 3 не виявила цю помилку, дата була б розподілена по каталозі (4), часовій шкалі (5) і довіднику (6). Завдяки КПП баг виправили в одному місці. Урок: рання перевірка запобігає поширенню помилки вгору по ланцюжку.

Випадок 2 — Етична перевірка врятувала проект. 18 із 250 документів містили конфіденційні дані живих людей. Етичний скринінг на етапі 1 помітив їх; ці 18 документів були оброблені в закритому середовищі, решта стандартними засобами. Це було б серйозним порушенням, якби сканування було пропущено і все було завантажено в хмару. Урок: етична перевірка – це перший крок, а не виправлення, додане пізніше.

Випадок 3 — Час і зусилля. При використанні традиційного методу для повної обробки колекції з 250 документів знадобиться приблизно 8-10 місяців. Завдяки підтримці штучного інтелекту робочому процесу контрольних точок процес скоротився приблизно до 3 місяців. Але економія відбулася не через те, що «ШІ зробив усе», а через те, що «ШІ виконав механічну роботу, зосереджену на перевірці людиною». Час, відведений на перевірку, не зменшився; Зменшився час, відведений на механічну роботу.

Чотири шаблони, які можна копіювати

1) Початковий план проекту:

У мене є колекція [кількість] документів: [комбінація друку/рукописів], [період], деякі з яких можуть містити конфіденційні дані. Створіть 7-етапний план робочого процесу, щоб оцифрувати та каталогізувати цю колекцію: укажіть завдання ШІ та контрольну точку ЛЮДИНИ на кожному етапі. Поставте перевірку етики на перше місце.

2) Перелік етапів переходу:

Я закінчив етап [ім’я сцени]. Створіть контрольний список критичних моментів, які мені потрібно перевірити, перш ніж переходити до наступного етапу: які факти (дата/ім’я/посилання) потрібно перевірити, які помилки можуть поширюватися вгору по ланцюжку? я маю остаточне схвалення; Ви даєте мені контрольний список.

3) Наскрізний контроль якості:

Нижче наведено всі рівні обробленого документа: транскрипція, метадані, витягнуті ресурси. НЕПОНЯТТЯ ФІГУРИ між шарами: чи збігається дата в транскрипції з метаданими, чи дійсно існують сутності в тексті? Накладення корекції; Створіть список невідповідностей. Шари: [тут]

4) Закриття проекту та декларація:

У цьому колекційному проекті я використовував ШІ на наступних етапах: [список]. Для проектної документації: (1) яка підтримка штучного інтелекту використовувалася на якому етапі, (2) як проводилася перевірка людиною, (3) які обмеження/обмеження існують — напишіть чесну заключну записку та проект заяви про використання штучного інтелекту, яка включатиме їх.

Слабка підказка / Сильна підказка

Слабкий:

Ретельно обробіть цю колекцію за допомогою ШІ та підготуйте її до дослідження.

Єдина інструкція «зробіть будь-що» обходить етичну перевірку, контрольні точки та перевірку; помилки поширюються по ланцюжку.

Сильний:

Налаштуйте 7-етапний робочий процес для цієї колекції з контрольною точкою людини на кожному етапі. Нехай 1-м етапом буде перевірка етики/конфіденційності. Вихідні дані, отримані ШІ на кожному етапі, будуть перевірені перед переходом до наступного етапу; позначте критичні факти (дата/назва/посилання). На жодному етапі ШІ не має останнього слова.

Відмінність: поетапна структура, етичний пріоритет, контрольні точки та принцип «люди мають останнє слово» роблять весь проект безпечним і виправданим.

Поширені помилки

  • Залишаючи етичну перевірку до кінця. Сканування конфіденційності/авторських прав є першим кроком; Якщо він додається пізніше, порушення вже відбулося.
  • Обхід блокпостів. Помилка, яка залишається неперевіреною, поширюється по всьому ланцюжку.
  • Головний файл не захищено. Якщо оригінал не залишиться недоторканим, повернення стане неможливим.
  • Економія на перевірці. ШІ скорочує механічну роботу; Якщо час перевірки скорочується, якість падає.
  • Не декларує використання ШІ. Прозорість є частиною наукової достовірності колекції.

Підсумовуючи

Наскрізний архівний проект об’єднує індивідуальні навички в ланцюжок контролю: етичне сканування, оцифрування, вилучення тексту, метадані, шаблон, інструмент пошуку та публікація. На кожному етапі ШІ прискорює механічну роботу; На кожному етапі останнє слово залишається за контрольно-пропускним пунктом людини. Етичний відбір є першим етапом, основний файл захищений, помилки виявляються на ранніх стадіях, щоб вони не поширювалися вгору по ланцюгу, а використання штучного інтелекту декларується чесно. Економія походить не від штучного інтелекту, який робить усе, а від того, що людина звільняється від механічної роботи та зосереджується на перевірці. ШІ прискорює; Людина забезпечує точність і цілісність історії.

Аплікаційне завдання

Виберіть невелику колекцію (10-20 документів; власний матеріал або набір зразків). Створіть робочий процес із 7 кроків за допомогою шаблону «план запуску проекту». Пропустіть принаймні два документи через цей потік: етичне сканування, вилучення тексту, метадані та шар шаблону. Перевіряйте кожен етап за допомогою «переліку етапів переходу». Нарешті, задокументуйте своє використання ШІ за допомогою шаблону «закриття проекту та заява». Зверніть увагу, які помилки були виявлені на ранніх контрольних точках.

контрольний список

  • [ ] Я пройшов перевірку етики/конфіденційності на першому етапі.
  • [ ] Я зберіг головні файли недоторканими.
  • [ ] Я розміщую людину на кожному етапі.
  • [ ] Я перевірив критичні факти, перш ніж вони були розповсюджені по ланцюжку.
  • [ ] Я заявив про використання ШІ на закритті проекту.

Модульний екзамен

1. Яке найкраще позиціонування штучного інтелекту в історії та архіві?

  • A) ШІ – це інструмент для узагальнення, редагування та написання; Коментар, критика джерела та остаточна відповідальність належать експерту ✔
  • B) Штучний інтелект може самостійно визначити автентичність і значення документа, як історик
  • C) Штучний інтелект працює лише для перекладу тексту, він не має нічого спільного з іншими архівними завданнями
  • D) Оскільки штучний інтелект завжди більш неупереджений, ніж люди, історичну інтерпретацію слід залишити йому.

Опис: Штучний інтелект; Це помічник, який редагує, сканує, перекладає та створює чернетки тексту. Критика джерела, інтерпретація, встановлення причинно-наслідкових зв'язків і остаточне рішення належать експерту; Неперевірені результати можуть призвести до сфабрикованого джерела, хибної дати або анахронізму.

2. Що таке галюцинація, створена штучним інтелектом в історичних дослідженнях?

  • А) Штучний інтелект дуже повільно обробляє документ
  • Б) Штучний інтелект вигадує неіснуюче джерело, цитату чи подію як реальні ✔
  • В) Документ фізично пошкоджено
  • Г) Архівний каталог не актуальний

Пояснення: Галюцинація — це коли штучний інтелект впевнено вигадує інформацію, джерела, цитати чи події, яких насправді не існує. Хоча його форма здається ідеальною, його зміст нереальний; Тому в кожному довідковому каталозі кожна цитата має бути перевірена за першоджерелом.

3. Який найкращий підхід до виправлення OCR за допомогою штучного інтелекту?

  • А) Попросити текст бути плавним і красивим і логічно завершити відсутні частини.
  • B) Дозволяє виправляти всі числа та дати на основі контексту
  • C) Попросити його виправити лише помилки оптичного розпізнавання, залишити нечитабельні області [?] і не змінювати числа/дати ✔
  • D) Попросіть студента заповнити нерозбірливі слова найбільш ймовірною здогадкою.

Пояснення: Золоте правило корекції OCR полягає у виправленні лише очевидних помилок оптичного розпізнавання (таких як rn на m, l на 1); не тлумачачи чи не завершуючи зміст тексту. Нечитабельні області позначені [?]; Числа і дати не змінені, звіряються з зображенням.

4. Що потрібно запитати у штучного інтелекту, коли потрібно прочитати слово, голосна буква якого не написана в османському тексті?

  • А) Дайте одноразове, точне читання, таким чином прискоривши роботу
  • B) Вибір слова, яке буде найбільш плавним, і заповнення пропусків
  • C) Завершення нечитабельних частин із власних загальних знань.
  • D) Пропонування можливих альтернатив читання та позначення неоднозначних областей замість нав’язування остаточного читання ✔

Пояснення: в османській турецькій мові короткі голосні переважно не пишуться; Одна різниця між голосною/літерою (abul і kabul, wali і vali) повністю змінює значення. Тому замість того, щоб нав’язувати остаточне читання, слід запитати про можливі альтернативи, слід зберегти нечитабельні ділянки, а остаточне рішення слід залишити за палеографом.

5. Який найефективніший спосіб запобігти галюцинаціям, коли ШІ створює чернетку метаданих (запис каталогу)?

  • A) Явно надайте дозвіл залишити це поле порожнім, якщо воно не включено в документ ✔
  • B) Вимагання, щоб кожне поле було заповнене та не залишалося незаповненим.
  • В) Оцінка дати за змістом недатованих документів
  • D) Дозволити штучному інтелекту генерувати еталонний код

Опис: тиск заповнення змушує штучний інтелект створювати документ, вгадуючи дату або автора, яких немає в документі. Найсильнішим захистом від цього є явний дозвіл залишити поле порожнім, якщо його немає в документі; Крім того, тематичні терміни зіставляються з контрольованою лексикою.

6. Як резюме документа, створене штучним інтелектом, має позиціонуватися в історичних дослідженнях?

  • А) Як надійний доказ, який можна прямо цитувати
  • B) Як карта відкриття, яка спрямовує вас до фактичного документа; Докази беруться з оригіналу документа ✔
  • В) Як адекватний ресурс, який може замінити сам документ
  • Г) Як текст, який можна використовувати в дослідженні, ніколи не повертаючись до документа

Опис: Резюме є картою відкриття, а не доказом. У цьому документі є щось на кшталт цього, там написано: «Іди і подивися»; Там не сказано точно те, що сказано в документі. Якщо подія, цитата або дані повинні бути включені в дослідження, вони повинні бути взяті дослівно з оригінального документа.

7. Як правильно уникнути анахронізмів під час перекладу історичного документа для публікації?

  • A) Заміна всіх термінів періоду найближчим еквівалентом на сьогодні
  • Б) Передавати текст якомога плавніше та сучасніше
  • C) Залиште назви періодів і назви установ унікальними та додайте пояснення ✔
  • Г) Адаптація власних імен до їх поточного вживання

Пояснення: Анахронізм — неправильне перенесення елементів з одного періоду в інший. Зміна назв періодів, назв установ та особистих імен на сучасні терміни переносить читача у світ, який не належить цьому періоду. Правильно залишити термін періоду та додати пояснення поруч із ним.

8. Як переконатися, що архівна довідка (назва фонду, номер справи), надана штучним інтелектом, є справжньою?

  • A) Довіряти посиланню, оскільки його формат виглядає правильним
  • Б) Знову запитуючи ШІ, чи вірне посилання
  • В) Прийняття посилання як правдивого, тому що воно переконливе та детальне
  • Г) Особисто знайшовши та перевіривши посилання в архівному каталозі чи надійному джерелі ✔

Опис: Штучний інтелект може створювати посилання, які ідеальні за формою, але насправді не існують; Вигадане посилання має таку саму форму, що й справжнє посилання. Єдиний спосіб довести, що посилання існує, це знайти його там, де знаходиться першоджерело (архівний каталог, бібліотека).

9. Як слід оцінювати шаблон, знайдений під час виконання аналізу шаблонів (NER, мережа, шкала часу) за допомогою штучного інтелекту?

  • А) Як гіпотезу, яку необхідно перевірити в документі; відправна точка, а не результат ✔
  • Б) Як остаточний висновок, який не потребує перевірки
  • В) Це беззаперечний об’єктивний факт, оскільки він є чисельним.
  • D) Як результат, який можна поставити під пряме дослідження, оскільки він знайшов штучний інтелект

Пояснення: кожна закономірність є гіпотезою, а не доказом. Об’єкти мають бути пов’язані з джерелом, різні варіанти написання (одних і тих же осіб/місць) мають бути нормалізовані за згодою людини, числа мають бути піддані сумніву щодо відсутніх даних і упередженості вибірки, а події без дати не повинні бути хронологізовані.

10. Чому розділ з біографічною/інституційною історією в допоміжному посібнику потребує особливої ​​уваги?

  • A) Цей розділ неважливий і може бути опублікований без перевірки
  • Б) Оскільки штучний інтелект може додавати в цей розділ сфабриковані події, неправдиві дати та назви, йому слід покладатися лише на перевірені джерела ✔
  • В) Штучний інтелект можна використовувати безпечно, оскільки він не робить жодних помилок у написанні історії.
  • Г) Цей розділ заповнюють лише дослідники, архівіст не цікавиться

Опис: Розділ історії — це місце, де найчастіше закрадаються галюцинації: штучний інтелект може вставляти неіснуючі події, хибні дати та вигадані заголовки під час написання вільного тексту із загальної інформації про особу чи установу. Цей розділ має базуватися лише на перевірених джерелах.

11. Як штучний інтелект має відповісти на питання дослідника про факти в довідковій (консультаційній) службі?

  • А) Відповідь на запитання має бути дана прямо і як певний факт.
  • B) Повинен створити правдоподібну дату чи ім’я та передати їх досліднику.
  • C) Замість того, щоб наводити факти прямо, він повинен направляти дослідника до відповідної колекції та джерела ✔
  • Г) Він повинен давати повну відповідь, щоб досліднику не потрібно було звертатися до джерела.

Пояснення: у довідковій службі штучний інтелект не повинен давати пряму відповідь на факти, а повинен спрямовувати дослідника до джерела. Оскільки пряма фактична відповідь, яку дає штучний інтелект, може бути сфабрикованою, і дослідник може помилково прийняти її за джерело. Замість «Відповідь така», має бути «Подивіться на ці документи в цій збірці».

12. Які операції є прийнятними та небажаними під час обробки зображення пошкодженого документа за допомогою штучного інтелекту?

  • A) Усі види операцій безкоштовні, включаючи заповнення відсутніх частин.
  • Б) Ніяких дій не можна вживати, зображення ніколи не торкатися
  • В) Заповнення відсутніх розділів є найціннішою дією, оскільки воно завершує документ.
  • D) Маніпуляції з читабельністю, такі як контраст/шум, прийнятні; Відгадками незручно заповнювати пропущені частини ✔

Пояснення: процеси, які покращують читабельність (контраст, освітлення, зменшення шуму), прийнятні, оскільки вони не змінюють вміст; Однак заповнення відсутніх/нерозбірливих частин за допомогою припущень є ризиком створення того, чого немає в документі, тобто історичної підробки. Оригінал зберігається, операції фіксуються.

13. Що необхідно зробити перед обробкою архівного документа, що містить конфіденційні персональні дані?

  • A) Сканування конфіденційності та анонімізація, якщо це необхідно, або за допомогою закритого/схваленого інструменту ✔
  • B) Завантаження документа безпосередньо в громадський транспорт, навіть не замислюючись про це
  • C) Ігнорування проблем конфіденційності заради ефективності
  • D) Подолання обмежень доступу з міркувань ефективності

Розголошення: завантаження документів, що містять конфіденційні дані, що ідентифікують живих людей (здоров’я, релігія, етнічна приналежність, адреса), у загальнодоступні хмарні інструменти може бути серйозним порушенням конфіденційності. Спершу слід перевірити конфіденційність, за потреби слід використати анонімізацію або закритий/схвалений інструмент.

14. Яка основна мета контрольної точки людини в проекті наскрізного архіву?

  • А) Уповільнення роботи штучного інтелекту та затягування проекту
  • Б) Щоб помилка (неправильна дата/назва) на одному етапі не була зв’язана з усіма наступними етапами ✔
  • C) Збільшення людської праці та повна відмова від автоматизації
  • D) Забезпечення останнього слова за штучним інтелектом

Опис. Контрольна точка людини на кожному етапі гарантує перевірку результатів ШІ перед переходом до наступного етапу. Без цього помилка на першому етапі (непрочитана дата) поширювалася б угору по ланцюжку через каталог, шаблон і посібник. Рання перевірка гарантує, що помилку буде виправлено в одному місці.

15. Що вимагають прозорість і автентичність у використанні штучного інтелекту в гуманітарних і соціальних науках?

  • A) Зберігання використання штучного інтелекту в таємниці, щоб ніхто не знав
  • B) Представити кожен текст, створений штучним інтелектом, як власну оригінальну ідею
  • C) Чесно заявляти про використання штучного інтелекту та не представляти його результати як власну оригінальну роботу ✔
  • D) Обмін лише результатами без пояснення методів

Опис: прозорість включає запис того, що транскрипцію, метадані або переклад було створено за допомогою штучного інтелекту; Оригінальність вимагає не подавати коментар, створений штучним інтелектом, як власну оригінальну ідею. Це важливо для перевірки наступними дослідниками та для академічної доброчесності.