одиниця 6 / 11

Цифровий архів, оцифровка, OCR і довгострокове збереження

Прибуток:

  • Можливість виправляти відскановані документи шляхом перетворення їх на текст за допомогою OCR і HTR і порівняння результату з фактичним зображенням
  • Здатність зберегти оригінальність і цілісність архівного документа та запобігти штучному інтелекту від зміни вмісту та сфабрикованої реставрації
  • Здатність планувати довгострокове цифрове збереження з інформацією про походження та довговічними форматами

Перед архіваріусом стоїть завдання перенести в майбутнє п’ятдесятирічні томи газет, рукописні листи чи старі фотографії. Ці документи з часом зношуються; Щоб зберегти та зробити їх доступними, виконується оцифрування: сканування фізичного документа та перетворення його на цифрову копію. Але одного скринінгу недостатньо; Цифровий об’єкт має бути доступним для пошуку, читання та підтримки в довгостроковій перспективі. У цьому розділі ви дізнаєтесь, як використовувати штучний інтелект у робочому процесі оцифрування, транскрипції та цифрового збереження; але ви дізнаєтеся, чому ви несете відповідальність за оригінальність і точність.

Кілька концепцій. OCR (оптичне розпізнавання символів) — це технологія, яка перетворює текст із зображення документа на текст, який можна редагувати машиною. HTR (Розпізнавання рукописного тексту) виконує ту саму роботу для рукописних документів, але набагато складнішу. Цифрове збереження — це спланована спроба гарантувати, що цифрові об’єкти залишатимуться читабельними протягом десятиліть, навіть якщо формати файлів застаріють і програмне забезпечення зміниться. AI є потужним, але недоліками помічника у всіх трьох сферах.

Крок за кроком: від оцифрування до збереження

1. Розставте пріоритети. Все відразу не оцифруєш. Найбільш крихкі, найбільш затребувані та найбільш унікальні документи ставляться на перше місце. Це судове рішення; AI допомагає редагувати список, але установа визначає пріоритет.

2. Скануйте та застосуйте OCR/HTR. Відскануйте документ із високою роздільною здатністю, а потім за допомогою OCR або HTR витягніть текст. Інструменти на основі штучного інтелекту тут стають все кращими й кращими, навіть зі старими та складними текстами.

3. Виправте та перевірте текст. Вихід OCR/HTR ніколи не буває ідеальним. Помилки є звичайним явищем, особливо якщо є старі записи, заплямовані сторінки або рукопис. Важливо порівняти результат із фактичним зображенням і виправити його.

4. Додайте метадані та інформацію про захист. Додайте до цифрового об’єкта його походження, умови сканування, інформацію про формат і походження — звідки надійшов документ і як він був оброблений. Ця інформація має важливе значення для майбутньої перевірки та захисту.

5. План довгострокового захисту. Вибирайте формати файлів, які є відкритими, поширеними та довговічними; резервне копіювання; Складіть план міграції на випадок, якщо формати застаріють.

Порада. Не сприймайте вихід OCR як «чистий текст». Якби пошукова система працювала з цим текстом, неправильно розпізнані слова призвели б до того, що джерело не було б знайдено. Для критично важливих колекцій коригування результату оптичного розпізнавання для людського ока визначає якість усього подальшого доступу.

Автентичність і цілісність цифрового об'єкта

В основі архівної роботи лежить автентичність і цілісність: впевненість у тому, що документ дійсно походить із заявленого джерела і що його зміст не було змінено. У цей момент ШІ створює двосторонню загрозу. По-перше, під час корекції OCR/HTR або «покращення» штучний інтелект може мовчки змінювати текст; можна під назвою «виправлення» додати слово, якого немає. По-друге, якщо «ремонт» або «відновлення» зображення виконується за допомогою штучного інтелекту, можуть вийти неоригінальні деталі.

Правило архіваріуса чітке: цифрова копія збереження має відповідати оригіналу. Кожне вдосконалення, зроблене за допомогою ШІ, має бути задокументовано, а фактичне (необроблене) сканування має завжди зберігатися. «Прикрашання» документа може знищити його історичну доказову цінність.

Застереження: може виникнути спокуса «поліпшити» стару фотографію чи документ за допомогою ШІ; але штучний інтелект заповнює відсутні частини, створюючи їх. В архівному документі це означає створення неправдивих історичних свідчень. Результати відновлення ніколи не замінюють вихідне джерело; зберігається як окремий, чітко позначений варіант.

три міні-чохла

Випадок 1 — Архіви газет стали доступними для пошуку. Бібліотека оцифрувала свою 30-річну колекцію місцевих газет. За допомогою OCR 90 000 сторінок було транскрибовано та доступно для пошуку; Пошук теми, який раніше займав кілька днів, тепер скорочено до секунд. Однак команда помітила, що точність оптичного розпізнавання символів впала до 80% на старих і заплямованих сторінках, і надала пріоритет виправленню найвищих років людським оком.

Випадок 2 — HTR відкрив рукопис. Архів застосував HTR до колекції важкочитаних листів 19 століття. Система набула великої швидкості згідно з місяцями читання експертами; Але кожну сторінку роздруківки порівнював з оригіналом фахівець-палеограф (знавець стародавньої писемності), тому що були помилки в назвах людей і місць.

Випадок 3 — Фальшиве «відновлення» відхилено. Одна команда розглядала можливість «відремонтувати» порвану історичну фотографію за допомогою ШІ. AI доповнив відсутні частини обличчя, підігнавши їх. Архіваріус розумів, що ці вигадані подробиці спотворять історичні свідчення; Відремонтоване зображення зберігалося окремо поряд з оригіналом, лише чітко позначеним як «похідна AI».

Копія для доступу, копія для збереження та рішення щодо формату

Гарною практикою оцифрування є розділення копій одного об’єкта для різних цілей. Мастер збереження — це фактичний цифровий об’єкт, який буде перенесено в майбутнє, збережений у найвищій роздільній здатності, у форматі без стиснення або без втрат; його рідко чіпають. Копія Access – це менший варіант, який легко відкривається, і надається користувачеві. Ця відмінність важлива, оскільки практичний для використання формат (маленький, стиснутий) може бути непридатним для тривалого зберігання; Ідеальний формат для збереження (великий, без втрат) є громіздким для щоденного використання. У цьому робочому процесі штучний інтелект може допомогти в інвентаризації файлів, виявленні відсутніх варіантів і збереженні узгодженості метаданих у двох копіях. Однак вибір формату є рішенням щодо збереження: слід віддавати перевагу відкритим, широко задокументованим і довговічним форматам (а не приватним, закритим форматам), а план міграції має бути готовим на випадок, якщо формати з часом застаріють. Навіть якщо штучний інтелект пропонує формат, останнє слово залишається за довгостроковою політикою закладу.

Порада: для кожного цифрового об’єкта зробіть короткий запис із відповідями на запитання «де оригінальне джерело, у якому форматі — копія для збереження, у якому форматі — копія для доступу та яка доступна для користувача?» Змішування цих трьох рівнів робить незрозумілим, який файл є надійним головним у майбутньому.

Чотири шаблони, які можна копіювати

1) Довідка з корекції виводу OCR:

Нижче наведено OCR-текст і опис фактичної сторінки. Виправляйте лише помилки openOCR (неправильні символи, складні/розділені слова). Не змінюйте вміст, не додавайте і не видаляйте слова. Якщо ви не впевнені, позначте «[?]». OCR текст: [тут]

2) Перевірка відповідності тексту та зображення:

Чи є у виправленому тексті нижче будь-які доповнення, яких не очікувалося в оригінальному документі (який, можливо, був вигаданий)? Позначте кожну підозрілу частину та напишіть, чому вона є підозрілою. Текст: [тут]

3) Проект метаданих захисту:

Створіть структуру метаданих збереження для такого оцифрованого об’єкта: джерело, походження, дата/роздільна здатність сканування, формат файлу, історія транзакцій. Просто використовуйте надану мною інформацію, залиште пропущене поле порожнім. Інформація: [тут]

4) Допомога у визначенні пріоритетів:

Нижче наведено список колекцій, які очікують оцифрування; Допомога у визначенні пріоритетів на основі крихкості, попиту та унікальності. Дайте коротке обґрунтування кожного ресурсу; Залиште остаточне рішення за мною. Список: [тут]

Слабка підказка / Сильна підказка

Слабка підказка:

Виправте та прикрасьте цей сканований текст.

«Beautify» запрошує штучний інтелект змінити вміст, компенсувати упущення; Пошкоджено оригінал архівного документа.

Потужна підказка:

Ваша роль: помічник редактора оцифрування. У наступному OCR-тексті виправте ЛИШЕ явні помилки розпізнавання (неправильний символ, неправильно розділене слово). Не додавайте, не видаляйте та не змінюйте жодних слів. Залиште "[?]", де ви не впевнені. Показуйте кожне зроблене виправлення в окремому списку. Текст: [тут]

Потужна підказка обмежує штучний інтелект лише розпізнаванням помилок, забороняє торкатися вмісту та робить виправлення доступними.

Таблиця робочого процесу та ризиків

етап

Внесок ШІ

Основний ризик

захід захисту

сканування

погана якість

висока роздільна здатність

OCR/HTR

Перетворити в текст

Помилки розпізнавання

виправлення людини

корекція

Пропозиція щодо помилки

Зміна змісту

Порівняння з оригіналом

відновлення

Похідне зображення

деталь примірки

Зберігайте необроблений оригінал, позначте його

захисту

Проект метаданих

втрата походження

Запис про походження

Поширені помилки

  • Прийняття результату OCR без виправлення. Помилки порушують пошук і доступ.
  • Виклик ШІ «робити красивим». Це змінює зміст і руйнує оригінальність.
  • Заміна реальних доказів відновленням ШІ. Сфабриковані деталі створюють неправдиву історію.
  • Не зберігається необроблений скан. Жодне виправлення неможливо перевірити без оригіналу.
  • Відсутність інформації про походження. Достовірність документа стає непростежуваною.

Підсумовуючи

ШІ в цифрових архівах і оцифровці; Це цінна допомога, яка прискорює транскрипцію OCR/HTR, складання метаданих і встановлення пріоритетів. Але суть архівної роботи полягає в автентичності та цілісності: вихід OCR має бути виправлений людським оком, ШІ ніколи не повинен мовчки замінювати вміст, похідні реставрації не повинні замінювати оригінальні докази, а необроблена інформація про сканування та походження має завжди зберігатися. Використовуйте ШІ як інструмент, який не «покращує» документ, а радше робить його доступним, залишаючись вірним йому.

Аплікаційне завдання

Отримайте короткий зразок результату OCR (власного виробництва або фактичного сканування). Виправте лише помилки розпізнавання за допомогою шаблону «Довідка щодо корекції виводу OCR», а потім перевірте, чи додав AI вміст за допомогою шаблону «Перевірка узгодженості тексту й зображення». Потім створіть запис із інформацією про походження та формат для об’єкта за допомогою шаблону «Чернетка метаданих збереження».

контрольний список

  • [ ] Я порівняв результат OCR/HTR із фактичним зображенням і виправив його.
  • [ ] Я перевірив, що ШІ не додає/змінює вміст.
  • [ ] Я зберіг необроблений (основний) скан окремо та без змін.
  • [] Я додав інформацію про походження та формат до метаданих.
  • [ ] Я чітко позначив варіанти відновлення як «похідні ШІ».