единица 6 / 11

Цифров архив, дигитализация, OCR и дългосрочно съхранение

Печалби:

  • Възможност за коригиране на сканирани документи чрез конвертирането им в текст с OCR и HTR и сравняване на изхода с действителното изображение
  • Възможност за запазване на оригиналността и целостта на архивния документ и предотвратяване на AI от промяна на съдържанието и фабрикувано възстановяване
  • Възможност за планиране на дългосрочно цифрово съхранение с информация за произхода и трайни формати

Един архивист има задачата да пренесе петдесетгодишни томове на вестници, ръкописни писма или стари снимки в бъдещето. Тези документи се износват с времето; За да се запазят и направят достъпни, се извършва дигитализация: актът на сканиране на физически документ и превръщането му в цифрово копие. Но скринингът сам по себе си не е достатъчен; Цифровият обект трябва да бъде откриваем, четим и поддържан в дългосрочен план. В този модул ще научите как да използвате изкуствения интелект в работния процес за цифровизация, транскрипция и цифрово съхранение; но ще научите защо вие ще носите отговорност за оригиналност и точност.

Няколко концепции. OCR (оптично разпознаване на знаци) е технология, която преобразува текста в изображението на документ в машинно редактиран текст. HTR (Handwritten Text Recognition) върши същата работа за ръкописни документи и е много по-трудна. Цифровото съхранение е планирано усилие да се гарантира, че цифровите обекти остават четими в продължение на десетилетия, дори когато файловите формати остареят и софтуерът се промени. AI е мощен, но недостатъчен помощник и в трите области.

Стъпка по стъпка: от дигитализация до съхранение

1. Подредете приоритетите. Не можете да дигитализирате всичко наведнъж. На първо място са най-крехките, най-търсените и най-уникалните документи. Това е съдебно решение; AI помага при редактирането на списъци, но институцията определя приоритета.

2. Сканирайте и приложете OCR/HTR. Сканирайте документа с висока разделителна способност, след което използвайте OCR или HTR, за да извлечете текста. Базираните на AI инструменти стават все по-добри и по-добри тук, дори и със стари и трудни текстове.

3. Коригирайте и проверете текста. OCR/HTR изходът никога не е перфектен. Грешките са често срещани, особено ако има старо писмо, зацапани страници или ръкопис. Важно е да сравните резултата с действителното изображение и да го коригирате.

4. Добавете метаданни и информация за защита. Добавете към дигиталния обект неговия произход, условия на сканиране, информация за формата и произход – откъде идва документът и как е обработен. Тази информация е критична за бъдеща проверка и защита.

5. План за дългосрочна защита. Изберете файлови формати, които са отворени, общи и издръжливи; архивиране; Направете план за миграция в случай, че форматите остареят.

Съвет: Не приемайте OCR изхода като "ясен текст". Ако система за търсене работи с този текст, неправилно разпознатите думи биха довели до невъзможност за намиране на източника. За критични колекции коригирането на OCR изхода за човешкото око определя качеството на целия последващ достъп.

Автентичност и цялост на цифровия обект

В основата на архивната работа са автентичността и целостта: увереността, че даден документ наистина произлиза от заявения източник и че съдържанието му не е променено. В този момент AI създава двупосочна заплаха. Първо, по време на OCR/HTR корекция или „подобряване“, AI може безшумно да модифицира текста; може да добави дума, която не съществува под името "корекция". Второ, ако „ремонтът“ или „възстановяването“ на изображението се извършва с AI, може да се получат неоригинални детайли.

Правилото на архивиста е ясно: копието за дигитално съхранение трябва да е вярно на оригинала. Всяко подобрение, направено с AI, трябва да се документира и действителното (сурово) сканиране трябва винаги да се запазва. „Разкрасяването“ на един документ може да унищожи историческата му доказателствена стойност.

Внимание: Може да е изкушаващо да „подобрите“ стара снимка или документ с AI; но AI попълва липсващите части, като ги измисля. В архивен документ това означава създаване на фалшиви исторически свидетелства. Резултатът от възстановяването никога не замества оригиналния източник; се съхранява като отделен, ясно етикетиран вариант.

три мини калъфа

Случай 1 — Архивите на вестниците станаха достъпни за търсене. Библиотека дигитализира своята 30-годишна колекция от местни вестници. С OCR 90 000 страници бяха транскрибирани и направени достъпни за търсене; Търсенето на теми, което преди отнемаше дни, сега е намалено до секунди. Екипът обаче забеляза, че точността на OCR спадна до 80% на стари и зацапани страници и даде приоритет на коригирането на най-добрите години с човешко око.

Случай 2 — HTR отвори ръкописа. Архив приложи HTR към колекция от трудни за четене писма от 19-ти век. Системата набра голяма скорост според месеци четене от експерти; Но всяка страница от разпечатката беше сравнена с оригинала от експерт палеограф (експерт по древна писменост), защото имаше грешки в имената на хора и места.

Случай 3 — Отхвърлено фалшиво „възстановяване“. Един екип смяташе да „поправи“ скъсана историческа снимка с AI. AI завърши липсващите лицеви части, като ги монтира. Архивистът разбра, че тези изфабрикувани подробности ще изкривят историческите доказателства; Поправеното изображение беше съхранено отделно заедно с оригинала, само ясно обозначено като „производно на AI“.

Копие за достъп, копие за съхранение и решение за форматиране

Добра практика при дигитализацията е да се отделят копия на един и същи обект за различни цели. Master за съхранение е действителният цифров обект, който трябва да бъде пренесен в бъдещето, съхранен в най-висока разделителна способност, некомпресиран или без загуба формат; рядко се пипа. Access copy е по-малък, лесно отваряем вариант, представен на потребителя. Това разграничение е важно, тъй като форматът, който е практичен за използване (малък, компресиран), може да не е подходящ за дългосрочно съхранение; Идеалният формат за съхранение (голям, без загуба) е тромав за ежедневна употреба. В този работен процес изкуственият интелект може да помогне при инвентаризация на файлове, откриване на липсващи варианти и поддържане на съгласуваност на метаданните между две копия. Изборът на формат обаче е решение за запазване: трябва да се предпочитат отворени, широко документирани и трайни формати (вместо частни, затворени формати) и трябва да се поддържа готов план за миграция, в случай че форматите остареят с времето. Дори AI да предложи формат, политиката за дългосрочно съхранение на институцията има последната дума.

Съвет: За всеки цифров обект водете кратък запис, който отговаря на въпросите "къде е оригиналният източник, в какъв формат е запазеното копие, в какъв формат е копието за достъп и кое е достъпно за потребителя?" Смесването на тези три слоя прави неясно кой файл е довереният главен занапред.

Четири копируеми шаблона

1) Помощ за корекция на OCR изход:

По-долу има OCR текст и описание на действителната страница. Коригирайте само грешки в openOCR (лоши знаци, сложни/разделени думи). Не променяйте съдържанието, не добавяйте и не премахвайте думи. Ако не сте сигурни, маркирайте с "[?]". OCR текст: [тук]

2) Проверка на съгласуваността на текста и изображението:

Има ли добавки в коригирания текст по-долу, които не се очаква да бъдат в оригиналния документ (който може да е измислен)? Маркирайте всяка подозрителна част и напишете защо е подозрителна. Текст: [тук]

3) Проект на метаданни за защита:

Генерирайте контура на метаданните за съхранение за следния цифровизиран обект: източник, произход, дата/резолюция на сканиране, файлов формат, история на транзакциите. Просто използвайте предоставената от мен информация, оставете липсващото поле празно. Информация: [тук]

4) Помощ за приоритизиране:

По-долу е списъкът на колекциите, които очакват дигитализиране; Помогнете при определянето на приоритети въз основа на нестабилност, търсене и уникалност. Дайте кратка обосновка за всеки ресурс; Оставете окончателното решение на мен. Списък: [тук]

Слаба подкана / Силна подкана

Слаба подкана:

Коригирайте и разкрасете този сканиран текст.

„Beautify“ кани AI да промени съдържанието, да компенсира пропуските; Нарушена е оригиналността на архивния документ.

Мощна подкана:

Вашата роля: асистент на редактора за цифровизация. В следния OCR текст поправете САМО изрични грешки при разпознаване (лош знак, неправилно разделена дума). Не добавяйте, премахвайте или променяйте думи. Оставете „[?]“ там, където не сте сигурни. Покажете всяка корекция, която сте направили, в отделен списък. Текст: [тук]

Мощната подкана ограничава AI само до разпознаване на грешки, забранява му да докосва съдържание и прави корекциите проследими.

Таблица на работния процес и риска

Етап

Принос на AI

Основен риск

мярка за защита

сканиране

лошо качество

висока резолюция

OCR/HTR

Преобразуване в текст

Грешки при разпознаване

човешка корекция

корекция

Предложение за грешка

Промяна на съдържанието

Сравнение с оригинала

реставрация

Производно изображение

монтажен детайл

Запазете необработения оригинал, етикетирайте го

защита

Чернова на метаданни

загуба на произход

Произходен запис

Често срещани грешки

  • Приемане на OCR изхода без корекция. Грешките нарушават търсенето и достъпа.
  • Наричай AI „направи красив“. Променя съдържанието и унищожава оригиналността.
  • Замяна на AI възстановяване с действителни доказателства. Изфабрикуваният детайл създава фалшива история.
  • Не се съхранява необработеното сканиране. Никаква корекция не може да бъде проверена без оригинала.
  • Пропускане на информация за произхода. Надеждността на документа става непроследима.

В обобщение

ИИ в цифровите архиви и дигитализацията; Това е ценна помощ, която ускорява OCR/HTR транскрипцията, съставянето на метаданни и приоритизирането. Но същността на архивната работа е автентичността и целостта: OCR изходът трябва да бъде коригиран от човешкото око, AI никога не трябва тихо да замества съдържанието, реставрационните производни не трябва да заместват оригиналното доказателство, а необработеното сканиране и информацията за произход трябва винаги да се запазват. Използвайте AI като инструмент, който не „подобрява“ документа, а по-скоро го прави достъпен, като същевременно остава верен на него.

Задача за приложение

Вземете кратка извадка от OCR изход (или ваша собствена продукция, или от действително сканиране). Коригирайте само грешките при разпознаване с шаблона „Помощ за корекция на OCR изход“, след което проверете дали AI е добавил съдържание с шаблона „Проверка за съгласуваност на текст и изображение“. След това създайте запис с информация за произхода и формата за обекта с шаблона „Чернова на метаданни за съхранение“.

контролен списък

  • [ ] Сравних OCR/HTR изхода с действителното изображение и го коригирах.
  • [ ] Проверих дали AI ​​не добавя/променя съдържание.
  • [ ] Запазих необработеното (главно) сканиране отделно и непроменено.
  • [ ] Добавих информация за произхода и формата към метаданните.
  • [ ] Ясно съм маркирал вариантите за възстановяване като „производни на AI“.