Добивки:
- Способност за корекција на скенирани документи со конвертирање во текст со OCR и HTR и споредување на излезот со вистинската слика
- Способност да се зачува оригиналноста и интегритетот на архивскиот документ и да се спречи вештачката интелигенција да ја промени содржината и фабрикуваната реставрација
- Способност да се планира долгорочно дигитално зачувување со информации за потеклото и трајни формати
Архиварот има задача да носи томови од весници стари педесет години, рачно напишани писма или стари фотографии во иднината. Овие документи се истрошија со текот на времето; За да се зачуваат и да бидат достапни, се врши дигитализација: чин на скенирање на физички документ и негово претворање во дигитална копија. Но, само скринингот не е доволен; Дигиталниот објект мора да може да се најде, да се чита и да се одржува на долг рок. Во оваа единица, ќе научите како да користите вештачка интелигенција во работниот тек на дигитализација, транскрипција и дигитално зачувување; но ќе научите зошто ќе ја имате одговорноста за оригиналноста и точноста.
Неколку концепти. OCR (Optical Character Recognition) е технологија која го конвертира текстот од сликата на документот во текст што може да се уредува со машина. HTR (Handwritten Text Recognition) ја врши истата работа за рачно напишани документи и е многу потешка. Дигиталното зачувување е планиран напор да се осигура дека дигиталните објекти остануваат читливи со децении, дури и кога форматите на датотеките стануваат застарени и софтверот се менува. ВИ е моќен, но неисправен асистент во сите три области.
Чекор по чекор: од дигитализација до зачувување
1. Дајте приоритет. Не можете да дигитализирате сè одеднаш. Најкревките, најбараните и најуникатните документи се ставаат на прво место. Ова е судска одлука; Вештачката интелигенција помага при уредувањето на списокот, но институцијата го одредува приоритетот.
2. Скенирајте и применете OCR/HTR. Скенирајте го документот со висока резолуција, а потоа користете OCR или HTR за да го извлечете текстот. Алатките засновани на вештачка интелигенција овде стануваат се подобри и подобри, дури и со стари и тешки текстови.
3. Поправете го и потврдете го текстот. Излезот OCR/HTR никогаш не е совршен. Грешките се чести, особено ако има старо пишување, обоени страници или ракопис. Неопходно е да се спореди излезот со вистинската слика и да се поправи.
4. Додадете метаподатоци и информации за заштита. Додајте на дигиталниот објект неговото потекло, условите за скенирање, информации за формат и потекло - од каде потекнува документот и како е обработен. Оваа информација е критична за идната проверка и заштита.
5. План за долгорочна заштита. Изберете формати на датотеки кои се отворени, вообичаени и издржливи; направете резервна копија; Направете план за миграција во случај форматите да станат застарени.
Совет: Не прифаќајте го излезот OCR како „чист текст“. Ако системот за пребарување работи низ овој текст, погрешно препознаените зборови ќе предизвикаат изворот да не се најде. За критичните збирки, коригирањето на излезот на OCR на човечкото око го одредува квалитетот на целиот последователен пристап.
Автентичност и интегритет на дигиталниот објект
Во срцето на архивската работа се автентичноста и интегритетот: уверувањето дека документот навистина доаѓа од тврдениот извор и дека неговата содржина не е изменета. Во овој момент, вештачката интелигенција создава двострана закана. Прво, за време на корекција на OCR/HTR или „подобрување“, вештачката интелигенција може тивко да го менува текстот; може да додаде збор што не постои под името „корекција“. Второ, ако „поправка“ или „реставрација“ на сликата се направи со вештачка интелигенција, може да се добијат неоригинални детали.
Правилото на архиварот е јасно: дигиталната копија за зачувување мора да биде верна на оригиналот. Секое подобрување направено со вештачка интелигенција треба да се документира и вистинското (необработено) скенирање секогаш треба да се зачува. „Разубавувањето“ на документот може да ја уништи неговата историска доказна вредност.
Внимание: може да биде примамливо да се „подобри“ стара фотографија или документ со вештачка интелигенција; но вештачката интелигенција ги пополнува деловите што недостасуваат со нивно составување. Во архивски документ тоа значи создавање лажни историски докази. Излезот за реставрација никогаш не го заменува оригиналниот извор; се чува како посебна, јасно означена варијанта.
три мини футроли
Случај 1 - Архивите на весниците станаа достапни за пребарување. Библиотека ја дигитализираше својата 30-годишна колекција на локални весници. Со OCR, 90.000 страници беа транскрибирани и направени за пребарување; Пребарувањето тема што претходно траеше со денови сега е намалено на секунди. Сепак, тимот забележа дека точноста на OCR падна на 80% на старите и обоени страници и даде приоритет на коригирање на првите години со човечко око.
Случај 2 - ХТР го отвори ракописот. Една архива го примени HTR на збирка тешко читливи писма од 19 век. Системот доби голема брзина според повеќемесечното читање од експерти; Но, секоја страница од отпечатокот ја споредувал со оригиналот од експерт палеограф (експерт за античко пишување), бидејќи имало грешки во имињата на луѓето и местата.
Случај 3 - Лажната „реставрација“ е одбиена. Еден тим размислуваше да „поправи“ искината историска фотографија со вештачка интелигенција. Вештачката интелигенција ги комплетираше деловите на лицето што недостасуваа со нивно поставување. Архиварот сфатил дека овие измислени детали ќе ги искриват историските докази; Поправената слика беше зачувана одделно заедно со оригиналот, само јасно означена како „АИ дериват“.
Пристапете до копија, зачувување на копија и одлука за формат
Добра практика во дигитализацијата е да се одделат копии од ист објект за различни цели. Господар за зачувување е вистинскиот дигитален објект што треба да се носи во иднината, складиран во највисока резолуција, некомпресиран или формат без загуби; ретко се допира. Копијата за пристап е помала, лесно отворена варијанта претставена на корисникот. Оваа разлика е важна затоа што форматот што е практичен за употреба (мал, компресиран) можеби не е соодветен за долгорочно зачувување; Идеалниот формат за зачувување (голем, без загуби) е тежок за секојдневна употреба. Во овој работен тек, вештачката интелигенција може да помогне во пописот на датотеките, откривањето варијанти што недостасуваат и одржувањето на метаподатоците конзистентни помеѓу две копии. Сепак, изборот на формат е одлука за зачувување: треба да се претпочитаат отворени, широко документирани и издржливи формати (наместо сопственички, затворени формати), а планот за миграција треба да се одржува подготвен во случај форматите да станат застарени со текот на времето. Дури и ако вештачката интелигенција сугерира формат, политиката за долгорочно зачувување на институцијата го има последниот збор.
Совет: За секој дигитален објект, водете краток запис кој одговара на прашањата „каде е оригиналниот извор, во каков формат е копијата за зачувување, во кој формат е копијата за пристап и која е достапна на корисникот?“. Мешањето на овие три слоја го прави нејасно која датотека е доверлив господар понатаму.
Четири шаблони за копирање
1) Помош за корекција на излезот на OCR:
Подолу е текст за OCR и опис на вистинската страница. Поправете ги само грешките во openOCR (лоши знаци, сложени/поделени зборови). Не менувајте содржина, не додавајте или отстранувајте зборови. Ако не сте сигурни, означете со „[?]“. OCR текст: [тука]
2) Проверка на конзистентност на текст-слика:
Дали има додатоци во поправениот текст подолу што не се очекуваше да бидат во оригиналниот документ (кој можеби е измислен)? Обележете го секој сомнителен дел и напишете зошто е сомнителен. Текст: [тука]
3) Нацрт на метаподатоци за заштита:
Генерирајте го прегледот на метаподатоците за зачувување за следниот дигитализиран објект: извор, потекло, датум/резолуција на скенирање, формат на датотека, историја на трансакции. Само искористете ги информациите што ги дадов, оставете го празно полето што недостасува. Информации: [тука]
4) Помош за приоритизација:
Подолу е списокот на збирки кои чекаат дигитализација; Помогнете во одредувањето приоритети врз основа на кревкоста, побарувачката и уникатноста. Наведете кратко оправдување за секој ресурс; Оставете ја конечната одлука на мене. Листа: [тука]
Слаб промпт / Силен промпт
Слаба навестување:
Поправете го и разубавете го овој скениран текст.
„Beautify“ ја поканува вештачката интелигенција да ја промени содржината, да ги надомести пропустите; Оригиналноста на архивскиот документ е оштетена.
Моќен потсетник:
Вашата улога: помошник уредник за дигитализација. Во следниот OCR текст, поправете ги САМО експлицитните грешки при препознавање (лош знак, неправилно поделен збор). Не додавајте, отстранувајте или менувајте зборови. Оставете „[?]“ каде што не сте сигурни. Прикажете ја секоја корекција што сте ја направиле во посебна листа. Текст: [тука]
Моќното известување ја ограничува вештачката интелигенција само да препознава грешки, ѝ забранува да допира содржина и прави корекции да се следат.
Работен тек и табела за ризик
Фаза
Придонес на ВИ
Главен ризик
мерка за заштита
скенирање
-
лош квалитет
висока резолуција
OCR/HTR
Претворете во текст
Грешки при препознавање
човечка корекција
корекција
Предлог за грешка
Промена на содржината
Споредба со оригиналот
реставрација
Дериват на слика
фитинг детал
Чувајте го суровиот оригинал, означете го
заштита
Нацрт на метаподатоци
губење на потеклото
Запис за потекло
Вообичаени грешки
- Прифаќање на излезот OCR без корекција. Грешките го нарушуваат пребарувањето и пристапот.
- Повикувајќи ја вештачката интелигенција „направи убава“. Ја менува содржината и ја уништува оригиналноста.
- Замена на реставрацијата на вештачката интелигенција за вистински докази. Фабрикуваните детали создаваат лажна историја.
- Не се складира необработеното скенирање. Ниту една корекција не може да се потврди без оригиналот.
- Испуштање информации за потеклото. Веродостојноста на документот не може да се следи.
Сумирано
ВИ во дигитални архиви и дигитализација; Тоа е вредна помош што ја забрзува транскрипцијата на OCR/HTR, изготвувањето на метаподатоците и приоритизирањето. Но, суштината на архивската работа е автентичноста и интегритетот: излезот на OCR треба да се коригира со човечко око, вештачката интелигенција никогаш не треба тивко да ја замени содржината, дериватите за реставрација не треба да ги заменуваат оригиналните докази и секогаш треба да се чуваат необработените информации за скенирање и потекло. Користете вештачка интелигенција како алатка која не го „подобрува“ документот, туку го прави достапен додека останува верен на него.
Задача за апликација
Добијте краток примерок од излезот OCR (или ваше сопствено производство или од вистинско скенирање). Поправете ги само грешките во препознавањето со шаблонот „Помош за корекција на излезот на OCR“, а потоа проверете дали вештачката интелигенција додаде содржина со шаблонот „Проверка на конзистентност на текст-слика“. Потоа креирајте запис со потеклото и информациите за форматирање на објектот со шаблонот „Прилог на метаподатоци за зачувување“.
листа за проверка
- [ ] Го споредив излезот OCR/HTR со вистинската слика и ја коригирав.
- [ ] Проверив дека вештачката интелигенција не додава/променува содржина.
- [ ] Го задржав необработеното (главно) скенирање посебно и непроменето.
- [ ] Додадов информации за потеклото и форматот на метаподатоците.
- [ ] Јасно ги означив варијантите на реставрација како „АИ дериват“.