Единица 12 / 12

Проект од крај до крај: Обработка на архивска колекција со вештачка интелигенција

Добивки:

  • Способност за обработка на збирка во работен тек од 7 фази, од етички преглед до објавување, со човечки контролен пункт во секоја фаза
  • Разберете како раните контролни пунктови спречуваат грешка (погрешен датум/име) да се шири низ синџирот
  • Способност да се применат принципите на зачувување на главната датотека, не заштеда на верификација и декларирање на употреба на вештачка интелигенција во холистички проект

Претходните единици опфаќаа индивидуални вештини: дигитализација, транскрипција, метаподатоци, скенирање, превод, верификација, анализа на модели, пронаоѓање, зачувување и етика. Оваа последна единица го комбинира сето тоа. Вистинскиот архивски проект ги доживува овие чекори не одделно, туку како меѓусебно поврзан работен тек. Овде, ќе видиме како можете да обработите колекција од почеток до крај со процес поддржан од вештачка интелигенција, но контролиран од човек, чекор по чекор и со контролен синџир.

Целта е да се позиционира вештачката интелигенција како партнер кој „го забрзува секој чекор, но нема конечен збор за ниту еден чекор“. Кога ќе ја завршите оваа единица, ќе останете со холистички метод кој трансформира неуредна куп документи во збирка подготвена за истражување, проверена, етички чиста.

Сценарио: она што го имаме

Да речеме дека добивате збирка од 250 документи: некои печатени (печатена кореспонденција, огласи), некои ракописи (писма, тетратки), од различни датуми, некои содржат чувствителни лични податоци. Цел: да се дигитализира, транскрибира, каталог и да се направи оваа збирка достапна за истражувачите. Ајде да го разложиме процесот во седум фази.

Работен тек од седум чекори

Фаза 1 - Проценка и етички скрининг. Прво запознајте ја колекцијата. Кои документи содржат чувствителни лични податоци? Каков е статусот на авторските права? Дали постои културна чувствителност? Ова скенирање одредува кои документи може да се дадат на алатките за вештачка интелигенција базирани на облак и кои ќе се обработуваат само во затворена/одобрена средина. Ако оваа фаза се прескокне, целиот проект е во етички ризик.

Фаза 2 - Дигитализација. Скенирајте документи со висока резолуција (најмалку 300-400 DPI, добар контраст). Чувајте ги оригиналните (главни) датотеки недопрени; Целата обработка ќе се изврши на примероците.

Фаза 3 - Извлекување текст. Примени OCR за хартиени документи и HTR за ракопис. Нека вештачката интелигенција го исчисти необработениот излез со инструкција за „безбедно лекторирање“ - само оптички/грешки во препознавање, без коментар за содржината, нечитливи места [?]. Алтернативно читање и палеографска контрола за отоманскиот/ракопис.

Фаза 4 - Метаподатоци и каталогизација. Имајте изготвени стандардни (Dublin Core/ISAD(G)) метаподатоци за секој документ; Со дозвола од „остави непостоечко поле празно“. Картирај ги термините на темата на контролираната листа. Потврдете ги датумите и имињата со документацијата.

Фаза 5 - Збогатување и моделирање. Извадете ентитети (лице/место/организација), нормализирајте, продуцирајте контури за врска и временска рамка. Потврдете ја секоја шема во документот; Нема измислени врски и нема хронологија.

Фаза 6 - Пристап до алатки. Направете преглед на помошта за наоѓање за собирање; Засновајте го делот за историја само на проверени белешки. Јасно означете ги ограничувањата за пристап (приватност/авторски права).

Фаза 7 - Верификација, декларација и објавување. Потврдете ги критичните полиња (датум, име, цитат, референца) последен пат. Објави употреба на ВИ. Експертот дава конечно одобрение; Збирката е отворена за истражување.

Совет: Ставете „човечки контролен пункт“ во секоја фаза: експерт го потврдува излезот на вештачката интелигенција пред да преминете на следната фаза. Без овие контролни точки, грешка во првата фаза (погрешно прочитан датум) ќе се прошири низ синџирот и на крајот ќе протече во каталогот, шаблонот и водичот.

Контролна маса со синџир

Фаза

Работата на АИ

човечки контролен пункт

1. Етички скрининг

Обележување на чувствителни податоци

Одлука за инсталација

2. Дигитализација

(Подобрување на сликата)

Квалитетна, господарна заштита

3. Извлекување на текст

OCR/HTR + сигурна корекција

Потврда за име/датум/читање

4. Метаподатоци

стандарден нацрт

Потврда на терен, совпаѓање на термини

5. Шема

ентитет, однос, временска рамка

Валидација во документ

6. Алатка за пристап

Наоѓање нацрт помош

Историја и одобрување ограничувања

7. Ослободете

-

Конечно одобрување, декларација

три мини футроли

Случај 1 - Утврдена грешка во синџирот. Во еден проект, во фаза 3, датумот на документот гласеше „1868“ наместо „1888“. Доколку контролниот пункт од 3-та фаза не ја забележал оваа грешка, датумот би бил распореден низ каталогот (4), временската линија (5) и водичот (6). Благодарение на контролниот пункт, бубачката беше поправена на едно место. Поука: раната проверка ја спречува грешката да се прошири на ланецот.

Случај 2 - Етичката проверка го спаси проектот. 18 од 250 документи содржеле чувствителни податоци на живи лица. Етички скрининг во фаза 1 ги означи овие; овие 18 документи беа обработени во затворена средина, останатите со стандардни алатки. Ќе беше сериозно прекршување ако скенирањето беше прескокнато и сето тоа беше поставено на облакот. Поука: етичкиот скрининг е првиот чекор, а не поправка додадена подоцна.

Случај 3 - Време и напор. Користејќи го традиционалниот метод, ќе бидат потребни приближно 8-10 месеци за целосна обработка на збирка од 250 документи. Со работниот тек на контролната точка поддржан од вештачка интелигенција, процесот беше намален на приближно 3 месеци. Но, заштедите не дојдоа од „Ви направи сè“, туку од „Ви направи механичка работа, фокусирана на човечка проверка“. Времето посветено на верификацијата не се намали; Времето посветено на механичка работа е намалено.

Четири шаблони за копирање

1) Почетен план на проектот:

Имам колекција од [број] документи: [мешавина од печатење/ракопис], [период], од кои некои може да содржат чувствителни податоци. Создадете план на работниот тек од 7 чекори за дигитализирање и каталогизација на оваа збирка: наведете ја задачата на вештачката интелигенција и контролната точка ЧОВЕК во секоја фаза. Ставете го етичкиот скрининг на прво место.

2) Список за проверка на транзиција на фази:

Ја завршив етапата [име на сцената]. Направете листа за проверка на критичните точки што треба да ги проверам пред да преминам на следната фаза: кои факти (датум/име/референца) треба да се потврдат, кои грешки можат да се пропагираат низ синџирот? Имам конечно одобрение; Дај ми го списокот за проверка.

3) Контрола на квалитет од крај до крај:

Подолу се сите слоеви на обработен документ: транскрипција, метаподатоци, извлечени средства. ФИГУРНИ НЕКОНЦЕПТИ меѓу слоевите: дали датумот во транскрипцијата се совпаѓа со метаподатоците, дали ентитетите всушност постојат во текстот? Наметнување на корекција; Создадете листа на недоследности. Слоеви: [тука]

4) Затворање и декларација на проектот:

Во овој проект за собирање, користев вештачка интелигенција во следните фази: [листа]. За проектна документација: (1) каква поддршка за вештачка интелигенција била користена во која фаза, (2) како е направена човечка проверка, (3) какви ограничувања/ограничувања постојат - напишете искрена завршна белешка и нацрт-изјава за употреба на вештачка интелигенција што ги вклучува овие.

Слаб промпт / Силен промпт

Слаб:

Темелно обработете ја оваа колекција со вештачка интелигенција и подгответе ја за истражување.

Една единствена инструкција „направи се“ ги заобиколува етичките проверки, контролните пунктови и верификацијата; грешките се шират по синџирот.

Силно:

Поставете работен тек од 7 фази за оваа колекција, со човечки контролен пункт во секоја фаза. Првата фаза нека биде проверка на етика/приватност. Излезот произведен од ВИ во секоја фаза ќе биде потврден пред да се пресели во следната фаза; означете ги критичните факти (датум/име/референца). Во ниту една фаза вештачката интелигенција го нема последниот збор.

Разликата: фазната структура, етичкиот приоритет, контролните пунктови и принципот „луѓето го имаат последниот збор“ го прават целиот проект безбеден и одбранлив.

Вообичаени грешки

  • Оставајќи го етичкиот скрининг до крај. Скенирањето на приватноста/авторските права е првиот чекор; Ако се додаде подоцна, прекршувањето е веќе настанато.
  • Заобиколувајќи ги контролните пунктови. Грешка што останува непроверена се шири низ целиот синџир.
  • Не ја заштитува главната датотека. Ако оригиналот не се чува недопрен, враќањето станува невозможно.
  • Заштеда на верификација. ВИ ја скратува механичката работа; Ако времето за верификација се скрати, квалитетот се намалува.
  • Не декларирање за употреба на вештачка интелигенција. Транспарентноста е дел од научниот кредибилитет на збирката.

Сумирано

Проект за архива од крај до крај ги поврзува индивидуалните вештини во синџир на контрола: етичко скенирање, дигитализација, екстракција на текст, метаподатоци, шема, алатка за пронаоѓање и објавување. Во секоја фаза, вештачката интелигенција ја забрзува механичката работа; Во секоја фаза, човечки контролен пункт го има последниот збор. Етичката проверка е првата фаза, главната датотека е заштитена, грешките се откриваат рано за да не се шират низ синџирот, а употребата на вештачка интелигенција е прогласена искрено. Заштедите не доаѓаат од тоа што вештачката интелигенција прави сè, туку од човечкото суштество ослободено од механичка работа и фокусирање на верификација. ВИ забрзува; Човекот ја обезбедува точноста и интегритетот на историјата.

Задача за апликација

Изберете мала колекција (10-20 документи; ваш сопствен материјал или комплет примерок). Создадете работен тек од 7 чекори со шаблонот „план за стартување на проектот“. Вклучете најмалку два документа низ овој тек: етичко скенирање, екстракција на текст, метаподатоци и слој на шема. Потврдете ја секоја фаза со „список за проверка на транзиција на фази“. Конечно, документирајте ја вашата употреба на вештачка интелигенција со шаблонот „затворање и изјава на проектот“. Забележете кои грешки беа фатени на раните контролни пунктови.

листа за проверка

  • [ ] Го направив скринингот за етика/приватност во првата фаза.
  • [ ] Ги чував главните датотеки недопрени.
  • [ ] Ставив човечки контролен пункт во секоја фаза.
  • [ ] Ги потврдив критичните факти пред да бидат пропагирани низ синџирот.
  • [ ] Прогласив употреба на вештачка интелигенција при затворањето на проектот.

Модул испит

1. Кое е најсоодветното позиционирање на вештачката интелигенција во историјата и архивирањето?

  • А) ВИ е алатка за резиме, уредување и изготвување; Коментарот, изворната критика и конечната одговорност му припаѓаат на експертот ✔
  • Б) Вештачката интелигенција може сама да одлучува за автентичноста и значењето на документот, како историчар
  • В) Вештачката интелигенција работи само за преведување текст, нема врска со други архивски задачи
  • Г) Бидејќи вештачката интелигенција е секогаш понепристрасна од луѓето, историското толкување треба да се остави на неа.

Опис: Вештачка интелигенција; Тоа е асистент кој уредува, скенира, преведува и произведува нацрти на текст. Изворната критика, толкувањето, причинско-последичното утврдување и конечната одлука му припаѓаат на експертот; Непроверениот излез може да доведе до фабрикуван извор, лажен датум или анахронизам.

2. Каква е халуцинацијата што ја создава вештачката интелигенција во историските истражувања?

  • А) Вештачката интелигенција обработува документ многу бавно
  • Б) Вештачката интелигенција фабрикува непостоечки извор, цитат или настан како вистински ✔
  • В) Физички е оштетен документ
  • Г) Архивскиот каталог не е ажуриран

Објаснување: Халуцинација е кога вештачката интелигенција самоуверено фабрикува информации, извори, цитати или настани кои всушност не постојат. Иако неговата форма изгледа совршена, неговата содржина не е реална; Затоа, во секој референтен каталог, секој цитат мора да биде потврден во оригиналниот извор.

3. Кој е најдобриот пристап за да се коригира излезот OCR со вештачка интелигенција?

  • А) Барање текстот да биде течен и убав и логично да ги дополни деловите што недостасуваат.
  • Б) Овозможувајќи му да ги коригира сите броеви и датуми врз основа на контекстот
  • В) Барајќи од него да ги исправи само грешките во оптичкото препознавање, да остави нечитливи области [?] и да не менува броеви/датуми ✔
  • Г) Барање од ученикот да ги пополни нечитливите зборови со најверојатната претпоставка.

Објаснување: Златното правило во корекција на OCR е да се поправат само очигледните грешки во оптичкото препознавање (како rn до m, l до 1); не толкување или комплетирање на содржината на текстот. Нечитливите области се означени со [?]; Броевите и датумите не се менуваат, се проверуваат со сликата.

4. Што треба да се побара од вештачката интелигенција кога станува збор за читање збор чија самогласка не е напишана во отомански текст?

  • А) Дајте едно, прецизно читање, со што ќе ја забрзате работата
  • Б) Избор на зборот што ќе го направи значењето најтечно и пополнување на празнините
  • В) Дополнување на нечитливите делови од сопственото општо знаење.
  • Г) Нудење можни алтернативи за читање и означување на двосмислени области наместо да се наметне дефинитивно читање ✔

Објаснување: Во османлискиот турски кратки самогласки најчесто не се пишуваат; Една разлика во самогласка/букви (абул и кабул, вали и вали) целосно го менува значењето. Затоа, наместо да се наметнува дефинитивно читање, треба да се побараат можни алтернативи, да се зачуваат нечитливите области, а конечната одлука да се остави на палеографот.

5. Кој е најефективниот начин да се спречи халуцинација кога вештачката интелигенција произведува нацрт-метаподатоци (каталошки запис)?

  • А) Експлицитно дајте дозвола да го оставите тоа поле празно ако не е вклучено во документот ✔
  • Б) Барање секое поле да се пополни и да не се остави нецелосно.
  • В) Проценка на датум врз основа на содржината на документите без датум
  • Г) Дозволување на вештачката интелигенција да го генерира референтниот код

Опис: Притисокот за пополнување ја принудува вештачката интелигенција да го состави документот со погодување на датумот или креаторот што не е во документот. Најсилниот штит против ова е експлицитно да се даде дозвола да се остави полето празно ако го нема во документот; Дополнително, термините на темата се пресликуваат со контролиран речник.

6. Како треба да се позиционира резиме на документ произведен од вештачка интелигенција во историските истражувања?

  • А) Како сигурен доказ кој може директно да се цитира
  • Б) Како карта за откривање што ве упатува до вистинскиот документ; Доказите се земени од оригиналниот документ ✔
  • В) Како соодветен ресурс кој може да го замени самиот документ
  • Г) Како текст што може да се користи во студијата без воопшто да се врати во документот

Опис: Резимето е карта за откривање, а не доказ. Има нешто вакво во овој документ, пишува оди и погледни; Не пишува точно што пишува во документот. Ако некој настан, цитат или податоци треба да бидат вклучени во студијата, тие мора да бидат земени дословно од оригиналниот документ.

7. Кој е вистинскиот начин да се избегнат анахронизми при преведување на историски документ за објавување?

  • А) Замена на сите термини за периоди со денешниот најблизок еквивалент
  • Б) Да се пренесе текстот што е можно потечно и современо
  • В) Оставете ги уникатни насловите на периодите и имињата на институциите и додајте објаснување ✔
  • Г) Приспособување на соодветните имиња на нивната моментална употреба

Објаснување: Анахронизмот е погрешно пренесување на елементи од еден период во друг период. Менувањето на насловите на периодите, имињата на институциите и личните имиња на денешните термини го транспортира читателот во свет кој не му припаѓа на тој период. Правилниот начин е да се задржи терминот за период и да се додаде објаснување до него.

8. Како да бидете сигурни дека референцата за архива (име на фондот, број на датотека) дадена од вештачката интелигенција е реална?

  • А) Доверба на референцата бидејќи нејзиниот формат изгледа точен
  • Б) Со повторно прашување на вештачката интелигенција дали референцата е точна
  • В) Прифаќање на референцата како вистинита бидејќи е убедлива и детална
  • Г) Со лично наоѓање и потврдување на референцата во архивскиот каталог или сигурен извор ✔

Опис: Вештачката интелигенција може да произведе референци кои се совршени по форма, но всушност не постојат; Фиктивна референца е во иста форма како вистинска референца. Единствениот начин да се докаже дека постои референца е да се најде каде се наоѓа оригиналниот извор (архивски каталог, библиотека).

9. Како треба да се процени шаблонот пронајден при вршење на анализа на шаблони (NER, мрежа, времеплов) со вештачка интелигенција?

  • А) Како хипотеза што треба да се потврди во документот; почетна точка, а не исход ✔
  • Б) Како дефинитивен наод кој не бара верификација
  • В) Тоа е неоспорен објективен факт бидејќи е нумерички.
  • Г) Како резултат што може да се стави во директна студија затоа што откри вештачка интелигенција

Објаснување: Секоја шема е хипотеза, а не доказ. Ентитетите треба да се поврзат со изворот, различните правописи (на исто лице/место) треба да се нормализираат со човечко одобрување, броевите треба да се преиспитуваат за исчезнати податоци и пристрасност при земање примероци, а настаните без датум не треба да се хронологизираат.

10. Зошто делот за биографска/институционална историја во помошта за наоѓање бара посебно внимание?

  • А) Овој дел е неважен и може да се објави без верификација
  • Б) Бидејќи вештачката интелигенција може да додаде фабрикувани настани, лажни датуми и наслови во овој дел, треба да се потпира само на проверени извори ✔
  • В) Вештачката интелигенција може безбедно да се користи бидејќи не прави никакви грешки при пишувањето историја.
  • Г) Само истражувачи го пополнуваат овој дел, архиварот не е заинтересиран

Опис: Делот за историја е местото каде што најчесто навлегува халуцинацијата: вештачката интелигенција може да вметне непостоечки настани, лажни датуми и измислени наслови додека пишува течен текст од општи информации за личност или институција. Овој дел треба да се заснова само на проверени извори.

11. Како треба вештачката интелигенција да одговори на прашањето за фактите на истражувачот во референтна (консултативна) услуга?

  • А) Одговорот на прашањето треба да се даде директно и како дефинитивен факт.
  • Б) Мора да изготви веродостоен датум или име и да му го пренесе на истражувачот.
  • В) Наместо директно да дава факти, треба да го насочи истражувачот до соодветната збирка и извор ✔
  • Г) Треба да даде целосен одговор за истражувачот да не треба да оди до изворот.

Објаснување: Во референтната услуга, вештачката интелигенција не треба да дава директен факт одговор, туку треба да го насочи истражувачот кон изворот. Затоа што директниот фактички одговор даден од вештачката интелигенција може да биде фабрикуван и истражувачот да го погреши за изворот. Наместо да се каже „Одговорот е ова“, треба да пишува „Погледнете ги овие документи во оваа збирка“.

12. Кои операции се прифатливи и непристојни при обработка на оштетена слика на документ со вештачка интелигенција?

  • А) Сите видови операции се бесплатни, вклучително и пополнување на деловите што недостасуваат.
  • Б) Не треба да се презема ништо, сликата никогаш не треба да се допира
  • В) Пополнувањето на деловите што недостасуваат е највредното дејство бидејќи го комплетира документот.
  • Г) Прифатливи се манипулациите со читливост како контраст/шум; Незгодно е да се пополнат деловите што недостасуваат со претпоставки ✔

Објаснување: Процесите кои ја подобруваат читливоста (контраст, осветлување, намалување на шумот) се прифатливи бидејќи не ја менуваат содржината; Меѓутоа, пополнувањето на делови што недостасуваат/нечитливи со претпоставки е ризик да се произведе она што го нема во документот, односно историски фалсификат. Оригиналот е зачуван, трансакциите се евидентираат.

13. Што треба да се направи пред да се обработи архивски документ кој содржи чувствителни лични податоци?

  • А) Скенирање на приватноста и анонимизација доколку е потребно или со користење на затворена/одобрена алатка ✔
  • Б) Поставување на документот директно на јавно возило без воопшто да размислувате за тоа
  • В) Игнорирање на загриженоста за приватноста заради ефикасност
  • Г) Надминување на ограничувањата за пристап од причини за ефикасност

Обелоденување: Поставувањето документи што содржат чувствителни податоци кои ги идентификуваат живите лица (здравје, религија, етничка припадност, адреса) на јавни алатки засновани на облак може да биде сериозно нарушување на приватноста. Прво треба да се направи проверка на приватноста, доколку е потребно треба да се користи анонимизација или затворена/одобрена алатка.

14. Која е главната цел на човечки контролен пункт во архивски проект од крај до крај?

  • А) Забавување на работата на вештачката интелигенција и одложување на проектот
  • Б) За да се спречи грешката (неточен датум/име) во една фаза да се поврзе со сите наредни фази ✔
  • В) Зголемување на човечкиот труд и целосно откажување од автоматизацијата
  • Г) Обезбедување дека вештачката интелигенција го има последниот збор

Опис: Човечка контролна точка во секоја фаза гарантира дека излезот на вештачката интелигенција е потврден пред да се префрли на следната фаза. Без ова, грешка во првата фаза (погрешно прочитан датум) би се проширила низ ланецот низ каталогот, шемата и водичот. Раната проверка осигурува дека грешката е исправена на едно место.

15. Што бараат транспарентноста и автентичноста при користењето на вештачката интелигенција во хуманистичките и општествените науки?

  • А) Чување во тајност на употребата на вештачка интелигенција, осигурувајќи дека никој не знае
  • Б) Да го претстави секој текст произведен од вештачката интелигенција како своја оригинална идеја
  • В) Искрено да се изјасни за употребата на вештачката интелигенција и да не го прикажува нејзиниот резултат како сопствено оригинално дело ✔
  • Г) Споделување само на резултатите без објаснување на методите

Опис: Транспарентноста вклучува снимање дека транскрипција, метаподатоци или превод се произведени со помош на вештачка интелигенција; Оригиналноста бара да не се презентира коментар произведен од вештачката интелигенција како сопствена оригинална идеја. Ова е од суштинско значење за верификација од страна на следните истражувачи и за академски интегритет.