единица 4 / 12

Метаданни, каталогизиране и класификация

Печалби:

  • Възможност за създаване на чернови на метаданни в съответствие със стандарти като ISAD(G) или Dublin Core с изкуствен интелект
  • Възможност за предотвратяване на халюцинации и картографиране на предметни термини към контролиран речник с разрешение за оставяне празно
  • Възможност за разграничаване кои полета, като дата, име на лице и референтен код, изискват одобрение от човек и кои трябва да бъдат зададени само от институцията

Архив или библиотека, колкото и да е богата, не може да бъде намерена, освен ако не е добре дефинирана. Това, което прави един документ „откриваем“, е описателната информация за него: кой го е написал, кога, къде, какъв е неговият предмет, към коя колекция принадлежи. Тази информация се нарича метаданни (метаданни — описателни данни за документ; „данни за данни“). Каталогизирането е процес на идентифициране на документи с тези метаданни и запазването им в система с възможност за търсене. Класификацията е да се организират документи според критерии като предмет, вид или произход.

Генерирането на метаданни отнема много време; Въвеждането на информация за дата, предмет, лице и място поотделно за хиляди документи в големи колекции може да отнеме години. AI е силен генератор на проекти в този бизнес. В този модул ще видим как да генерираме метаданни с AI, каталогизиране в съответствие със стандартите (ISAD(G), Dublin Core), както и силата и клопките на автоматичната класификация.

Архивни стандарти: защо са необходими

Метаданните не се въвеждат на случаен принцип; Има международни стандарти, така че записите от различни институции да могат да общуват помежду си:

  • ISAD(G) (Общо международно стандартно архивно описание): Правила за йерархично описание на архивен материал (на ниво фонд, серия, файл, документ). Съдържа полета като референтен код, заглавие, дата, обхват, създател.
  • Дъблинско ядро: Общ стандарт, състоящ се от 15 основни полета за описание на цифрови ресурси (заглавие, създател, тема, дата, жанр, формат, източник, език и т.н.).
  • Фондове: Набор от записи, естествено образувани в резултат на дейностите на отделно лице, семейство или институция. Това е основната организационна единица на архивното дело.
  • Произход (произход): Информация за това от кого идва документът и през коя ръка е преминал. В архивирането документите се съхраняват заедно според техния произход.

Изричното уточняване на целевия стандарт, когато AI произвежда метаданни, гарантира, че изходът може да бъде въведен директно в предприятието.

Друга ключова концепция е авторитетен запис - запис, който дефинира единична, стандартна, одобрена форма на име на лице, място или институция. В исторически документи едно и също лице или място може да се появи с различен правопис; Контролният запис ги свързва всички в един одобрен формат, така че да не бъдат разпръснати при търсенето. AI предлага имена от документ; но картографирането на това име към стандартната форма в авторитетния запис е човешка работа. Свързването на това, което AI казва „Ахмед“ с „Ахмед бей (1840-1912)“ в авторитетния запис на институцията запазва последователността на каталога.

Работен процес: стъпка по стъпка

1. Подгответе източника. Съберете препис или изображение на документа и всяка контекстна информация.

2. Идентифицирайте стандарта и областите. Кажете на AI ​​кой стандарт (ISAD(G), Dublin Core) и според кои полета ще генерира изход.

3. Генерирайте чернова на метаданни. AI попълва полета, които могат да бъдат извлечени от документа (дата, лице, място, тема, език, жанр); Оставя празни областите, които не може да премахне.

4. Карта на контролиран речник. Имената на предмети и места не са безплатни в повечето институции, но са обвързани с предварително определен списък (контролиран речник/тезаурус). Картирайте предметните термини, предложени от AI ​​в този списък.

5. Проверете и потвърдете. Всяко поле, особено дата, име и тема, се сравнява от хората с документи и записи на авторитет.

Съвет: Изрично дайте разрешение на AI да „остави празно“. В противен случай ще „познае“ да попълни дата или създател, които не са в документа, и ще вмъкне фалшиви метаданни във вашия каталог. Инструкцията „Оставете това поле празно, ако не е в документа“ е най-силният щит срещу халюцинации.

Полета и ниво на доверие в таблица

Поле за метаданни

Колко надежден е AI?

проверка

език

високо

проба

Тип документ

средно-висока

контрол

Имена на лица/места

Средна (грешка при четене)

задължително

дата

Нисък-среден (риск от фабрикуване)

задължително

Предметни условия

Среден (безплатно генериране)

Карта към списък за проверка

Обхват/обобщение

средно-висока

Сравнете с източника

Референтен код

Няма (институцията дава)

човешки хвърляния

Резюме: AI е бърз и надежден в области като език и жанр; генерира чернови в полета като дата, име и тема, но се изисква одобрение от човек; AI никога не създава институционални полета като референтен код.

три мини калъфа

Случай 1 — Чернова на метаданни за 8000 снимки. Градски архив каталогизира 8000 исторически снимки. Бележките на гърба на всяка снимка бяха транскрибирани и предоставени на AI; AI генерира дата, местоположение и очертание на темата. Човешкият екип го провери поле по поле и го картографира към контролирания списък. Приблизителна 10-месечна работа беше намалена на 3 месеца; но всяка дата и име на място бяха визуално проверени.

Случай 2 — Измислена история. Един архивист накара AI да каталогизира писмо без дата. YZ разгледа съдържанието на писмото и написа точно датата "1912". В документа обаче нямаше дата; AI прогнозира. Ако архивистът не беше добавил инструкцията "оставете празно, ако не е в документа", каталогът щеше да бъде попълнен с измислена дата. Урок: празното разрешение е задължително.

Случай 3 — Термините със свободна тема създадоха объркване. AI присвои подобни, но различни безплатни термини като „имиграция“, „имиграция“, „заселване“ на подобни документи. Когато не беше съпоставено с контролирания речник, същата тема беше маркирана с три различни термина и разпръсната в търсенето. Последователността беше постигната чрез картографиране на термините в единен авторитетен списък. Урок: термините на темата не се публикуват, те са свързани към списъка.

Четири копируеми шаблона

1) Очертание на Dublin Core:

Извлечете черновата на метаданните на Dublin Core от транскрипцията на документа по-долу. Полета: Заглавие, Създател, Тема, Описание, Дата, Жанр, Език, Обхват (местоположение/период). Правила: (1) Използвайте само информация ЯСНО в текста. (2) Оставете полето, което не е в текста, ПРАЗНО, не гадайте. (3) Маркирайте стойността, в която не сте сигурни, с [?]. Транскрипция: [тук]

2) Проектоопределение на ISAD(G):

Генерирайте чернова за следния документ в полета ISAD(G): Заглавие, Дата(и), Ниво на описание (документ/файл), Обхват и съдържание (кратко резюме), Създател, Език. Оставете референтния код ПРАЗЕН (институцията ще го предостави). Не добавяйте информация, която не е в текста; Оставете несъществуващото поле празно. Документ: [тук]

3) Предложение за тематичен термин (контролирано):

Предложете 3-5 тематични термина, подходящи за документа по-долу. Първо, разчитайте на фактите В документа. По-долу е списъкът с контролирана терминология на нашата институция; ПЪРВО, изберете го от този списък, ако не е в списъка, маркирайте новото си предложение за термин отделно. Списък: [термини]. Документ: [тук]

4) Проверка на груповата консистенция:

По-долу са записите с метаданни за документи от същата колекция. Несъответствия във флаговете: записи, изписващи едно и също място/човек по различен начин, различни формати на дата, различни термини за една и съща тема. Корекция НАЛАГАНЕ; Просто изгответе списък с несъответствия, който човекът да прегледа. Записи: [тук]

Слаба подкана / Силна подкана

Слаб:

Създайте пълен каталожен запис за този документ.

„Пълната“ инструкция кара AI да запълни всяко пространство, т.е. да измисли история и създатели, които не съществуват.

Силен:

Дъблинското ядро е изготвено за този документ. Използвайте само информация, ЯСНО включена в транскрипцията; оставете несъществуващото поле празно, не гадайте. Изберете термини на тема от този контролиран списък: [списък]. Маркирайте датата и имената на лицата с [?], за да мога да го проверя с документа. Транскрипция: [тук]

Разлика: разрешение „оставете празно“ вместо „пълно“ издание, контролирано спазване на списъка и знаци за потвърждение защитават каталога от измисляне.

Често срещани грешки

  • Това означава "напълнете го напълно". Това води до напасване на несъществуващи полета; трябва да се даде разрешение „оставете празно“.
  • Освобождаване на предметни условия. Термините, които не съответстват на контролирания речник, ще разсейват търсенето.
  • Наличието на AI предсказване на историята. Въвеждането на измислена дата в документ без дата замърсява каталога.
  • Наличието на референтния код, генериран от AI. Това е корпоративно, уникално пространство; хората хвърлят.
  • Без уточняване на стандарта. Ако стандартът не е споменат, резултатът ще бъде разхвърляна чернова, която не може да бъде въведена в институцията.

В обобщение

Метаданните и каталогизирането са невидимата инфраструктура, която отваря архива за изследователя, а това изисква много усилия. От транскрипцията изкуственият интелект създава бързо очертание за полета като дата, лице, място, тема и жанр; Може да работи по стандарти като ISAD(G) или Dublin Core. Но натискът да се „запълни напълно“ тласка AI да измисля нещата; Разрешението „оставете празно“, картографирането към контролиран речник и човешко потвърждение на дати/имена поддържат каталога надежден. AI подготвя проекта; Вие носите отговорност за точността на каталога.

Задача за приложение

Вземете транскрипция на документ и поискайте метаданни от AI с шаблона „Dublin Core draft“; Проверете дали оставя празни полета, които не съществуват. След това изпълнете шаблона „предложение за термин на тема“ с вашия собствен (или примерен) контролен списък. И накрая, тествайте няколко записа с „масова проверка на последователност“. Обърнете внимание колко полета AI се опитва да попълни с прогноза и колко тематични термини трябва да бъдат картографирани в списъка.

контролен списък

  • [ ] Ясно посочих целевия стандарт (ISAD(G)/Dublin Core).
  • [ ] Дадох разрешение „Оставете празно поле празно“.
  • [ ] Съпоставих термините на темата към контролирания списък.
  • [ ] Проверих датата и имената на лицата с документа/авторитетния запис.
  • [ ] Оставих референтния код на институцията, а не на AI.