Единица 2 / 11

Вештачка интелигенција во каталогизација и генерирање метаподатоци

Добивки:

  • Способност да се скрати времето на каталогизација со производство на нацрт метаподатоци во согласност со стандардите како MARC и Dublin Core од вистински информации за отпечатоци
  • Способност да се потврдат полињата со висок ризик од изработка, како што се годината на објавување, ISBN, име на авторот, со оригиналниот извор и термините за тема на мапа од контролираниот речник
  • Способност да се направат формати на авторот и предметот еднократно одобрени со авторитетна контрола и одржување на конзистентноста на каталогот

Каталогизацијата е невидливата, но најфундаменталната работа на библиотекарството. Откривањето на ресурс (книга, статија, мапа, звучна снимка, дигитална датотека) е можно со точни метаподатоци. Метаподатоци значи „податоци за податоци“: структурирани информации што го опишуваат насловот на ресурсот, авторот, годината на објавување, предметот, јазикот и физичките атрибути. Ако метаподатоците се добри, корисникот го наоѓа ресурсот; Ако е лош или нецелосен, ресурсот се губи дури и да постои. Во оваа единица ќе научите како да користите вештачка интелигенција при генерирање на нацрт метаподатоци, но како да обезбедите усогласеност и точност на стандардите.

Ајде прво да ги дефинираме двата концепта. MARC (Machine-Readable Cataloging) е формат на запис што библиотеките го користеле со децении и кој секоја информација ја става во нумерирани полиња; На пример, полето 245 го содржи насловот, а полето 100 го содржи главниот автор. Dublin Core е поедноставен стандард за метаподатоци за дигитални ресурси, кој се состои од 15 основни полиња (наслов, креатор, тема, датум, жанр итн.). Овие стандарди обезбедуваат дека записите од различни библиотеки можат да разговараат едни со други.

Чекор по чекор: генерирање нацрт метаподатоци со вештачка интелигенција

1. Соберете ги информациите за идентитетот на изворот. Корицата на книгата, насловната страница, содржината или текстот на дигитална датотека. ВИ работи само од информациите што и ги давате; Ако обезбедите нецелосни информации, тие произведуваат нецелосни или измислени метаподатоци.

2. Наведете го целниот стандард. Дајте ѝ на вештачката интелигенција јасна цел, како што е „по полиња на јадрото на Даблин“ или „по полиња MARC 245, 100, 260, 650“. Ако не наведете стандард, тој произведува произволен формат.

3. Направете нацрт. Вештачката интелигенција го подготвува насловот, изјавата за одговорност, информациите за публикацијата и предлогот за тема од информациите што ги давате.

4. Спроведување на контрола на власта. Авторитетен запис е оној што ја утврдува единствената, стандардна форма на име, институција или тема на авторот (на пр., „Ататурк, Мустафа Кемал, 1881-1938“). ВИ може да напише име на различни начини; Вие го проверувате и коригирате одобрениот формат на авторитет.

5. Потврдете и потврдете. Споредете го секое поле со оригиналниот извор. Особено, прецизни информации како што се годината на објавување, ISBN и името на авторот се многу подложни на фалсификување од вештачка интелигенција.

Совет: дајте му на вештачката интелигенција фотографија или текст од вистинската кредитна страница на изворот; Не кажувајте „погодете го името на книгата“. Предвидувачките метаподатоци ја поткопуваат веродостојноста на каталогот. Вештачката интелигенција пишува самоуверено кога прави предвидувања и тоа ќе ве доведе во заблуда.

Контролиран речник и конзистентност

Доследноста е сè во каталогизирањето. Ако истата тема е напишана со два различни поими во два различни записи, корисникот ќе го најде едниот, а другиот ќе го пропушти. Затоа библиотеките користат контролиран речник - одобрена, стандардна листа на термини. Кога сугерира термини од слободен текст, вештачката интелигенција може да го избере својот разговорен еквивалент наместо официјалниот термин во оваа листа. На пример, вештачката интелигенција може да напише „срцев удар“; при што одобрениот термин може да биде „миокарден инфаркт“.

Решението е да и се даде на вештачката интелигенција контролиран речник и да се каже „само изберете од оваа листа“. Така, наместо слободно да составува термини, вештачката интелигенција одговара на најсоодветниот од одобрената листа.

Внимание: Ако предметниот термин предложен од вештачката интелигенција не е во контролираниот речник, не додавајте го тој термин во каталогот. Одлуката за додавање нови услови е на експертот одговорен за управување со органот; Додавањето произволни термини ја нарушува доследноста на каталогот.

три мини футроли

Случај 1 - Забрзано собирање донации. Народна библиотека доби донација од 1.200 книги. Специјалистот за каталогизација побара од вештачката интелигенција да ја прочита страницата со отпечаток од секоја книга и да изработи нацрт од јадрото на Даблин; Времето по снимање се намали од 9 минути на 3,5 минути. Експертот го посвети преостанатото време на проверка и верификација на авторитет; Вкупното време беше намалено за приближно 55%, но ниедна запис не влезе во системот без да биде потврдена.

Случај 2 — Фатен лажен ISBN. Експерт побарал вештачката интелигенција да подготви нацрти од 30 книги. При проверката, тој открил дека ISBN во 4 записи е лажен: АИ напишал 13-цифрен број кој изгледа разумен, иако не го знаел вистинскиот број на книгата. Чекорот на верификација спречи четири неточни ISBN да станат упорни во каталогот.

Случај 3 - Поправена е недоследноста на авторитетот. Една библиотека најде автор како „Џ. Смит“ во некои записи, „Џон Смит“ во други, „Смит, Џон“ во други. Вештачката интелигенција беше усогласена со датотеката со авторитет, доведувајќи ги сите записи во единствен одобрен формат ("Smith, John, 1965-"); Ако оваа работа се работеше рачно, ќе траеше неколку дена, но со предлогот за вештачка интелигенција, таа беше намалена на неколку часа, но секој натпревар беше одобрен од експертот.

Ретроспективна конверзија и стари записи

Многу библиотеки имаат нецелосни или застарени записи кои биле внесени пред години со различни правила. Преместувањето на овие на сегашниот стандард се нарекува ретроспективна конверзија и е многу макотрпно кога се прави рачно. Вештачката интелигенција може да прочита стар запис и да генерира нацрт за да ја премести во тековната структура на поле: на пример, може да анализира цитат од слободен текст и да го дистрибуира до правилните полиња. Сепак, тука има две опасности. Прво, вештачката интелигенција може да ги надополни информациите што недостасуваат за да ги „направи“; второ, може да овековечи грешка во стариот запис со тоа што ќе го копира во нов формат наместо да го коригира. Затоа, при ретроспективна трансформација, излезот на ВИ треба да се проверува систематски, не со земање примероци, туку со критични полиња (автор, година, идентификациски броеви). Добра практика е да се прикажуваат записите пред и по конверзијата рамо до рамо, правејќи ја секоја промена видлива; за да може експертот на прв поглед да види што е поместено, што се сменило и што можеби е измислено.

Внимание: нацрт-метаподатоците произведени од вештачката интелигенција не треба да се пренесуваат во системот како серија без да се прегледуваат еден по еден. Масовната грешка расипува стотици записи одеднаш, а преземањето е многу попроблематично отколку производството. Најбезбедно е да се произведе и да се потврди во мали серии.

Четири шаблони за копирање

1) Преглед на јадрото на Даблин:

Вашата улога: помошник каталог. Пополнете ги полињата Dublin Core од следниот текст: Наслов, Создател, Предмет, Опис, Издавач, Датум, Жанр, Формат, Јазик. Користете само информации што се јасни во текстот; Оставете го полето што недостасува „[нема информации]“, не погодувајте. Отпечатете го текстот: [тука]

2) преглед на полето MARC:

Предложете контури за следните полиња MARC од информациите за книгата подолу: 245 (наслов/заслуга), 100 (главен автор), 260/264 (публикација), 300 (физички опис), 650 (предмет). Обележете го секое поле за кое не сте сигурни како „[потребна е потврда]“. Информации: [тука]

3) Поклопување на теми од контролиран речник:

Подолу е резиме на изворот и листа на одобрени термини за тема. Поврзете ги само 3-5 најпогодни термини од списокот со изворот. Ако нема соодветен термин во списокот, напишете „нема соодветен термин во списокот“, не измислувајте нови поими. Резиме: [тука] / Список на термини: [тука]

4) Контрола на формата на овластување:

Поврзете ги имињата на авторите подолу со одобрените обрасци во списокот со авторитети што го дадов. За секое име: формат во запис -> одобрен формат. Ако нема еквивалент во списокот, напишете „нема авторитет запис“. Имиња: [тука] / Список на органи: [тука]

Слаб промпт / Силен промпт

Слаба навестување:

Извлечете ги информациите за каталогизација за следната книга: „Вештачка интелигенција и општество“.

Даден е само насловот; ВИ е принудена да ги сочинува авторот, годината, издавачот и ISBN. Не постои целен стандард. Резултат: убедлив, но веројатно лажен запис.

Моќен потсетник:

Вашата улога: помошник каталог. Подолу е целосниот текст на страницата со отпечаток на книгата. Пополнете ги полињата Dublin Core од ова. Користете само информации што се јасно наведени во текстот; Оставете го полето без текст празно и напишете „[нема информација]“. Не се измислени датуми, имиња или ISBN. Отпечатете го текстот: [целосниот текст овде]

Моќното известување ја ограничува вештачката интелигенција на реални информации и ја принудува искрено да остави празни места наместо да ги измислува.

Поле за метаподатоци и табела за валидација

област

Ризик од изработка

Како да се потврди

Наслов

низок

Споредете со отпечаток страница

Формат на автор/авторитет

средно

Пребарајте во датотека со авторитет

Година на објавување

високо

Потврдете со отпечаток/колофон

ISBN

многу високо

Контрола еден-на-еден со баркод/извор

Термин на предметот

високо

Поврзете се во контролираниот речник

Вообичаени грешки

  • Само барам метаподатоци од насловот. Нецелосните информации ја поттикнуваат вештачката интелигенција да ги измисли работите.
  • Не наведувајќи го целниот стандард. Произволното форматирање ја нарушува хармонијата на записите.
  • Прифаќање на ISBN и година без да се потврди. Овие области носат најголем ризик од изработка.
  • Преземање на предметниот термин надвор од контролираниот вокабулар. Конзистентноста и достапноста се загрозени.
  • Заобиколувајќи ја контролата на власта. Истиот автор се распрснува во различни формати, корисникот го промашува изворот.

Сумирано

Во генерирањето метаподатоци, вештачката интелигенција е моќен асистент кој брзо извлекува информации за отпечатоците и значително го скратува времето на каталогизација. Но, цената на продуктивноста е строга валидација наспроти ризиците од изработка: направете јасен целниот стандард (MARC, Dublin Core), активирајте ја вештачката интелигенција само со вистинско знаење за зборовите, мапирајте ги термините за теми од контролирани речник и потврдете ги формуларите за авторитет. Наместо да ги надополнува празнините, вештачката интелигенција искрено треба да ја остави празна; Вие го задржувате конечното одобрение.

Задача за апликација

Со шаблонот „Dublin Core draft“ дајте го текстот на страницата за отпечаток на вистинска книга што ја имате на вештачката интелигенција и добијте нацрт. Потоа, дали истата книга е изготвена само со наслов („Слаба порака“) и споредете ги двата излеза: кои полиња се направени? Потоа, со шаблонот „Мапирање тема од контролиран речник“, дајте краток список на одобрени термини за да се совпадне темата и проверете дали вештачката интелигенција излегува од списокот.

листа за проверка

  • [ ] Ви ги дадов вистинските информации за идентитетот на изворот на вештачката интелигенција, не оставив на погодување.
  • [ ] Јасно го специфицирав целниот стандард за метаподатоци (MARC/Dublin Core).
  • [ ] Ја потврдив годината на објавување и ISBN дословно со оригиналниот извор.
  • [ ] Ги мапирав термините на темата од контролираниот речник.
  • [ ] Ги потврдив формите на овластување со одобрениот запис.