Единица 3 / 11

Анализа на теми, класификација и автоматско индексирање

Добивки:

  • Способност да се извлече извадок од темата од вистинската содржина и да се мапираат примарните и секундарните теми од одобрениот список со теми
  • Да се биде во можност да ја прифати главната класа на предлози за класификација како што е Диви и да ги потврди поднивоата со официјалната табела.
  • Способност да се разбере осудувачката и репрезентативната природа на класификацијата и да се проверат предлозите во однос на застарените и исклучувачките термини.

Утврдувањето за што е „за“ ресурсот е една од најосудувачките задачи на библиотекарството. Ова се нарекува анализа на темата: читање на содржината на документот и нејзино усогласување со точните наслови на темата и точниот број на класификација. Ако корисникот може да најде поврзани книги рамо до рамо на полицата или да добие точни резултати кога бара тема во каталогот, има добра анализа на темата зад неа. Во оваа единица, ќе научите како да користите вештачка интелигенција во препорака за теми, класификација и автоматско индексирање; но ќе научите зошто човекот треба да ја донесе конечната одлука за предметот.

Ајде да дефинираме неколку концепти. Системот за класификација е систем кој ги нумерира изворите според нивниот предмет; најчести се Девејската класификација (DDC) и Класификацијата на Конгресната библиотека (LCC). На пример, кај Дјуи, 500 означува природни науки, 900 означува историја и географија. Индексирањето е задача да се назначат клучните термини на документот што го прави да се најде. Автоматското индексирање е кога софтверот ја предлага оваа работа. ВИ дава предлози за сите три задачи, но експертот го има последниот збор за секоја од нив.

Чекор по чекор: анализа на тема со вештачка интелигенција

1. Дајте ја суштината на документот на вештачката интелигенција. Целосен текст, апстракт, содржина или вовед. Анализата на темата се заснова на контекст; Ако на вештачката интелигенција му дадете само наслов, ќе добиете површна и погрешна препорака.

2. Побарајте резиме на содржината од вештачката интелигенција. Прво, „за што главно се работи овој документ? прашај. Ова ви помага брзо да разберете и покажува дали вештачката интелигенција правилно ја сфатила темата.

3. Поврзете се со контролирани теми. Дајте ѝ на вештачката интелигенција вашата листа на одобрени теми и кажете „предложете ги само најсоодветните теми од оваа листа“. Не дозволувајте да произведува бесплатна терминологија.

4. Предложете класификација број. Можете да ја прашате вештачката интелигенција „во која главна класа спаѓа овој документ во Дјуи? но не заборавајте да ги потврдите точните цифри на бројот со официјалната табела за класификација. ВИ може да произведе разумни, но неточни бројки.

5. Донесете ја одлуката и оправдајте ја. Прегледајте ги предлозите на вештачката интелигенција, изберете ги во светло на политиката на институцијата и базата на корисници и отфрлете ги кога е потребно. Конечната одлука за предметот и класификација го носат вашиот потпис.

Совет: Документот може да добие повеќе теми. Од АИ „која е примарна тема на овој документ, кои се неговите споредни теми? Прашај посебно. Правилниот избор на примарниот предмет осигурува дека ресурсот оди на вистинското место на полицата; секундарните теми даваат дополнителни точки за пристап во каталогот.

Судска природа на класификацијата

Класификацијата изгледа неутрална, но не е. Дали да ставите документ под „женски студии“ или „социологија“, или дури и под која географија ќе класифицирате историски настан, се одлуки кои вклучуваат перспектива. Системите за класификација ги носат претпоставките за одредени периоди и култури; Некои термини стануваат застарени или исклучувачки со текот на времето. Вештачката интелигенција ги наследува овие предрасуди буквално од податоците за кои е обучен и може дури и да ги зајакне.

Затоа, анализата на темата е прашање на проценка што не може да се остави на вештачката интелигенција. ВИ означува кои наслови се „веројатни“; Но, одлуката за тоа кој наслов најпрецизно и најправедно го претставува изворот му припаѓа на експертот кој ги знае вредностите на институцијата и нејзината корисничка база.

Внимание: Осигурете се дека темата предложена од вештачката интелигенција не го претставува погрешно или исклучува изворот. Споредете ги термините генерирани од вештачката интелигенција со актуелниот и инклузивен речник на институцијата, особено за чувствителни теми како што се идентитетот, етничката припадност, религијата и полот.

три мини футроли

Случај 1 - Предлог за масовна тема. Библиотеката би доделила теми на дигитална збирка од 800 статии. Експертот го дал резимето на секој напис на вештачката интелигенција и побарал совпаѓање од одобрениот список со наслови. Препораките за вештачка интелигенција правилно доловуваат во просек 2 од 3 подобни наслови по статија; експертот додаде трет и ги отстрани погрешните предлози. Работата беше завршена приближно 40% побрзо отколку ако се работеше целосно со рака.

Случај 2 - Неточен број за класификација. Експерт побарал број на Диви од вештачката интелигенција за книга со медицинска историја. YZ предложи „610 (Медицина)“; Сепак, книгата главно се однесуваше на историјата на медицината и точното место беше „610.9 (Историја на медицината)“. Експертот ја погледна официјалната табела на Дјуи и ја поправи; Вештачката интелигенција ја пронајде главната класа, но ја пропушти под-пауза.

Случај 3 - Фатен застарен термин. АИ предложи застарен и сега се смета за исклучен предмет за книга за социологија; бидејќи овој стар термин беше вообичаен во податоците за обуката. Експертот го избра точниот термин од тековниот инклузивен речник на институцијата. Ова беше конкретен пример дека вештачката интелигенција ја носи пристрасноста од минатото.

Длабочина и конзистентност: колку треба да биде специфично?

Вообичаена одлука во анализата на темата е нивото на специфичност на терминот што треба да се додели. Ако на изворот му дадете наслов кој е премногу општ („Датум“), корисникот што ја бара темата ќе се удави во стотици ирелевантни резултати. Ако дадете претесен наслов, корисникот кој бара поширок извор нема да може да го најде. Правилото е да се избере терминот што најконкретно, но целосно го покрива изворот: ако изворот се занимава само со архитектура од селџучкиот период, „селџуската архитектура“ а не „Архитектура“ е вистинското ниво. ВИ често ја пропушта оваа рамнотежа; Таа произведува предлози кои се или премногу општи или премногу дисперзирани. Затоа, неопходно е да се дадат јасни инструкции на вештачката интелигенција како „предложете ја најконкретната тема што ја покрива изворот и не додавајте подтеми што изворот всушност не ги допира“. Дополнително, постојаното означување на ресурсите на иста тема со текот на времето е исто толку важно за интегритетот на каталогот колку и специфичноста; Кажувањето „селџуска архитектура“ еден ден и „згради од селџучки период“ следниот ден го дели корисникот.

Совет: Кога давате повеќе наслови на ресурс, не непотребно ставајте поими кои се подмножества еден од друг. Давањето и „османлиска историја“ и „Историја“ ја прави втората непотребна; изберете ги најконкретните и вклучете само наслови кои навистина додаваат различен досег.

Четири шаблони за копирање

1) Извлекување тема:

Примарната тема на документот подолу напишете ја во една реченица, а споредните теми во 3 ставки. Додавање тема што ја нема во текстот, само врз основа на текстот. Документ/резиме: [тука]

2) Усогласување од одобреното заглавие:

Подолу е резиме на документи и листа на одобрени наслови на теми. Поврзете ги само 3-5 наслови од списокот кои се најсоодветни за документот, почнувајќи од најсоодветните. Напишете оправдување со една реченица за секој избор. Ако нема соодветен наслов во списокот, наведете го. Резиме: [тука] / Листа: [тука]

3) Предлог за мастер класа за класификација:

За следниот документ, предложете можна голема класа (3 цифри) во Децималната класификација на Dewey и објаснете зошто ја избравте. Означете ги долните цифри како „мора да се проверат од официјалната табела“, не давајте точни бројки. Документ: [тука]

4) Проверка на пристрасност и валута:

Дали има термини што може да бидат застарени, исклучувачки или еднострани меѓу предлозите за теми подолу? Ако е така, означете го и објаснете зошто може да биде проблематично. Предлози: [тука]

Слаб промпт / Силен промпт

Слаба навестување:

Наведете ги темите на оваа книга: „Трговијата во Отоманската Империја“.

Работејќи исклучиво од насловот, вештачката интелигенција прави општи термини без да го знае контекстот и го игнорира контролираниот речник. Резултат: неконзистентни, можеби неточни наслови.

Моќен потсетник:

Вашата улога: асистент аналитичар на тема. Подолу е воведот и содржината на книгата; Дадов и листа на одобрени теми. (1) Сумирајте ја основната тема на книгата во една реченица. (2) Поврзете ги само 3-5 најсоодветни наслови од списокот со образложението. (3) Не излегувајте од списокот, не измислувајте термини. Текст: [тука] /Одобрена листа: [тука]

Силниот поттик ја ограничува вештачката интелигенција на вистинска содржина и контролиран речник; ја одржува и точноста и конзистентноста.

Табела со задачи за анализа на тема

Потрага

Улогата на вештачката интелигенција

машка одлука

Резиме на содржина

брз нацрт

проверка на точноста

Предлог за наслов

Натпревар од списокот

Краен избор, оправдување

Класификација број

Предлог за мастер класа

Верификација на подподелба

Проверка на пристрасност

означување

Одлука за инклузивен термин

Вообичаени грешки

  • Само барам тема од насловот. Анализата на темата се заснова на контекст; Насловот е погрешен.
  • Прифаќање на класификацискиот број без негово потврдување. Иако вештачката интелигенција ја наоѓа главната класа, ја пропушта под-прекин.
  • Прескокнување на контролиран речник. Слободниот термин ја нарушува конзистентноста.
  • Игнорирање на предрасудите. ВИ може да ги пренесе застарените, исклучувачки услови од минатото.
  • Оставајќи ја одлуката целосно на АИ. Застапувањето и правдата бараат расудување; Одлуката е на личноста.

Сумирано

Во анализата и класификацијата на теми, вештачката интелигенција е брз асистент кој извлекува резиме на содржината, ги совпаѓа темите од одобрениот список и предлага мастер-клас за класификација. Но, анализата на предметот во суштина е прашање на проценка и претставување: на експертот е да одлучи кој наслов најпрецизно и најправедно го опишува изворот, точните цифри на класификацискиот број и валутата на термините. Вклучете ја вештачката интелигенција со вистинска содржина и контролиран речник, проверете ги класификациските броеви со официјалната табела и внимавајте на пристрасност.

Задача за апликација

Подгответе вовед во изворот што го имате и кратка листа на одобрени теми. Добијте предлози за вештачка интелигенција со шаблоните „Извлекување тема“ и „Одобрено појавување теми“. Потоа споредете ги предлозите со официјалната табела за класификација и тековниот речник на институцијата: колку предлози беа точни, колку коригиравте? Проверете ги препораките за застарени термини со шаблонот „Проверка на пристрасност и неодамнешност“.

листа за проверка

  • [ ] Анализата на темата ја направив од вистинската содржина, а не од насловот.
  • [ ] Ги мапирав насловите од контролираниот вокабулар.
  • [ ] Ги потврдив долните цифри од класификацискиот број со официјалната табела.
  • [ ] Ги проверив предлозите за застарени и исклучувачки услови.
  • [ ] Конечната одлука за предметот и класификацијата ја донесов по моја дискреција.