одиниця 4 / 11

Системи семантичного пошуку та виявлення

Прибуток:

  • Здатність зрозуміти, як семантичний пошук знаходить релевантні ресурси, які пропускає пошук за ключовими словами, з їх близькістю значення, і мати можливість використовувати обидва методи разом на місці.
  • Здатність критично оцінювати підсумки систем виявлення, що підтримуються ШІ, залежно від того, засновані вони на джерелі чи ні, і підтверджувати їх джерелом.
  • Можливість прояснити розпливчасте запитання користувача та відрізнити «здавалося б релевантні» результати з точки зору надійності

Користувач шукає в каталозі «проблеми зі сном у дітей», але найпопулярніший ресурс має назву «Розлади сну у дітей». Класичний пошук може взагалі не показувати це джерело, оскільки воно точно збігається зі словами. Ось тут і вступає в дію семантичний пошук: це форма пошуку, яка відповідає значенню слів, а не їхньому написанню. У цьому розділі ви дізнаєтесь, як працюють системи семантичного пошуку та виявлення на основі штучного інтелекту, що вони приносять бібліотекарю та які підводні камені несуть у собі.

Давайте визначимо основне поняття. В основі семантичного пошуку лежить вбудовування: техніка перетворення значення тексту у вектор чисел (тип координати значення). У цьому числовому просторі близькі один до одного тексти, близькі за змістом. Таким чином, хоча «проблема зі сном» і «розлад сну» є різними словами, вони розташовані близько один до одного, і пошук одного також знайде інший. Це сила вловлювати релевантні ресурси, які пропускає пошук за ключовими словами.

Крок за кроком: розуміння та використання семантичного пошуку

1. Зрозумійте справжні наміри користувача. Семантичний пошук намагається вловити те, що має на увазі користувач. Ваше завдання як бібліотекаря полягає в тому, щоб прояснити нечіткі запитання користувача та надати пошуковій системі правильні дані.

2. Використовуйте ключові слова та семантичний пошук разом. Семантичний пошук знаходить ресурси зі спорідненими, але різними словами; Пошук за ключовими словами більш надійний, якщо шукати точний термін, назву чи код (ім’я автора, номер закону). Хороший бібліотекар використовує обидва.

3. Критично оцінити результати. Семантичний пошук повертає результати, які «видаються релевантними»; Але виглядати релевантним не означає бути точним чи надійним. Ви оцінюєте джерело та своєчасність результатів.

4. Навчіть користувача стратегії пошуку. Системи виявлення є потужними, але користувачі часто шукають за одним словом. Одне із завдань бібліотекаря – навчити користувача краще шукати.

Порада: семантичний пошук може бути слабшим, ніж пошук за ключовим словом/доменом, якщо шукати дуже точну інформацію (конкретний ISBN, повна назва, усі твори автора); тому що це плутає інші результати, «близькі за значенням». Використовуйте пошук на основі домену для точної інформації та семантичний пошук для відкриття та перегляду тем.

Системи виявлення та резюме на основі ШІ

Сучасні системи виявлення більше не просто надають списки результатів; Деякі дають пряму коротку відповідь на запитання за допомогою ШІ. Це потужна, але ризикована тенденція. Це корисно, якщо система створює зведення на основі фактичних джерел у колекції та цитує джерело. Але якщо система генерує відповідь із власної загальної пам’яті без посилання на джерело, це створює ризик галюцинації та може дезінформувати користувача.

Роль бібліотекаря полягає в тому, щоб повідомити користувачеві, чи базуються такі зведення на джерелах чи ні. Повідомлення «Резюме, надане системою, — початок; перейдіть до першоджерела і перевірте там» — основа інформаційної грамотності.

Застереження: навіть якщо підсумок відкриття за допомогою штучного інтелекту цитує джерело, не припускайте, що цитоване джерело насправді підтверджує цю інформацію. Іноді система показує правильне джерело, але повертає неправильне резюме. Для критичного використання відкрийте та перевірте відповідний розділ ресурсу разом з користувачем.

три міні-чохла

Випадок 1 — знайдено вихідне джерело. Один дослідник шукав ресурси про «міський острів тепла», але назва найкращого дослідження в колекції була «тепловий комфорт у містах». Пошук за ключовими словами пропустив це; семантичний пошук повернув його серед п’яти найкращих результатів завдяки його семантичній близькості. Дослідник дістався до джерела, яке інакше б не побачив.

Випадок 2 — «інтерес», що вводить в оману. Один користувач шукав "економічні причини Французької революції". Семантичний пошук також ранжував кілька джерел загалом на тему «революція та економіка», але не пов’язані з Французькою революцією. Бібліотекар зрозумів, що ці «начебто релевантні» результати насправді не відповідають темі, і скерував користувача до правильних ресурсів.

Випадок 3 — підсумкова перевірка. Система виявлення надала резюме ШІ на запитання та цитувала два джерела. Бібліотекар відкрила джерела: один підтримав конспект, інший сказав протилежне тому, що в анотації. Система неправильно інтерпретувала ресурс. Бібліотекар показав патрону правильне джерело та справжню знахідку.

Рейтинг, видимість і справедливість

Який ресурс з’являється вгорі, а який внизу в результаті пошуку – це не невинна технічна деталь; Переважна більшість користувачів переглядають лише кілька перших результатів. Таким чином, ранжирування визначає, яку інформацію насправді бачать. Ранжування на основі штучного інтелекту розраховує свою метрику «релевантності» на основі шаблонів, які він вивчив, і ці шаблони можуть мати тенденцію висвітлювати джерела, які є популярними, часто цитованими або певними мовами. У результаті цінні, але маловідомі ресурси на нових або інших мовах можуть залишатися невидимими. Робота бібліотекаря полягає в тому, щоб знати, що порядок не є нейтральним фактом, і навчити користувача дивитися за межі початкових результатів, пробувати різні терміни пошуку та сумніватися в порядку результатів. «Три найкращих джерела» ніколи не слід ототожнювати з «трьома найкращими джерелами», особливо для дослідницького питання. Відкриття вимагає глибшого копання в списку.

Порада. Навчаючи користувача пошуку, покажіть йому, як шукати ту саму тему, використовуючи два-три різні набори термінів. Різні умови повертають різний рейтинг результатів; Це розриває сліпу пляму, створену одним пошуком, і відкриває багатший пул ресурсів.

Чотири шаблони, які можна копіювати

1) Розширення терміну пошуку:

Збагатіть тему пошуку нижче для семантичного пошуку та пошуку за ключовими словами. Перелічіть синоніми, пов’язані терміни та можливі формальні/технічні еквіваленти. Пропонуйте лише ті терміни, які справді відповідають темі. Тема: [тут]

2) Уточнення питання користувача:

Запропонуйте 3 уточнюючих запитання, які я маю поставити, щоб роз’яснити наступне невизначене запитання користувача (наприклад, обсяг, період, жанр, мова). Не припускайте намірів користувача, представляйте варіанти. Питання: [тут]

3) Оцінка релевантності результату:

Нижче наведено тему пошуку та отримані заголовки/резюме. Оцініть, наскільки кожен результат відповідає темі, як «високий/середній/низький» і дайте обґрунтування одним реченням. Просто спирайтеся на поданий текст. Тема: [тут] / Результати: [тут]

4) Перевірка узгодженості джерела:

Нижче наведено короткий виклад і вихідний текст, на якому, як стверджується, він базується. Чи кожне твердження в резюме насправді присутні у вихідному тексті? Позначте пункт за пунктом "підтримується / не підтримується / частково". Короткий зміст: [тут] / Джерело: [тут]

Слабка підказка / Сильна підказка

Слабка підказка:

Перелічіть мені найкращі ресурси на цю тему.

ШІ не знає, з якої колекції, за якими критеріями вибрати з реально існуючих ресурсів; може створити вигаданий список «найкращого» зі своєї загальної пам’яті.

Потужна підказка:

Ваша роль: помічник скаута. Нижче наведено тему пошуку та 15 фактичних результатів (заголовок + анотація), отриманих від скаутської системи. Перелічіть ці 15 результатів відповідно до їх відповідності темі та дайте обґрунтування одним реченням для кожного. Додавання нового джерела до списку, його формування. Тема: [тут] / Результати: [тут]

Потужна підказка обмежує ШІ реальним набором результатів і змушує його оцінювати; Це запобігає створенню та вилученню із загальної пам’яті.

Таблиця порівняння типів пошуку

Статус

найкращий метод

чому

Точна назва/ISBN/автор

Поле/ключове слово

Зіставлення один до одного є надійним

Дослідження теми, різні терміни

Семантичний пошук

Вловлює близькість значення

Поточна подія/іменник

ключове слово + дата

Точність і своєчасність

Пов’язане, але інше джерело назви

Семантичний пошук

знаходить синоніми

Поширені помилки

  • Використання семантичного пошуку для точної інформації. Пошук у домені за ISBN або повною назвою є більш надійним.
  • Припускаючи, що «те, що здається релевантним», є правдою. Близькість значення не є гарантією надійності чи точності.
  • Надання резюме AI, не дивлячись на джерело. Короткий зміст міг неправильно витлумачити джерело.
  • Не прояснюючи розпливчасте запитання користувача. Неправильний вхід приносить неправильний результат.
  • Використовуючи лише один метод. Найкраще використовувати семантичний пошук і пошук за ключовими словами разом.

Підсумовуючи

Системи семантичного пошуку та виявлення знаходять відповідні ресурси, які пропускає пошук за ключовими словами, збігаючи значення, а не слово, і покращують відкриття. Резюме на основі штучного інтелекту забезпечує зручність, але містить ризик галюцинації та неправильного тлумачення джерела. Робота бібліотекаря; Спільне використання семантичного пошуку та пошуку за ключовими словами, критична оцінка того, що «здається релевантним», перевірка підсумків штучного інтелекту за допомогою джерела та навчання користувача звичці пошуку на основі джерела.

Аплікаційне завдання

Виберіть тему та виконайте пошук за ключовими словами та семантичний пошук (якщо є); порівняти два набори результатів: які додаткові ресурси знайшов семантичний пошук, які непов’язані результати він змішав? Згенеруйте резюме за допомогою штучного інтелекту (або візьміть зразок резюме) і перевірте, чи справді твердження в резюме містяться в джерелі за допомогою шаблону «Перевірка узгодженості джерела».

контрольний список

  • [ ] Я використовував домен/ключове слово для точної інформації та семантичного пошуку для відкриття.
  • [ ] Я прояснив туманне запитання користувача.
  • [ ] Я оцінив результати, які «здавалися релевантними», щодо надійності.
  • [ ] Я перевірив резюме AI з першоджерелом.
  • [ ] Я пояснив звичку користувача шукати на основі джерел.