Единица 4 / 11

Системы семантического поиска и обнаружения

Прибыль:

  • Уметь понимать, как семантический поиск находит релевантные ресурсы, которые пропускает поиск по ключевым словам, с его близостью по смыслу, и иметь возможность использовать оба метода вместе на месте.
  • Способность критически оценивать сводки систем обнаружения, поддерживаемые искусственным интеллектом, в зависимости от того, основаны ли они на источнике или нет, и подтверждать их источником.
  • Способность прояснить неопределенный вопрос пользователя и отличить «кажущиеся релевантными» результаты с точки зрения надежности.

Пользователь ищет в каталоге «проблемы со сном у детей», но самый популярный ресурс называется «Нарушения сна у детей». Классический поиск может вообще не показывать этот источник, поскольку он точно соответствует словам. Здесь в игру вступает семантический поиск: это форма поиска, которая соответствует значению слов, а не их написанию. В этом модуле вы узнаете, как работают системы семантического поиска и обнаружения на основе искусственного интеллекта, что они приносят библиотекарю и какие подводные камни они таят в себе.

Давайте определимся с основным понятием. В основе семантического поиска лежит встраивание: техника преобразования смысла текста в вектор чисел (вид смысловой координаты). Близкие по смыслу тексты находятся рядом друг с другом в этом числовом пространстве. Таким образом, хотя «проблема сна» и «расстройство сна» — разные слова, они расположены близко друг к другу и поиск одного приведет и к другому. В этом заключается сила поиска релевантных ресурсов, которые упускаются из виду при поиске по ключевым словам.

Шаг за шагом: понимание и использование семантического поиска

1. Поймите истинные намерения пользователя. Семантический поиск пытается уловить то, что имеет в виду пользователь. Ваша задача как библиотекаря — прояснить неопределенный вопрос пользователя и дать правильный ввод в поисковую систему.

2. Используйте вместе ключевые слова и семантический поиск. Семантический поиск находит ресурсы со связанными, но разными словами; Поиск по ключевым словам более надежен при поиске точного термина, имени или кода (имя автора, номер закона). Хороший библиотекарь использует оба.

3. Критически оцените результаты. Семантический поиск возвращает результаты, которые «кажутся релевантными»; Но выглядеть релевантным не означает быть точным или заслуживающим доверия. Вы оцениваете источник и своевременность результатов.

4. Научите пользователей стратегии поиска. Системы обнаружения являются мощными инструментами, но пользователи часто выполняют поиск по отдельным словам. Одна из задач библиотекаря — научить пользователя лучше искать.

Совет: Семантический поиск может быть слабее, чем поиск по ключевому слову/домену, при поиске очень точной информации (конкретный ISBN, полное название, все работы автора); поскольку это сбивает с толку другие результаты, «близкие по смыслу». Используйте поиск по доменам для получения точной информации и семантический поиск для обнаружения и просмотра тем.

Системы обнаружения и сводки на основе искусственного интеллекта

Современные системы обнаружения больше не просто предоставляют списки результатов; Некоторые дают прямой краткий ответ на вопрос с помощью ИИ. Это мощная, но рискованная тенденция. Полезно, если система создает резюме на основе реальных источников в сборнике и со ссылкой на источник. Но если система генерирует ответ из собственной общей памяти, не ссылаясь на источник, это несет в себе риск возникновения галлюцинаций и может дезинформировать пользователя.

Роль библиотекаря состоит в том, чтобы сообщить пользователю, основаны ли такие сводки на источниках или нет. Сообщение «Резюме, выдаваемое системой, — это начало; обратитесь к первоисточнику и проверьте там» — основа информационной грамотности.

Внимание: даже если в резюме открытия, созданном на основе искусственного интеллекта, цитируется источник, не предполагайте, что цитируемый источник действительно поддерживает эту информацию. Иногда система показывает правильный источник, но возвращает неверное резюме. При критическом использовании откройте и проверьте соответствующий раздел ресурса вместе с пользователем.

три мини-кейса

Случай 1 — Обнаружен сбежавший источник. Один исследователь искал ресурсы на «городском острове тепла», но лучшим исследованием в коллекции было название «Тепловой комфорт в городах». Поиск по ключевым словам пропустил это; семантический поиск вернул его в пятерку лучших результатов благодаря семантической близости. Исследователь достиг источника, который иначе он бы не увидел.

Случай 2. Вводящий в заблуждение «интерес». Один пользователь искал «экономические причины Французской революции». Семантический поиск также ранжировал несколько источников, в основном посвященных теме «революции и экономики», но не связанных с Французской революцией. Библиотекарь понял, что эти «на первый взгляд релевантные» результаты на самом деле не соответствуют теме, и направил пользователя на правильные ресурсы.

Случай 3. Суммарная проверка. Система обнаружения предоставила краткое изложение вопроса с помощью ИИ и процитировала два источника. Библиотекарь открыла источники: один поддержал аннотацию, другой сказал противоположное тому, что было сказано в аннотации. Система неправильно интерпретировала ресурс. Библиотекарь показал посетителю правильный источник и фактическую находку.

Рейтинг, видимость и справедливость

Какой ресурс оказывается вверху, а какой внизу в результате поиска – это не невинная формальность; Подавляющее большинство пользователей смотрят только на первые несколько результатов. Таким образом, ранжирование определяет, какая информация на самом деле видна. Ранжирование на основе искусственного интеллекта рассчитывает показатель «релевантности» на основе изученных шаблонов, и эти шаблоны могут иметь тенденцию выделять популярные, высоко цитируемые источники или источники на определенных языках. В результате ценные, но малоизвестные ресурсы на новых или разных языках могут остаться невидимыми. Задача библиотекаря — знать, что порядок не является нейтральным фактом, и научить пользователя выходить за рамки первоначальных результатов, пробовать разные условия поиска и подвергать сомнению порядок результатов. «Три основных источника» никогда не следует отождествлять с «тремя ведущими источниками», особенно в вопросах исследования. Открытие требует более глубокого изучения списка.

Совет: обучая пользователя поиску, покажите ему, как искать одну и ту же тему, используя два-три разных набора терминов. Разные термины возвращают разные рейтинги результатов; Это устраняет слепое пятно, созданное одним поиском, и открывает более богатый пул ресурсов.

Четыре копируемых шаблона

1) Расширение поискового запроса:

Дополните тему поиска ниже семантическим поиском и поиском по ключевым словам. Перечислите синонимы, связанные термины и возможные формальные/технические эквиваленты. Предлагайте только те термины, которые действительно имеют отношение к теме. Тема: [здесь]

2) Уточняем вопрос пользователя:

Предложите 3 уточняющих вопроса, которые мне следует задать, чтобы прояснить следующий расплывчатый вопрос пользователя (например, объем, период, жанр, язык). Не предполагайте намерения пользователя, предлагайте варианты. Вопрос: [здесь]

3) Оценка актуальности результатов:

Ниже приведена тема поиска и возвращены заголовки/сводки результатов. Оцените, насколько каждый результат соответствует теме: «высокий/средний/низкий» и дайте обоснование в одном предложении. Просто опирайтесь на данный текст. Тема: [здесь] / Результаты: [здесь]

4) Проверка согласованности сводки и источника:

Ниже приводится краткое изложение и исходный текст, на котором оно, как утверждается, основано. Действительно ли каждое утверждение в резюме присутствует в исходном тексте? Отметьте пункт за пунктом «поддерживается/не поддерживается/частично». Резюме: [здесь] / Источник: [здесь]

Слабая подсказка / Сильная подсказка

Слабая подсказка:

Перечислите мне лучшие ресурсы по этой теме.

ИИ не знает, из какой коллекции, по каким критериям выбирать из реально существующих ресурсов; может составить список «лучшего» на основе своей общей памяти.

Мощная подсказка:

Ваша роль: помощник разведчика. Ниже представлена ​​тема поиска и 15 фактических результатов (заголовок + аннотация), полученных из скаутской системы. Перечислите эти 15 результатов в соответствии с их отношением к теме и дайте обоснование каждому из них в одном предложении. Добавление нового источника в список, его составление. Тема: [здесь] / Результаты: [здесь]

Мощная подсказка ограничивает ИИ реальным набором результатов и заставляет его оценивать; Это предотвращает изготовление и извлечение из общей памяти.

Сравнительная таблица типов поиска

Статус

лучший метод

Почему

Точное название/ISBN/автор

Поле/ключевое слово

Сопоставление «один к одному» надежно

Исследование темы, разные термины

Семантический поиск

Улавливает близость смысла

Текущее событие/существительное

ключевое слово + дата

Точность и своевременность

Родственный, но другой источник имени

Семантический поиск

находит синоним

Распространенные ошибки

  • Использование семантического поиска для точной информации. Поиск домена по ISBN или полному названию более надежен.
  • Предполагая, что «то, что кажется актуальным» является правдой. Близость смысла не является гарантией достоверности и точности.
  • Предоставление резюме AI, не глядя на источник. В резюме, возможно, неверно истолкован источник.
  • Не уточняет неясный вопрос пользователя. Неправильный ввод приводит к неправильному результату.
  • Использование только одного метода. Лучше всего использовать семантический поиск и поиск по ключевым словам вместе.

В заключение

Системы семантического поиска и обнаружения находят релевантные ресурсы, которые упускают из виду при поиске по ключевым словам, сопоставляя значение, а не слово, и усиливают обнаружение. Резюме, созданные на основе искусственного интеллекта, удобны, но несут в себе риск галлюцинаций и неправильного толкования источника. Работа библиотекаря; Совместное использование семантического поиска и поиска по ключевым словам, критическая оценка того, что «кажется релевантным», сверка сводок ИИ с источником и обучение пользователя привычке поиска на основе источника и подтверждения.

Задача приложения

Выберите тему и выполните поиск по ключевым словам и семантический поиск (если применимо); сравнить два набора результатов: какие дополнительные ресурсы нашел семантический поиск, какие несвязанные результаты перепутал? Создайте сводку на основе искусственного интеллекта (или возьмите образец сводки) и проверьте, действительно ли утверждения в сводке встречаются в источнике с помощью шаблона «Проверка согласованности сводки-источника».

контрольный список

  • [ ] Я использовал домен/ключевое слово для получения точной информации и семантического поиска.
  • [ ] Я уточнил неясный вопрос пользователя.
  • [ ] Я оценивал надежность результатов, которые «казались релевантными».
  • [ ] Я сверил сводки AI с первоисточником.
  • [ ] Я объяснил привычку пользователя выполнять поиск по источникам.