Jednotka 4 / 11

Systémy sémantického vyhledávání a zjišťování

zisky:

  • Být schopen porozumět tomu, jak sémantické vyhledávání najde relevantní zdroje, které vyhledávání klíčových slov postrádá, s jeho blízkostí ve významu, a být schopen používat obě metody společně na místě.
  • Schopnost kriticky vyhodnotit souhrny vyhledávacích systémů podporované umělou inteligencí podle toho, zda jsou založeny na zdroji nebo ne, a potvrdit je se zdrojem.
  • Schopnost objasnit nejasnou otázku uživatele a rozlišit „zdánlivě relevantní“ výsledky z hlediska spolehlivosti

Uživatel hledá v katalogu „problémy se spánkem u dětí“, ale hlavní související zdroj má název „Pediatrické poruchy spánku“. Klasické vyhledávání nemusí tento zdroj vůbec zobrazit, protože se přesně shoduje se slovy. Zde vstupuje do hry sémantické vyhledávání: je to forma vyhledávání, která odpovídá významu slov, nikoli jejich pravopisu. V této jednotce se dozvíte, jak fungují systémy sémantického vyhledávání a objevování založené na umělé inteligenci, co přinášejí knihovníkovi a jaká úskalí s sebou nesou.

Pojďme si definovat základní pojem. Základem sémantického vyhledávání je vkládání: technika transformace významu textu na vektor čísel (typ významové souřadnice). Významově blízké texty jsou v tomto číselném prostoru blízko sebe. Ačkoli jsou tedy „problém se spánkem“ a „porucha spánku“ různá slova, nacházejí se blízko sebe a hledání jednoho najde i druhé. To je síla zachycení relevantních zdrojů, které vyhledávání klíčových slov míjí.

Krok za krokem: porozumění a použití sémantického vyhledávání

1. Pochopte skutečný záměr uživatele. Sémantické vyhledávání se snaží zachytit, co má uživatel na mysli. Vaším úkolem jako knihovníka je objasnit uživatelovu nejasnou otázku a poskytnout správný vstup do vyhledávacího systému.

2. Používejte klíčová slova a sémantické vyhledávání společně. Sémantické vyhledávání najde zdroje se souvisejícími, ale odlišnými slovy; Vyhledávání podle klíčových slov je spolehlivější, když hledáte přesný výraz, jméno nebo kód (jméno autora, číslo zákona). Dobrý knihovník používá obojí.

3. Kriticky zhodnoťte výsledky. Sémantické vyhledávání vrací výsledky, které „se zdají relevantní“; Ale vypadat relevantní neznamená být přesný nebo důvěryhodný. Hodnotíte zdroj a aktuálnost výsledků.

4. Naučte uživatelskou strategii vyhledávání. Systémy vyhledávání jsou výkonné, ale uživatelé často vyhledávají pomocí jednotlivých slov. Jedním z úkolů knihovníka je naučit uživatele lépe vyhledávat.

Tip: Sémantické vyhledávání může být slabší než vyhledávání podle klíčových slov/domény, pokud hledáte velmi přesné informace (konkrétní ISBN, celý název, všechna díla autora); protože to mate jiné výsledky, které jsou „významově blízké“. Použijte vyhledávání na základě domény pro přesné informace a sémantické vyhledávání pro objevování a procházení témat.

Discovery systems a souhrny poháněné umělou inteligencí

Moderní vyhledávací systémy již neposkytují pouze seznamy výsledků; Některé vytvářejí přímou souhrnnou odpověď na otázku s AI. Toto je silný, ale riskantní trend. Je užitečné, pokud systém vytváří souhrny založené na skutečných zdrojích v kolekci a s uvedením zdroje. Pokud však systém generuje odpověď ze své vlastní obecné paměti bez uvedení zdroje, nese to riziko halucinací a může uživatele dezinformovat.

Úlohou knihovníka je sdělit uživateli, zda takové souhrny vycházejí ze zdroje či nikoli. Základem informační gramotnosti je zpráva „Souhrn poskytnutý systémem je začátek; přejděte k původnímu zdroji a ověřte si tam“.

Upozornění: I když souhrn objevů založený na AI uvádí zdroj, nepředpokládejte, že citovaný zdroj skutečně podporuje tyto informace. Někdy systém zobrazí správný zdroj, ale vrátí nesprávné shrnutí. Pro kritická použití otevřete a zkontrolujte příslušnou část zdroje společně s uživatelem.

tři mini pouzdra

Případ 1 – Nalezen zdroj úniku. Jeden výzkumník hledal zdroje na „městském tepelném ostrově“, ale název nejlepší studie ve sbírce byl „tepelný komfort ve městech“. Hledání podle klíčových slov toto minulo; sémantické vyhledávání jej vrátilo mezi pět nejlepších výsledků díky jeho sémantické blízkosti. Badatel se dostal ke zdroji, který by jinak neviděl.

Případ 2 – Zavádějící „zájem“. Jeden uživatel hledal „ekonomické příčiny francouzské revoluce“. Sémantické vyhledávání také zařadilo několik zdrojů obecně na téma „revoluce a ekonomie“, ale nesouvisejících s francouzskou revolucí. Knihovník si uvědomil, že tyto „zdánlivě relevantní“ výsledky ve skutečnosti neodpovídají tématu a nasměroval uživatele ke správným zdrojům.

Případ 3 – Souhrnné ověření. Discovery system poskytl souhrn AI na otázku a citoval dva zdroje. Knihovník otevřel zdroje: jeden podpořil shrnutí, druhý řekl opak toho, co shrnuje. Systém nesprávně interpretoval zdroj. Knihovník ukázal patronovi správný zdroj a skutečný nález.

Pořadí, viditelnost a férovost

Který zdroj se v důsledku hledání objeví nahoře a který dole, není nevinná technická záležitost; Drtivá většina uživatelů se dívá pouze na prvních pár výsledků. Pořadí tedy určuje, jaké informace jsou skutečně vidět. Hodnocení založené na umělé inteligenci vypočítává svou metriku „relevance“ na základě vzorců, které se naučila, a tyto vzorce mohou mít tendenci zvýraznit zdroje, které jsou populární, vysoce citované nebo v určitých jazycích. V důsledku toho mohou cenné, ale málo známé zdroje v nových nebo jiných jazycích zůstat neviditelné. Úkolem knihovníka je vědět, že pořadí není neutrální fakt a naučit uživatele dívat se za počáteční výsledky, zkoušet různé hledané výrazy a zpochybňovat pořadí výsledků. „Tři nejlepší zdroje“ by nikdy neměly být ztotožňovány s „třemi nejlepšími zdroji“, zejména u výzkumné otázky. Zjištění vyžaduje proniknout hlouběji do seznamu.

Tip: Když učíte uživatele hledat, ukažte jim, jak hledat stejné téma pomocí dvou až tří různých sad výrazů. Různé výrazy vracejí různé pořadí výsledků; Tím se prolomí slepá skvrna vytvořená jediným vyhledáváním a otevře se bohatší fond zdrojů.

Čtyři kopírovatelné šablony

1) Rozšíření vyhledávacích dotazů:

Obohaťte téma vyhledávání níže o sémantické vyhledávání a vyhledávání klíčových slov. Uveďte synonyma, související termíny a možné formální/technické ekvivalenty. Navrhujte pouze výrazy, které jsou skutečně relevantní k tématu. Předmět: [zde]

2) Upřesnění dotazu uživatele:

Navrhněte 3 vysvětlující otázky, které bych měl položit, abych objasnil následující vágní uživatelskou otázku (jako je rozsah, období, žánr, jazyk). Nepředpokládejte záměr uživatele, předkládejte možnosti. Otázka: [zde]

3) Hodnocení relevance výsledku:

Níže je téma hledání a vrácené názvy/souhrny výsledků. Ohodnoťte, jak relevantní jsou jednotlivé výsledky pro dané téma, jako „vysoké/střední/nízké“ a uveďte odůvodnění jednou větou. Stačí se spolehnout na uvedený text. Téma: [zde] / Výsledky: [zde]

4) Kontrola konzistence zdroje souhrnu:

Níže je uveden souhrn a zdrojový text, o který se tvrdí, že je založen. Je každé tvrzení v souhrnu skutečně přítomno ve zdrojovém textu? Označte položku podle položky "podporováno / nepodporováno / částečně". Shrnutí: [zde] / Zdroj: [zde]

Slabá výzva / Silná výzva

Slabá výzva:

Uveďte mi nejlepší zdroje na toto téma.

Umělá inteligence neví, ze které sbírky, podle jakých kritérií, vybrat ze skutečně existujících zdrojů; může ze své obecné paměti vytvořit vymyšlený seznam „nejlepších“.

Výkonná výzva:

Vaše role: skautský asistent. Níže je hledané téma a 15 aktuálních výsledků (název + abstrakt) vrácených ze skautského systému. Uveďte těchto 15 výsledků podle jejich relevance k tématu a každý z nich zdůvodněte jednou větou. Přidání nového zdroje do seznamu, jeho vytvoření. Téma: [zde] / Výsledky: [zde]

Výkonná výzva omezuje AI na skutečnou sadu výsledků a nutí ji vyhodnotit; Zabraňuje výrobě a získávání z obecné paměti.

Srovnávací tabulka typů vyhledávání

Stav

nejlepší metoda

Proč?

Přesný název/ISBN/autor

Pole/klíčové slovo

Jednotné párování je spolehlivé

Průzkum tématu, různé termíny

Sémantické vyhledávání

Zachycuje blízkost významu

Aktuální událost/podstatné jméno

klíčové slovo + datum

Přesnost a včasnost

Související, ale jiný zdroj názvu

Sémantické vyhledávání

najde synonymum

Časté chyby

  • Použití sémantického vyhledávání pro přesné informace. Vyhledávání domény podle ISBN nebo celého názvu je spolehlivější.
  • Za předpokladu, že „co se zdá relevantní“ je pravda. Významová blízkost není zárukou spolehlivosti nebo přesnosti.
  • Poskytování souhrnu AI bez pohledu na zdroj. Souhrn mohl nesprávně interpretovat zdroj.
  • Neobjasnění nejasné otázky uživatele. Špatné zadání přináší špatný výsledek.
  • Použití pouze jedné metody. Nejlepší je používat sémantické a klíčové vyhledávání společně.

V souhrnu

Systémy sémantického vyhledávání a zjišťování nalézají relevantní zdroje, které vyhledávání klíčových slov postrádá, tím, že odpovídají významu, nikoli slovu, a posilují zjišťování. Souhrny poháněné umělou inteligencí poskytují pohodlí, ale nesou riziko halucinací a chybné interpretace zdroje. Práce knihovníka; Společné používání sémantického vyhledávání a vyhledávání klíčových slov, kritické vyhodnocování toho, co se „zdá relevantní“, ověřování souhrnů umělé inteligence se zdrojem a učení uživatele ověřovacímu návyku vyhledávání založenému na zdroji.

Aplikační úkol

Vyberte téma a provádějte vyhledávání klíčových slov i sémantiky (pokud je to možné); porovnejte dvě sady výsledků: jaké další zdroje sémantické vyhledávání našlo, jaké nesouvisející výsledky smíchalo? Vygenerujte souhrn s umělou inteligencí (nebo si vezměte vzorový souhrn) a pomocí šablony „Kontrola konzistence zdroje souhrnu“ zkontrolujte, zda se nároky v souhrnu skutečně vyskytují ve zdroji.

kontrolní seznam

  • [ ] Použil jsem doménu/klíčové slovo pro přesné informace a sémantické vyhledávání pro objev.
  • [ ] Objasnil jsem nejasnou otázku uživatele.
  • [ ] Výsledky, které se „zdály jako relevantní“, jsem vyhodnotil z hlediska spolehlivosti.
  • [ ] Ověřil jsem souhrny AI s původním zdrojem.
  • [ ] Vysvětlil jsem zvyk vyhledávání uživatele na základě zdroje.