Jednotka 4 / 11

Systémy sémantického vyhľadávania a zisťovania

zisky:

  • Byť schopný porozumieť tomu, ako sémantické vyhľadávanie nachádza relevantné zdroje, ktoré pri vyhľadávaní kľúčových slov chýbajú, s ich blízkosťou vo význame, a byť schopný použiť obe metódy spolu na mieste.
  • Schopnosť kriticky vyhodnotiť súhrny systémov objavovania podporované AI podľa toho, či sú založené na zdroji alebo nie, a potvrdiť ich so zdrojom.
  • Schopnosť objasniť nejasnú otázku používateľa a rozlíšiť „zdanlivo relevantné“ výsledky z hľadiska spoľahlivosti

Používateľ hľadá v katalógu „problémy so spánkom u detí“, ale hlavný súvisiaci zdroj má názov „Porucha spánku u detí“. Klasické vyhľadávanie nemusí tento zdroj vôbec zobraziť, pretože sa presne zhoduje so slovami. Tu vstupuje do hry sémantické vyhľadávanie: je to forma vyhľadávania, ktorá zodpovedá významu slov, nie ich pravopisu. V tejto lekcii sa dozviete, ako fungujú systémy sémantického vyhľadávania a objavovania založené na umelej inteligencii, čo prinášajú knihovníkovi a aké úskalia prinášajú.

Definujme základný pojem. Základom sémantického vyhľadávania je vkladanie: technika transformácie významu textu na vektor čísel (typ významovej súradnice). Významovo blízke texty sú v tomto číselnom priestore blízko seba. Hoci sú teda „problém so spánkom“ a „porucha spánku“ rôzne slová, nachádzajú sa blízko seba a hľadanie jedného nájde aj druhé. Toto je sila zachytenia relevantných zdrojov, ktoré pri vyhľadávaní kľúčových slov chýbajú.

Krok za krokom: pochopenie a používanie sémantického vyhľadávania

1. Pochopte skutočný zámer používateľa. Sémantické vyhľadávanie sa snaží zachytiť, čo používateľ myslí. Vašou úlohou ako knihovníka je objasniť používateľovu nejasnú otázku a poskytnúť správny vstup do vyhľadávacieho systému.

2. Používajte kľúčové slová a sémantické vyhľadávanie spolu. Sémantické vyhľadávanie nájde zdroje so súvisiacimi, ale odlišnými slovami; Vyhľadávanie podľa kľúčových slov je spoľahlivejšie, keď hľadáte presný výraz, názov alebo kód (meno autora, číslo zákona). Dobrý knihovník používa oboje.

3. Kriticky zhodnoťte výsledky. Sémantické vyhľadávanie vráti výsledky, ktoré sa „zdajú relevantné“; Ale vyzerať relevantne neznamená byť presný alebo dôveryhodný. Hodnotíte zdroj a aktuálnosť výsledkov.

4. Naučte užívateľskú stratégiu vyhľadávania. Systémy vyhľadávania sú výkonné, ale používatelia často vyhľadávajú pomocou jednotlivých slov. Jednou z úloh knihovníka je naučiť používateľa lepšie vyhľadávať.

Tip: Pri hľadaní veľmi presných informácií (konkrétne číslo ISBN, celý názov, všetky diela autora) môže byť sémantické vyhľadávanie slabšie ako vyhľadávanie podľa kľúčových slov/domén; pretože to zamieňa iné výsledky, ktoré sú „významovo blízke“. Na presné informácie použite vyhľadávanie založené na doméne a sémantické vyhľadávanie na objavovanie a prehliadanie tém.

Systémy objavovania a súhrny poháňané AI

Moderné vyhľadávacie systémy už neposkytujú len zoznamy výsledkov; Niektorí vytvárajú priamu súhrnnú odpoveď na otázku s AI. Toto je silný, ale riskantný trend. Je užitočné, ak systém vytvára súhrny založené na skutočných zdrojoch v kolekcii a uvádza zdroj. Ak však systém vygeneruje odpoveď zo svojej vlastnej všeobecnej pamäte bez uvedenia zdroja, nesie so sebou riziko halucinácií a môže používateľa dezinformovať.

Úlohou knihovníka je povedať používateľovi, či sú takéto súhrny založené na zdroji alebo nie. Základom informačnej gramotnosti je hlásenie „Súhrn daný systémom je začiatok, prejdite na pôvodný zdroj a overte si ho tam“.

Upozornenie: Aj keď súhrn objavov založený na AI cituje zdroj, nepredpokladajte, že uvedený zdroj tieto informácie skutočne podporuje. Niekedy systém zobrazí správny zdroj, ale vráti nesprávne zhrnutie. Pre kritické použitie otvorte a skontrolujte príslušnú časť zdroja spolu s používateľom.

tri mini prípady

Prípad 1 – nájdený únikový zdroj. Jeden výskumník hľadal zdroje na „mestskom tepelnom ostrove“, ale názov najlepšej štúdie v zbierke bol „tepelný komfort v mestách“. Vyhľadávanie pomocou kľúčových slov toto prehliadlo; sémantické vyhľadávanie ho vrátilo medzi päť najlepších výsledkov vďaka jeho sémantickej blízkosti. Výskumník sa dostal k zdroju, ktorý by inak nevidel.

Prípad 2 – Zavádzajúci „záujem“. Jeden používateľ hľadal „ekonomické príčiny Francúzskej revolúcie“. Sémantické vyhľadávanie tiež zoradilo niekoľko zdrojov všeobecne na tému „revolúcia a ekonómia“, ktoré však nesúvisia s Francúzskou revolúciou. Knihovník si uvedomil, že tieto „zdanlivo relevantné“ výsledky v skutočnosti nezodpovedajú téme a nasmeroval používateľa na správne zdroje.

Prípad 3 – Súhrnné overenie. Systém objavovania poskytol súhrn AI na otázku a citoval dva zdroje. Knihovník otvoril zdroje: jeden podporil súhrn, druhý povedal opak toho, čo hovorí súhrn. Systém nesprávne interpretoval zdroj. Knihovník ukázal patrónovi správny zdroj a skutočný nález.

Poradie, viditeľnosť a spravodlivosť

Ktorý zdroj sa v dôsledku vyhľadávania objaví hore a ktorý dole, nie je nevinná technická záležitosť; Prevažná väčšina používateľov sa pozerá len na niekoľko prvých výsledkov. Poradie teda určuje, aké informácie sú skutočne viditeľné. Hodnotenie založené na AI vypočítava svoju metriku „relevancie“ na základe vzorov, ktoré sa naučila, a tieto vzorce môžu mať tendenciu zvýrazniť zdroje, ktoré sú populárne, vysoko citované alebo v určitých jazykoch. V dôsledku toho môžu cenné, ale málo známe zdroje v nových alebo iných jazykoch zostať neviditeľné. Úlohou knihovníka je vedieť, že poradie nie je neutrálny fakt a naučiť používateľa pozerať sa za počiatočné výsledky, skúšať rôzne hľadané výrazy a spochybňovať poradie výsledkov. „Tri hlavné zdroje“ by sa nikdy nemali stotožňovať s „tromi najlepšími zdrojmi“, najmä pokiaľ ide o výskumnú otázku. Objavenie si vyžaduje hlbšie preniknutie do zoznamu.

Tip: Keď učíte používateľa hľadať, ukážte mu, ako hľadať rovnakú tému pomocou dvoch až troch rôznych skupín výrazov. Rôzne výrazy vrátia rôzne poradie výsledkov; Tým sa prelomí slepé miesto vytvorené jediným vyhľadávaním a otvorí sa bohatšia zásoba zdrojov.

Štyri kopírovateľné šablóny

1) Rozšírenie hľadaných výrazov:

Obohaťte tému vyhľadávania nižšie o sémantické vyhľadávanie a vyhľadávanie podľa kľúčových slov. Uveďte synonymá, súvisiace výrazy a možné formálne/technické ekvivalenty. Navrhujte iba výrazy, ktoré sú skutočne relevantné pre danú tému. Predmet: [tu]

2) Objasnenie otázky používateľa:

Navrhnite 3 objasňujúce otázky, ktoré by som mal položiť, aby som objasnil nasledujúcu nejasnú otázku používateľa (napríklad rozsah, obdobie, žáner, jazyk). Nepredpokladajte zámer používateľa, prezentujte možnosti. Otázka: [tu]

3) Hodnotenie relevantnosti výsledku:

Nižšie je uvedená téma vyhľadávania a vrátené názvy/súhrny výsledkov. Ohodnoťte, do akej miery sú jednotlivé výsledky relevantné pre danú tému, ako „vysoké/stredné/nízke“ a uveďte odôvodnenie jednou vetou. Stačí sa spoľahnúť na daný text. Téma: [tu] / Výsledky: [tu]

4) Kontrola konzistencie zdroja súhrnu:

Nižšie je uvedený súhrn a zdrojový text, na ktorom sa údajne zakladá. Je každé tvrdenie v súhrne skutočne prítomné v zdrojovom texte? Označte položku podľa položky "podporované / nepodporované / čiastočne". Zhrnutie: [tu] / Zdroj: [tu]

Slabá výzva / Silná výzva

Slabá výzva:

Uveďte mi najlepšie zdroje na túto tému.

AI nevie, z ktorej zbierky, podľa akých kritérií si vybrať zo skutočne existujúcich zdrojov; môže zo svojej všeobecnej pamäte vytvoriť vymyslený zoznam „best of“.

Výkonná výzva:

Vaša úloha: skautský asistent. Nižšie je uvedená téma vyhľadávania a 15 aktuálnych výsledkov (názov + abstrakt) vrátených zo skautského systému. Uveďte týchto 15 výsledkov podľa ich relevantnosti pre danú tému a každý z nich odôvodnite jednou vetou. Pridanie nového zdroja do zoznamu, jeho vytvorenie. Téma: [tu] / Výsledky: [tu]

Výkonná výzva obmedzuje AI na skutočný súbor výsledkov a núti ju vyhodnotiť; Zabraňuje vymýšľaniu a získavaniu zo všeobecnej pamäte.

Porovnávacia tabuľka typov vyhľadávania

Stav

najlepšia metóda

Prečo?

Presný názov/ISBN/autor

Pole/kľúčové slovo

Priraďovanie jedna k jednej je spoľahlivé

Prieskum tém, rôzne pojmy

Sémantické vyhľadávanie

Zachytáva významovú blízkosť

Aktuálna udalosť/podstatné meno

kľúčové slovo + dátum

Presnosť a aktuálnosť

Súvisiaci, ale iný zdroj názvu

Sémantické vyhľadávanie

nájde synonymum

Časté chyby

  • Použitie sémantického vyhľadávania na presné informácie. Vyhľadávanie domény podľa ISBN alebo celého názvu je spoľahlivejšie.
  • Za predpokladu, že „to, čo sa zdá byť relevantné“, je pravda. Významová blízkosť nie je zárukou spoľahlivosti alebo presnosti.
  • Poskytnutie súhrnu AI bez toho, aby ste sa pozreli na zdroj. Súhrn mohol nesprávne interpretovať zdroj.
  • Neobjasnenie nejasnej otázky používateľa. Nesprávny vstup prináša nesprávny výsledok.
  • Použitie iba jednej metódy. Najlepšie je použiť sémantické vyhľadávanie a vyhľadávanie podľa kľúčových slov spolu.

V súhrne

Systémy sémantického vyhľadávania a zisťovania nachádzajú relevantné zdroje, ktoré pri vyhľadávaní kľúčových slov chýbajú, tým, že zodpovedajú významu, nie slovu, a posilňujú zisťovanie. Súhrny poháňané AI poskytujú pohodlie, ale prinášajú riziko halucinácií a nesprávnej interpretácie zdroja. Práca knihovníka; Spoločné používanie sémantického vyhľadávania a vyhľadávania kľúčových slov, kritické hodnotenie toho, čo sa „zdá relevantné“, overovanie súhrnov AI so zdrojom a výučba používateľa na základe zdroja potvrdzujúceho zvyk vyhľadávania.

Aplikačná úloha

Vyberte si tému a vykonajte vyhľadávanie kľúčových slov aj sémantické vyhľadávanie (ak je to možné); porovnajte dve skupiny výsledkov: aké ďalšie zdroje sémantické vyhľadávanie našlo, aké nesúvisiace výsledky pomiešalo? Vytvorte súhrn založený na AI (alebo si vezmite vzorový súhrn) a skontrolujte, či sa nároky v súhrne skutočne vyskytujú v zdroji pomocou šablóny „Kontrola konzistencie zdroja súhrnu“.

kontrolný zoznam

  • [ ] Použil som doménu/kľúčové slovo na presné informácie a sémantické vyhľadávanie na objavenie.
  • [ ] Objasnil som nejasnú otázku používateľa.
  • [ ] Hodnotil som výsledky, ktoré sa „zdali byť relevantné“ z hľadiska spoľahlivosti.
  • [ ] Overil som súhrny AI s pôvodným zdrojom.
  • [ ] Vysvetlil som zvyk vyhľadávania používateľa na základe zdroja.