Jedinica 4 / 11

Sistemi semantičkog pretraživanja i otkrivanja

Dobici:

  • Biti u stanju razumjeti kako semantička pretraga pronalazi relevantne resurse koje pretraživanje ključnih riječi propušta, sa svojom bliskošću u značenju, i biti u mogućnosti koristiti obje metode zajedno na mjestu.
  • Sposobnost kritičke procene sažetaka sistema otkrivanja podržanih veštačkom inteligencijom prema tome da li su zasnovani na izvoru ili ne i potvrditi ih izvorom.
  • Sposobnost razjašnjenja korisnikovog nejasnog pitanja i razlikovanja 'naizgled relevantnih' rezultata u smislu pouzdanosti

Korisnik u katalogu pretražuje "probleme sa spavanjem kod djece", ali glavni resurs srodan naslovom "Pedijatrijski poremećaji spavanja". Klasična pretraga možda uopće neće prikazati ovaj izvor jer se točno podudara s riječima. Ovdje dolazi u obzir semantičko pretraživanje: to je oblik pretraživanja koji odgovara značenju riječi, a ne njihovom pravopisu. U ovoj cjelini naučit ćete kako funkcioniraju sistemi semantičkog pretraživanja i otkrivanja zasnovani na umjetnoj inteligenciji, šta donose bibliotekaru i koje zamke nose.

Hajde da definišemo osnovni koncept. U središtu semantičkog pretraživanja je ugrađivanje: tehnika transformacije značenja teksta u vektor brojeva (vrsta koordinata značenja). Tekstovi koji su bliski po značenju bliski su jedan drugom u ovom brojevnom prostoru. Dakle, iako su "problem spavanja" i "poremećaj spavanja" različite riječi, one se nalaze blizu jedna uz drugu i potraga za jednim će također pronaći i drugu. Ovo je moć hvatanja relevantnih resursa koje pretraga po ključnim riječima propušta.

Korak po korak: razumijevanje i korištenje semantičke pretrage

1. Razumjeti pravu namjeru korisnika. Semantička pretraga pokušava da uhvati šta korisnik misli. Vaš posao kao bibliotekara je da razjasnite korisnikovo nejasno pitanje i date ispravan unos u sistem pretraživanja.

2. Koristite ključne riječi i semantičku pretragu zajedno. Semantičko pretraživanje pronalazi resurse sa srodnim, ali različitim riječima; Pretraživanje ključnih riječi je pouzdanije kada se traži tačan pojam, ime ili šifra (ime autora, zakonski broj). Dobar bibliotekar koristi oboje.

3. Kritički procijenite rezultate. Semantička pretraga vraća rezultate koji „izgledaju relevantni“; Ali izgledati relevantno ne znači biti tačan ili pouzdan. Vi ocjenjujete izvor i pravovremenost rezultata.

4. Naučite strategiju pretraživanja korisnika. Discovery sistemi su moćni, ali korisnici često pretražuju pomoću jedne riječi. Jedan zadatak bibliotekara je da nauči korisnika da bolje pretražuje.

Savjet: Semantička pretraga može biti slabija od pretraživanja ključnih riječi/domena kada se traže vrlo precizne informacije (određeni ISBN, pun naslov, sva djela autora); jer zbunjuje druge rezultate koji su "bliski po značenju". Koristite pretragu baziranu na domeni za precizne informacije i semantičku pretragu za otkrivanje i pregledavanje tema.

Sistemi za otkrivanje i sažeci zasnovani na veštačkoj inteligenciji

Moderni sistemi otkrivanja više ne pružaju samo liste rezultata; Neki daju direktan sažeti odgovor na pitanje sa AI. Ovo je moćan, ali rizičan trend. Korisno je ako sistem proizvodi sažetke na osnovu stvarnih izvora u kolekciji i navodeći izvor. Ali ako sistem generiše odgovor iz sopstvene opšte memorije bez navođenja izvora, to nosi rizik od halucinacije i može dezinformisati korisnika.

Uloga bibliotekara je da kaže korisniku da li su takvi sažeci zasnovani na izvoru ili ne. Poruka "Sažetak koji daje sistem je početak; idite na izvorni izvor i provjerite tamo" je osnova informatičke pismenosti.

Oprez: Čak i ako sažetak otkrića koji pokreće AI citira izvor, nemojte pretpostavljati da citirani izvor zapravo podržava tu informaciju. Ponekad sistem prikazuje tačan izvor, ali vraća pogrešan sažetak. Za kritične upotrebe, otvorite i provjerite relevantni odjeljak resursa zajedno s korisnikom.

tri mini kofera

Slučaj 1 — Pronađeni izvor. Jedan istraživač je tražio resurse na "urbanom toplotnom ostrvu", ali naslov najbolje studije u kolekciji bio je "termalni komfor u gradovima". Pretraga po ključnim riječima ovo je propustila; semantička pretraga ga je vratila među prvih pet rezultata, zahvaljujući njegovoj semantičkoj blizini. Istraživač je došao do izvora koji inače ne bi vidio.

Slučaj 2 — Obmanjujući „interes“. Jedan korisnik je tražio "ekonomske uzroke Francuske revolucije". Semantička pretraga je također rangirala nekoliko izvora općenito na temu "revolucije i ekonomije", ali nevezanih za Francusku revoluciju. Bibliotekar je shvatio da ovi "naizgled relevantni" rezultati zapravo ne odgovaraju temi i uputio je korisnika na ispravne izvore.

Slučaj 3 — Provjera sažetka. Sistem otkrivanja dao je AI sažetak pitanja i citirao dva izvora. Bibliotekar je otvorio izvore: jedan je podržao sažetak, drugi je rekao suprotno od onoga što je sažetak rekao. Sistem je pogrešno protumačio resurs. Knjižničarka je pokrovitelju pokazala tačan izvor i stvarni nalaz.

Rangiranje, vidljivost i pravičnost

Koji resurs se pojavljuje na vrhu, a koji na dnu kao rezultat pretrage nije nevina tehnička stvar; Velika većina korisnika gleda samo prvih nekoliko rezultata. Stoga rangiranje određuje koje se informacije zapravo vide. Rangiranje zasnovano na umjetnoj inteligenciji izračunava svoju metriku „relevantnosti“ na osnovu obrazaca koje je naučio, a ovi obrasci mogu imati tendenciju da istaknu izvore koji su popularni, visoko citirani ili na određenim jezicima. Kao rezultat toga, vrijedni, ali malo poznati resursi na novim ili različitim jezicima mogu ostati nevidljivi. Posao bibliotekara je da zna da redoslijed nije neutralna činjenica i da nauči korisnika da gleda dalje od početnih rezultata, isproba različite pojmove za pretraživanje i dovodi u pitanje redoslijed rezultata. „Tri najbolja izvora“ nikada ne bi trebalo poistovećivati ​​sa „najbolja tri izvora“, posebno za istraživačko pitanje. Discovery zahtijeva dublje kopanje po listi.

Savjet: Kada podučavate korisnika da pretražuje, pokažite mu kako da pretražuju istu temu koristeći dva do tri različita skupa pojmova. Različiti termini vraćaju različita rangiranja rezultata; Ovo razbija slijepu pjegu stvorenu jednom pretragom i otvara bogatiji fond resursa.

Četiri šablona za kopiranje

1) Proširenje pojma za pretraživanje:

Obogatite temu pretraživanja u nastavku za semantičko pretraživanje i pretraživanje po ključnim riječima. Navedite sinonime, povezane termine i moguće formalne/tehničke ekvivalente. Predložite samo termine koji su zaista relevantni za temu. Predmet: [ovdje]

2) Pojašnjavanje korisničkog pitanja:

Predložite 3 pojašnjavajuća pitanja koja bih trebao postaviti da razjasnim sljedeće nejasno korisničko pitanje (kao što je opseg, period, žanr, jezik). Nemojte pretpostavljati namjeru korisnika, predstavite opcije. Pitanje: [ovdje]

3) Procjena relevantnosti ishoda:

Ispod je tema pretraživanja i vraćeni naslovi/sažeci rezultata. Ocijenite koliko je svaki rezultat relevantan za temu kao "visoko/srednje/nisko" i dajte opravdanje u jednoj rečenici. Samo se oslonite na dati tekst. Tema: [ovdje] / Rezultati: [ovdje]

4) Provjera konzistentnosti sažetka-izvora:

Ispod je sažetak i izvorni tekst na kojem se tvrdi da se zasniva. Da li je svaka tvrdnja u sažetku zaista prisutna u izvornom tekstu? Označite stavku po stavku "podržano / nepodržano / djelimično". Sažetak: [ovdje] / Izvor: [ovdje]

Slaba prompt / Jaka prompt

Slab upit:

Navedite mi najbolje resurse na ovu temu.

AI ne zna iz koje kolekcije, prema kojim kriterijumima, da bira između stvarno postojećih resursa; može proizvesti iz svog opšteg pamćenja sastavljenu listu "najboljih".

Snažan upit:

Vaša uloga: pomoćnik izviđača. Ispod su tema pretraživanja i 15 stvarnih rezultata (naslov + sažetak) vraćenih iz skautskog sistema. Navedite ovih 15 rezultata prema njihovoj relevantnosti za temu i dajte opravdanje u jednoj rečenici za svaki. Dodavanje novog izvora na listu, sastavljanje. Tema: [ovdje] / Rezultati: [ovdje]

Snažan prompt ograničava AI na stvarni skup rezultata i čini ga evaluacijom; Sprečava izmišljanje i izvlačenje iz opšte memorije.

Tabela poređenja tipova pretrage

Status

najbolja metoda

Zašto

Tačan naslov/ISBN/autor

Polje/ključna riječ

Usklađivanje jedan na jedan je pouzdano

Istraživanje teme, različiti termini

Semantičko pretraživanje

Zahvaća bliskost značenja

Trenutni događaj/imenica

ključna riječ + datum

Tačnost i pravovremenost

Srodan, ali različit izvor imena

Semantičko pretraživanje

nalazi sinonim

Uobičajene greške

  • Korištenje semantičke pretrage za precizne informacije. Pretraživanje domene za ISBN ili puni naslov je pouzdanije.
  • Pod pretpostavkom da je "ono što se čini relevantnim" istina. Bliskost značenja nije garancija pouzdanosti ili tačnosti.
  • Davanje AI sažetka bez gledanja u izvor. Sažetak je možda pogrešno protumačio izvor.
  • Ne razjašnjavajući korisnikovo nejasno pitanje. Pogrešan unos donosi pogrešan rezultat.
  • Koristeći samo jednu metodu. Najbolje je koristiti semantičko pretraživanje i pretraživanje po ključnim riječima zajedno.

Ukratko

Sistemi semantičkog pretraživanja i otkrivanja pronalaze relevantne resurse koje pretraživanje ključnih riječi propušta tako što se podudaraju sa značenjem, a ne s riječju, i pojačavaju otkrivanje. Sažeci zasnovani na umjetnoj inteligenciji pružaju praktičnost, ali nose rizik od halucinacija i pogrešnog tumačenja izvora. Posao bibliotekara; Korištenje semantičke pretrage i pretraživanja ključnih riječi zajedno, kritička procjena onoga što se „čini relevantnim“, provjera AI sažetaka sa izvorom i podučavanje korisnika baziranoj na izvoru, potvrđujući naviku pretraživanja.

Zadatak aplikacije

Odaberite temu i izvršite i ključne riječi i semantičke pretrage (ako je primjenjivo); uporedite dva skupa rezultata: koje dodatne resurse je semantička pretraga pronašla, koje nepovezane rezultate je pomiješala? Generirajte sažetak koji pokreće AI (ili uzmite uzorak sažetka) i provjerite da li se tvrdnje u sažetku zaista pojavljuju u izvoru pomoću predloška "Provjera konzistentnosti sažetka-izvora".

kontrolna lista

  • [ ] Koristio sam domen/ključnu riječ za precizne informacije i semantičku pretragu za otkriće.
  • [ ] Pojasnio sam korisnikovo nejasno pitanje.
  • [ ] Procijenio sam rezultate koji su "izgledali relevantni" za pouzdanost.
  • [ ] Provjerio sam AI sažetke s originalnim izvorom.
  • [ ] Objasnio sam korisnikovu naviku pretraživanja zasnovanu na izvoru.