Enota 8 / 10

Pregled literature in sinteza znanja: RAG, sistematična kompilacija in generiranje hipotez

Dobički:

  • Sposobnost razumevanja, da navadna orodja za klepet ustvarjajo lažne reference, in uporabo discipline preverjanja vsakega vira v dejanski bazi podatkov.
  • Sposobnost zmanjšanja halucinacij s povezovanjem sinteze literature z resničnimi dokumenti s pristopom RAG (generacija, odvisna od virov).
  • Sposobnost interpretacije hipotez kot začetka in ne dokazov z uporabo umetne inteligence za predhodni pregled pri sistematičnem pregledu in ohranjanje končne odločitve in preglednosti v rokah ljudi

Eksplozija znanja v bioinženiringu je resničen problem: vsako leto je objavljenih na sto tisoče člankov, ki zberejo na tisoče študij o eni sami temi. Preden postavi hipotezo, izbere metodo ali interpretira rezultat, mora inženir pregledati ustrezno literaturo; vendar to traja tedne ročno. AI je eno od področij, kjer prihrani največ časa pri pregledu literature, povzemanju in sintezi informacij. Je pa tudi najnevarnejši vir halucinacij: AI lahko ustvari neobstoječe članke, izmišljene DOI in lažne ugotovitve. Glavna lekcija te enote je disciplina povezovanja vsake trditve z izvirnim virom pri uporabi AI v literaturi.

V tej enoti se boste naučili, kako uporabljati AI pri varnem pregledu literature, zakaj je pristop RAG (Retrieval-Augmented Generation — AI najde in ustvari odgovor iz podatkovne zbirke resničnih dokumentov, ne iz njenega pomnilnika) bolj zanesljiv, podporo sistematičnega pregleda in ustvarjanje hipotez.

Zakaj je navadno orodje za klepet nevarno?

Ko ukažete jezikovnemu modelu, naj "poišče članke o tem, to pomeni tekoče, a izmišljene reference: imena avtorjev, revije, leta in DOI, kot da bi bili resnični. Zato nikoli ne kršite dveh pravil pri pregledu literature: (1) preverite vsako referenco v dejanski zbirki podatkov (PubMed, Google Scholar, stran revije), (2) če je mogoče, uporabite orodja, ki temeljijo na RAG, povezana z resničnimi članki (kot so Elicit, Consensus, Scite).

Pozor: izjava umetne inteligence se lahko zdi pristna – v pravilni obliki, znan dnevnik, razumno leto. To ne pomeni, da obstaja. Članek obravnavajte kot obstoječega šele, ko ga najdete in odprete v PubMed/DOI. Vključitev izmišljene reference v vašo publikacijo je napaka, ki lahko uniči vaš znanstveni ugled.

RAG: proizvodnja, odvisna od virov

Pri pristopu RAG umetna inteligenca najprej najde ustrezne odlomke iz resničnega skladišča dokumentov (bodisi PDF-jev, ki jih naložite, ali znanstvene baze podatkov), nato ustvari odgovor na podlagi teh odlomkov in pokaže na vir. To močno zmanjša halucinacije, ker mora model "citirati" in ne "predstavljati". Dati lastno knjižnico PDF orodju RAG in vprašati, »kaj teh 40 člankov pravi o tem in tem«, je veliko bolj zanesljivo kot neposredni pogovor; vendar si oglejte odlomek vsakega citata v dejanskem članku.

Namig: tudi ko uporabljate RAG, izrecno navedite "citirajte vir in odgovorite samo iz dokumentacije, ki jo zagotovim, ne dodajajte informacij, ki niso dokument". Nato v dejanskem dokumentu poiščite odlomek, na katerega kaže model. Zaradi teh dveh korakov je vaša sinteza branljiva.

Sistematični pregled in oblikovanje hipotez

Sistematični pregled – odgovor na določeno vprašanje s skeniranjem vse relevantne literature na pregleden in ponovljiv način – zahteva visoko metodološko natančnost: strategijo iskanja, kriterije vključitve/izključitve, ekstrakcijo podatkov. Umetna inteligenca pospeši mehanske dele tega procesa (abstraktno pregledovanje, začetno pregledovanje, osnutek ekstrakcije podatkov), vendar je odgovornost in preglednost vsake odločitve (ali vključiti ali izključiti članek) na strani raziskovalca. Umetna inteligenca prav tako navdihuje ustvarjanje hipotez z opozarjanjem na vrzeli v literaturi; vendar je hipoteza, ki jo ustvari, izhodišče in ne dokaz.

trije mini kovčki

1. primer — skeniranje pospešeno 10x. Recenzentska ekipa je morala prebrati 1850 povzetkov člankov. Z orodjem, ki temelji na RAG, je predkvalifikacija vključitve/izključitve trajala s 3 dni na 5 ur. Toda dva raziskovalca sta neodvisno preverila 120 člankov, ki jih je umetna inteligenca ocenila kot "izključene", in odkrila 9 lažnih izločitev; Umetna inteligenca je izbrala, človek je sprejel končno odločitev.

Primer 2 – Ulovljena izmišljena referenca. Doktorski študent je prosil YZ za 15 referenc za svojo disertacijo. Ko je preveril na PubMedu, je ugotovil, da jih 6 sploh ne obstaja, 3 pa so pripisani napačnemu avtorju. Navadno orodje za klepet je ustvarilo realistično, a lažno bibliografijo. Verifikacija je preprečila akademsko katastrofo.

Primer 3 – Navdih za hipotezo. Ekipa presnovnega inženiringa je umetni inteligenci predala korpus 60 dokumentov in vprašala, "katere poti so premalo raziskane?" Umetna inteligenca je pokazala na nepreizkušeno kombinacijo encimov. Ekipa je to vzela kot hipotezo, jo potrdila v literaturi in oblikovala poskus; Končno so prišli do resnične ugotovitve, ki je povečala produktivnost. Navdih je prišel z umetno inteligenco, dokaz je prišel z eksperimentom.

Štiri predloge za kopiranje

1) Sinteza literature, povezane z viri (RAG):

Vaša vloga: asistent znanstvenega pregleda. Odgovori SAMO iz dokumentov, ki sem jih naložil; Ne dodajajte dodatnih informacij o dokumentu. Za vsako trditev navedite ime izvornega dokumenta in ustrezni odlomek. Na vprašanje, na katerega v dokumentih ni odgovora, recite "ni ga v dokumentih". Referenca, DOI ali ugotovitev FITTING.Vprašanje: [vprašanje]

2) Disciplina preverjanja reference:

Dal ti bom temo. Predlagajte možne ključne besede in iskalno strategijo (s sintakso PubMed). Toda VI seznam člankov je LAŽEN; Poklical bom sam. Povejte mi, katere izraze, filtre in merila za vključitev/izključitev naj uporabim namesto tega.

3) Sistematična pomoč pri izločanju kompilacije:

Dal vam bom naslov članka + povzetke. Predlagajte vključitev/izključitev/nejasnost za vsako na podlagi naslednjih meril vključitve (vključi: [merila]) in napišite svojo UTEMELJITEV. "Negotove" bom pregledal ročno. Upoštevajte, da je odločitev predhodna in ni dokončna; Ne črtajte nobenega člena brez utemeljitve.

4) Generiranje hipotez (previdno):

Podal vam bom povzetek ugotovitev o temi. Predlagajte mi 3 hipoteze, ki jih je mogoče preizkusiti na podlagi VRZELI v literaturi in nepreizkušenih kombinacij. Za vsako hipotezo: navedite osnovo, kako bo preizkušena in da je START, ne dokaz. Ne zanašajte se na neobstoječe dokaze.

Šibek poziv/močan poziv

Šibek poziv:

Poiščite in povzemite zame 10 člankov o encimskem inženirstvu s CRISPR.

Model ne izvaja dejanskih iskanj; bo najverjetneje ustvaril lažne reference.

Močan poziv:

Vaša vloga: pomočnik pri gradnji. Na podlagi SAMO 12 PDF-jev, ki sem jih naložil, sintetiziram glavne ugotovitve na temo "encimskega inženirstva na osnovi CRISPR". Za vsako najdbo pokažite, iz katerega dokumenta PDF izvira, in celoten odlomek. Ne dodajajte študij, DOI ali rezultatov, ki niso v PDF-jih. Vse podteme, ki niso zajete, označite kot »ni zajeto v teh dokumentih«.

Razlika: povezovanje z dejanskimi dokumenti, zahteva po viru + prehodu, prepoved izdelave in poštenost obsega.

Književne naloge in zanesljiv pristop

Iskanje

tvegana cesta

varen način

preverjanje

Poiščite članek

Klepetu rečeš "najdi".

Orodje PubMed + RAG

Potrditev v DOI

povzemanje

Povzetek brez dokumentacije

Povzetek iz naloženega PDF-ja

Oglejte si dejanski odlomek

izločanje

Slepo zaupanje v AI

Predkvalifikacija AI + človek

Drugi recenzent

sinteza

brezplačna proizvodnja

Sinteza, odvisna od vira

Preverjanje ponudbe

hipoteza

zamenjati za "dokaz"

izhodišče

eksperimentalni preizkus

Pogoste napake

  • Ne preverjam referenc. AI proizvaja realistične, a lažne vire; vsak mora biti prikazan v bazi podatkov.
  • Zamenjajte navaden klepet za klic. Model generira iz pomnilnika; dejansko iskanje zahteva RAG/bazo podatkov.
  • Popoln prenos odločitve o izločitvi. Nepravilna izločitev bo prekinila kompilacijo; Potreben je drugi recenzent.
  • Zamenjavanje hipoteze z dokazom. Hipoteza, ki jo ustvari AI, je špekulacija, dokler ni preizkušena s poskusom.
  • Pretiravanje z obsegom. AI lahko daje vtis, da "sem skeniral vse"; Dokumentirate dejanski obseg.

Če povzamem

Pregled literature je področje, kjer AI prihrani največ časa, vendar povzroči največ halucinacij. Navadna orodja za klepet lahko ustvarijo realistična, a lažna pričevanja; zato preverite vsak vir glede na dejansko bazo podatkov in, če je mogoče, uporabite orodja, ki temeljijo na RAG in so odvisna od dejanskih dokumentov. Pri sistematičnem pregledu AI izvede predhodni pregled, vendar končna odločitev in preglednost pripadata raziskovalcu. AI navdihuje ustvarjanje hipotez; Ta hipoteza je izhodišče in ne dokaz, dokler ni potrjena z eksperimentom.

Aplikacijska naloga

Izberite temo in povejte AI ​​(prek navadnega orodja za klepet) "poišči 8 člankov o tej temi in jih povzemi." Vsako referenco, ki jo navede, preverite glede na PubMed ali DOI, eno za drugo, in preštejte, koliko je pristnih. Nato ponovite isto nalogo z orodjem RAG ali tako, da naložite nekaj PDF-jev, ki ste jih sami prenesli, in z navodilom "odgovori samo iz teh dokumentov". Napišite kratko primerjavo zanesljivosti obeh pristopov.

kontrolni seznam

  • [ ] Vsako referenco, ki jo je dal AI, sem preveril glede na dejansko bazo podatkov.
  • [ ] Pri sintezi literature sem uporabil pristop, odvisen od vira (RAG/naložen dokument).
  • [ ] Odločitve o pregledu sem pregledal z drugim ocenjevalcem.
  • [ ] Hipoteze, ki jo je ustvaril AI, nisem obravnaval kot dokaz, ampak kot začetek, ki ga je treba preizkusiti.
  • [ ] Videl sem odlomek vsakega citata v izvirnem članku.
  • [ ] Iskreno sem dokumentiral pravi obseg in omejitve skeniranja.