Egység 11 / 11

Etika, biológiai biztonság, titoktartás és tudományos integritás

Nyereség:

  • Képes az érzékeny emberi/genetikai adatok védelmére a KVKK, a GDPR és az etikai bizottság szabályai szerint, és elkerülhető, hogy ezeket a nyílt modellbe adják.
  • Képes megkérdőjelezni az eredmények érvényességét a biológiai biztonság/kettős felhasználás és a lakossági torzítás kockázatainak felmérésével
  • Annak megértése, hogy az etikai felelősséget nem lehet a járműre átruházni, és értelmes ember a hurokban szükséges

A mesterséges intelligencia erőteljes felhasználása a biológiában kiegészül a felelősségteljes felhasználással. A biológia érzékeny terület, amely érinti az emberi egészséget, a genetikai adatvédelmet, a környezetet és még a biológiai biztonságot is. Ebben az egységben megvitatjuk azokat az etikai, jogi és biztonsági kötelezettségeket, amelyekkel a mesterséges intelligencia biológiai vizsgálatokban való használata során szembesül. Ez az egység egy olyan keretrendszer, amely az összes korábbi egységben az ellenőrzés és az őszinteség elvén alapul.

Alapelv: az AI egy eszköz; Az etikai felelősség mindig az embert terheli. A „javasolt modell” nem kifogás.

Négy felelősségi terület

1. Adatvédelem és emberi adatok

A humán résztvevők genetikai, klinikai vagy egészségügyi adatai rendkívül érzékenyek. Egy személy DNS-szekvenciája feltárhatja saját és hozzátartozói betegség kockázatát és azonosságát; Még az anonimizáltnak hitt genomikai adatok is újra azonosíthatók. Ezen adatok nyilvánosan elérhető mesterségesintelligencia-modellbe való beillesztése sértheti az adatvédelmi törvényeket (a türkijében a KVKK, Európában a GDPR) és az etikai bizottság (IRB/etikai bizottság) jóváhagyását.

  • Ne adjon meg személyes/klinikai adatokat a nyílt modellhez.
  • Kerülje a beleegyezésen túli felhasználást; Mihez járult hozzá a résztvevő?
  • Válasszon vállalati/helyi (helyi) vagy adatfeldolgozási szerződéses eszközöket.

2. Biológiai biztonság és kettős felhasználás

Néhány biológiai információ „kettős felhasználású”: lehet hasznos és káros is; például kórokozó (betegséget okozó) szekvenciák, toxintermelés. A legtöbb helyen etikátlan és illegális a mesterséges intelligencia információk kérése a veszélyes kórokozók fokozásával vagy a káros biológiai ágensek tervezésével kapcsolatban.

  • Ne küldjön veszélyes, kettős felhasználású kéréseket.
  • Kövesse intézménye biológiai biztonsági tanácsának (IBC) irányelveit.

3. Tudományos integritás

Minden, amit a korábbi egységekben láttunk, itt összejön: nincs hamis hozzárendelés, nincs adatszépítés, nincs p-hackelés, nincs szelektív jelentés. A mesterséges intelligencia ezeket megkönnyítheti vagy megnehezítheti; A különbség az őszinteségedben van.

  • Jelentse az összes eredményt (beleértve a negatívakat is).
  • Nyilatkozni a mesterséges intelligencia használatáról.
  • A reprodukálhatóság támogatása nyers adatok és kód megosztásával (ha lehetséges).

4. Elfogultság és tisztesség

Az AI-modellek torzításokat hordoznak azon adatok tekintetében, amelyekre képezték őket. A genomi adatbázisok túlnyomórészt európai származású populációkból származnak; ez gyengébb előrejelzésekhez vezet más populációkban. Egy képmodell rosszul teljesíthet olyan körülmények között, amelyek alulreprezentáltak a betanítási adatokban.

  • Kérdés, hogy milyen populációra/adatokra képezték ki a modellt.
  • Értékelje, hogy az eredmények érvényesek-e az összes csoportra.
Tipp: Tegye fel magának a kérdést: "Ha megadom ezeket az adatokat a modellnek, kihez tartozik, és adott-e engedélyt az illető?" Ha a válasz homályos, ne adja meg. A titoktartás megsértése visszafordíthatatlan.

Lépésről lépésre: felelős AI-vezérlés

  1. Az adatforrás besorolása: személyes/érzékeny vagy nyilvános?
  2. A beleegyezés és az engedélyek ellenőrzése: Ez a felhasználás vonatkozik rá?
  3. Válassza ki a megfelelő eszközt: Biztonságos/natív környezet az érzékeny adatokhoz.
  4. Vegye figyelembe a kettős használat kockázatát.
  5. Kérdés torzítása: Minden csoportra érvényes az eredmény?
  6. Dokumentálja és nyilatkozzon a felhasználásról.

Másolható prompt sablonok

Tekintse át az alábbi elemzési tervemet etikai szempontból: sorolja fel az adatok bizalmas kezelésével, a résztvevők beleegyezésével, az esetleges torzítással és a kettős felhasználás kockázatával kapcsolatos figyelmeztetéseket. Terv: [szöveg] (Megjegyzés: NEM a tényleges betegadatokat osztom meg, csak a tervet.)

Milyen adatvédelmi és hozzájárulási kérdésekre kell válaszolnom a genomiális adatkészlet használata előtt? Ellenőrző lista készül a KVKK/GDPR és az etikai bizottság szempontjából.

Hogyan kell átláthatóan deklarálnom az általam használt mesterséges intelligencia eszközt a cikkem módszer részében? Írjon példa kijelentő mondatot; milyen információkat (eszközt, verziót, felhasználási kört) tartalmazzon?

Hogyan értékelhetem, hogy ennek a modellnek az eredményei tartalmaznak-e populációs torzítást? Sorolja fel azokat a kérdéseket, amelyeket fel kell tennem az edzési adatokkal és az ellenőrzési lépésekkel kapcsolatban.

Gyenge felszólítás / Erős felszólítás

Gyenge: "Elemezze a következő beteg genetikai adatait: [valós adatok]."

Güçlü: "Klinikai genomikai adatokkal működő elemzési tervet készítek, de valós betegadatokat nem osztok meg. Csak módszertani szempontból: milyen titoktartási intézkedéseket tegyek, milyen környezetben dolgozzam fel az adatokat, milyen jóváhagyási és etikai bizottsági feltételeknek kell megfelelnem? Az áramlást ál-/mintaadatokkal is meg tudja mutatni."

Különbség: A hatékony promptban nem osztanak meg ténylegesen érzékeny adatokat; Csak a módszert kérdezik. Az adatvédelem megmarad, a modell továbbra is segít.

három mini tok

1. eset – Adatvédelem megsértése: Egy kutató beillesztette a szerinte anonim páciens-exome-adatokat egy nyílt modellbe, hogy elemezze azokat. Amikor az etikai bizottság tudomást szerzett erről, a vizsgálatot felfüggesztették; Nem volt adatkezelési megállapodás. Tanulság: érzékeny adatok soha nem kerülnek be a nyílt modellbe.

2. eset – Populációs torzítás: Egy poligén kockázati pontozó eszközt képeztek ki európai eredetű adatokra; Egy másik populációban a kockázatbecslések jelentősen pontatlanok voltak. Amikor a modell a képzési adatok összetételének megkérdőjelezését javasolta, a csapat úgy döntött, hogy nem használja az eszközt ebben a populációban. Tanulság: az elfogultság életeket ment meg vagy károsít.

3. eset – Nyilvánosság és átláthatóság: Egy csapat adattisztító kódot írt az MI-vel, és ezt egyértelműen jelezte a módszer szakaszban; Megosztotta a kódot is. A bírálók üdvözölték ezt, mert az ismételhetőség erős volt. Tanulság: az átláthatóság bizalmat szül.

összehasonlító táblázat

területen

biztonságos viselkedés

kockázatos viselkedés

betegadatok

Helyi/biztonságos környezet

Beillesztés a megnyitott modellbe

beleegyezését

Használja a hatókörön belül

Ne lépje túl a hatókört

Biológiai biztonság

A kettős használat elkerülése

veszélyes kereslet

integritás

Jelentse az összes eredményt

szelektív jelentés

elfogultság

Kérdezze le a lakosságot

Alkalmazza vakon

átláthatóság

Használat bejelentése

bujkál

Gyakori hibák

  • Érzékeny adatok megadása a nyílt modellnek: Visszafordíthatatlan adatsértés.
  • A hozzájárulási kör túllépése: A résztvevő által nem engedélyezett felhasználás.
  • Az elfogultság figyelmen kívül hagyása: Az eredmények általánosítása minden csoportra.
  • Használat eltitkolása: A mesterséges intelligencia hozzájárulásának bejelentése nélkül.
  • "Modellt javasolt" védekezés: A felelősség hozzárendelése a járműhöz.
Figyelem: A nagy következményekkel járó biológiai munkában (klinikai döntés, biológiai biztonság, humán adatok) az AI-kimenet nem helyettesíti a hozzáértő szakértői ellenőrzést és az etikai felügyeletet; csak felgyorsítja. A végső felelősség mindig az embert terheli, a döntés etikai és tudományos következményeivel együtt.

Környezet, ökológia és hagyományos ismeretek

Az etikai felelősség nem korlátozódik az emberi adatokra. Óvatosságra van szükség a mesterséges intelligencia ökológiában és természetvédelmi biológiában való alkalmazásakor is. Például egy veszélyeztetett faj pontos helyadatai (kameracsapda koordinátái) érzékenyek az orvvadászat veszélye miatt; Ezen adatok nyílt modell vagy nyilvánosság számára történő közzététele károsíthatja a fajt. Hasonlóan etikai és jogi (például a Nagoya Protokoll) problémák merülnek fel, amikor a helyi közösségek hagyományos biológiai ismereteit (pl. egy növény használata) engedély nélkül használják fel. Az adatok felhasználása előtt "kihez tartozik ez az információ, és kinek lenne kára a nyilvánosságra hozataluk?" Mindig tedd fel a kérdést.

Emberi felügyelet és végső döntés

Ennek az egész modulnak a lényege egyetlen alapelvre vezethető vissza: az értelmes emberi felügyeletre. Az AI javaslatot készít, vázlatot ír, mintát mutat; De egy biológiai, klinikai vagy etikai döntés soha nem közvetlenül a modell kimenetén alapul. Különösen a fokozottan veszélyeztetett területeken (diagnózis, kezelés, fajvédelmi döntés, kibocsátás) a modell szerepe nem a döntéshozatal, hanem a szakértői döntés meggyorsítása. A „human-in-the-loop” megközelítés nem szlogen, hanem szükségszerűség.

Ahhoz, hogy ez a felügyelet működjön, a felügyelőnek hozzáértőnek kell lennie. A vak beleegyezés („modell mondta, elfogadás”) nem felügyelet. A valódi felügyelethez olyan szakértelemre van szükség, amely megkérdőjelezi a kimenetet, elkapja a hibáját, és szükség esetén elutasítja. Ezért a mesterséges intelligencia nem helyettesíti a szakértőt; A szakértőt még nélkülözhetetlenebbé teszi. Aki a legjobban használja a járművet, az tudja a legjobban irányítani.

Összefoglalva

A mesterséges intelligencia felelős felhasználása a biológiában négy területet fed le: adatvédelem (érzékeny emberi adatok védelme), biológiai biztonság (a kettős felhasználás elkerülése), tudományos integritás (őszinte és teljes jelentés) és elfogultság tudatosítás (az eredmények érvényessége minden csoportban). Ne adjon meg érzékeny adatokat a nyílt modellhez, deklarálja átláthatóan a felhasználást, kérdőjelezze meg a populáció torzítását. Az etikai felelősség soha nem ruházható át az ügynökre; Mindig az emberben van.

Pályázati feladat

Vegyünk egy forgatókönyvet a saját munkaterületéről (például emberi adatkészlet vagy képmodell használatával). A mesterséges intelligencia állítsa elő ennek a forgatókönyvnek az etikai ellenőrző listáját (bizalmasság, beleegyezés, elfogultság, kettős felhasználás, átláthatóság) valós adatok megosztása nélkül. Minden tételnél jelölje meg, hogy „megfelelő/kockázatos/bizonytalan” az Ön helyzetében, és írjon cselekvési tervet azoknak, amelyek kockázatos/bizonytalanok. Készítsen cikkéhez egy mesterséges intelligencia használatára vonatkozó nyilatkozatot is.

ellenőrző lista

  • [ ] Nem adtam meg érzékeny/személyes adatokat a nyílt modellhez.
  • [ ] Ellenőriztem a hozzájárulási és etikai bizottság körét.
  • [ ] Felmértem a kettős felhasználás/biológiai biztonsági kockázatot.
  • [ ] Minden eredményt őszintén jelentettem.
  • [ ] Megkérdőjeleztem a népesség/adat torzítást.
  • [ ] Átláthatóan nyilatkoztam a mesterséges intelligencia használatáról, és felelősséget vállaltam.

Modul vizsga

1. Egy diák megkérdezte a nyelvi modellt, hogy "hány karakterlánc van ebben a FASTA fájlban?" – kérdezi, a modell pedig 48-at válaszol. Melyik a leghelyesebb megközelítés?

  • A) Közvetlenül a modell által megadott 48-as szám használatával; A modell megbízható, mert látja a fájlt
  • B) Kérdezd meg még egyszer a számot, és fogadd el helyesnek, ha a két válasz megegyezik
  • C) A fájl beolvasása Biopython segítségével, a szekvenciák számának megszámlálása kóddal és a kimenet használata ✔
  • D) A fájl manuális megnyitása és szem döntéssel történő számolás

Magyarázat: A determinisztikus feladatokat, például a számlálást és a mérést a futtatott kódra kell hagyni, nem a nyelvi modellre. A modell nem „emlékezik” a számra, valószínűségi értéket állít elő, és tévedhet; A Biopythonhoz hasonló eszközzel történő számolás pontos és reprodukálható eredményeket ad.

2. Meg akarja számolni a sejteket egy mikroszkópos képen, és meg szeretné mérni mindegyik területét. Mi a legmegfelelőbb megközelítés erre a feladatra?

  • A) Szakértői szegmentáló eszköz, például Cellpose/StarDist használata és az eredmény kézi ellenőrzése ✔
  • B) Illessze be a képet az általános nyelvi modellbe, és kérdezze meg "hány cella van"
  • C) Írja le a képet a modellnek, és kérjen becsült számot
  • D) A pixelek számának elfogadása cellaszámként kalibrálás nélkül

Magyarázat: A sejtszegmentálás és -mérés nem az általános nyelvi modell, hanem a speciálisan erre a feladatra kiképzett képmodellek (Cellpose, StarDist) területe. A nyelvi modell írja az eszközöket meghívó kódot; A szakértői modell elvégzi a mérést, a biológus pedig ellenőrzi az eredményt.

3. Egy végzős hallgató 8 nyelvi modell által előállított forrást ad a dolgozat bevezetőjéhez. A tanácsadó úgy találja, hogy ezek közül 3 egyáltalán nem létezik. Hogyan lehetne ezt a helyzetet megelőzni?

  • A) Megkérjük a modellt, hogy ismét termeljen erőforrásokat
  • B) Csak a DOI-val rendelkező idézetek kiválasztásával (ha van DOI, akkor az valós)
  • C) A lista lekérése a modell „illeszkedés” utasításával
  • D) Függetlenül ellenőrzi a PubMed/doi.org webhelyen található minden idézetet, és csak az általa olvasott cikkeket idézi ✔

Magyarázat: Az általános nyelvi modellek nem irodalmi adatbázisok; Ahelyett, hogy valódi rekordokat keresne, valósághű hangzású attribútumokat "generál" (koholt attribúció). Az egyes szerzői sorokat és DOI-kat nem szabad független ellenőrzés nélkül használni olyan forrásokban, mint a PubMed/doi.org, és csak a ténylegesen elolvasott cikkekre hivatkozva.

4. Mi a leghatékonyabb módja a mesterséges intelligencia által írt adattisztító kód pontosságának biztosításának?

  • A) Ha a kód hibátlanul működik, fogadja el helyesnek.
  • B) Az eredmény tesztelése ismert kis mintával és az elvárás igazolása ✔ asserttel
  • C) Kérdezd meg a modelltől: "Helyes-e a kód?" kérdezni és bízni az igen válaszban
  • D) Futtassa többször a kódot, és minden alkalommal ugyanazt a kimenetet kapja

Megjegyzés: Az, hogy a kód hiba nélkül működik, nem jelenti azt, hogy helyes; A „hiba nélkül működő rossz kód” a legveszélyesebb helyzet a biológiában. A kis mintával végzett tesztelés, amelynek eredményét előre ismeri, és az elvárás beágyazása a kódba az assert-tel a legerősebb pajzs a csendes rossz eredmények ellen.

5. Az RNS-seq analízis során 20 000 gént teszteltünk, és 3800 gént találtunk „szignifikánsnak”, p<0,05 korrekció nélkül. Mi a fő probléma ezzel a következtetéssel?

  • A) A minták száma túl magas, csökkenteni kell
  • B) a p küszöb túl magas, 0,10-et kellett volna használni
  • C) Nem történt többszörös összehasonlítás korrekció (FDR); Sok téves pozitív eredmény van ✔
  • D) Gének helyett mintákat kellett volna vizsgálni

Magyarázat: Ha több ezer gént tesztelünk egyidejűleg, sok gén véletlenül „szignifikánsnak” tűnik, még akkor is, ha nincs valódi különbség; Ezt többszörös összehasonlítási problémának nevezik. A megoldás az FDR (false discovery rate) korrekció alkalmazása olyan módszerrel, mint például a Benjamini-Hochberg; Korrekcióval a lista általában tíz-néhány génre csökken.

6. A BLAST eredményben a legjobb mérkőzés E-értéke 2,0. Ez mit jelent?

  • A) Az egyezés nagy valószínűséggel véletlenszerű; ✔ nem megbízható párosítás
  • B) A tengelykapcsoló nagyon erős; Minél nagyobb az e-érték, annál jobb
  • C) A sorozat 2%-os arányban egyezik
  • D) A két szekvencia között 2 bázis különbség van

Magyarázat: Az E-érték azt jelzi, hogy az egyezés véletlenszerű lesz; Jobb kicsinek lenni. Az 1-nél nagyobb e-érték azt jelzi, hogy az egyezés nagy valószínűséggel véletlenszerű. A megbízható egyezések érdekében általában nagyon kicsi küszöbértékeket keresnek, például e < 1e-5.

7. Egy AlphaFold modellben a fehérje terminális régiója alacsony pLDDT pontszámot mutat (<50). Hogyan kell értelmezni ezt a régiót?

  • A) Az AlphaFold hibát követett el ebben a régióban, ezért a régiót el kell távolítani az elemzésből
  • B) Ez a régió határozottan egy alfa-hélix
  • C) A modell teljesen megbízhatatlan, a szerkezetet nem szabad használni
  • D) A régió valószínűleg szabálytalan/rugalmas; „Nem világos”-ként kell értelmezni, nem pedig „hamis” ✔

Leírás: A pLDDT az egyes aminosavak helyi megbízhatósági pontszáma; Az 50 alatti értékek gyakran valóban szabálytalan (rugalmas, nem rögzített) régiókat tükröznek. Helytelen ezeket a régiókat automatikusan törölni, mint „téves találgatást”; Az alacsony pontszámot „bizonytalan/rugalmas”-ként kell értelmezni, és értékelni kell biológiai jelentőségét.

8. A kutató csak pixelben adja meg a sejtterületeket, és az eredmények nincsenek összhangban az irodalommal. Mi a hiányzó lépés?

  • A) Több sejtet kellett volna megszámolni
  • B) Skála kalibrálás (pixel-mikrométer konverzió) nem történt, az eredményeket nem konvertálták át fizikai mértékegységekre ✔
  • C) A szegmentáló eszközt rosszul választották ki
  • D) A képfelbontás túl nagy

Magyarázat: A méretarány kalibrálása (hány mikrométer/pixel) elengedhetetlen a fizikai méret kinyeréséhez a képből. Ha ezt a lépést kihagyja, az értékek összehasonlíthatatlanok maradnak, a mikroszkóp beállításától függően. A területeket át kell alakítani fizikai egységekre, például négyzetmikrométerekre.

9. Egy tanuló 10 szövetmintát vesz egyetlen egérből, és 'n=10'-et használ a statisztikákban. Miért helytelen ez?

  • A) 10 minta kevés a statisztikákhoz, legalább 30-ra van szükség
  • B) Különböző szervekből kellett szövetmintákat venni
  • C) Ez a 10 példa technikai ismétlés; biológiai n továbbra is 1, ez az úgynevezett ismétlés ✔
  • D) A minták érvénytelenek, mert ugyanazon a napon vették őket

Magyarázat: Az ugyanazon személytől végzett ismételt mérések technikai ismétlések; ahol a statisztikai n a biológiai egységek (itt egerek) száma. Ha a technikai ismétlést biológiainak tekintjük (pszeudoreplikáció), hamis jelentőséget adunk. A megfelelő tervezés azt jelenti, hogy több személlyel kell dolgozni.

10. One analysis found p=0.03. Mi ennek az értéknek a helyes értelmezése?

  • A) 3% esély van arra, hogy ilyen vagy ennél szélsőségesebb eredményt lát, ha a valóságban nincs különbség ✔
  • B) A hatás valós valószínűsége 97%
  • C) Annak a valószínűsége, hogy a nullhipotézis igaz, 3%
  • D) The result is 97% repeatable

Magyarázat: p-érték nem „valószínűsége annak, hogy a hipotézis igaz”, vagy „valószínűsége annak, hogy a hatás igaz”. A p-érték annak a valószínűsége, hogy a különbséget a megfigyeltnél nagyobbnak vagy szélsőségesebbnek látjuk, ha valójában nincs különbség. Ezért a p=0,03 nem azt jelenti, hogy „a hatás 97%-ban valós”; az eredményeket a hatás méretével és konfidenciaintervallumával is értékelni kell.

11. Egy prezentációban az y-tengely 95-100-as tartományba való összenyomásával két csoport közötti 3%-os különbség hatalmasnak mutatkozik. What is this an example of?

  • A) A good visualization technique; highlights the difference
  • B) Colorblind friendly palette problem
  • C) An acceptable style choice
  • D) Félrevezető és tisztességtelen diagram, amely eltúlozza a különbséget a csonka tengellyel ✔

Magyarázat: Ha nem nulláról inicializálja a tengelyt (csonka tengely), az félrevezeti a nézőt egy kis eltérés vizuális eltúlzásával. This is a violation of the principle of honesty; Különösen oszlopdiagramokban a tengelynek nulláról kell indulnia, és a különbséget a tényleges méretével kell megjeleníteni.

12. Egy kutató beilleszti a szerinte anonim betegek exome-adatait egy nyilvános nyelvi modellbe, hogy elemezze azokat. Why is this behavior problematic?

  • A) Nincs probléma; data can be shared if anonymous
  • B) Az érzékeny betegadatok nyílt modellben való megadása sérti a magánélet védelmét és az etikai/jogszabályokat (KVKK/GDPR), és nem vonható vissza ✔
  • C) Már csak azért is problémás, mert az elemzés lassú lesz
  • D) A modell problémás, mert nem tudja megérteni az adatokat

Leírás: A beteg genetikai/klinikai adatai rendkívül érzékenyek; Még az anonimnak hitt genomikai adatok is újra azonosíthatók. Ezen adatok nyilvános modell számára történő megadása sérti a KVKK/GDPR és az etikai bizottság (IRB) jóváhagyását, és a magánélet visszafordíthatatlan megsértését jelenti. Az érzékeny adatokat helyi/biztonságos, szerződéses környezetben kell feldolgozni.

13. Az egyik vizsgálatban a „beteg és a kontroll” közötti különbség valójában annak tudható be, hogy a mintákat két különböző napon dolgozták fel. Hogy hívják ezt a helyzetet és hogyan kezelik?

  • A) It is the outlier effect; pontokat törölni kell
  • B) It is a lack of normalization; only scale correction is sufficient
  • C) It is the batch effect; kiegyensúlyozottnak kell lennie a tervezésben, és hozzá kell adni a modellhez kötegelt változóként ✔
  • D) p-hackelés; the test should be changed

Magyarázat: A mintavételi tétel/feldolgozási nap miatti technikai eltérést köteghatásnak nevezik, és összetéveszthető a biológiai különbséggel. A helyes megközelítés az, hogy a tervezésben kiegyensúlyozzuk a kötegeket, és hozzáadjuk a kötegelt változót a statisztikai modellhez (pl. „~tétel + feltétel”), így elválasztva a műszaki jelet a biológiai jeltől.

14. Egy DNS-szekvencia GC arányát szeretné kiszámítani. Which is the correct and repeatable approach?

  • A) Nyomtassa ki a kódot, amely kiszámítja a GC arányt a Biopython segítségével, futtassa, és használja a kimenetet ✔
  • B) Adja meg a modellnek a sorozatot, és kérje meg, hogy mondja el szóban a GC sebességét
  • C) A modell által megadott arány megerősítése egy másik modellel
  • D) A sorozat első 100 betűjének megtekintése és szemrevételezés

Magyarázat: A GC arány egy determinisztikus számítás; a tömböt feldolgozó kódon kell alapulnia, nem pedig olyan értéken, amelyre a nyelvi modell „emlékezik”. Ahelyett, hogy a modell kiszámítaná, ha kinyomtatja a számítási kódot egy olyan eszközzel, mint a Biopython, és saját maga futtatja, akkor pontos eredményt kap, amely ugyanazt az eredményt adja minden alkalommal, amikor futtatja.