Eenheid 11 / 11

Ethiek, bioveiligheid, vertrouwelijkheid en wetenschappelijke integriteit

Winst:

  • Mogelijkheid om gevoelige menselijke/genetische gegevens te beschermen in overeenstemming met de regels van de KVKK, de AVG en de ethische commissie, en te voorkomen dat ze aan het open model worden doorgegeven
  • Vermogen om de geldigheid van resultaten in twijfel te trekken door de risico's van bioveiligheid/duaal gebruik en bevolkingsvooroordelen te beoordelen
  • Begrijpen dat ethische verantwoordelijkheid niet aan het voertuig kan worden gedelegeerd en dat een zinvolle ‘human-in-the-loop’ noodzakelijk is

Het krachtig inzetten van kunstmatige intelligentie in de biologie wordt aangevuld met een verantwoord gebruik ervan. Biologie is een gevoelig vakgebied dat raakt aan de menselijke gezondheid, genetische privacy, het milieu en zelfs bioveiligheid. In deze unit bespreken we de ethische, juridische en veiligheidsverantwoordelijkheden waarmee u te maken krijgt bij het gebruik van kunstmatige intelligentie in biologische onderzoeken. Deze unit is een raamwerk dat is gebouwd op de principes van verificatie en eerlijkheid uit alle voorgaande units.

Basisprincipe: AI is een hulpmiddel; Ethische verantwoordelijkheid ligt altijd bij de mens. ‘Het voorgestelde model’ is geen excuus.

Vier verantwoordelijkheidsgebieden

1. Gegevensprivacy en menselijke gegevens

Genetische, klinische of gezondheidsgegevens van menselijke deelnemers zijn uiterst gevoelig. De DNA-sequentie van een persoon kan het ziekterisico en de identiteit van hemzelf en zijn familieleden onthullen; Zelfs genomische gegevens waarvan men denkt dat ze geanonimiseerd zijn, kunnen opnieuw worden geïdentificeerd. Het plakken van deze gegevens in een openbaar beschikbaar AI-model kan in strijd zijn met de wetgeving inzake gegevensbescherming (KVKK in Türkiye, GDPR in Europa) en goedkeuringen van de ethische raad (IRB/ethische commissie).

  • Verstrek geen persoonlijke/klinische gegevens aan het open model.
  • Vermijd gebruik buiten het bereik van de toestemming; Waar heeft de deelnemer mee ingestemd?
  • Kies voor zakelijke/lokale (on-premise) of contracttools voor gegevensverwerking.

2. Bioveiligheid en duaal gebruik

Sommige biologische informatie is 'voor tweeërlei gebruik': het kan zowel nuttig als schadelijk zijn; bijvoorbeeld sequenties van pathogenen (ziekteveroorzakende), toxineproductie. Het vragen van AI om informatie over het vergroten van gevaarlijke ziekteverwekkers of het ontwerpen van schadelijke biologische agentia is op de meeste plaatsen onethisch en illegaal.

  • Dien geen gevaarlijke verzoeken voor tweeërlei gebruik in.
  • Volg de richtlijnen van de bioveiligheidsraad (IBC) van uw instelling.

3. Wetenschappelijke integriteit

Alles wat we in eerdere eenheden hebben gezien, komt hier samen: geen valse toeschrijving, geen gegevensverfraaiing, geen p-hacking, geen selectieve rapportage. Kunstmatige intelligentie kan deze gemakkelijker of moeilijker maken; Het verschil zit in jouw eerlijkheid.

  • Rapporteer alle resultaten (inclusief negatieve).
  • Verklaar het gebruik van kunstmatige intelligentie.
  • Ondersteun de reproduceerbaarheid door onbewerkte gegevens en code te delen (indien mogelijk).

4. Vooringenomenheid en eerlijkheid

AI-modellen dragen vooroordelen over van de gegevens waarop ze zijn getraind. Genomische databases zijn voornamelijk afkomstig van populaties van Europese afkomst; dit leidt tot slechtere voorspellingen in andere populaties. Een beeldmodel kan slecht presteren in een toestand die ondervertegenwoordigd is in de trainingsgegevens.

  • Vraag op welke populatie/gegevens het model is getraind.
  • Evalueer of de resultaten gelden voor alle groepen.
Tip: Stel uzelf de vraag: "Als ik deze gegevens aan het model geef, van wie zijn deze dan en heeft die persoon toestemming gegeven?" Als het antwoord vaag is, geef het dan niet. De schending van de vertrouwelijkheid is onomkeerbaar.

Stap voor stap: verantwoorde AI-controle

  1. Classificeer de gegevensbron: persoonlijk/gevoelig of openbaar?
  2. Controleer toestemming en machtigingen: valt dit gebruik onder de dekking?
  3. Kies de juiste tool: Veilige/native omgeving voor gevoelige data.
  4. Houd rekening met het risico van dubbelgebruik.
  5. Vraagbias: is het resultaat geldig in alle groepen?
  6. Gebruik documenteren en declareren.

Kopieerbare promptsjablonen

Bekijk hieronder mijn analyseplan vanuit een ethisch perspectief: som waarschuwingen op met betrekking tot de vertrouwelijkheid van gegevens, toestemming van deelnemers, mogelijke vooringenomenheid en het risico van dubbel gebruik. Plan: [tekst] (Opmerking: ik deel GEEN daadwerkelijke patiëntgegevens, alleen het plan.)

Welke privacy- en toestemmingsvragen moet ik beantwoorden voordat ik deze genomische dataset gebruik? Er wordt een checklist opgesteld op het gebied van KVKK/GDPR en de ethische commissie.

Hoe moet ik op transparante wijze de tool voor kunstmatige intelligentie aangeven die ik gebruik in de methodesectie van mijn artikel? Schrijf een voorbeeld van een verklarende zin; welke informatie (tool, versie, toepassingsgebied) moet het bevatten?

Hoe evalueer ik of de resultaten van dit model een populatiebias vertonen? Geef een overzicht van de vragen die ik moet stellen over de trainingsgegevens en de controlestappen.

Zwakke prompt/sterke prompt

Zwak: "Analyseer de genetische gegevens van de volgende patiënt: [echte gegevens]."

Güçlü: "Ik ben een analyseplan aan het opzetten dat werkt met klinische genomische gegevens, maar ik deel geen echte patiëntgegevens. Alleen vanuit methodologisch perspectief: welke vertrouwelijkheidsmaatregelen moet ik nemen, in welke omgeving moet ik de gegevens verwerken, aan welke goedkeurings- en ethische commissievoorwaarden moet ik voldoen? Je kunt de stroom laten zien met dummy-/steekproefgegevens."

Verschil: er worden geen daadwerkelijke gevoelige gegevens gedeeld in de krachtige prompt; Er wordt alleen naar de methode gevraagd. Privacy blijft behouden, het model helpt nog steeds.

drie minikoffers

Geval 1 – Privacyschending: Een onderzoeker plakte wat volgens hem anonieme exoomgegevens van patiënten waren in een open model om deze te laten analyseren. Toen de ethische commissie hiervan hoorde, werd het onderzoek opgeschort; Er was geen verwerkersovereenkomst. Les: gevoelige gegevens komen nooit in het open model terecht.

Geval 2 — Populatievooroordelen: Er werd een polygene risicoscore-tool getraind op basis van gegevens van Europese oorsprong; In een andere populatie waren de risicoschattingen aanzienlijk onnauwkeurig. Toen het model voorstelde om de samenstelling van de trainingsgegevens in twijfel te trekken, besloot het team de tool niet in die populatie te gebruiken. Les: vooringenomenheid redt of schaadt levens.

Geval 3 – Openbaarmaking en transparantie: Een team schreef code voor het opschonen van gegevens met AI en vermeldde dit duidelijk in het methodegedeelte; Hij deelde ook de code. Recensenten verwelkomden dit omdat de herhaalbaarheid groot was. Les: transparantie kweekt vertrouwen.

vergelijkingstabel

gebied

veilig gedrag

riskant gedrag

patiëntgegevens

Lokale/veilige omgeving

Plakken om het model te openen

toestemming

Gebruik binnen bereik

Overschrijd de reikwijdte niet

Bioveiligheid

Dubbel gebruik vermijden

gevaarlijke eis

integriteit

Rapporteer alle resultaten

selectieve berichtgeving

vooringenomenheid

Vraag de bevolking

Blindelings toepassen

transparantie

Gebruik declareren

verbergen

Veel voorkomende fouten

  • Gevoelige gegevens aan het open model geven: onomkeerbare schending van de privacy.
  • Overschrijding van de reikwijdte van de toestemming: Gebruik niet geautoriseerd door de deelnemer.
  • Vooroordelen negeren: resultaten generaliseren naar alle groepen.
  • Gebruik verbergen: AI-bijdrage niet declareren.
  • Verdediging "Model voorgesteld": verantwoordelijkheid aan het voertuig toewijzen.
Let op: bij biologisch werk met grote gevolgen (klinische besluitvorming, bioveiligheid, menselijke gegevens) is AI-output geen vervanging voor deskundige verificatie door deskundigen en ethisch toezicht; het versnelt het alleen maar. De uiteindelijke verantwoordelijkheid ligt altijd bij de mens, samen met de ethische en wetenschappelijke consequenties van de beslissing.

Milieu, ecologie en traditionele kennis

Ethische verantwoordelijkheid beperkt zich niet tot menselijke gegevens. Voorzichtigheid is ook geboden bij het gebruik van kunstmatige intelligentie in de ecologie en natuurbehoudsbiologie. De precieze locatiegegevens (coördinaten van de cameravallen) van een bedreigde soort zijn bijvoorbeeld gevoelig vanwege het risico op stroperij; Het vrijgeven van deze gegevens aan een open model of publiek zou de soort kunnen schaden. Op dezelfde manier ontstaan ​​ethische en juridische kwesties (zoals het Nagoya Protocol) wanneer de traditionele biologische kennis van lokale gemeenschappen (bijvoorbeeld het gebruik van een plant) zonder toestemming wordt gebruikt. Alvorens de gegevens te gebruiken, "van wie is deze informatie en wie zou schade lijden door de openbaarmaking ervan?" Stel altijd de vraag.

Menselijk toezicht en uiteindelijke beslissing

De essentie van deze hele module komt neer op één principe: betekenisvol menselijk toezicht. AI komt met een suggestie, schrijft een concept, laat een patroon zien; Maar een biologische, klinische of ethische beslissing is nooit rechtstreeks gebaseerd op de output van modellen. Vooral in gebieden met een hoog risico (diagnose, behandeling, beslissing over het behoud van soorten, vrijlating) is de rol van het model niet het nemen van beslissingen, maar het versnellen van de beslissing van de deskundige. De ‘human-in-the-loop’-benadering is geen slogan, maar een noodzaak.

Om dit toezicht te laten werken, moet de toezichthouder competent zijn. Blinde toestemming (“model gezegd, aanvaarding”) is geen onoplettendheid. Voor echt toezicht is expertise nodig die de resultaten in twijfel kan trekken, fouten kan ontdekken en deze indien nodig kan afwijzen. Daarom vervangt kunstmatige intelligentie de expert niet; Het maakt de expert nog onmisbaarder. Degene die het voertuig het beste gebruikt, is degene die het het beste kan besturen.

Samengevat

Verantwoord gebruik van AI in de biologie omvat vier gebieden: gegevensprivacy (bescherming van gevoelige menselijke gegevens), bioveiligheid (voorkomen van dubbel gebruik), wetenschappelijke integriteit (eerlijke en volledige rapportage) en bewustzijn van vooroordelen (geldigheid van resultaten voor alle groepen). Verstrek geen gevoelige gegevens aan het open model, declareer het gebruik op transparante wijze en trek de vooroordelen van de bevolking niet in twijfel. Ethische verantwoordelijkheid kan nooit aan de agent worden gedelegeerd; Het zit altijd in de mens.

Applicatie taak

Overweeg een scenario uit uw eigen werkruimte (bijvoorbeeld met behulp van een menselijke dataset of een beeldmodel). Laat de AI de ethische checklist van dit scenario bedenken (vertrouwelijkheid, toestemming, vooringenomenheid, dubbel gebruik, transparantie) zonder echte gegevens te delen. Markeer elk item als ‘gepast/risicovol/onzeker’ in uw situatie en schrijf een actieplan voor de items die riskant/onzeker zijn. Laat ook voor uw artikel een AI-gebruiksverklaring opstellen.

controlelijst

  • [ ] Ik heb geen gevoelige/persoonlijke gegevens aan het open model verstrekt.
  • [ ] Ik heb de reikwijdte van de toestemming en de ethische commissie gecontroleerd.
  • [ ] Ik heb het risico voor tweeërlei gebruik/bioveiligheid beoordeeld.
  • [ ] Ik heb alle resultaten eerlijk gerapporteerd.
  • [ ] Ik twijfelde aan de populatie-/gegevensbias.
  • [ ] Ik heb op transparante wijze het gebruik van kunstmatige intelligentie verklaard en de verantwoordelijkheid op mij genomen.

Module-examen

1. Een leerling vroeg aan het taalmodel 'hoeveel strings zitten er in dit FASTA-bestand?' vraagt ​​hij en het model antwoordt '48'. Wat is de meest correcte aanpak?

  • A) Rechtstreeks gebruik makend van het nummer 48 gegeven door het model; Het model is betrouwbaar omdat het het bestand ziet
  • B) Vraag het getal nogmaals en accepteer het als juist als de twee antwoorden hetzelfde zijn
  • C) Het bestand lezen met Biopython, het aantal reeksen met code tellen en de uitvoer gebruiken ✔
  • D) Het bestand handmatig openen en tellen via oogbeslissing

Uitleg: Deterministische taken zoals tellen en meten moeten worden overgelaten aan de code die u uitvoert, niet aan het taalmodel. Het model 'onthoudt' het getal niet, het produceert een probabilistische waarde en kan zich vergissen; Tellen met een tool als Biopython geeft nauwkeurige en reproduceerbare resultaten.

2. U wilt cellen in een microscoopopname tellen en de oppervlakte van elk ervan meten. Wat is de meest geschikte aanpak voor deze taak?

  • A) Een deskundige segmentatietool zoals Cellpose/StarDist gebruiken en het resultaat handmatig verifiëren ✔
  • B) Plak de afbeelding in het algemene taalmodel en vraag 'hoeveel cellen zijn er'
  • C) Beschrijf de afbeelding voor het model en vraag om een geschat aantal
  • D) Het aantal pixels accepteren als het aantal cellen zonder enige kalibratie

Uitleg: Celsegmentatie en -meting is niet het domein van het algemene taalmodel, maar van gespecialiseerde beeldmodellen (Cellpose, StarDist) die speciaal voor deze taak zijn opgeleid. Het taalmodel schrijft de code die deze tools aanroept; Het expertmodel doet de meting en de bioloog verifieert het resultaat.

3. Een afgestudeerde student voegt 8 bronnen geproduceerd door het taalmodel toe aan zijn scriptieinleiding. De adviseur constateert dat 3 hiervan helemaal niet bestaan. Hoe zou deze situatie voorkomen kunnen worden?

  • A) Door het model te vragen opnieuw grondstoffen te produceren
  • B) Door alleen de citaten met DOI te selecteren (als er een DOI is, is deze echt)
  • C) Opvragen van de lijst door het model de opdracht te geven te 'passen'
  • D) Elke citatie op PubMed/doi.org onafhankelijk verifiëren en alleen de artikelen citeren die hij heeft gelezen ✔

Toelichting: Algemene taalmodellen zijn geen literatuurdatabase; In plaats van te zoeken naar echte platen, 'genereert' het realistisch klinkende attributies (verzonnen attributie). Elke naamregel en DOI mag niet worden gebruikt zonder onafhankelijke verificatie in bronnen zoals PubMed/doi.org en alleen door artikelen te citeren die daadwerkelijk zijn gelezen.

4. Wat is de krachtigste manier om de nauwkeurigheid te garanderen van een door kunstmatige intelligentie geschreven code voor het opschonen van gegevens?

  • A) Als de code zonder fouten werkt, accepteer deze dan als correct.
  • B) Het testen van het resultaat met een kleine bekende steekproef en het verifiëren van de verwachting met bewering ✔
  • C) Vraag het model 'is de code correct?' vragen en vertrouwen op het antwoord 'ja'
  • D) Voer de code meerdere keren uit en krijg elke keer dezelfde uitvoer

Opmerking: het feit dat de code zonder fouten werkt, betekent niet dat deze correct is; 'verkeerde code werkt zonder fouten' is de gevaarlijkste situatie in de biologie. Testen met een kleine steekproef waarvan je het resultaat van tevoren kent en het inbedden van de verwachting in de code met assert is het sterkste schild tegen stille foute resultaten.

5. In een RNA-seq-analyse worden 20.000 genen getest en blijken 3.800 genen 'significant' te zijn met p<0,05 zonder correctie. Wat is het voornaamste probleem met deze conclusie?

  • A) Het aantal monsters is te hoog en moet worden verminderd
  • B) de p-drempel is te hoog, er had 0,10 moeten worden gebruikt
  • C) Er is geen meervoudige vergelijkingscorrectie (FDR) uitgevoerd; Er zijn veel valse positieven ✔
  • D) Monsters hadden getest moeten worden in plaats van genen

Uitleg: Wanneer je duizenden genen tegelijk test, lijken veel genen toevallig 'significant', ook al is er geen echt verschil; Dit wordt het meervoudige vergelijkingsprobleem genoemd. De oplossing is om FDR-correctie (false discovery rate) toe te passen met een methode zoals Benjamini-Hochberg; Met correctie wordt de lijst doorgaans teruggebracht tot tientallen tot enkele honderden genen.

6. De beste match in een BLAST-resultaat heeft een E-waarde van 2,0. Wat betekent dit?

  • A) De match is hoogstwaarschijnlijk willekeurig; ✔ geen betrouwbare match
  • B) De koppeling is erg sterk; Hoe groter de e-waarde, hoe beter
  • C) De reeks kwam overeen met een snelheid van 2%
  • D) Er is een verschil van 2 basen tussen de twee sequenties

Uitleg: De E-waarde geeft de verwachting aan dat de match willekeurig zal zijn; Het is beter om klein te zijn. Een e-waarde groter dan 1 geeft aan dat de match hoogstwaarschijnlijk willekeurig is. Voor betrouwbare matches wordt doorgaans gezocht naar zeer kleine drempels, zoals e < 1e-5.

7. In een AlphaFold-model vertoont het terminale gebied van het eiwit een lage pLDDT-score (<50). Hoe moet deze regio geïnterpreteerd worden?

  • A) AlphaFold heeft een fout gemaakt in deze regio, de regio moet uit de analyse worden verwijderd
  • B) Deze regio is beslist een alfa-helix
  • C) Het model is volkomen onbetrouwbaar, de structuur mag niet worden gebruikt
  • D) Het gebied is waarschijnlijk onregelmatig/elastisch; moet worden geïnterpreteerd als 'onduidelijk' in plaats van als 'onwaar' ✔

Beschrijving: pLDDT is de lokale betrouwbaarheidsscore voor elk aminozuur; Waarden onder de 50 weerspiegelen vaak werkelijk onregelmatige (flexibele, niet-vaste) gebieden. Het is verkeerd om deze regio's automatisch te verwijderen als 'verkeerde gissingen'; Een lage score moet worden gelezen als 'onzeker/flexibel' en de biologische betekenis ervan moet worden geëvalueerd.

8. Een onderzoeker rapporteert celgebieden alleen in pixels en de resultaten zijn inconsistent met de literatuur. Wat is de ontbrekende stap?

  • A) Er hadden meer cellen geteld moeten worden
  • B) Schaalkalibratie (conversie van pixel naar micrometer) is niet uitgevoerd, de resultaten zijn niet omgezet in fysieke eenheden ✔
  • C) De segmentatietool is verkeerd gekozen
  • D) Beeldresolutie is te hoog

Uitleg: Schaalkalibratie (hoeveel micrometer per pixel) is essentieel om de fysieke grootte uit de afbeelding te halen. Als deze stap wordt overgeslagen blijven de waarden onvergelijkbaar, afhankelijk van de microscoopinstelling. Gebieden moeten worden omgezet in fysieke eenheden zoals vierkante micrometers.

9. Een leerling neemt 10 weefselmonsters van één muis en gebruikt 'n=10' in de statistieken. Waarom is dit onjuist?

  • A) 10 monsters zijn te weinig voor statistieken, er zijn minstens 30 nodig
  • B) Weefselmonsters moesten uit verschillende organen worden genomen
  • C) Deze 10 voorbeelden zijn technische herhalingen; biologische n is nog steeds 1, dit is de zogenaamde herhaling ✔
  • D) Monsters zijn ongeldig omdat ze op dezelfde dag zijn genomen

Uitleg: Herhaalde metingen bij hetzelfde individu zijn technische herhalingen; waarbij statistische n het aantal biologische eenheden is (hier muizen). Het beschouwen van technische herhaling als biologisch (pseudoreplicatie) levert een valse betekenis op. Een goed ontwerp betekent werken met meerdere personen.

10. Eén analyse vond p=0,03. Wat is de juiste interpretatie van deze waarde?

  • A) Er is een kans van 3% dat u dit of een extremer resultaat ziet, terwijl er in werkelijkheid geen verschil is ✔
  • B) De waarschijnlijkheid dat het effect reëel is, is 97%
  • C) De kans dat de nulhypothese waar is, is 3%
  • D) Het resultaat is voor 97% herhaalbaar

Toelichting: p-waarde is niet 'waarschijnlijkheid dat de hypothese waar is' of 'waarschijnlijkheid dat het effect waar is'. De p-waarde is de waarschijnlijkheid dat een verschil even groot of extremer is dan het waargenomen verschil, terwijl er feitelijk geen verschil is. Daarom betekent p=0,03 niet 'het effect is voor 97% reëel'; de resultaten moeten ook worden geëvalueerd op basis van de effectgrootte en het betrouwbaarheidsinterval.

11. In een presentatie wordt een verschil van 3% tussen twee groepen als enorm weergegeven door de y-as te comprimeren naar het bereik van 95-100. Waar is dit een voorbeeld van?

  • A) Een goede visualisatietechniek; benadrukt het verschil
  • B) Kleurenblindvriendelijk paletprobleem
  • C) Een acceptabele stijlkeuze
  • D) Een misleidende en oneerlijke grafiek die het verschil met de afgeknotte as overdrijft ✔

Uitleg: Het niet initialiseren van de as vanaf nul (afgeknotte as) misleidt de kijker door een klein verschil visueel te overdrijven. Dit is een schending van het eerlijkheidsbeginsel; Vooral in staafdiagrammen moet de as vanaf nul beginnen en moet het verschil worden weergegeven met de werkelijke grootte.

12. Een onderzoeker plakt wat volgens hem anonieme exoomgegevens van patiënten zijn in een openbaar taalmodel om deze te laten analyseren. Waarom is dit gedrag problematisch?

  • A) Er is geen probleem; gegevens kunnen worden gedeeld als ze anoniem zijn
  • B) Het verstrekken van gevoelige patiëntgegevens aan een open model is een schending van de privacy en ethisch/juridisch (KVKK/GDPR) en kan niet ongedaan worden gemaakt ✔
  • C) Het is alleen problematisch omdat de analyse traag zal zijn
  • D) Het model is problematisch omdat het de gegevens niet kan begrijpen

Beschrijving: Genetische/klinische gegevens van patiënten zijn uiterst gevoelig; Zelfs genomische gegevens waarvan men denkt dat ze anoniem zijn, kunnen opnieuw worden geïdentificeerd. Het verstrekken van deze gegevens aan een openbaar model schendt de goedkeuringen van de KVKK/GDPR en de ethische commissie (IRB) en is een onomkeerbare inbreuk op de privacy. Gevoelige gegevens moeten worden verwerkt in lokale/beveiligde, gecontracteerde omgevingen.

13. In één onderzoek was het verschil waarvan zij dachten dat het 'patiënt versus controle' was, feitelijk te wijten aan het feit dat de monsters op twee verschillende dagen werden verwerkt. Hoe wordt deze situatie genoemd en hoe wordt hiermee omgegaan?

  • A) Het is het uitbijtereffect; punten moeten worden verwijderd
  • B) Het is een gebrek aan normalisatie; alleen schaalcorrectie is voldoende
  • C) Het is het batcheffect; moet in het ontwerp gebalanceerd zijn en als batchvariabele aan het model worden toegevoegd ✔
  • D) p-hacken; de test moet worden gewijzigd

Toelichting: Een technisch verschil als gevolg van bemonsteringspartij/verwerkingsdag wordt batcheffect genoemd en kan worden verward met biologisch verschil. De juiste aanpak is om de batches in het ontwerp in evenwicht te brengen en de batchvariabele toe te voegen aan het statistische model (bijvoorbeeld '~batch + condition'), waardoor het technische signaal wordt gescheiden van het biologische signaal.

14. U wilt de GC-ratio van een DNA-sequentie berekenen. Wat is de juiste en herhaalbare aanpak?

  • A) Druk de code af die de GC-snelheid berekent met Biopython, voer deze uit en gebruik de uitvoer ✔
  • B) Geef het model de volgorde en vraag hem om mondeling het GC-percentage te vertellen
  • C) Bevestiging van de verhouding gegeven door het model door een ander model
  • D) Kijken naar de eerste 100 letters van de serie en raden met het oog

Uitleg: Het GC-tarief is een deterministische berekening; moet gebaseerd zijn op de code die de array verwerkt, en niet op een waarde die het taalmodel 'onthoudt'. In plaats van het model het te laten berekenen, zal het afdrukken van de rekencode met een tool als Biopython en het zelf uitvoeren ervan een nauwkeurige uitvoer opleveren die elke keer dat u het uitvoert hetzelfde resultaat oplevert.