Κέρδη:
- Δυνατότητα προστασίας ευαίσθητων ανθρώπινων/γενετικών δεδομένων σύμφωνα με τους κανόνες KVKK, GDPR και επιτροπής δεοντολογίας και αποφυγή παροχής τους στο ανοιχτό μοντέλο
- Δυνατότητα αμφισβήτησης της εγκυρότητας των αποτελεσμάτων αξιολογώντας τους κινδύνους βιοασφάλειας/διπλής χρήσης και μεροληψίας πληθυσμού
- Κατανοώντας ότι η ηθική ευθύνη δεν μπορεί να ανατεθεί στο όχημα και ότι είναι απαραίτητη η ουσιαστική ανθρώπινη παρουσία
Η ισχυρή χρήση της τεχνητής νοημοσύνης στη βιολογία συμπληρώνεται με την υπεύθυνη χρήση της. Η βιολογία είναι ένας ευαίσθητος τομέας που αγγίζει την ανθρώπινη υγεία, τη γενετική ιδιωτικότητα, το περιβάλλον, ακόμη και τη βιοασφάλεια. Σε αυτή την ενότητα, θα συζητήσουμε τις ηθικές, νομικές και ασφαλείς ευθύνες που θα αντιμετωπίσετε όταν χρησιμοποιείτε την τεχνητή νοημοσύνη σε βιολογικές μελέτες. Αυτή η ενότητα είναι ένα πλαίσιο που βασίζεται στις αρχές της επαλήθευσης και της ειλικρίνειας σε όλες τις προηγούμενες ενότητες.
Βασική αρχή: Η τεχνητή νοημοσύνη είναι ένα εργαλείο. Η ηθική ευθύνη ανήκει πάντα στους ανθρώπους. «Το μοντέλο πρότεινε» δεν είναι δικαιολογία.
Τέσσερις τομείς ευθύνης
1. Απόρρητο δεδομένων και ανθρώπινα δεδομένα
Γενετικά, κλινικά ή δεδομένα υγείας από ανθρώπους που συμμετέχουν είναι εξαιρετικά ευαίσθητα. Η αλληλουχία DNA ενός ατόμου μπορεί να αποκαλύψει τον κίνδυνο και την ταυτότητα της νόσου του και των συγγενών του. Ακόμη και γονιδιωματικά δεδομένα που πιστεύεται ότι είναι ανώνυμα μπορούν να επαναπροσδιοριστούν. Η επικόλληση αυτών των δεδομένων σε ένα μοντέλο τεχνητής νοημοσύνης που είναι διαθέσιμο στο κοινό ενδέχεται να παραβιάζει τους νόμους περί προστασίας δεδομένων (KVKK στην Τουρκία, GDPR στην Ευρώπη) και τις εγκρίσεις του συμβουλίου δεοντολογίας (IRB/επιτροπή δεοντολογίας).
- Μην παρέχετε προσωπικά/κλινικά δεδομένα στο ανοιχτό μοντέλο.
- Αποφύγετε τη χρήση πέρα από το πεδίο της συγκατάθεσης. Σε τι συναίνεσε ο συμμετέχων;
- Επιλέξτε εταιρικά/τοπικά (on-premise) εργαλεία συμβάσεων ή εργαλεία επεξεργασίας δεδομένων.
2. Βιοασφάλεια και διπλή χρήση
Ορισμένες βιολογικές πληροφορίες είναι "διπλής χρήσης": μπορεί να είναι και χρήσιμες και επιβλαβείς. για παράδειγμα, αλληλουχίες παθογόνων (που προκαλούν ασθένειες), παραγωγή τοξινών. Το να ζητάς από την τεχνητή νοημοσύνη πληροφορίες σχετικά με την ενίσχυση επικίνδυνων παθογόνων ή το σχεδιασμό επιβλαβών βιολογικών παραγόντων είναι ανήθικο και παράνομο στα περισσότερα μέρη.
- Μην κάνετε επικίνδυνα αιτήματα διπλής χρήσης.
- Ακολουθήστε τις οδηγίες του συμβουλίου βιοασφάλειας (IBC) του ιδρύματός σας.
3. Επιστημονική ακεραιότητα
Όλα όσα έχουμε δει σε προηγούμενες ενότητες συνδυάζονται εδώ: χωρίς ψευδή απόδοση, χωρίς ωραιοποίηση δεδομένων, χωρίς p-hacking, χωρίς επιλεκτική αναφορά. Η τεχνητή νοημοσύνη μπορεί να τα κάνει ευκολότερα ή δυσκολότερα. Η διαφορά είναι στην ειλικρίνειά σου.
- Αναφέρετε όλα τα αποτελέσματα (συμπεριλαμβανομένων των αρνητικών).
- Δηλώστε τη χρήση τεχνητής νοημοσύνης.
- Υποστηρίξτε την αναπαραγωγιμότητα με κοινή χρήση πρωτογενών δεδομένων και κώδικα (αν είναι δυνατόν).
4. Μεροληψία και δικαιοσύνη
Τα μοντέλα AI φέρουν προκαταλήψεις των δεδομένων στα οποία εκπαιδεύονται. Οι βάσεις δεδομένων γονιδιώματος προέρχονται κυρίως από πληθυσμούς ευρωπαϊκής καταγωγής. Αυτό οδηγεί σε φτωχότερες προβλέψεις σε άλλους πληθυσμούς. Ένα μοντέλο εικόνας μπορεί να έχει κακή απόδοση σε μια κατάσταση που υποεκπροσωπείται στα δεδομένα εκπαίδευσης.
- Αναρωτηθείτε σε ποιον πληθυσμό/δεδομένα εκπαιδεύτηκε το μοντέλο.
- Αξιολογήστε εάν τα αποτελέσματα ισχύουν σε όλες τις ομάδες.
Συμβουλή: Ρωτήστε τον εαυτό σας: "Αν δώσω αυτά τα δεδομένα στο μοντέλο, σε ποιον ανήκουν και έδωσε άδεια αυτό το άτομο;" Αν η απάντηση είναι ασαφής, μην τη δώσεις. Η παραβίαση του απορρήτου είναι μη αναστρέψιμη.
Βήμα προς βήμα: υπεύθυνος έλεγχος AI
- Ταξινόμηση της πηγής δεδομένων: Προσωπική/ευαίσθητη ή δημόσια;
- Ελέγξτε τη συγκατάθεση και τα δικαιώματα: Καλύπτεται αυτή η χρήση;
- Επιλέξτε το σωστό εργαλείο: Ασφαλές/εγγενές περιβάλλον για ευαίσθητα δεδομένα.
- Λάβετε υπόψη τον κίνδυνο διπλής χρήσης.
- Προκατάληψη ερώτησης: Ισχύει το αποτέλεσμα σε όλες τις ομάδες;
- Τεκμηριώστε και δηλώστε τη χρήση.
Αντιγράψιμα πρότυπα προτροπών
Εξετάστε το σχέδιο ανάλυσής μου παρακάτω από ηθική άποψη: αναφέρετε προφυλάξεις σχετικά με το απόρρητο των δεδομένων, τη συναίνεση των συμμετεχόντων, την πιθανή μεροληψία και τον κίνδυνο διπλής χρήσης. Σχέδιο: [κείμενο] (Σημείωση: ΔΕΝ κοινοποιώ πραγματικά δεδομένα ασθενούς, μόνο το σχέδιο.)
Ποιες ερωτήσεις απορρήτου και συναίνεσης πρέπει να απαντήσω πριν χρησιμοποιήσω αυτό το γονιδιωματικό σύνολο δεδομένων; Καταρτίζεται μια λίστα ελέγχου όσον αφορά το KVKK/GDPR και την επιτροπή δεοντολογίας.
Πώς πρέπει να δηλώσω με διαφάνεια το εργαλείο τεχνητής νοημοσύνης που χρησιμοποιώ στην ενότητα μεθόδων του άρθρου μου; Γράψτε ένα παράδειγμα δηλωτικής πρότασης. ποιες πληροφορίες (εργαλείο, έκδοση, εύρος χρήσης) πρέπει να περιέχει;
Πώς αξιολογώ εάν τα αποτελέσματα αυτού του μοντέλου έχουν πληθυσμιακή μεροληψία; Καταγράψτε τις ερωτήσεις που πρέπει να κάνω σχετικά με τα δεδομένα εκπαίδευσης και τα βήματα ελέγχου.
Αδύναμη προτροπή / Ισχυρή προτροπή
Αδύναμο: "Ανάλυση των ακόλουθων γενετικών δεδομένων του ασθενούς: [πραγματικά δεδομένα]."
Güçlü: "Δημιουργώ ένα σχέδιο ανάλυσης που λειτουργεί με κλινικά γονιδιωματικά δεδομένα, αλλά δεν μοιράζομαι πραγματικά δεδομένα ασθενών. Μόνο από μεθοδολογική άποψη: ποια μέτρα εμπιστευτικότητας πρέπει να λάβω, σε ποιο περιβάλλον πρέπει να επεξεργαστώ τα δεδομένα, ποιες προϋποθέσεις επιτροπής έγκρισης και δεοντολογίας πρέπει να πληρώ; Μπορείτε να δείξετε τη ροή με εικονικά δεδομένα/δείγματα δεδομένων."
Διαφορά: Δεν κοινοποιούνται πραγματικά ευαίσθητα δεδομένα στην ισχυρή προτροπή. Ζητείται μόνο η μέθοδος. Το απόρρητο διατηρείται, το μοντέλο εξακολουθεί να βοηθά.
τρεις μίνι θήκες
Περίπτωση 1 — Παραβίαση απορρήτου: Ένας ερευνητής επικόλλησε σε ένα ανοιχτό μοντέλο αυτά που πίστευε ότι ήταν ανώνυμα δεδομένα εξαγωγής ασθενούς για να τα αναλύσει. Όταν η επιτροπή δεοντολογίας το έμαθε αυτό, η μελέτη ανεστάλη. Δεν υπήρχε συμφωνία επεξεργασίας δεδομένων. Μάθημα: ευαίσθητα δεδομένα δεν εισέρχονται ποτέ στο ανοιχτό μοντέλο.
Περίπτωση 2 — Μεροληψία πληθυσμού: Εκπαιδεύτηκε ένα εργαλείο βαθμολογίας πολυγονιδιακού κινδύνου σε δεδομένα ευρωπαϊκής προέλευσης. Σε άλλο πληθυσμό, οι εκτιμήσεις κινδύνου ήταν σημαντικά ανακριβείς. Όταν το μοντέλο πρότεινε να αμφισβητηθεί η σύνθεση των δεδομένων εκπαίδευσης, η ομάδα αποφάσισε να μην χρησιμοποιήσει το εργαλείο σε αυτόν τον πληθυσμό. Μάθημα: η προκατάληψη σώζει ή βλάπτει ζωές.
Περίπτωση 3 — Αποκάλυψη και διαφάνεια: Μια ομάδα έγραψε κώδικα καθαρισμού δεδομένων με τεχνητή νοημοσύνη και το δήλωσε ξεκάθαρα στην ενότητα μεθόδων. Μοιράστηκε επίσης τον κωδικό. Οι αναθεωρητές το καλωσόρισαν επειδή η επαναληψιμότητα ήταν ισχυρή. Μάθημα: η διαφάνεια γεννά εμπιστοσύνη.
γράφημα σύγκρισης
περιοχή
ασφαλής συμπεριφορά
επικίνδυνη συμπεριφορά
δεδομένα ασθενούς
Τοπικό/ασφαλές περιβάλλον
Επικόλληση στο ανοιχτό μοντέλο
συναίνεση
Χρήση εντός του πεδίου εφαρμογής
Μην υπερβαίνετε το πεδίο εφαρμογής
Βιοασφάλεια
Αποφυγή διπλής χρήσης
επικίνδυνη ζήτηση
ακεραιότητα
Αναφέρετε όλα τα αποτελέσματα
επιλεκτική αναφορά
προκατάληψη
Ρωτήστε τον πληθυσμό
Εφαρμόστε τυφλά
διαφάνεια
Δηλώστε τη χρήση
κρύβεται
Συνήθη λάθη
- Παροχή ευαίσθητων δεδομένων στο ανοιχτό μοντέλο: Μη αναστρέψιμη παραβίαση απορρήτου.
- Υπέρβαση του πεδίου της συγκατάθεσης: Χρήση μη εξουσιοδοτημένη από τον συμμετέχοντα.
- Παράβλεψη μεροληψίας: Γενίκευση αποτελεσμάτων σε όλες τις ομάδες.
- Απόκρυψη χρήσης: Δεν δηλώνεται συνεισφορά AI.
- Άμυνα «προτεινόμενο μοντέλο»: Απόδοση ευθύνης στο όχημα.
Προσοχή: Σε βιολογικές εργασίες υψηλών συνεπειών (κλινική απόφαση, βιοασφάλεια, ανθρώπινα δεδομένα) η παραγωγή τεχνητής νοημοσύνης δεν υποκαθιστά την επαλήθευση από αρμόδιους εμπειρογνώμονες και την ηθική επίβλεψη. μόνο το επιταχύνει. Η τελική ευθύνη ανήκει πάντα στον άνθρωπο, μαζί με τις ηθικές και επιστημονικές συνέπειες της απόφασης.
Περιβάλλον, οικολογία και παραδοσιακή γνώση
Η ηθική ευθύνη δεν περιορίζεται στα ανθρώπινα δεδομένα. Απαιτείται επίσης προσοχή όταν χρησιμοποιείται τεχνητή νοημοσύνη στην οικολογία και τη βιολογία διατήρησης. Για παράδειγμα, τα ακριβή δεδομένα θέσης (συντεταγμένες παγίδας κάμερας) ενός απειλούμενου είδους είναι ευαίσθητα λόγω του κινδύνου λαθροθηρίας. Η αποδέσμευση αυτών των δεδομένων σε ανοιχτό μοντέλο ή κοινό θα μπορούσε να βλάψει το είδος. Ομοίως, ηθικά και νομικά (όπως το Πρωτόκολλο της Ναγκόγια) προκύπτουν όταν η παραδοσιακή βιολογική γνώση των τοπικών κοινοτήτων (π.χ. η χρήση ενός φυτού) χρησιμοποιείται χωρίς άδεια. Πριν χρησιμοποιήσετε τα δεδομένα, "σε ποιον ανήκουν αυτές οι πληροφορίες και ποιος θα ζημιωθεί από την αποκάλυψή τους;" Να κάνετε πάντα την ερώτηση.
Ανθρώπινη εποπτεία και τελική απόφαση
Η ουσία ολόκληρης αυτής της ενότητας συνοψίζεται σε μία αρχή: ουσιαστική ανθρώπινη επίβλεψη. Η τεχνητή νοημοσύνη παράγει μια πρόταση, γράφει ένα προσχέδιο, δείχνει ένα μοτίβο. Αλλά μια βιολογική, κλινική ή ηθική απόφαση δεν βασίζεται ποτέ απευθείας στην παραγωγή του μοντέλου. Ειδικά σε περιοχές υψηλού κινδύνου (διάγνωση, θεραπεία, απόφαση διατήρησης ειδών, απελευθέρωση), ο ρόλος του μοντέλου δεν είναι να λαμβάνει αποφάσεις, αλλά να επιταχύνει την απόφαση του ειδικού. Η προσέγγιση "human-in-the-loop" δεν είναι σύνθημα, αλλά αναγκαιότητα.
Για να λειτουργήσει αυτή η επιτήρηση, ο επόπτης πρέπει να είναι ικανός. Η τυφλή συναίνεση («μοντέλο είπε, αποδοχή») δεν είναι παράβλεψη. Η πραγματική επίβλεψη απαιτεί τεχνογνωσία που μπορεί να αμφισβητήσει το αποτέλεσμα, να εντοπίσει το σφάλμα του και να το απορρίψει όταν είναι απαραίτητο. Επομένως, η τεχνητή νοημοσύνη δεν αντικαθιστά τον ειδικό. Κάνει τον ειδικό ακόμα πιο απαραίτητο. Αυτός που χρησιμοποιεί καλύτερα το όχημα είναι αυτός που μπορεί να το ελέγξει καλύτερα.
Συνοπτικά
Η υπεύθυνη χρήση της τεχνητής νοημοσύνης στη βιολογία καλύπτει τέσσερις τομείς: ιδιωτικότητα δεδομένων (προστασία ευαίσθητων ανθρώπινων δεδομένων), βιοασφάλεια (αποφυγή διπλής χρήσης), επιστημονική ακεραιότητα (ειλικρινής και πλήρης αναφορά) και ευαισθητοποίηση μεροληψίας (εγκυρότητα αποτελεσμάτων σε όλες τις ομάδες). Μην παρέχετε ευαίσθητα δεδομένα στο ανοιχτό μοντέλο, δηλώνετε τη χρήση με διαφάνεια, αμφισβητείτε την προκατάληψη του πληθυσμού. Η ηθική ευθύνη δεν μπορεί ποτέ να ανατεθεί στον πράκτορα. Είναι πάντα στους ανθρώπους.
Εργασία εφαρμογής
Σκεφτείτε ένα σενάριο από τον δικό σας χώρο εργασίας (π.χ. χρησιμοποιώντας ένα ανθρώπινο σύνολο δεδομένων ή ένα μοντέλο εικόνας). Ζητήστε από το AI να καταλήξει στη δεοντολογική λίστα ελέγχου αυτού του σεναρίου (εμπιστευτικότητα, συναίνεση, μεροληψία, διπλή χρήση, διαφάνεια) χωρίς να μοιράζεται πραγματικά δεδομένα. Για κάθε στοιχείο, σημειώστε το ως «κατάλληλο/επικίνδυνο/αβέβαιο» στην περίπτωσή σας και γράψτε ένα σχέδιο δράσης για εκείνα που είναι επικίνδυνα/αβέβαια. Επίσης, έχετε συντάξει μια δήλωση χρήσης AI για το άρθρο σας.
λίστα ελέγχου
- [ ] Δεν παρείχα ευαίσθητα/προσωπικά δεδομένα στο ανοιχτό μοντέλο.
- [ ] Έλεγξα το εύρος της επιτροπής συναίνεσης και δεοντολογίας.
- [ ] Έχω αξιολογήσει τον κίνδυνο διπλής χρήσης/βιοασφάλειας.
- [ ] Ανέφερα όλα τα αποτελέσματα με ειλικρίνεια.
- [ ] Αμφισβήτησα την προκατάληψη πληθυσμού/δεδομένων.
- [ ] Έχω δηλώσει με διαφάνεια τη χρήση τεχνητής νοημοσύνης και έχω αναλάβει την ευθύνη.
Εξέταση Ενοτήτων
1. Ένας μαθητής ρώτησε το μοντέλο γλώσσας "πόσες συμβολοσειρές υπάρχουν σε αυτό το αρχείο FASTA;" ρωτάει και το μοντέλο απαντά '48'. Ποια είναι η πιο σωστή προσέγγιση;
- Α) Χρησιμοποιώντας απευθείας τον αριθμό 48 που δίνεται από το μοντέλο. Το μοντέλο είναι αξιόπιστο επειδή βλέπει το αρχείο
- Β) Ρωτήστε τον αριθμό άλλη μια φορά και αποδεχτείτε τον ως σωστό αν οι δύο απαντήσεις είναι ίδιες
- Γ) Ανάγνωση του αρχείου με Biopython, μέτρηση του αριθμού των ακολουθιών με κώδικα και χρήση της εξόδου ✔
- Δ) Άνοιγμα του αρχείου χειροκίνητα και μέτρηση με μάτι απόφαση
Επεξήγηση: Οι ντετερμινιστικές εργασίες, όπως η μέτρηση και η μέτρηση, πρέπει να αφεθούν στον κώδικα που εκτελείτε και όχι στο μοντέλο γλώσσας. Το μοντέλο δεν «θυμάται» τον αριθμό, παράγει μια πιθανολογική τιμή και μπορεί να είναι λάθος. Η μέτρηση με ένα εργαλείο όπως το Biopython δίνει ακριβή και αναπαραγώγιμα αποτελέσματα.
2. Θέλετε να μετρήσετε κελιά σε μια εικόνα μικροσκοπίου και να μετρήσετε την περιοχή του καθενός. Ποια είναι η καταλληλότερη προσέγγιση για αυτήν την εργασία;
- Α) Χρησιμοποιώντας ένα ειδικό εργαλείο τμηματοποίησης όπως το Cellpose/StarDist και επαλήθευση του αποτελέσματος με μη αυτόματο τρόπο ✔
- Β) Επικολλήστε την εικόνα στο γενικό μοντέλο γλώσσας και ρωτήστε "πόσα κελιά υπάρχουν"
- Γ) Περιγράψτε την εικόνα στο μοντέλο και ζητήστε έναν εκτιμώμενο αριθμό
- Δ) Αποδοχή του αριθμού των pixel ως τον αριθμό των κελιών χωρίς καμία βαθμονόμηση
Επεξήγηση: Η τμηματοποίηση και η μέτρηση κελιών δεν είναι τομέας του γενικού γλωσσικού μοντέλου, αλλά εξειδικευμένων μοντέλων εικόνας (Cellpose, StarDist) που έχουν εκπαιδευτεί ειδικά για αυτήν την εργασία. Το μοντέλο γλώσσας γράφει τον κώδικα που καλεί αυτά τα εργαλεία. Το μοντέλο των ειδικών κάνει τη μέτρηση και ο βιολόγος επαληθεύει το αποτέλεσμα.
3. Ένας μεταπτυχιακός φοιτητής προσθέτει 8 πηγές που παράγονται από το γλωσσικό μοντέλο στην εισαγωγή της διατριβής του. Ο σύμβουλος διαπιστώνει ότι 3 από αυτά δεν υπάρχουν καθόλου. Πώς θα μπορούσε να αποτραπεί αυτή η κατάσταση;
- Α) Ζητώντας από το μοντέλο να παράγει ξανά πόρους
- Β) Επιλέγοντας μόνο τις παραπομπές με DOI (αν υπάρχει DOI, είναι πραγματικό)
- Γ) Ζητώντας τη λίστα δίνοντας εντολή στο μοντέλο να «ταιριάσει»
- Δ) Ανεξάρτητη επαλήθευση κάθε αναφοράς στο PubMed/doi.org και αναφορά μόνο των άρθρων που έχει διαβάσει ✔
Εξήγηση: Τα γενικά γλωσσικά μοντέλα δεν αποτελούν λογοτεχνική βάση δεδομένων. Αντί να αναζητά πραγματικούς δίσκους, «δημιουργεί» αποδόσεις ρεαλιστικού ήχου (κατασκευασμένη απόδοση). Κάθε byline και DOI δεν θα πρέπει να χρησιμοποιούνται χωρίς ανεξάρτητη επαλήθευση σε πηγές όπως το PubMed/doi.org και μόνο με αναφορά άρθρων που έχουν πραγματικά διαβαστεί.
4. Ποιος είναι ο πιο ισχυρός τρόπος για να διασφαλιστεί η ακρίβεια ενός κώδικα καθαρισμού δεδομένων που έχει γραφτεί από την τεχνητή νοημοσύνη;
- Α) Εάν ο κωδικός λειτουργεί χωρίς σφάλματα, αποδεχτείτε τον ως σωστό.
- Β) Δοκιμή του αποτελέσματος με ένα μικρό γνωστό δείγμα και επαλήθευση της προσδοκίας με ισχυρισμό ✔
- Γ) Ρωτήστε το μοντέλο "είναι σωστός ο κωδικός;" ρωτώντας και εμπιστεύομαι την απάντηση «ναι»
- Δ) Εκτελέστε τον κώδικα πολλές φορές και λάβετε την ίδια έξοδο κάθε φορά
Παρατήρηση: Το ότι ο κώδικας λειτουργεί χωρίς σφάλματα δεν σημαίνει ότι είναι σωστός. «Λάθος κώδικας που λειτουργεί χωρίς σφάλματα» είναι η πιο επικίνδυνη κατάσταση στη βιολογία. Η δοκιμή με ένα μικρό δείγμα του οποίου το αποτέλεσμα γνωρίζετε εκ των προτέρων και η ενσωμάτωση της προσδοκίας στον κώδικα με το assert είναι η ισχυρότερη ασπίδα ενάντια στα σιωπηλά λανθασμένα αποτελέσματα.
5. Σε μια ανάλυση RNA-seq, ελέγχονται 20.000 γονίδια και 3.800 γονίδια βρέθηκαν να είναι «σημαντικά» με p<0,05 χωρίς διόρθωση. Ποιο είναι το κύριο πρόβλημα με αυτό το συμπέρασμα;
- Α) Ο αριθμός των δειγμάτων είναι πολύ υψηλός, θα πρέπει να μειωθεί
- Β) Το όριο p είναι πολύ υψηλό, θα έπρεπε να είχε χρησιμοποιηθεί 0,10
- Γ) Δεν πραγματοποιήθηκε διόρθωση πολλαπλής σύγκρισης (FDR). Υπάρχουν πολλά ψευδώς θετικά ✔
- Δ) Τα δείγματα θα έπρεπε να έχουν ελεγχθεί αντί για γονίδια
Εξήγηση: Όταν δοκιμάζετε χιλιάδες γονίδια ταυτόχρονα, πολλά γονίδια φαίνονται «σημαντικά» τυχαία, ακόμα κι αν δεν υπάρχει πραγματική διαφορά. Αυτό ονομάζεται πρόβλημα πολλαπλής σύγκρισης. Η λύση είναι η εφαρμογή διόρθωσης FDR (false discovery rate) με μια μέθοδο όπως ο Benjamini-Hochberg. Με τη διόρθωση, η λίστα συνήθως μειώνεται σε δεκάδες έως μερικές εκατοντάδες γονίδια.
6. Ο καλύτερος αγώνας σε ένα αποτέλεσμα BLAST έχει τιμή E 2,0. Τι σημαίνει αυτό;
- Α) Η αντιστοιχία είναι πιθανότατα τυχαία. ✔ δεν είναι αξιόπιστο ταίριασμα
- Β) Η σύζευξη είναι πολύ δυνατή. Όσο μεγαλύτερη είναι η ηλεκτρονική αξία, τόσο το καλύτερο
- Γ) Η αλληλουχία ταιριάζει σε ποσοστό 2%
- Δ) Υπάρχει διαφορά 2 βάσεων μεταξύ των δύο αλληλουχιών
Εξήγηση: Η τιμή E υποδηλώνει την προσδοκία ότι η αντιστοίχιση είναι τυχαία. Είναι καλύτερα να είσαι μικρός. Μια e-τιμή μεγαλύτερη από 1 υποδηλώνει ότι η αντιστοίχιση είναι πιθανότατα τυχαία. Για αξιόπιστους αγώνες, γενικά αναζητούνται πολύ μικρά κατώφλια όπως e < 1e-5.
7. Σε ένα μοντέλο AlphaFold, η τερματική περιοχή της πρωτεΐνης δείχνει χαμηλό σκορ pLDDT (<50). Πώς πρέπει να ερμηνευτεί αυτή η περιοχή;
- Α) Το AlphaFold έκανε ένα σφάλμα σε αυτήν την περιοχή, η περιοχή πρέπει να αφαιρεθεί από την ανάλυση
- Β) Αυτή η περιοχή είναι σίγουρα μια άλφα έλικα
- Γ) Το μοντέλο είναι εντελώς αναξιόπιστο, η δομή δεν πρέπει να χρησιμοποιείται
- Δ) Η περιοχή είναι πιθανόν ακανόνιστη/ελαστική. θα πρέπει να ερμηνεύεται ως «ασαφές» και όχι ως «ψευδές» ✔
Περιγραφή: Το pLDDT είναι η τοπική βαθμολογία εμπιστοσύνης για κάθε αμινοξύ. Οι τιμές κάτω από 50 συχνά αντικατοπτρίζουν πραγματικά ακανόνιστες (ευέλικτες, μη σταθερές) περιοχές. Είναι λάθος να διαγράφονται αυτόματα αυτές οι περιοχές ως «λανθασμένες εικασίες». Μια χαμηλή βαθμολογία θα πρέπει να διαβάζεται ως «αβέβαιη/ευέλικτη» και να αξιολογείται η βιολογική της σημασία.
8. Ένας ερευνητής αναφέρει τις περιοχές των κυττάρων μόνο σε εικονοστοιχεία και τα αποτελέσματα δεν συνάδουν με τη βιβλιογραφία. Ποιο είναι το βήμα που λείπει;
- Α) Θα έπρεπε να έχουν μετρηθεί περισσότερα κύτταρα
- Β) Δεν πραγματοποιήθηκε βαθμονόμηση κλίμακας (μετατροπή pixel σε μικρόμετρο), τα αποτελέσματα δεν μετατράπηκαν σε φυσικές μονάδες ✔
- Γ) Το εργαλείο τμηματοποίησης επιλέχθηκε λανθασμένα
- Δ) Η ανάλυση της εικόνας είναι πολύ υψηλή
Εξήγηση: Η βαθμονόμηση κλίμακας (πόσα μικρόμετρα ανά pixel) είναι απαραίτητη για την εξαγωγή φυσικού μεγέθους από την εικόνα. Εάν παραλειφθεί αυτό το βήμα, οι τιμές παραμένουν ασύγκριτες, ανάλογα με τη ρύθμιση του μικροσκοπίου. Οι περιοχές πρέπει να μετατραπούν σε φυσικές μονάδες όπως τετραγωνικά μικρόμετρα.
9. Ένας μαθητής παίρνει 10 δείγματα ιστού από ένα μόνο ποντίκι και χρησιμοποιεί το 'n=10' στις στατιστικές. Γιατί αυτό είναι λάθος;
- Α) 10 δείγματα είναι πολύ λίγα για στατιστικά, χρειάζονται τουλάχιστον 30
- Β) Έπρεπε να ληφθούν δείγματα ιστών από διαφορετικά όργανα
- Γ) Αυτά τα 10 παραδείγματα είναι τεχνικές επαναλήψεις. βιολογικό n είναι ακόμα 1, αυτό είναι η λεγόμενη επανάληψη ✔
- Δ) Τα δείγματα είναι άκυρα γιατί ελήφθησαν την ίδια μέρα
Εξήγηση: Οι επαναλαμβανόμενες μετρήσεις που λαμβάνονται από το ίδιο άτομο είναι τεχνικές επαναλήψεις. όπου το στατιστικό n είναι ο αριθμός των βιολογικών μονάδων (εδώ ποντίκια). Η εξέταση της τεχνικής επανάληψης ως βιολογικής (ψευδοαναδιπλασιασμού) παράγει ψευδή σημασία. Σωστός σχεδιασμός σημαίνει συνεργασία με πολλά άτομα.
10. Μία ανάλυση βρέθηκε p=0,03. Ποια είναι η σωστή ερμηνεία αυτής της τιμής;
- Α) Υπάρχει 3% πιθανότητα να δείτε αυτό ή πιο ακραίο αποτέλεσμα όταν στην πραγματικότητα δεν υπάρχει διαφορά ✔
- Β) Η πιθανότητα το αποτέλεσμα να είναι πραγματικό είναι 97%
- Γ) Η πιθανότητα να είναι αληθής η μηδενική υπόθεση είναι 3%
- Δ) Το αποτέλεσμα είναι 97% επαναλαμβανόμενο
Εξήγηση: Η τιμή p δεν είναι «πιθανότητα ότι η υπόθεση είναι αληθινή» ή «πιθανότητα ότι το αποτέλεσμα είναι αληθές». Η τιμή p είναι η πιθανότητα να δούμε μια διαφορά ως ή πιο ακραία από αυτή που παρατηρείται όταν στην πραγματικότητα δεν υπάρχει διαφορά. Επομένως, το p=0,03 δεν σημαίνει «το αποτέλεσμα είναι 97% πραγματικό». Τα αποτελέσματα θα πρέπει επίσης να αξιολογούνται με βάση το μέγεθος του αποτελέσματος και το διάστημα εμπιστοσύνης.
11. Σε μια παρουσίαση, μια διαφορά 3% μεταξύ δύο ομάδων εμφανίζεται ως τεράστια συμπιέζοντας τον άξονα y στο εύρος 95-100. Τι είναι αυτό ένα παράδειγμα;
- Α) Μια καλή τεχνική οπτικοποίησης. αναδεικνύει τη διαφορά
- Β) Πρόβλημα φιλικής παλέτας με αχρωματοψία
- Γ) Μια αποδεκτή επιλογή στυλ
- Δ) Ένα παραπλανητικό και ανέντιμο γράφημα που υπερβάλλει τη διαφορά με τον περικομμένο άξονα ✔
Επεξήγηση: Η μη αρχικοποίηση του άξονα από το μηδέν (περικομμένος άξονας) παραπλανά τον θεατή υπερβάλλοντας οπτικά μια μικρή διαφορά. Πρόκειται για παραβίαση της αρχής της εντιμότητας. Ειδικά στα ραβδωτά γραφήματα, ο άξονας πρέπει να ξεκινά από το μηδέν και η διαφορά να φαίνεται με το πραγματικό του μέγεθος.
12. Ένας ερευνητής επικολλά αυτά που πιστεύει ότι είναι ανώνυμα δεδομένα εξαγωγής ασθενούς σε ένα μοντέλο δημόσιας γλώσσας για να το αναλύσει. Γιατί είναι προβληματική αυτή η συμπεριφορά;
- Α) Δεν υπάρχει πρόβλημα. τα δεδομένα μπορούν να κοινοποιηθούν εάν είναι ανώνυμα
- Β) Η παροχή ευαίσθητων δεδομένων ασθενών σε ανοιχτό μοντέλο αποτελεί παραβίαση του απορρήτου και ηθικής/νομικής (KVKK/GDPR) και δεν μπορεί να αντιστραφεί ✔
- Γ) Είναι προβληματικό μόνο γιατί η ανάλυση θα είναι αργή
- Δ) Το μοντέλο είναι προβληματικό γιατί δεν μπορεί να κατανοήσει τα δεδομένα
Περιγραφή: Τα γενετικά/κλινικά δεδομένα του ασθενούς είναι εξαιρετικά ευαίσθητα. Ακόμη και γονιδιωματικά δεδομένα που θεωρούνται ανώνυμα μπορούν να επαναπροσδιοριστούν. Η παροχή αυτών των δεδομένων σε ένα δημόσιο μοντέλο παραβιάζει τις εγκρίσεις του KVKK/GDPR και της επιτροπής δεοντολογίας (IRB) και αποτελεί μη αναστρέψιμη παραβίαση του απορρήτου. Τα ευαίσθητα δεδομένα θα πρέπει να υποβάλλονται σε επεξεργασία σε τοπικά/ασφαλή περιβάλλοντα με συμβάσεις.
13. Σε μια μελέτη, η διαφορά που πίστευαν ότι ήταν «ασθενής έναντι ελέγχου» οφειλόταν στην πραγματικότητα στην επεξεργασία των δειγμάτων σε δύο διαφορετικές ημέρες. Πώς ονομάζεται αυτή η κατάσταση και πώς αντιμετωπίζεται;
- Α) Είναι το ακραίο αποτέλεσμα. οι τελείες πρέπει να διαγραφούν
- Β) Είναι έλλειψη ομαλοποίησης. αρκεί μόνο η διόρθωση της κλίμακας
- Γ) Είναι το αποτέλεσμα παρτίδας. θα πρέπει να είναι ισορροπημένη στη σχεδίαση και να προστεθεί στο μοντέλο ως μεταβλητή παρτίδας ✔
- Δ) p-hacking? το τεστ πρέπει να αλλάξει
Επεξήγηση: Η τεχνική διαφορά λόγω παρτίδας δειγματοληψίας/ημέρας επεξεργασίας ονομάζεται φαινόμενο παρτίδας και μπορεί να συγχέεται με τη βιολογική διαφορά. Η σωστή προσέγγιση είναι να εξισορροπηθούν οι παρτίδες στο σχεδιασμό και να προστεθεί η μεταβλητή παρτίδας στο στατιστικό μοντέλο (π.χ. '~batch + condition'), διαχωρίζοντας έτσι το τεχνικό σήμα από το βιολογικό σήμα.
14. Θέλετε να υπολογίσετε την αναλογία GC μιας αλληλουχίας DNA. Ποια είναι η σωστή και επαναλαμβανόμενη προσέγγιση;
- Α) Εκτυπώστε τον κωδικό που υπολογίζει τον ρυθμό GC με το Biopython, εκτελέστε τον και χρησιμοποιήστε την έξοδο ✔
- Β) Δώστε στο μοντέλο τη σειρά και ζητήστε του να πει προφορικά τον ρυθμό GC
- Γ) Επιβεβαίωση της αναλογίας που δίνει το μοντέλο από άλλο μοντέλο
- Δ) Κοιτάζοντας τα πρώτα 100 γράμματα της σειράς και μαντεύοντας με το μάτι
Εξήγηση: Ο ρυθμός GC είναι ένας ντετερμινιστικός υπολογισμός. θα πρέπει να βασίζεται στον κώδικα που επεξεργάζεται τον πίνακα, όχι σε μια τιμή που το μοντέλο γλώσσας «θυμάται». Αντί να τον υπολογίζει το μοντέλο, η εκτύπωση του κώδικα υπολογισμού με ένα εργαλείο όπως το Biopython και η εκτέλεση του μόνοι σας θα παρέχει μια ακριβή έξοδο που δίνει το ίδιο αποτέλεσμα κάθε φορά που τον εκτελείτε.