Κέρδη:
- Δυνατότητα διασφάλισης αναπαραγωγιμότητας με τέσσερις πυλώνες (καθήλωση σπόρων, έκδοση δεδομένων, πάγωμα μέσων, παρακολούθηση πειράματος) και παραγωγή του ίδιου αποτελέσματος κατά την επανάληψη της ίδιας εκτέλεσης
- Δυνατότητα συνδυασμού όλων των στόχων της ενότητας (μετρήσεις, δεδομένα, μοντέλο, στοιχεία LLM, αξιολόγηση, δικαιοσύνη, ασφάλεια, διανομή, παρακολούθηση) σε μια αλυσίδα από άκρο σε άκρο
- Δυνατότητα επαλήθευσης ότι η κρίσιμη απόφαση παραμένει με τον άνθρωπο σε κάθε στάση και τεκμηρίωση του έργου με ελεγχόμενο τρόπο
Η πιο ύπουλη αποτυχία ενός έργου ML δεν είναι συντριβή. «Δεν θα ξαναπάρουμε το ίδιο αποτέλεσμα». Εάν δεν μπορείτε να αναπαράγετε σήμερα τη βαθμολογία του μοντέλου που βάλατε στην παραγωγή πριν από τρεις μήνες, δεν ελέγχετε πραγματικά αυτό το μοντέλο. Σε αυτήν την ενότητα κλεισίματος, εμβαθύνουμε την αναπαραγωγιμότητα: την ικανότητα να επιτυγχάνουμε αξιόπιστα το ίδιο αποτέλεσμα με τις ίδιες εισροές και να συνδυάζουμε ολόκληρη την ενότητα σε μια πειθαρχία έργου από άκρο σε άκρο.
Γιατί η αναπαραγωγιμότητα είναι δύσκολη
Στο συνηθισμένο λογισμικό, ο ίδιος κώδικας δίνει την ίδια έξοδο. Στο ML υπάρχουν πολλές περισσότερες μεταβλητές που καθορίζουν το αποτέλεσμα:
- Τυχαία: Ανακάτεμα δεδομένων, αρχικοποίηση βάρους, διαχωρισμός δεδομένων — όλα βασίζονται στην τυχαιότητα.
- Δεδομένα: Ο ίδιος κώδικας παράγει διαφορετικό μοντέλο με διαφορετική έκδοση δεδομένων.
- Περιβάλλον: Οι εκδόσεις της βιβλιοθήκης, το υλικό (CPU/GPU), ακόμη και το λειτουργικό σύστημα μπορούν να αλλάξουν το αποτέλεσμα.
- Κρυφή θήκη: Μια μη αποθηκευμένη υπερπαράμετρος, ένα βήμα χειροκίνητης προεπεξεργασίας, μια μη σημειωμένη επιλογή.
Η αναπαραγωγιμότητα δεν είναι "ωραίο να έχεις" αλλά επιστημονική και μηχανική επιταγή. Ένα αποτέλεσμα που δεν μπορεί να αναπαραχθεί είναι ένας ισχυρισμός που δεν μπορεί να αποδειχθεί.
Τέσσερις πυλώνες αναπαραγωγιμότητας
1. Διορθώστε την τυχαιότητα. Ρυθμίστε όλους τους τυχαίους σπόρους σε ένα μέρος: διαχωρισμός δεδομένων, προετοιμασία μοντέλου, ανακάτεμα δεδομένων. Ο σταθερός σπόρος είναι η βάση της εγγύησης "το ίδιο αποτέλεσμα όταν επαναλαμβάνετε την ίδια διαδρομή".
2. Έκδοση των δεδομένων. Καταγράψτε με ποια έκδοση δεδομένων πραγματοποιήθηκε κάθε πείραμα (διαμόρφωση εκδόσεων δεδομένων στην ενότητα 2). Τα "Τελευταία δεδομένα" είναι ασαφή. Η "έκδοση δεδομένων v3, hash abc123" είναι ακριβής.
3. Παγώστε το μέσο. Καρφιτσώστε όλες τις εξαρτήσεις στις ακριβείς εκδόσεις τους (π.χ. ακριβείς εκδόσεις όπως numpy==1.26.4 στο request.txt ή μια εικόνα κοντέινερ). Η «τελευταία έκδοση» θα τα σπάσει όλα μια μέρα.
4. Παρακολουθήστε τα πάντα (παρακολούθηση πειράματος). Αυτόματη αποθήκευση για κάθε πείραμα: έκδοση κώδικα (git commit), έκδοση δεδομένων, όλες οι υπερπαράμετροι, μετρήσεις και δομές εξόδου. Τα πειραματικά εργαλεία παρακολούθησης όπως τα MLflow, Weights & Biases το κάνουν συστηματικά. Χωρίς εγγραφή, το ερώτημα "ποια ρύθμιση ήταν καλύτερη" παραμένει αναπάντητο.
Προσοχή: «Θα το θυμηθώ αργότερα» είναι η πιο ακριβή πλάνη. Δύο εβδομάδες αργότερα δεν θα θυμάστε ποιο σπόρο, ποια δεδομένα, ποια υπερπαράμετρο χρησιμοποιήσατε. Η αυτόματη παρακολούθηση εξαλείφει την εξάρτηση από τη μνήμη.
Αδύναμη προσέγγιση / Δυνατή προσέγγιση
Αδύναμος: «Βρήκα το καλύτερο μοντέλο, είναι στο σημειωματάριο, νομίζω ότι η βαθμολογία του ήταν 89%.
Ισχυρή: "Εκτέλεση #147 στο εργαλείο παρακολούθησης πειράματος: git commit a3f9c, έκδοση δεδομένων v3 (hash abc123), σπόρος 42, καταχωρημένες όλες οι υπερπαράμετροι, δοκιμή PR-AUC 0.887. Όταν εκτελώ ξανά την ίδια εντολή, λαμβάνω το ίδιο αποτέλεσμα λίγο-λίγο. Το μοντέλο regist εξαρτάται από αυτήν την εκτέλεση."
Η διαφορά: στην ισχυρή προσέγγιση το αποτέλεσμα δεν βασίζεται σε μνήμη, αλλά σε σταθερή και παρακολουθούμενη αλυσίδα. Ο καθένας μπορεί να παράγει το ίδιο αποτέλεσμα κάθε φορά.
Έργο από άκρο σε άκρο: συνδυασμός ενότητας
Τώρα ας συνδυάσουμε ολόκληρη την ενότητα σε μια ενιαία ροή έργου. Ένα πραγματικό σύστημα ML περνά από αυτές τις στάσεις και κάθε στάση βασίζεται στην προηγούμενη:
- Ορισμός προβλήματος: Τι λύνουμε, πώς μετράμε την επιτυχία (ενότητα 3: σωστή μέτρηση, επιχειρηματικό πλαίσιο). Η μέτρηση και το όριο είναι ξεκάθαρα από την αρχή.
- Διοχέτευση δεδομένων: Συλλογή, επικύρωση, καθαρισμός, διαχωρισμός χωρίς διαρροές, έκδοση εκδόσεων (μονάδα 2).
- Ανάπτυξη μοντέλου: Εκπαίδευση, σύγκριση βασικής γραμμής, διασταυρούμενη επικύρωση, σκληρός σπόρος (ενότητα 3 + αυτή η ενότητα).
- Στοιχεία LLM (εάν υπάρχουν): RAG (μονάδα 4) ή/και πράκτορες (μονάδα 5). μικρορύθμιση εάν χρειάζεται (μονάδα 6).
- Αξιολόγηση: σύμπλεγμα αξιολόγησης με θήκες ακμών και ασφαλείας, αξιολόγηση πολλαπλών επιπέδων σε συστήματα LLM (ενότητα 8).
- Έλεγχος δικαιοσύνης και δεοντολογίας: Ανάλυση υποομάδας, κάρτα μοντέλου, επεξήγηση (ενότητα 10).
- Έλεγχος ασφαλείας: Άμεση έγχυση, απόρρητο, εφοδιαστική αλυσίδα (μονάδα 9).
- Διανομή: Συσκευασία, σταδιακή διανομή, επαναφορά, μητρώο μοντέλων (μονάδα 7).
- Παρακολούθηση: Παρακολούθηση τριών επιπέδων, συναγερμοί ολίσθησης (μονάδα 8).
- Αναπαραγωγιμότητα: Seed, έκδοση δεδομένων, μέσα και παρακολούθηση πειραμάτων σε ολόκληρη την αλυσίδα (αυτή τη μονάδα).
Σε αυτή τη ροή, το AI είναι ένας επιταχυντής και μια γεννήτρια σχεδιαγράμματος σε κάθε στάση. αλλά η επιλογή μετρήσεων, οι αποφάσεις δεδομένων, η δίκαιη ιεράρχηση προτεραιοτήτων, το όριο ανάπτυξης και η έγκριση έκδοσης — οι κρίσιμες αποφάσεις παραμένουν στον άνθρωπο. Αυτή είναι η ουσία της ενότητας.
Τεκμηρίωση: το μέλλον θα σας ευχαριστήσει
Ένα καλό έργο ML τεκμηριώνει το ίδιο. Τουλάχιστον, πρέπει να γράφονται τα ακόλουθα: κριτήρια προβλήματος και επιτυχίας, πηγή και έκδοση δεδομένων, επιλογές και αιτιολογήσεις μοντέλων, αποτελέσματα αξιολόγησης (συμπεριλαμβανομένων των υποομάδων), γνωστά όρια και κίνδυνοι, διαδικασία ανάπτυξης και ανάκτησης, σχέδιο παρακολούθησης. Αυτό το έγγραφο είναι ο καλύτερος φίλος του ατόμου (ίσως είστε εσείς) που επιστρέφει στο έργο μετά από έξι μήνες.
τρεις μίνι θήκες
Περίπτωση 1 - Χαμένο αποτέλεσμα. Ένας μηχανικός εκπαίδευσε ένα εξαιρετικό μοντέλο, αλλά δεν διόρθωσε το seed και δεν έσωσε την έκδοση δεδομένων. Όταν έφυγε από τη δουλειά, κανείς δεν μπορούσε να αναπαράγει αυτό το αποτέλεσμα. το μοντέλο έγινε «θρύλος του μαύρου κουτιού» και τελικά κατασκευάστηκε από την αρχή. Οι βδομάδες πήγαν χαμένες. Μάθημα: ένα μη αναπαραγώγιμο αποτέλεσμα είναι ένα ανύπαρκτο αποτέλεσμα.
Περίπτωση 2 - Κατάρρευση περιβάλλοντος. Μία ομάδα δεν είχε διορθώσει τις εξαρτήσεις. Όταν μια βιβλιοθήκη ενημερωνόταν αυτόματα, τα αποτελέσματα του μοντέλου άλλαζαν σιωπηλά και η παραγωγή διακόπηκε. Χρειάστηκαν μέρες για να βρεθεί το πρόβλημα. Όταν οι εξαρτήσεις παγώθηκαν και δεσμεύτηκαν με τις οριστικές εκδόσεις, το πρόβλημα δεν παρουσιάστηκε ξανά. Μάθημα: παγώστε το περιβάλλον.
Περίπτωση 3 - Η δύναμη της παρακολούθησης. Μια ομάδα παρακολουθούσε αυτόματα κάθε πείραμα. Τρεις μήνες αργότερα, κατά τη διάρκεια ενός ρυθμιστικού ελέγχου, απάντησαν στην ερώτηση «με ποια δεδομένα, με τι ρυθμίσεις, τι απόδοση είχε σε ποιες ομάδες;». με πλήρη ηχογράφηση μέσα σε λίγα λεπτά. Ο έλεγχος έγινε ομαλά. Μάθημα: η παρακολούθηση είναι ένα εργαλείο συμμόρφωσης, όχι απλώς ένα μηχανικό.
Αντιγράψιμα πρότυπα
Κάντε έναν έλεγχο αναπαραγωγιμότητας για αυτό το έργο ML.- Έχουν επιδιορθωθεί όλοι οι σπόροι τυχαίας (διαχωρισμός, αρχικοποίηση, τυχαία αναπαραγωγή);- Έχουν εκδοθεί τα δεδομένα;- Έχουν παγώσει οι εξαρτήσεις σε ακριβείς εκδόσεις;- Παρακολουθείται κάθε πείραμα (δέσμευση κώδικα, δεδομένα, υπερπαράμετρος, μέτρηση); Γράψτε συγκεκριμένα βήματα για το πώς να το διορθώσετε για κάθε στήλη που λείπει. Δομή έργου: [περιγραφή]
Δημιουργήστε έναν σκελετό σχεδίου για αυτό το έργο ML από άκρο σε άκρο. Πρόβλημα: [περιγραφή] Καλύψτε τις ακόλουθες στάσεις και σημειώστε πού βρίσκεται η απόφαση ΑΝΘΡΩΠΟΣ σε κάθε στάση: πρόβλημα/μετρική, αγωγός, μοντέλο, (RAG/πράκτορας/λεπτομέρεια;), αξιολόγηση, δικαιοσύνη, ασφάλεια, διανομή, παρακολούθηση, αναπαραγωγιμότητα. Γράψτε τον κύριο κίνδυνο και το βήμα επαλήθευσης για κάθε στάση.
Δημιουργήστε ένα πρότυπο τεχνικής τεκμηρίωσης για αυτό το έργο. Ενότητες: πρόβλημα+κριτήρια επιτυχίας, δεδομένα (πηγή+έκδοση), επιλογές μοντέλων+αιτιολόγηση, αξιολόγηση (συμπεριλαμβανομένων των υποομάδων), γνωστά όρια+κίνδυνοι, ανάπτυξη+επαναστροφή, σχέδιο παρακολούθησης. Δώστε τα πεδία που πρέπει να συμπληρωθούν για κάθε ενότητα ως ερωτήσεις.
Ελέγξτε τη ρύθμιση παρακολούθησης του πειράματός μου: Αποθηκεύεται αυτόματα σε κάθε εκτέλεση: git commit, έκδοση/κατακερματισμός δεδομένων, όλες οι υπερπαράμετροι, όλες οι μετρήσεις, περιβάλλον (εκδόσεις βιβλιοθήκης); Παίρνω το ίδιο αποτέλεσμα όταν ξανατρέχω την ίδια διαδρομή; Ρύθμιση: [περιγραφή]. Καταγράψτε τα ελαττώματα και διόρθωση.
Πίνακας στηλών αναπαραγωγιμότητας
στήλη
Τι διορθώνεται
Παράδειγμα οχήματος
τυχαιότητα
όλους τους σπόρους
ρύθμιση σπόρων
Δεδομένα
Έκδοση δεδομένων/κατακερματισμός
DVC
περιβάλλον
Εκδόσεις βιβλιοθήκης
pin απαιτήσεων, Docker
Παρακολούθηση
Κώδικας+δεδομένα+ρύθμιση+μέτρηση
MLflow, W&B
Συνήθη λάθη
- Μη στερέωση του σπόρου. Το αποτέλεσμα δεν μπορεί να επαναληφθεί.
- Δεν αποθηκεύεται η έκδοση δεδομένων. «Με ποια δεδομένα;» παραμένει αναπάντητο.
- Όχι παγωμένους εθισμούς. Μια ενημέρωση θα σπάσει σιωπηλά τα πάντα.
- Αφήνοντας τα πειράματα στη μνήμη. Δύο εβδομάδες αργότερα δεν θυμάται τίποτα.
- Αφήνοντας τις κρίσιμες αποφάσεις στην τεχνητή νοημοσύνη. Οι μετρήσεις, η δικαιοσύνη και οι αποφάσεις διανομής πρέπει να παραμείνουν στους ανθρώπους.
- Αναβολή τεκμηρίωσης. Η μελλοντική ομάδα (και εσείς) πληρώνετε το τίμημα.
Συνοπτικά
Η αναπαραγωγιμότητα είναι η υπογραφή της σοβαρής μηχανικής ML: το μη αναπαραγώγιμο αποτέλεσμα είναι ο αναπόδεικτος ισχυρισμός. Έρχεται με τέσσερις στήλες — επιδιόρθωση τυχαίας, δεδομένα έκδοσης, παγωμένο περιβάλλον, παρακολούθηση κάθε πειράματος. Ένα έργο από άκρο σε άκρο συνδυάζει όλα τα σημεία αυτής της ενότητας (μετρική, δεδομένα, μοντέλο, στοιχεία LLM, ισοτιμία, δικαιοσύνη, ασφάλεια, διανομή, παρακολούθηση) σε μια διασυνδεδεμένη αλυσίδα. Η τεχνητή νοημοσύνη είναι ένας επιταχυντής σε κάθε στάση, αλλά οι κρίσιμες αποφάσεις παραμένουν στον άνθρωπο. Τεκμηριώστε τα πάντα — για μελλοντική ομάδα και ελέγχους. Αυτή η πειθαρχία είναι το πλαίσιο που υποστηρίζει όλα όσα μαθαίνετε σε όλη την ενότητα.
Εργασία εφαρμογής
Ελέγξτε ένα έργο ML σε τέσσερις πυλώνες αναπαραγωγιμότητας: είναι οι σπόροι αμετάβλητοι, τα δεδομένα έχουν εκδοθεί, είναι παγωμένο το περιβάλλον, παρακολουθούνται τα πειράματα; Διορθώστε τυχόν στήλες που λείπουν και αποδείξτε ότι μπορείτε να εκτελέσετε την ίδια εκτέλεση δύο φορές και να έχετε το ίδιο αποτέλεσμα. Στη συνέχεια, εξάγετε τη ροή από άκρο σε άκρο του έργου (10 στάσεις) σε μία σελίδα και σημειώστε "πού είναι η ανθρώπινη απόφαση" σε κάθε στάση. Τέλος, γράψτε ένα σύντομο προσχέδιο τεχνικής τεκμηρίωσης.
λίστα ελέγχου
- [ ] Διορθώθηκαν όλοι οι σπόροι τυχαίας.
- [ ] Η έκδοση/κατακερματισμός δεδομένων καταγράφεται με κάθε πείραμα.
- [ ] Οι εξαρτήσεις παγώνουν σε σταθερές εκδόσεις (pin/container).
- [ ] Κάθε πείραμα παρακολουθείται αυτόματα (κωδικός+δεδομένα+ρύθμιση+μέτρηση).
- [ ] Όταν επαναλαμβάνω την ίδια διαδρομή, έχω το ίδιο αποτέλεσμα.
- [ ] Επιβεβαίωσα και τεκμηρίωσα ότι οι κρίσιμες αποφάσεις στη ροή από άκρο σε άκρο λαμβάνονται από ανθρώπους.
Εξέταση Ενοτήτων
1. Ως μηχανικός ML, ποια είναι η καλύτερη προσέγγιση κατά την τοποθέτηση της τεχνητής νοημοσύνης στη ροή εργασίας;
- Α) Η τεχνητή νοημοσύνη είναι ένας επιταχυντής σε επιχειρήσεις χαμηλού κινδύνου. Οι κρίσιμες αποφάσεις όπως οι μετρήσεις, τα δεδομένα και η παραγωγή παραμένουν επικυρωμένες και αφήνονται στον άνθρωπο ✔
- Β) Εφόσον οι έξοδοι AI φαίνονται καλές, δεν υπάρχει ανάγκη επαλήθευσης
- Γ) Αφήνοντας την απόφαση να τεθεί το μοντέλο σε παραγωγή στην τεχνητή νοημοσύνη εξοικονομεί χρόνο.
- Δ) Η τεχνητή νοημοσύνη είναι χρήσιμη μόνο για τη σύνταξη κειμένου, δεν έχει καμία σχέση με δεδομένα και εργασίες μοντέλων
Περιγραφή: Η τεχνητή νοημοσύνη είναι ένας ισχυρός επιταχυντής για εργασίες χαμηλού κινδύνου, εύκολα επαληθευμένες, όπως κώδικας, αναλύσεις δεδομένων και έγγραφα. Ωστόσο, η ευθύνη για αποφάσεις που επηρεάζουν τα χρήματα, το απόρρητο και τη νομική ευθύνη, όπως η επιλογή μετρήσεων, η οποία τα δεδομένα πηγαίνουν στην εκπαίδευση και η θέση του μοντέλου στην παραγωγή, βαρύνει τον εξειδικευμένο μηχανικό και την ομάδα. Κάθε έξοδος δεν πρέπει να χρησιμοποιείται χωρίς επαλήθευση.
2. Γιατί η επικύρωση σχήματος τοποθετείται στην αρχή μιας διοχέτευσης δεδομένων;
- Α) Γιατί αυξάνει άμεσα την ακρίβεια του μοντέλου
- Β) Επειδή καθιστά περιττή την έκδοση εκδόσεων δεδομένων
- Γ) Επειδή συλλαμβάνει κατεστραμμένα δεδομένα στο νωρίτερο και φθηνότερο σημείο και αποτρέπει τη διαρροή τους στα επόμενα βήματα ✔
- Δ) Γιατί εξαλείφει την ανάγκη επισήμανσης
Εξήγηση: Όσο νωρίτερα συλληφθούν κατεστραμμένα δεδομένα, τόσο φθηνότερο είναι να τα διορθώσετε. Η επικύρωση σχήματος αποτρέπει τη σιωπηρή διαρροή κατεστραμμένων δεδομένων στην εκπαίδευση ή την παραγωγή, απορρίπτοντας δεδομένα εκτός του αναμενόμενου τύπου και εύρους στην αρχή της γραμμής (π.χ. μετατόπιση τιμής 100 φορές με αλλαγή μονάδας). Το ίδιο σφάλμα που εντοπίζεται στην παραγωγή είναι πολλές φορές πιο ακριβό.
3. Ποια είναι η σωστή προσέγγιση κατά τη διαίρεση των δεδομένων σε εκπαίδευση και δοκιμή σε ένα πρόβλημα που περιλαμβάνει χρόνο (χρονικές σειρές);
- Α) Χρησιμοποιώντας τυχαίο διαχωρισμό γιατί είναι πάντα η πιο δίκαιη μέθοδος
- Β) Χρήση χρονικού διαχωρισμού: αποτρέψτε τη διαρροή με εκπαίδευση με το παρελθόν και δοκιμές στο μέλλον ✔
- Γ) Χρήση όλων των δεδομένων τόσο ως εκπαίδευση όσο και ως δοκιμή
- Δ) Ενσωμάτωση δεδομένων δοκιμής σε παραμέτρους κλιμάκωσης πριν από την προπόνηση
Εξήγηση: Ο τυχαίος διαχωρισμός σε χρονοσειρές δίνει στο μοντέλο ένα πλεονέκτημα «βλέποντας το μέλλον» που δεν θα συμβεί ποτέ στην παραγωγή και διογκώνει τεχνητά τις μετρήσεις (χρονική διαρροή). Το σωστό είναι η χρονική διαίρεση: τρένο με το παρελθόν, δοκιμή στο μέλλον. Αυτό μετρά την πραγματική απόδοση που το διατηρεί στην παραγωγή.
4. Γιατί η ακρίβεια είναι παραπλανητική σε ένα μοντέλο ανίχνευσης απάτης με θετικό ποσοστό κλάσης 1,5%;
- Α) Επειδή η ακρίβεια είναι πάντα χαμηλή σε μη ισορροπημένα δεδομένα
- Β) Επειδή η Ακρίβεια μπορεί να χρησιμοποιηθεί μόνο σε προβλήματα παλινδρόμησης
- Γ) Επειδή ο υπολογισμός Ακρίβειας απαιτεί μεγάλη επεξεργαστική ισχύ
- Δ) Ακόμη και ένα ασήμαντο μοντέλο που προβλέπει την πλειοψηφική τάξη μπορεί να είναι πολύ ακριβές, κρύβοντας έτσι την πραγματική επιτυχία ✔
Επεξήγηση: Σε μη ισορροπημένα δεδομένα, ακόμη και ένα βασικό μοντέλο που λέει "καλέστε τα πάντα αρνητικά" έχει περίπου 98,5% ακρίβεια, αλλά δεν θα εντοπίσει ούτε μία απάτη. Επομένως, σε μη ισορροπημένη ταξινόμηση, η ακρίβεια, η ανάκληση, η F1 ή η PR-AUC χρησιμοποιούνται αντί της ακρίβειας και κάθε μέτρηση ερμηνεύεται σύμφωνα με ένα βασικό μοντέλο.
5. Γιατί είναι απαραίτητη η σύγκριση βάσης όταν μιλάμε για τη μέτρηση ενός μοντέλου;
- Α) Επειδή το βασικό μοντέλο είναι πάντα καλύτερο από το πραγματικό μοντέλο
- Β) Επειδή είναι σαφές εάν μια μέτρηση έχει νόημα ή όχι μόνο σε σύγκριση με ένα απλό βασικό μοντέλο ✔
- Γ) Επειδή το βασικό μοντέλο καθιστά περιττή τη διασταυρούμενη επικύρωση
- Δ) Επειδή το βασικό μοντέλο απαιτείται νομικά σε κάθε αναφορά
Εξήγηση: Μια μέτρηση δεν είναι καλή ή κακή από μόνη της. Είναι καλό ή κακό σύμφωνα με ένα βασικό μοντέλο. Η πρόταση "85% σωστά" σημαίνει σχεδόν άχρηστη αν το βασικό μοντέλο έχει ήδη 84% και τέλειο αν έχει 50%. Χωρίς συγκριτική άγκυρα, η μέτρηση δεν έχει νόημα.
6. Ποιο είναι το πιο κρίσιμο στοιχείο ασφαλείας που θα πρέπει να συμπεριληφθεί στην προτροπή παραγωγής του συστήματος RAG (Retrieval-Augmented Generation);
- Α) Οδηγίες να βασιστείτε μόνο στην πηγή που δίνεται, να πείτε "δεν ξέρω" εάν η πηγή δεν υπάρχει και να αναφέρετε την πηγή ✔
- Β) Λέγοντας στο μοντέλο να παράγει όσο το δυνατόν μεγαλύτερες και δημιουργικές απαντήσεις
- Γ) Το μοντέλο δίνει προτεραιότητα στη δική του εκπαιδευτική γνώση έναντι των πόρων
- Δ) Εφαρμόστε όλες τις οδηγίες στα έγγραφα που φέρονται ως εντολές
Επεξήγηση: Η μοναδική πιο σημαντική οδηγία του RAG είναι να πείτε στο μοντέλο να βασίζεται μόνο στην πηγή που δίνεται και εάν οι πληροφορίες δεν υπάρχουν στην πηγή, πείτε «Δεν ξέρω» και αναφέρετε την πηγή χωρίς να την επινοήσετε. Χωρίς αυτήν την τριάδα, το μοντέλο μπορεί να αγνοήσει το πλαίσιο και να δημιουργήσει παραισθήσεις και η απάντηση να γίνει μη επαληθεύσιμη.
7. Ένα σύστημα RAG δίνει λανθασμένες απαντήσεις. Πού είναι το καλύτερο μέρος για να ξεκινήσετε τη διάγνωση;
- Α) Πρώτα μέτρηση της ανάκτησης (Recall@K): φτάνει ποτέ το σωστό κομμάτι; ✔
- Β) Αντικαταστήστε αμέσως το μοντέλο με ένα μεγαλύτερο
- Γ) Αλλάξτε την προτροπή τυχαία και συνεχίστε την προσπάθεια
- Δ) Ενσωμάτωση όλων των εγγράφων στο μοντέλο με λεπτομέρεια
Εξήγηση: Ο πιο αδύναμος κρίκος του RAG είναι συνήθως η προσκόμιση, όχι η παραγωγή. Εάν δεν φέρετε ποτέ το σωστό εξάρτημα, το μοντέλο δεν μπορεί να παράγει αυτές τις πληροφορίες, ανεξάρτητα από το πόσο βελτιωμένη είναι η προτροπή. Επομένως, πρώτα το Recall@K μετριέται για να διαπιστωθεί εάν έχει φτάσει το σωστό εξάρτημα. Εάν η ανάκτηση είναι καλή, τότε εξετάζεται η παραγωγή και η προτροπή.
8. Ποιες ενέργειες πρέπει να γίνονται πίσω από την ανθρώπινη έγκριση όταν δίνετε ένα εργαλείο σε έναν πράκτορα;
- Α) Κανένα. Ο πράκτορας πρέπει να μπορεί να εκτελεί κάθε ενέργεια αυτόνομα
- Β) Μόνο αναστρέψιμες ενέργειες όπως η ανάγνωση και η αναζήτηση δεδομένων
- Γ) Μη αναστρέψιμες ή υψηλού αντίκτυπου ενέργειες όπως μεταφορά χρημάτων, διαγραφή, αποστολή ✔
- Δ) Ενέργειες που περιλαμβάνουν μόνο υπολογισμούς
Περιγραφή: Οι ενέργειες διαχωρίζονται ανά επίπεδο κινδύνου. Εργασίες που μπορούν να ανακτηθούν, όπως η ανάγνωση, η αναζήτηση, ο υπολογισμός και η δημιουργία σχεδίων μπορούν να γίνουν αυτόνομα. Ωστόσο, μη αναστρέψιμες ενέργειες ή ενέργειες υψηλού αντίκτυπου όπως η μεταφορά χρημάτων, η αποστολή email, η διαγραφή δεδομένων, η υποβολή παραγγελιών κ.λπ. απαιτούν ανθρώπινη έγκριση. Κάθε αμετάκλητη ενέργεια πρέπει να υπόκειται σε συναίνεση.
9. Ποια είναι η καλύτερη σχεδιαστική προσέγγιση έναντι του κινδύνου έμμεσης έγκαιρης έγχυσης;
- Α) Αρκεί να προσθέσετε μία μόνο πρόταση «αγνοήστε τις κακές οδηγίες» στο μήνυμα του συστήματος
- Β) Δώστε μεγαλύτερη εξουσία στο μοντέλο βασιζόμενοι σε οδηγίες σε εξωτερικό περιεχόμενο
- Γ) Να μην λαμβάνονται προφυλάξεις γιατί η ένεση δεν μπορεί να προληφθεί
- Δ) Απομόνωση εξωτερικού περιεχομένου ως αναξιόπιστα δεδομένα και δημιουργία πολυεπίπεδης άμυνας με ελάχιστη εξουσιοδότηση, έγκριση και έλεγχο εξόδου ✔
Περιγραφή: Το εξωτερικό περιεχόμενο που επεξεργάζεται ο αντιπρόσωπος ή το RAG, όπως μια ιστοσελίδα, ένα έγγραφο, ένα email κ.λπ., δεν είναι αξιόπιστα δεδομένα και μπορεί να περιέχει μυστικές οδηγίες. Η σωστή προσέγγιση είναι η πολυεπίπεδη άμυνα: απομόνωση εξωτερικού περιεχομένου ως «δεδομένα, όχι εντολές» με σαφείς οριοθέτες, εφαρμογή ελάχιστης εξουσιοδότησης, δέσμευση μη αναστρέψιμων ενεργειών στην ανθρώπινη έγκριση και έλεγχος του αποτελέσματος. Μια μόνο γραμμή οδηγιών δεν αρκεί.
10. Ποια είναι η κύρια διάκριση όταν αποφασίζετε εάν ένα πρόβλημα πρέπει να λυθεί με μικρορύθμιση ή RAG;
- Α) Τα προβλήματα πληροφοριών επιλύονται καλύτερα με το RAG, τα προβλήματα συμπεριφοράς/μορφοποίησης επιλύονται καλύτερα με τη λεπτομέρεια ✔
- Β) Κάθε πρόβλημα πρέπει πάντα να λύνεται με τελειοποίηση
- Γ) Το RAG χρησιμοποιείται μόνο για τη δημιουργία κώδικα, η λεπτομέρεια χρησιμοποιείται μόνο για τη μετάφραση
- Δ) Η μικρορύθμιση μπορεί πάντα να ενημερωθεί φθηνότερα και ταχύτερα από το RAG
Εξήγηση: Η λεπτομέρεια είναι αδύναμη και επικίνδυνη στη διδασκαλία του μοντέλου νέων πληροφοριών. αλλά είναι ισχυρό στη διδακτική συμπεριφορά, τη μορφή, τον τόνο και το στυλ. «Η εταιρεία μοντέλου δεν γνωρίζει τα δεδομένα μας» είναι ένα πρόβλημα πληροφοριών και ανήκει στη RAG. Το «Αφήστε το μοντέλο να βγαίνει πάντα στην αυστηρή μας μορφή» είναι ένα πρόβλημα συμπεριφοράς και είναι υποψήφιο για λεπτομέρεια. Επιπλέον, θα πρέπει να καταναλώνονται άμεσες και λίγες λήψεις πριν από τη λεπτομέρεια.
11. Τι είναι υποχρεωτικό για την ασφαλή ανάπτυξη κατά την παραγωγή ενός νέου μοντέλου;
- Α) Εάν το μοντέλο είναι καλό στη δοκιμή, ανοίξτε το απευθείας στο 100% επισκεψιμότητα
- Β) Καθόλου ρύθμιση παρακολούθησης μετά την ανάπτυξη
- Γ) Σταδιακή ανάπτυξη (σκιά/καναρίνι) και ένα προ-δοκιμασμένο σχέδιο επαναφοράς ✔
- Δ) Δημοσίευση του μοντέλου ακόμη και αν δεν τηρηθεί το όριο αξιολόγησης
Εξήγηση: Το άνοιγμα του νέου μοντέλου απευθείας σε όλη την κυκλοφορία είναι επικίνδυνο. Αν είναι λάθος, επηρεάζονται όλοι. Το σωστό είναι ότι είναι σταδιακή διανομή (σκιά, καναρίνι) και κάθε διανομή έχει δοκιμασμένο σχέδιο επαναφοράς. Μια διανομή δεν είναι πλήρης χωρίς ένα σχέδιο clawback. Η δυνατότητα επαναφοράς στην προηγούμενη έκδοση μέσα σε λίγα λεπτά προστατεύει τον χρήστη όταν το μοντέλο συμπεριφέρεται απροσδόκητα στην παραγωγή.
12. Πώς μπορεί ένα μοντέλο ML να αποτύχει «σιωπηλά» στην παραγωγή και ποιος είναι ο τρόπος για να το πιάσετε αυτό;
- Α) Το μοντέλο καταρρέει. Τα αρχεία καταγραφής διακομιστή το δείχνουν αυτό
- Β) Με την παραγωγή λανθασμένων προβλέψεων χωρίς να κάνετε λάθη. ✔ Καταγράφει τη λειτουργική παρακολούθηση, την είσοδο και την έξοδο σε επίπεδα
- Γ) Το μοντέλο δεν μπορεί ποτέ να αποτύχει σιωπηλά, πάντα συναγερμός
- Δ) Αρκεί μόνο η παρακολούθηση του λανθάνοντος χρόνου για να αντιληφθεί οποιαδήποτε υποβάθμιση
Εξήγηση: Το μοντέλο μπορεί να αποτύχει απλώς δημιουργώντας λανθασμένες προβλέψεις χωρίς να κολλάει ή να δίνει σφάλματα. Ο κύριος λόγος για αυτό είναι η μετατόπιση δεδομένων και η μετατόπιση εννοιών. Δεν αρκεί απλώς η παρακολούθηση των λειτουργικών μετρήσεων (λανθάνουσα κατάσταση, ποσοστό σφάλματος). Η κατανομή εισροών και η κατανομή εξόδου/πρόβλεψης θα πρέπει επίσης να παρακολουθούνται. Η μετατόπιση εισόδου δίνει έγκαιρη προειδοποίηση εάν το πραγματικό αποτέλεσμα καθυστερήσει.
13. Ποια αρχή είναι ουσιαστική όταν χρησιμοποιείται το LLM-as-judge για την αξιολόγηση ενός συστήματος LLM;
- Α) Ο διαιτητής LLM είναι πάντα σωστός, η ανθρώπινη επαλήθευση δεν είναι απαραίτητη
- Β) Ο διαιτητής πρέπει να λάβει μια απόφαση με βάση μόνο τη διάρκεια της απάντησης.
- Γ) Οι έλεγχοι που βασίζονται σε κανόνες και η ανθρώπινη αξιολόγηση θα πρέπει να απορρίπτονται εντελώς όταν χρησιμοποιούνται διαιτητές
- Δ) Οι βαθμολογίες των κριτών θα πρέπει να βαθμονομηθούν με δείγμα ανθρώπινου σήμανσης και να μετρηθεί η μεροληψία τους προτού μπορέσει να γίνει αξιόπιστη ✔
Περιγραφή: Ο διαιτητής LLM είναι επίσης μοντέλο. Μπορεί να είναι παραισθησιογόνος, προκατειλημμένος (ευνοεί μακροσκελείς, σίγουρες απαντήσεις) και ασυνεπής. Ως εκ τούτου, οι βαθμολογίες των διαιτητών πρέπει να βαθμονομηθούν με δείγμα ανθρώπινης ετικέτας και η συστηματική προκατάληψη τους πρέπει να μετρηθεί πριν ληφθεί η απόφαση παραγωγής. Ένας μη επαληθευμένος διαιτητής δίνει ψεύτικη εμπιστοσύνη.
14. Γιατί η εξέταση της συνολικής ακρίβειας είναι ανεπαρκής κατά την αξιολόγηση της προκατάληψης του μοντέλου;
- Α) Η συνολική ακρίβεια είναι επαρκής γιατί αντανακλά πάντα την απόδοση της χειρότερης ομάδας
- Β) Η συνολική ακρίβεια από μόνη της είναι ανεπαρκής καθώς μπορεί να κρύψει τη συστηματική διαφορά (κρυφή διάκριση) μεταξύ των υποομάδων ✔
- Γ) Επειδή η ακρίβεια είναι μια μέτρηση που δεν έχει καμία σχέση με την προκατάληψη
- Δ) Η προκατάληψη προέρχεται μόνο από το μοντέλο και δεν έχει καμία σχέση με τα δεδομένα.
Εξήγηση: Η συνολική ακρίβεια μπορεί να κρύψει τις συστηματικές διαφορές μεταξύ των υποομάδων. Για παράδειγμα, ενώ η συνολική ακρίβεια είναι 88%, η ανάκληση μπορεί να είναι 91% σε μια ομάδα και 67% σε άλλη ομάδα. Το μοντέλο χάνει συστηματικά αυτή την ομάδα. Ως εκ τούτου, το μοντέλο θα πρέπει να αξιολογηθεί με βάση τις υποομάδες (δημογραφικά στοιχεία/τμήμα) και ποιος ορισμός της δικαιοσύνης θα πρέπει να δοθεί προτεραιότητα θα πρέπει να αποφασιστεί με τα ενδιαφερόμενα μέρη.
15. Ποια τέσσερα πράγματα πρέπει να διορθωθούν μαζί για να είναι αναπαραγώγιμο ένα αποτέλεσμα ML;
- Α) Μόνο όνομα μοντέλου, μέγεθος, τιμή και ημερομηνία κυκλοφορίας
- Β) Μόνο μάρκα GPU και ταχύτητα internet
- Γ) Μόνο η τελική βαθμολογία ακρίβειας του μοντέλου. τα υπόλοιπα μπορούν να διατηρηθούν στη μνήμη
- Δ) Σπόρος τυχαίας, έκδοση δεδομένων, περιβάλλον (εκδόσεις εξάρτησης) και παρακολούθηση πειράματος ✔
Περιγραφή: Η αναπαραγωγιμότητα επιτυγχάνεται μέσω τεσσάρων πυλώνων: καθορισμός σπόρων τυχαίας, έκδοση δεδομένων (έκδοση/κατακερματισμός), πάγωμα του περιβάλλοντος (ακριβείς εκδόσεις βιβλιοθήκης/κοντέινερ) και παρακολούθηση κάθε πειράματος (δέσμευση κώδικα, δεδομένα, υπερπαράμετρος, μετρική). Χωρίς αυτή την αλυσίδα δεν είναι δυνατό να αναπαραχθεί το ίδιο αποτέλεσμα. Ένα μη αναπαραγώγιμο αποτέλεσμα είναι ένας ισχυρισμός που δεν μπορεί να αποδειχθεί.