Zyski:
- Możliwość zapewnienia powtarzalności w oparciu o cztery filary (utrwalanie nasion, wersjonowanie danych, zamrażanie pożywek, monitorowanie eksperymentu) i uzyskiwanie tego samego wyniku przy powtarzaniu tego samego cyklu
- Możliwość połączenia wszystkich przystanków modułu (metryki, dane, model, komponenty LLM, ewaluacja, uczciwość, bezpieczeństwo, dystrybucja, monitorowanie) w kompleksowym łańcuchu
- Możliwość sprawdzenia, czy krytyczna decyzja pozostaje przy człowieku na każdym przystanku i udokumentowania projektu w sposób umożliwiający audyt
Najbardziej podstępna porażka projektu ML nie jest awarią; „Nie uzyskam ponownie takiego samego wyniku”. Jeśli nie możesz dzisiaj odtworzyć wyniku modelu, który wprowadziłeś do produkcji trzy miesiące temu, tak naprawdę nie masz nad nim kontroli. W tej jednostce zamykającej pogłębiamy odtwarzalność: możliwość niezawodnego uzyskania tego samego wyniku przy tych samych nakładach i połączenia całego modułu w kompleksową dyscyplinę projektową.
Dlaczego powtarzalność jest trudna
W zwykłym oprogramowaniu ten sam kod daje taki sam wynik. W ML istnieje znacznie więcej zmiennych, które determinują wynik:
- Losowość: tasowanie danych, inicjalizacja wagi, dzielenie danych — wszystko opiera się na losowości.
- Dane: ten sam kod tworzy inny model z inną wersją danych.
- Środowisko: Wersje bibliotek, sprzęt (CPU/GPU), nawet system operacyjny mogą zmienić wynik.
- Ukryty przypadek: niezapisany hiperparametr, ręczny etap przetwarzania wstępnego, niezanotowany wybór.
Powtarzalność nie jest czymś, co warto mieć, ale koniecznością naukową i inżynieryjną. Wynik, którego nie można odtworzyć, jest twierdzeniem, którego nie można udowodnić.
Cztery filary powtarzalności
1. Napraw losowość. Ustaw wszystkie losowe nasiona w jednym miejscu: dzielenie danych, inicjalizacja modelu, tasowanie danych. Stałe rozstawienie jest podstawą gwarancji „tego samego wyniku przy powtarzaniu tego samego przejazdu”.
2. Wersjonuj dane. Zapisz, z jaką wersją danych przeprowadzono każdy eksperyment (wersjonowanie danych w części 2). „Najnowsze dane” są niejasne; „wersja danych v3, skrót abc123” jest dokładny.
3. Zamrozić podłoże. Przypnij wszystkie zależności do ich dokładnych wersji (np. dokładnych wersji, takich jak numpy==1.26.4 w pliku wymagania.txt lub obraz kontenera). „Najnowsza wersja” pewnego dnia wszystko zepsuje.
4. Śledź wszystko (śledzenie eksperymentu). Automatycznie zapisuj dla każdego eksperymentu: wersję kodu (git commit), wersję danych, wszystkie hiperparametry, metryki i struktury wyjściowe. Narzędzia do śledzenia eksperymentów, takie jak MLflow, Weights & Biases, robią to systematycznie. Bez rejestracji pytanie „które ustawienie było najlepsze” pozostaje bez odpowiedzi.
Uwaga: „później zapamiętam” to najdroższy błąd. Dwa tygodnie później nie będziesz pamiętał, jakiego materiału siewnego, jakich danych i jakiego hiperparametru użyłeś. Automatyczne śledzenie eliminuje zależność od pamięci.
Słabe podejście / Silne podejście
Słabe: „Znalazłem najlepszy model, jest na notebooku, myślę, że jego wynik wyniósł 89%.”.
Strong: „Uruchom #147 w narzędziu do śledzenia eksperymentu: git commit a3f9c, wersja danych v3 (hash abc123), ziarno 42, wszystkie zarejestrowane hiperparametry, przetestuj PR-AUC 0,887. Kiedy ponownie uruchomię to samo polecenie, otrzymuję ten sam wynik krok po kroku. Model zależy od tego uruchomienia w rejestrze.”
Różnica: w podejściu silnym wynik nie opiera się na pamięci, ale na ustalonym i monitorowanym łańcuchu. Każdy może za każdym razem uzyskać ten sam wynik.
Projekt kompleksowy: połączenie modułów
Teraz połączmy cały moduł w jeden przepływ projektu. Prawdziwy system ML przechodzi przez te przystanki, a każdy przystanek opiera się na poprzednim:
- Definicja problemu: Co rozwiązujemy, jak mierzyć sukces (część 3: właściwy miernik, kontekst biznesowy). Metryka i próg są jasne od początku.
- Potok danych: zbieranie, sprawdzanie poprawności, oczyszczanie, partycjonowanie bez wycieków, wersjonowanie (część 2).
- Opracowanie modelu: szkolenie, porównanie wartości bazowych, weryfikacja krzyżowa, twarde nasiona (część 3 + ta jednostka).
- Komponenty LLM (jeśli dotyczy): RAG (jednostka 4) i/lub agenci (jednostka 5); w razie potrzeby dostrojenie (część 6).
- Ocena: klaster ewaluacyjny z przypadkami brzegowymi i bezpieczeństwa, ewaluacja wielowarstwowa w systemach LLM (część 8).
- Audyt sprawiedliwości i etyki: analiza podgrup, karta modelu, wyjaśnialność (część 10).
- Audyt bezpieczeństwa: Szybki zastrzyk, prywatność, łańcuch dostaw (część 9).
- Dystrybucja: Pakowanie, dystrybucja stopniowa, wycofywanie, rejestracja modeli (część 7).
- Monitoring: Monitoring trójwarstwowy, alarmy dryfu (jednostka 8).
- Powtarzalność: śledzenie nasion, wersji danych, multimediów i eksperymentów w całym łańcuchu (to urządzenie).
W tym przepływie sztuczna inteligencja jest akceleratorem i generatorem planów na każdym przystanku; ale wybór wskaźników, decyzje dotyczące danych, uczciwe ustalanie priorytetów, próg wdrożenia i zatwierdzenie wydania – najważniejsze decyzje pozostają w gestii człowieka. To jest istota modułu.
Dokumentacja: przyszłość będzie Ci wdzięczna
Dobry projekt ML dokumentuje się sam. Należy zapisać co najmniej następujące informacje: problem i kryteria sukcesu, źródło i wersja danych, wybór i uzasadnienie modelu, wyniki oceny (w tym podgrupy), znane ograniczenia i ryzyko, procedura wdrażania i odzyskiwania, plan monitorowania. Ten dokument jest najlepszym przyjacielem osoby (a może to właśnie Ty), która po sześciu miesiącach wraca do projektu.
trzy mini etui
Przypadek 1 – Utracony wynik. Inżynier wytrenował świetny model, ale nie naprawił materiału siewnego i nie zapisał wersji danych. Kiedy odszedł z pracy, nikt nie był w stanie odtworzyć takiego wyniku; model stał się „legendą czarnej skrzynki” i ostatecznie został zbudowany od podstaw. Tygodnie zostały zmarnowane. Lekcja: wynik, którego nie można powtórzyć, to wynik, który nie istnieje.
Przypadek 2 – Załamanie środowiska. Jeden zespół nie naprawił zależności. Gdy biblioteka została automatycznie zaktualizowana, dane wyjściowe modelu uległy cichej zmianie, a produkcja została zakłócona. Znalezienie problemu zajęło kilka dni. Po zamrożeniu zależności i umieszczeniu w kontenerach wersji ostatecznych problem nie wystąpił ponownie. Lekcja: zamroź środowisko.
Przypadek 3 – Siła monitoringu. Zespół automatycznie monitorował każdy eksperyment. Trzy miesiące później podczas audytu regulacyjnego odpowiedzieli na pytanie „z jakimi danymi, przy jakich ustawieniach, jaką wydajność uzyskał w jakich grupach?” z pełnym nagraniem w ciągu kilku minut. Kontrola przebiegła sprawnie. Lekcja: monitorowanie to narzędzie zapewniające zgodność, a nie tylko narzędzie inżynieryjne.
Szablony do kopiowania
Wykonaj kontrolę odtwarzalności tego projektu ML. – Czy wszystkie nasiona losowości zostały naprawione (podział, inicjalizacja, przetasowanie)? – Czy dane są wersjonowane? – Czy zależności są zamrożone do dokładnych wersji? – Czy każdy eksperyment (zatwierdzenie kodu, dane, hiperparametr, metryka) jest śledzony? Napisz konkretne kroki, jak to naprawić dla każdej brakującej kolumny.Struktura projektu: [opis]
Utwórz szkielet planu dla tego kompleksowego projektu ML. Problem: [opis] Uwzględnij następujące przystanki i zaznacz, gdzie na każdym przystanku znajduje się decyzja CZŁOWIEKA: problem/metryka, rurociąg, model, (RAG/agent/dostrojenie?), ocena, uczciwość, bezpieczeństwo, dystrybucja, monitorowanie, odtwarzalność. Zapisz główne ryzyko i etap weryfikacji dla każdego przystanku.
Przygotuj szablon dokumentacji technicznej dla tego projektu. Sekcje: problem+kryteria sukcesu, dane (źródło+wersja), wybór modelu+uzasadnienie, ocena (w tym podgrupy), znane limity+ryzyka, wdrożenie+wycofanie zmian, plan monitorowania. Podaj pola do wypełnienia w każdej sekcji w formie pytań.
Sprawdź konfigurację monitorowania mojego eksperymentu: czy jest ona automatycznie zapisywana przy każdym uruchomieniu: zatwierdzenie git, wersja/skrót danych, wszystkie hiperparametry, wszystkie metryki, środowisko (wersje bibliotek)? Czy uzyskam ten sam wynik, jeśli ponownie uruchomię ten sam bieg? Konfiguracja: [opis]. Wypisz wady i poprawki.
Tabela kolumn odtwarzalności
kolumna
Co jest naprawione
Przykład pojazdu
losowość
wszystkie nasiona
ustawienie nasion
Dane
Wersja danych/hash
DVC
środowisko
Wersje biblioteczne
pin wymagań, Docker
Monitorowanie
Kod+dane+ustawienie+metryka
MLflow, W&B
Typowe błędy
- Nie naprawianie nasion. Wynik nie może się powtórzyć.
- Nie zapisano wersji danych. „Z jakimi danymi?” pozostaje bez odpowiedzi.
- Nie zamrażanie uzależnień. Aktualizacja po cichu wszystko zepsuje.
- Pozostawienie eksperymentów w pamięci. Po dwóch tygodniach nic się nie pamięta.
- Pozostawienie kluczowych decyzji sztucznej inteligencji. Wskaźniki, sprawiedliwość i decyzje dotyczące dystrybucji powinny pozostać w gestii ludzi.
- Odkładanie dokumentacji. Przyszły zespół (i Ty) płacicie cenę.
Podsumowując
Powtarzalność jest cechą poważnej inżynierii ML: nieodtwarzalny wynik jest twierdzeniem niemożliwym do udowodnienia. Zawiera cztery kolumny — napraw losowość, dane wersji, zamroź środowisko, śledź każdy eksperyment. Kompleksowy projekt łączy wszystkie elementy tego modułu (metryka, dane, model, komponenty LLM, ewaluacja, uczciwość, bezpieczeństwo, dystrybucja, monitorowanie) w połączonym łańcuchu; Sztuczna inteligencja jest akceleratorem na każdym kroku, ale krytyczne decyzje pozostają w gestii człowieka. Dokumentuj wszystko — na potrzeby przyszłego zespołu i audytów. Dyscyplina ta stanowi podstawę, na której opiera się wszystko, czego nauczysz się w trakcie modułu.
Zadanie aplikacji
Sprawdź projekt ML pod kątem czterech filarów odtwarzalności: czy nasiona są niezmienne, czy dane są wersjonowane, czy środowisko jest zamrożone, czy eksperymenty są śledzone? Napraw brakujące kolumny i udowodnij, że możesz dwukrotnie uruchomić ten sam bieg i uzyskać ten sam wynik. Następnie zapisz całościowy przebieg projektu (10 przystanków) na jednej stronie i zaznacz na każdym przystanku „gdzie znajduje się decyzja człowieka”. Na koniec napisz krótki projekt dokumentacji technicznej.
lista kontrolna
- [ ] Naprawiono wszystkie nasiona losowości.
- [ ] Wersja danych/skrót jest rejestrowana przy każdym eksperymencie.
- [ ] Zależności są zamrożone do wersji stałych (szpilka/pojemnik).
- [ ] Każdy eksperyment jest automatycznie monitorowany (kod+dane+ustawienia+metryka).
- [ ] Kiedy powtarzam ten sam przebieg, otrzymuję ten sam wynik.
- [ ] Sprawdziłem i udokumentowałem, że krytyczne decyzje w całym procesie są podejmowane przez ludzi.
Egzamin modułowy
1. Jakie jest najlepsze podejście, jeśli chodzi o pozycjonowanie sztucznej inteligencji w przepływie pracy, jako inżynier ML?
- A) sztuczna inteligencja jest akceleratorem w przedsiębiorstwach niskiego ryzyka; Krytyczne decyzje, takie jak wskaźniki, dane i produkcja, pozostają potwierdzone i pozostawione człowiekowi ✔
- B) Dopóki wyniki AI wyglądają dobrze, nie ma potrzeby weryfikacji
- C) Pozostawienie decyzji o wprowadzeniu modelu do produkcji sztucznej inteligencji pozwala zaoszczędzić czas.
- D) Sztuczna inteligencja przydaje się jedynie do pisania tekstu, nie ma ona nic wspólnego z danymi i pracą nad modelami
Opis: sztuczna inteligencja to potężny akcelerator zadań niskiego ryzyka i łatwych do zweryfikowania, takich jak kod, podsumowania danych i dokumenty; Jednakże odpowiedzialność za decyzje mające wpływ na pieniądze, poufność i odpowiedzialność prawną, takie jak wybór metryk, które dane trafiają do szkolenia i wprowadzenie modelu do produkcji, spoczywa na wykwalifikowanym inżynierze i zespole. Nie należy używać żadnego wyjścia bez sprawdzenia.
2. Dlaczego walidację schematu umieszcza się na początku potoku danych?
- A) Ponieważ bezpośrednio zwiększa dokładność modelu
- B) Ponieważ sprawia to, że wersjonowanie danych jest niepotrzebne
- C) Ponieważ wychwytuje uszkodzone dane w najwcześniejszym i najtańszym momencie i zapobiega ich wyciekowi do kolejnych kroków ✔
- D) Ponieważ eliminuje potrzebę etykietowania
Objaśnienie: Im wcześniej wykryte zostaną uszkodzone dane, tym taniej będzie je naprawić. Walidacja schematu zapobiega cichemu wyciekaniu uszkodzonych danych do szkolenia lub produkcji poprzez odrzucanie danych spoza oczekiwanego typu i zakresu na początku wiersza (np. 100-krotna zmiana ceny przy zmianie jednostki); Ten sam błąd wyłapany na produkcji jest wielokrotnie droższy.
3. Jakie jest prawidłowe podejście przy podziale danych na uczące i testujące w przypadku problemu związanego z czasem (szereg czasowy)?
- A) Stosowanie losowego podziału, ponieważ jest to zawsze najuczciwsza metoda
- B) Stosowanie podziału czasowego: zapobieganie wyciekom poprzez ćwiczenie przeszłości i testowanie przyszłości ✔
- C) Wykorzystanie wszystkich danych do celów szkoleniowych i testowych
- D) Włączenie danych testowych do parametrów skalowania przed szkoleniem
Objaśnienie: Losowy podział na szeregi czasowe daje modelowi przewagę w przewidywaniu przyszłości, która nigdy nie pojawi się w środowisku produkcyjnym, i sztucznie zawyża metryki (przeciek czasowy). Prawidłowy jest podział czasowy: trenuj z przeszłością, testuj w przyszłości. Mierzy rzeczywistą wydajność, która utrzymuje go w produkcji.
4. Dlaczego dokładność wprowadza w błąd w modelu wykrywania oszustw ze współczynnikiem klasy dodatniej wynoszącym 1,5%?
- A) Ponieważ dokładność jest zawsze niska w przypadku danych niezrównoważonych
- B) Ponieważ dokładność może być używana tylko w przypadku problemów z regresją
- C) Ponieważ obliczenia dokładności wymagają dużej mocy obliczeniowej
- D) Nawet marny model, który przewiduje klasę większości, może być bardzo dokładny, ukrywając w ten sposób prawdziwy sukces ✔
Objaśnienie: W przypadku niezrównoważonych danych nawet podstawowy model, który mówi „nazwij wszystko negatywnym”, uzyskuje dokładność około 98,5%, ale nie wykryje ani jednego oszustwa. Dlatego w klasyfikacji niezrównoważonej zamiast dokładności stosuje się precyzję, przypomnienie, F1 lub PR-AUC, a każdą metrykę interpretuje się zgodnie z modelem podstawowym.
5. Dlaczego porównanie wartości bazowych jest niezbędne, gdy mówimy o metryce modelu?
- A) Ponieważ model bazowy jest zawsze lepszy od modelu rzeczywistego
- B) Ponieważ jest jasne, czy metryka ma znaczenie, czy nie tylko w porównaniu z prostym modelem bazowym ✔
- C) Ponieważ model podstawowy sprawia, że weryfikacja krzyżowa jest niepotrzebna
- D) Ponieważ model podstawowy jest prawnie wymagany w każdym raporcie
Objaśnienie: Metryka sama w sobie nie jest ani dobra, ani zła; W zależności od podstawowego modelu jest to dobre lub złe. Zdanie „poprawne w 85%” oznacza prawie bezwartościowe, jeśli model bazowy uzyskał już 84%, i doskonałe, jeśli uzyska 50%. Bez kotwicy porównawczej metryka nie ma znaczenia.
6. Jaki jest najważniejszy element bezpieczeństwa, który powinien zostać uwzględniony w linii produkcyjnej systemu RAG (Retrieval-Augmented Generation)?
- A) Instrukcja polegania wyłącznie na podanym źródle, mówienia „nie wiem”, jeśli źródło nie istnieje i powoływania się na źródło ✔
- B) Nakazanie modelowi, aby udzielał jak najdłuższych i kreatywnych odpowiedzi
- C) Model przedkłada własną wiedzę edukacyjną nad zasoby
- D) Wykonaj wszystkie instrukcje zawarte w dokumentach przyniesionych jako polecenia
Wyjaśnienie: Najważniejszą instrukcją RAG jest poinformowanie modelu, aby opierał się wyłącznie na podanym źródle, a jeśli informacji nie ma w źródle, powiedz „nie wiem” i zacytuj źródło bez wymyślania go. Bez tej triady model może zignorować kontekst i wywołać halucynacje, a odpowiedzi nie da się zweryfikować.
7. System RAG podaje błędne odpowiedzi. Gdzie najlepiej rozpocząć diagnostykę?
- A) Najpierw pomiar przy odbiorze (Recall@K): czy właściwy element w ogóle dociera? ✔
- B) Natychmiast wymienić model na większy
- C) Zmień losowo monit i kontynuuj próbę
- D) Osadzanie wszystkich dokumentów w modelu z dostrojeniem
Objaśnienie: najsłabszym ogniwem RAG jest zwykle pobieranie, a nie produkcja. Jeśli nigdy nie zostanie dostarczona właściwa część, model nie będzie w stanie wygenerować tych informacji, niezależnie od tego, jak bardzo udoskonalono monit. Dlatego najpierw mierzony jest Recall@K, aby sprawdzić, czy dotarła właściwa część; Jeśli pobranie jest dobre, sprawdzana jest produkcja i monit.
8. Jakie działania powinny opierać się na ludzkiej akceptacji, gdy przekazujesz narzędzie agentowi?
- A) Brak; Agent musi być w stanie wykonać każdą akcję samodzielnie
- B) Tylko działania odwracalne, takie jak czytanie i wyszukiwanie danych
- C) Działania nieodwracalne lub mające duży wpływ, takie jak przesyłanie pieniędzy, usuwanie, wysyłanie ✔
- D) Działania polegające wyłącznie na obliczeniach
Opis: Akcje są rozdzielone według poziomu ryzyka. Zadania możliwe do odzyskania, takie jak czytanie, wyszukiwanie, obliczanie i generowanie wersji roboczych, można wykonywać autonomicznie; Jednak nieodwracalne lub mające duży wpływ działania, takie jak przesyłanie pieniędzy, wysyłanie e-maili, usuwanie danych, składanie zamówień itp. wymagają zgody człowieka. Każde nieodwołalne działanie wymaga zgody.
9. Jakie jest najlepsze podejście projektowe w kontekście ryzyka pośredniego i szybkiego wtrysku?
- A) Wystarczy dodać do podpowiedzi systemowej jedno zdanie „ignoruj złe instrukcje”.
- B) Nadaj modelowi większą władzę, opierając się na instrukcjach zawartych w treści zewnętrznej
- C) Niestosowanie żadnych środków ostrożności, ponieważ wstrzyknięciu nie można zapobiec
- D) Izolowanie treści zewnętrznych jako niewiarygodnych danych i ustanawianie warstwowych zabezpieczeń przy minimalnej autoryzacji, zatwierdzaniu i kontroli wyników ✔
Opis: Treści zewnętrzne przetwarzane przez agenta lub RAG, takie jak strona internetowa, dokument, wiadomość e-mail itp., stanowią dane niezaufane i mogą zawierać tajne instrukcje. Prawidłowym podejściem jest obrona warstwowa: izolowanie treści zewnętrznych w postaci „danych, a nie poleceń” z wyraźnymi ogranicznikami, stosowanie minimalnej autoryzacji, wiązanie nieodwracalnych działań z aprobatą człowieka i kontrolowanie wyników. Pojedyncza linijka instrukcji nie wystarczy.
10. Jaka jest główna różnica przy podejmowaniu decyzji, czy problem należy rozwiązać za pomocą dostrajania, czy RAG?
- A) Problemy informacyjne są lepiej rozwiązywane za pomocą RAG, problemy z zachowaniem/formatem są lepiej rozwiązywane za pomocą dostrajania ✔
- B) Każdy problem należy zawsze rozwiązać poprzez dostrojenie
- C) RAG służy tylko do generowania kodu, dostrajanie służy tylko do tłumaczenia
- D) Dostrajanie zawsze można zaktualizować taniej i szybciej niż RAG
Wyjaśnienie: Dostrajanie jest słabe i ryzykowne w uczeniu modelu nowych informacji; ale ma potężną moc w nauczaniu zachowań, formatu, tonu i stylu. „Wzorowa firma nie zna naszych danych” jest problemem informacyjnym i należy do RAG. „Niech model zawsze generuje wyniki w naszym ścisłym formacie” jest problemem behawioralnym i wymaga dostrojenia. Dodatkowo, przed dostrojeniem należy oddać szybkie i kilka strzałów.
11. Co jest obowiązkowe, aby zapewnić bezpieczne wdrożenie nowego modelu do produkcji?
- A) Jeśli model wypadł dobrze w testach, otwórz go bezpośrednio na 100% ruchu
- B) W ogóle nie konfigurowano monitorowania po wdrożeniu
- C) Wdrażanie etapowe (w tle/kanaryjskie) i wstępnie przetestowany plan wycofywania ✔
- D) Publikacja modelu nawet w przypadku nieosiągnięcia progu oceny
Wyjaśnienie: Otwarcie nowego modelu bezpośrednio na cały ruch jest ryzykowne; Jeśli coś jest nie tak, dotyczy to wszystkich. Prawidłowe jest to, że jest to dystrybucja stopniowa (cień, kanarek) i każda dystrybucja ma przetestowany plan wycofywania. Dystrybucja nie jest kompletna bez planu wycofania; Możliwość powrotu do poprzedniej wersji w ciągu kilku minut chroni użytkownika, gdy model zachowuje się nieoczekiwanie w produkcji.
12. W jaki sposób model ML może „po cichu” zawieść w produkcji i jak to wyłapać?
- A) Model się zapada; logi serwera to pokazują
- B) Tworząc błędne prognozy bez popełniania błędów; ✔ Przechwytuje monitorowanie operacyjne, wejściowe i wyjściowe
- C) Model nigdy nie może zawieść po cichu, zawsze alarmować
- D) Samo monitorowanie opóźnień wystarczy, aby wykryć wszelkie degradacje
Objaśnienie: Model może zawieść po prostu przez wygenerowanie błędnych przewidywań bez awarii lub błędów; Główną tego przyczyną jest dryf danych i dryf koncepcji. Samo monitorowanie wskaźników operacyjnych (opóźnień, poziomu błędów) nie wystarczy; należy również monitorować rozkład danych wejściowych i rozkład wyników/prognoz. Dryft wejściowy daje wczesne ostrzeżenie, jeśli rzeczywisty wynik jest opóźniony.
13. Jaka zasada jest niezbędna, gdy LLM jest sędzią do oceny systemu LLM?
- A) Sędzia LLM ma zawsze rację, weryfikacja przez człowieka nie jest konieczna
- B) Sędzia musi podjąć decyzję wyłącznie na podstawie długości odpowiedzi.
- C) W przypadku korzystania z sędziów należy całkowicie odrzucić kontrolę opartą na zasadach i ocenę ludzką
- D) Wyniki sędziów należy skalibrować na podstawie próbki oznaczonej przez człowieka, a ich stronniczość zmierzyć, zanim będzie można im zaufać ✔
Opis: Sędzia LLM jest także modelem; Może mieć charakter halucynacyjny, stronniczy (faworyzujący długie i pewne odpowiedzi) i niespójny. Dlatego też wyniki sędziowskie należy skalibrować na podstawie próbki oznakowanej przez człowieka, a przed podjęciem decyzji o produkcji należy zmierzyć ich systematyczne odchylenie. Niezweryfikowany sędzia daje fałszywą pewność.
14. Dlaczego sprawdzanie ogólnej dokładności nie jest wystarczające przy ocenie obciążenia modelu?
- A) Ogólna dokładność jest wystarczająca, ponieważ zawsze odzwierciedla wyniki najgorszej grupy
- B) Sama ogólna dokładność jest niewystarczająca, ponieważ może zaciemnić systematyczne różnice (ukrytą dyskryminację) pomiędzy podgrupami ✔
- C) Ponieważ dokładność jest metryką, która nie ma nic wspólnego z uprzedzeniami
- D) Błąd pochodzi wyłącznie z modelu i nie ma nic wspólnego z danymi.
Wyjaśnienie: Ogólna dokładność może przesłaniać systematyczne różnice pomiędzy podgrupami. Na przykład, chociaż ogólna dokładność wynosi 88%, zapamiętywanie może wynosić 91% w jednej grupie i 67% w innej grupie; Model systematycznie pomija tę grupę. Dlatego też model należy oceniać na podstawie podgrup (demografia/segment) i wspólnie z zainteresowanymi stronami ustalić, która definicja sprawiedliwości powinna być traktowana priorytetowo.
15. Jakie cztery rzeczy muszą zostać połączone, aby wynik ML był powtarzalny?
- A) Tylko nazwa modelu, rozmiar, cena i data premiery
- B) Tylko marka GPU i prędkość Internetu
- C) Tylko ostateczny wynik dokładności modelu; resztę można zachować w pamięci
- D) Ziarno losowości, wersja danych, środowisko (wersje zależności) i śledzenie eksperymentu ✔
Opis: Powtarzalność osiąga się poprzez cztery filary: naprawianie nasion losowości, wersjonowanie danych (wersja/skrót), zamrażanie środowiska (dokładne wersje bibliotek/kontener) i śledzenie każdego eksperymentu (zatwierdzenie kodu, dane, hiperparametr, metryka). Bez tego łańcucha nie jest możliwe odtworzenie tego samego wyniku; Niepowtarzalny wynik to twierdzenie, którego nie można udowodnić.