Jednostka 11 / 11

Powtarzalność i kompleksowy projekt: połączenie wszystkiego

Zyski:

  • Możliwość zapewnienia powtarzalności w oparciu o cztery filary (utrwalanie nasion, wersjonowanie danych, zamrażanie pożywek, monitorowanie eksperymentu) i uzyskiwanie tego samego wyniku przy powtarzaniu tego samego cyklu
  • Możliwość połączenia wszystkich przystanków modułu (metryki, dane, model, komponenty LLM, ewaluacja, uczciwość, bezpieczeństwo, dystrybucja, monitorowanie) w kompleksowym łańcuchu
  • Możliwość sprawdzenia, czy krytyczna decyzja pozostaje przy człowieku na każdym przystanku i udokumentowania projektu w sposób umożliwiający audyt

Najbardziej podstępna porażka projektu ML nie jest awarią; „Nie uzyskam ponownie takiego samego wyniku”. Jeśli nie możesz dzisiaj odtworzyć wyniku modelu, który wprowadziłeś do produkcji trzy miesiące temu, tak naprawdę nie masz nad nim kontroli. W tej jednostce zamykającej pogłębiamy odtwarzalność: możliwość niezawodnego uzyskania tego samego wyniku przy tych samych nakładach i połączenia całego modułu w kompleksową dyscyplinę projektową.

Dlaczego powtarzalność jest trudna

W zwykłym oprogramowaniu ten sam kod daje taki sam wynik. W ML istnieje znacznie więcej zmiennych, które determinują wynik:

  • Losowość: tasowanie danych, inicjalizacja wagi, dzielenie danych — wszystko opiera się na losowości.
  • Dane: ten sam kod tworzy inny model z inną wersją danych.
  • Środowisko: Wersje bibliotek, sprzęt (CPU/GPU), nawet system operacyjny mogą zmienić wynik.
  • Ukryty przypadek: niezapisany hiperparametr, ręczny etap przetwarzania wstępnego, niezanotowany wybór.

Powtarzalność nie jest czymś, co warto mieć, ale koniecznością naukową i inżynieryjną. Wynik, którego nie można odtworzyć, jest twierdzeniem, którego nie można udowodnić.

Cztery filary powtarzalności

1. Napraw losowość. Ustaw wszystkie losowe nasiona w jednym miejscu: dzielenie danych, inicjalizacja modelu, tasowanie danych. Stałe rozstawienie jest podstawą gwarancji „tego samego wyniku przy powtarzaniu tego samego przejazdu”.

2. Wersjonuj dane. Zapisz, z jaką wersją danych przeprowadzono każdy eksperyment (wersjonowanie danych w części 2). „Najnowsze dane” są niejasne; „wersja danych v3, skrót abc123” jest dokładny.

3. Zamrozić podłoże. Przypnij wszystkie zależności do ich dokładnych wersji (np. dokładnych wersji, takich jak numpy==1.26.4 w pliku wymagania.txt lub obraz kontenera). „Najnowsza wersja” pewnego dnia wszystko zepsuje.

4. Śledź wszystko (śledzenie eksperymentu). Automatycznie zapisuj dla każdego eksperymentu: wersję kodu (git commit), wersję danych, wszystkie hiperparametry, metryki i struktury wyjściowe. Narzędzia do śledzenia eksperymentów, takie jak MLflow, Weights & Biases, robią to systematycznie. Bez rejestracji pytanie „które ustawienie było najlepsze” pozostaje bez odpowiedzi.

Uwaga: „później zapamiętam” to najdroższy błąd. Dwa tygodnie później nie będziesz pamiętał, jakiego materiału siewnego, jakich danych i jakiego hiperparametru użyłeś. Automatyczne śledzenie eliminuje zależność od pamięci.

Słabe podejście / Silne podejście

Słabe: „Znalazłem najlepszy model, jest na notebooku, myślę, że jego wynik wyniósł 89%.”.

Strong: „Uruchom #147 w narzędziu do śledzenia eksperymentu: git commit a3f9c, wersja danych v3 (hash abc123), ziarno 42, wszystkie zarejestrowane hiperparametry, przetestuj PR-AUC 0,887. Kiedy ponownie uruchomię to samo polecenie, otrzymuję ten sam wynik krok po kroku. Model zależy od tego uruchomienia w rejestrze.”

Różnica: w podejściu silnym wynik nie opiera się na pamięci, ale na ustalonym i monitorowanym łańcuchu. Każdy może za każdym razem uzyskać ten sam wynik.

Projekt kompleksowy: połączenie modułów

Teraz połączmy cały moduł w jeden przepływ projektu. Prawdziwy system ML przechodzi przez te przystanki, a każdy przystanek opiera się na poprzednim:

  1. Definicja problemu: Co rozwiązujemy, jak mierzyć sukces (część 3: właściwy miernik, kontekst biznesowy). Metryka i próg są jasne od początku.
  2. Potok danych: zbieranie, sprawdzanie poprawności, oczyszczanie, partycjonowanie bez wycieków, wersjonowanie (część 2).
  3. Opracowanie modelu: szkolenie, porównanie wartości bazowych, weryfikacja krzyżowa, twarde nasiona (część 3 + ta jednostka).
  4. Komponenty LLM (jeśli dotyczy): RAG (jednostka 4) i/lub agenci (jednostka 5); w razie potrzeby dostrojenie (część 6).
  5. Ocena: klaster ewaluacyjny z przypadkami brzegowymi i bezpieczeństwa, ewaluacja wielowarstwowa w systemach LLM (część 8).
  6. Audyt sprawiedliwości i etyki: analiza podgrup, karta modelu, wyjaśnialność (część 10).
  7. Audyt bezpieczeństwa: Szybki zastrzyk, prywatność, łańcuch dostaw (część 9).
  8. Dystrybucja: Pakowanie, dystrybucja stopniowa, wycofywanie, rejestracja modeli (część 7).
  9. Monitoring: Monitoring trójwarstwowy, alarmy dryfu (jednostka 8).
  10. Powtarzalność: śledzenie nasion, wersji danych, multimediów i eksperymentów w całym łańcuchu (to urządzenie).

W tym przepływie sztuczna inteligencja jest akceleratorem i generatorem planów na każdym przystanku; ale wybór wskaźników, decyzje dotyczące danych, uczciwe ustalanie priorytetów, próg wdrożenia i zatwierdzenie wydania – najważniejsze decyzje pozostają w gestii człowieka. To jest istota modułu.

Dokumentacja: przyszłość będzie Ci wdzięczna

Dobry projekt ML dokumentuje się sam. Należy zapisać co najmniej następujące informacje: problem i kryteria sukcesu, źródło i wersja danych, wybór i uzasadnienie modelu, wyniki oceny (w tym podgrupy), znane ograniczenia i ryzyko, procedura wdrażania i odzyskiwania, plan monitorowania. Ten dokument jest najlepszym przyjacielem osoby (a może to właśnie Ty), która po sześciu miesiącach wraca do projektu.

trzy mini etui

Przypadek 1 – Utracony wynik. Inżynier wytrenował świetny model, ale nie naprawił materiału siewnego i nie zapisał wersji danych. Kiedy odszedł z pracy, nikt nie był w stanie odtworzyć takiego wyniku; model stał się „legendą czarnej skrzynki” i ostatecznie został zbudowany od podstaw. Tygodnie zostały zmarnowane. Lekcja: wynik, którego nie można powtórzyć, to wynik, który nie istnieje.

Przypadek 2 – Załamanie środowiska. Jeden zespół nie naprawił zależności. Gdy biblioteka została automatycznie zaktualizowana, dane wyjściowe modelu uległy cichej zmianie, a produkcja została zakłócona. Znalezienie problemu zajęło kilka dni. Po zamrożeniu zależności i umieszczeniu w kontenerach wersji ostatecznych problem nie wystąpił ponownie. Lekcja: zamroź środowisko.

Przypadek 3 – Siła monitoringu. Zespół automatycznie monitorował każdy eksperyment. Trzy miesiące później podczas audytu regulacyjnego odpowiedzieli na pytanie „z jakimi danymi, przy jakich ustawieniach, jaką wydajność uzyskał w jakich grupach?” z pełnym nagraniem w ciągu kilku minut. Kontrola przebiegła sprawnie. Lekcja: monitorowanie to narzędzie zapewniające zgodność, a nie tylko narzędzie inżynieryjne.

Szablony do kopiowania

Wykonaj kontrolę odtwarzalności tego projektu ML. – Czy wszystkie nasiona losowości zostały naprawione (podział, inicjalizacja, przetasowanie)? – Czy dane są wersjonowane? – Czy zależności są zamrożone do dokładnych wersji? – Czy każdy eksperyment (zatwierdzenie kodu, dane, hiperparametr, metryka) jest śledzony? Napisz konkretne kroki, jak to naprawić dla każdej brakującej kolumny.Struktura projektu: [opis]

Utwórz szkielet planu dla tego kompleksowego projektu ML. Problem: [opis] Uwzględnij następujące przystanki i zaznacz, gdzie na każdym przystanku znajduje się decyzja CZŁOWIEKA: problem/metryka, rurociąg, model, (RAG/agent/dostrojenie?), ocena, uczciwość, bezpieczeństwo, dystrybucja, monitorowanie, odtwarzalność. Zapisz główne ryzyko i etap weryfikacji dla każdego przystanku.

Przygotuj szablon dokumentacji technicznej dla tego projektu. Sekcje: problem+kryteria sukcesu, dane (źródło+wersja), wybór modelu+uzasadnienie, ocena (w tym podgrupy), znane limity+ryzyka, wdrożenie+wycofanie zmian, plan monitorowania. Podaj pola do wypełnienia w każdej sekcji w formie pytań.

Sprawdź konfigurację monitorowania mojego eksperymentu: czy jest ona automatycznie zapisywana przy każdym uruchomieniu: zatwierdzenie git, wersja/skrót danych, wszystkie hiperparametry, wszystkie metryki, środowisko (wersje bibliotek)? Czy uzyskam ten sam wynik, jeśli ponownie uruchomię ten sam bieg? Konfiguracja: [opis]. Wypisz wady i poprawki.

Tabela kolumn odtwarzalności

kolumna

Co jest naprawione

Przykład pojazdu

losowość

wszystkie nasiona

ustawienie nasion

Dane

Wersja danych/hash

DVC

środowisko

Wersje biblioteczne

pin wymagań, Docker

Monitorowanie

Kod+dane+ustawienie+metryka

MLflow, W&B

Typowe błędy

  • Nie naprawianie nasion. Wynik nie może się powtórzyć.
  • Nie zapisano wersji danych. „Z jakimi danymi?” pozostaje bez odpowiedzi.
  • Nie zamrażanie uzależnień. Aktualizacja po cichu wszystko zepsuje.
  • Pozostawienie eksperymentów w pamięci. Po dwóch tygodniach nic się nie pamięta.
  • Pozostawienie kluczowych decyzji sztucznej inteligencji. Wskaźniki, sprawiedliwość i decyzje dotyczące dystrybucji powinny pozostać w gestii ludzi.
  • Odkładanie dokumentacji. Przyszły zespół (i Ty) płacicie cenę.

Podsumowując

Powtarzalność jest cechą poważnej inżynierii ML: nieodtwarzalny wynik jest twierdzeniem niemożliwym do udowodnienia. Zawiera cztery kolumny — napraw losowość, dane wersji, zamroź środowisko, śledź każdy eksperyment. Kompleksowy projekt łączy wszystkie elementy tego modułu (metryka, dane, model, komponenty LLM, ewaluacja, uczciwość, bezpieczeństwo, dystrybucja, monitorowanie) w połączonym łańcuchu; Sztuczna inteligencja jest akceleratorem na każdym kroku, ale krytyczne decyzje pozostają w gestii człowieka. Dokumentuj wszystko — na potrzeby przyszłego zespołu i audytów. Dyscyplina ta stanowi podstawę, na której opiera się wszystko, czego nauczysz się w trakcie modułu.

Zadanie aplikacji

Sprawdź projekt ML pod kątem czterech filarów odtwarzalności: czy nasiona są niezmienne, czy dane są wersjonowane, czy środowisko jest zamrożone, czy eksperymenty są śledzone? Napraw brakujące kolumny i udowodnij, że możesz dwukrotnie uruchomić ten sam bieg i uzyskać ten sam wynik. Następnie zapisz całościowy przebieg projektu (10 przystanków) na jednej stronie i zaznacz na każdym przystanku „gdzie znajduje się decyzja człowieka”. Na koniec napisz krótki projekt dokumentacji technicznej.

lista kontrolna

  • [ ] Naprawiono wszystkie nasiona losowości.
  • [ ] Wersja danych/skrót jest rejestrowana przy każdym eksperymencie.
  • [ ] Zależności są zamrożone do wersji stałych (szpilka/pojemnik).
  • [ ] Każdy eksperyment jest automatycznie monitorowany (kod+dane+ustawienia+metryka).
  • [ ] Kiedy powtarzam ten sam przebieg, otrzymuję ten sam wynik.
  • [ ] Sprawdziłem i udokumentowałem, że krytyczne decyzje w całym procesie są podejmowane przez ludzi.

Egzamin modułowy

1. Jakie jest najlepsze podejście, jeśli chodzi o pozycjonowanie sztucznej inteligencji w przepływie pracy, jako inżynier ML?

  • A) sztuczna inteligencja jest akceleratorem w przedsiębiorstwach niskiego ryzyka; Krytyczne decyzje, takie jak wskaźniki, dane i produkcja, pozostają potwierdzone i pozostawione człowiekowi ✔
  • B) Dopóki wyniki AI wyglądają dobrze, nie ma potrzeby weryfikacji
  • C) Pozostawienie decyzji o wprowadzeniu modelu do produkcji sztucznej inteligencji pozwala zaoszczędzić czas.
  • D) Sztuczna inteligencja przydaje się jedynie do pisania tekstu, nie ma ona nic wspólnego z danymi i pracą nad modelami

Opis: sztuczna inteligencja to potężny akcelerator zadań niskiego ryzyka i łatwych do zweryfikowania, takich jak kod, podsumowania danych i dokumenty; Jednakże odpowiedzialność za decyzje mające wpływ na pieniądze, poufność i odpowiedzialność prawną, takie jak wybór metryk, które dane trafiają do szkolenia i wprowadzenie modelu do produkcji, spoczywa na wykwalifikowanym inżynierze i zespole. Nie należy używać żadnego wyjścia bez sprawdzenia.

2. Dlaczego walidację schematu umieszcza się na początku potoku danych?

  • A) Ponieważ bezpośrednio zwiększa dokładność modelu
  • B) Ponieważ sprawia to, że wersjonowanie danych jest niepotrzebne
  • C) Ponieważ wychwytuje uszkodzone dane w najwcześniejszym i najtańszym momencie i zapobiega ich wyciekowi do kolejnych kroków ✔
  • D) Ponieważ eliminuje potrzebę etykietowania

Objaśnienie: Im wcześniej wykryte zostaną uszkodzone dane, tym taniej będzie je naprawić. Walidacja schematu zapobiega cichemu wyciekaniu uszkodzonych danych do szkolenia lub produkcji poprzez odrzucanie danych spoza oczekiwanego typu i zakresu na początku wiersza (np. 100-krotna zmiana ceny przy zmianie jednostki); Ten sam błąd wyłapany na produkcji jest wielokrotnie droższy.

3. Jakie jest prawidłowe podejście przy podziale danych na uczące i testujące w przypadku problemu związanego z czasem (szereg czasowy)?

  • A) Stosowanie losowego podziału, ponieważ jest to zawsze najuczciwsza metoda
  • B) Stosowanie podziału czasowego: zapobieganie wyciekom poprzez ćwiczenie przeszłości i testowanie przyszłości ✔
  • C) Wykorzystanie wszystkich danych do celów szkoleniowych i testowych
  • D) Włączenie danych testowych do parametrów skalowania przed szkoleniem

Objaśnienie: Losowy podział na szeregi czasowe daje modelowi przewagę w przewidywaniu przyszłości, która nigdy nie pojawi się w środowisku produkcyjnym, i sztucznie zawyża metryki (przeciek czasowy). Prawidłowy jest podział czasowy: trenuj z przeszłością, testuj w przyszłości. Mierzy rzeczywistą wydajność, która utrzymuje go w produkcji.

4. Dlaczego dokładność wprowadza w błąd w modelu wykrywania oszustw ze współczynnikiem klasy dodatniej wynoszącym 1,5%?

  • A) Ponieważ dokładność jest zawsze niska w przypadku danych niezrównoważonych
  • B) Ponieważ dokładność może być używana tylko w przypadku problemów z regresją
  • C) Ponieważ obliczenia dokładności wymagają dużej mocy obliczeniowej
  • D) Nawet marny model, który przewiduje klasę większości, może być bardzo dokładny, ukrywając w ten sposób prawdziwy sukces ✔

Objaśnienie: W przypadku niezrównoważonych danych nawet podstawowy model, który mówi „nazwij wszystko negatywnym”, uzyskuje dokładność około 98,5%, ale nie wykryje ani jednego oszustwa. Dlatego w klasyfikacji niezrównoważonej zamiast dokładności stosuje się precyzję, przypomnienie, F1 lub PR-AUC, a każdą metrykę interpretuje się zgodnie z modelem podstawowym.

5. Dlaczego porównanie wartości bazowych jest niezbędne, gdy mówimy o metryce modelu?

  • A) Ponieważ model bazowy jest zawsze lepszy od modelu rzeczywistego
  • B) Ponieważ jest jasne, czy metryka ma znaczenie, czy nie tylko w porównaniu z prostym modelem bazowym ✔
  • C) Ponieważ model podstawowy sprawia, że weryfikacja krzyżowa jest niepotrzebna
  • D) Ponieważ model podstawowy jest prawnie wymagany w każdym raporcie

Objaśnienie: Metryka sama w sobie nie jest ani dobra, ani zła; W zależności od podstawowego modelu jest to dobre lub złe. Zdanie „poprawne w 85%” oznacza prawie bezwartościowe, jeśli model bazowy uzyskał już 84%, i doskonałe, jeśli uzyska 50%. Bez kotwicy porównawczej metryka nie ma znaczenia.

6. Jaki jest najważniejszy element bezpieczeństwa, który powinien zostać uwzględniony w linii produkcyjnej systemu RAG (Retrieval-Augmented Generation)?

  • A) Instrukcja polegania wyłącznie na podanym źródle, mówienia „nie wiem”, jeśli źródło nie istnieje i powoływania się na źródło ✔
  • B) Nakazanie modelowi, aby udzielał jak najdłuższych i kreatywnych odpowiedzi
  • C) Model przedkłada własną wiedzę edukacyjną nad zasoby
  • D) Wykonaj wszystkie instrukcje zawarte w dokumentach przyniesionych jako polecenia

Wyjaśnienie: Najważniejszą instrukcją RAG jest poinformowanie modelu, aby opierał się wyłącznie na podanym źródle, a jeśli informacji nie ma w źródle, powiedz „nie wiem” i zacytuj źródło bez wymyślania go. Bez tej triady model może zignorować kontekst i wywołać halucynacje, a odpowiedzi nie da się zweryfikować.

7. System RAG podaje błędne odpowiedzi. Gdzie najlepiej rozpocząć diagnostykę?

  • A) Najpierw pomiar przy odbiorze (Recall@K): czy właściwy element w ogóle dociera? ✔
  • B) Natychmiast wymienić model na większy
  • C) Zmień losowo monit i kontynuuj próbę
  • D) Osadzanie wszystkich dokumentów w modelu z dostrojeniem

Objaśnienie: najsłabszym ogniwem RAG jest zwykle pobieranie, a nie produkcja. Jeśli nigdy nie zostanie dostarczona właściwa część, model nie będzie w stanie wygenerować tych informacji, niezależnie od tego, jak bardzo udoskonalono monit. Dlatego najpierw mierzony jest Recall@K, aby sprawdzić, czy dotarła właściwa część; Jeśli pobranie jest dobre, sprawdzana jest produkcja i monit.

8. Jakie działania powinny opierać się na ludzkiej akceptacji, gdy przekazujesz narzędzie agentowi?

  • A) Brak; Agent musi być w stanie wykonać każdą akcję samodzielnie
  • B) Tylko działania odwracalne, takie jak czytanie i wyszukiwanie danych
  • C) Działania nieodwracalne lub mające duży wpływ, takie jak przesyłanie pieniędzy, usuwanie, wysyłanie ✔
  • D) Działania polegające wyłącznie na obliczeniach

Opis: Akcje są rozdzielone według poziomu ryzyka. Zadania możliwe do odzyskania, takie jak czytanie, wyszukiwanie, obliczanie i generowanie wersji roboczych, można wykonywać autonomicznie; Jednak nieodwracalne lub mające duży wpływ działania, takie jak przesyłanie pieniędzy, wysyłanie e-maili, usuwanie danych, składanie zamówień itp. wymagają zgody człowieka. Każde nieodwołalne działanie wymaga zgody.

9. Jakie jest najlepsze podejście projektowe w kontekście ryzyka pośredniego i szybkiego wtrysku?

  • A) Wystarczy dodać do podpowiedzi systemowej jedno zdanie „ignoruj złe instrukcje”.
  • B) Nadaj modelowi większą władzę, opierając się na instrukcjach zawartych w treści zewnętrznej
  • C) Niestosowanie żadnych środków ostrożności, ponieważ wstrzyknięciu nie można zapobiec
  • D) Izolowanie treści zewnętrznych jako niewiarygodnych danych i ustanawianie warstwowych zabezpieczeń przy minimalnej autoryzacji, zatwierdzaniu i kontroli wyników ✔

Opis: Treści zewnętrzne przetwarzane przez agenta lub RAG, takie jak strona internetowa, dokument, wiadomość e-mail itp., stanowią dane niezaufane i mogą zawierać tajne instrukcje. Prawidłowym podejściem jest obrona warstwowa: izolowanie treści zewnętrznych w postaci „danych, a nie poleceń” z wyraźnymi ogranicznikami, stosowanie minimalnej autoryzacji, wiązanie nieodwracalnych działań z aprobatą człowieka i kontrolowanie wyników. Pojedyncza linijka instrukcji nie wystarczy.

10. Jaka jest główna różnica przy podejmowaniu decyzji, czy problem należy rozwiązać za pomocą dostrajania, czy RAG?

  • A) Problemy informacyjne są lepiej rozwiązywane za pomocą RAG, problemy z zachowaniem/formatem są lepiej rozwiązywane za pomocą dostrajania ✔
  • B) Każdy problem należy zawsze rozwiązać poprzez dostrojenie
  • C) RAG służy tylko do generowania kodu, dostrajanie służy tylko do tłumaczenia
  • D) Dostrajanie zawsze można zaktualizować taniej i szybciej niż RAG

Wyjaśnienie: Dostrajanie jest słabe i ryzykowne w uczeniu modelu nowych informacji; ale ma potężną moc w nauczaniu zachowań, formatu, tonu i stylu. „Wzorowa firma nie zna naszych danych” jest problemem informacyjnym i należy do RAG. „Niech model zawsze generuje wyniki w naszym ścisłym formacie” jest problemem behawioralnym i wymaga dostrojenia. Dodatkowo, przed dostrojeniem należy oddać szybkie i kilka strzałów.

11. Co jest obowiązkowe, aby zapewnić bezpieczne wdrożenie nowego modelu do produkcji?

  • A) Jeśli model wypadł dobrze w testach, otwórz go bezpośrednio na 100% ruchu
  • B) W ogóle nie konfigurowano monitorowania po wdrożeniu
  • C) Wdrażanie etapowe (w tle/kanaryjskie) i wstępnie przetestowany plan wycofywania ✔
  • D) Publikacja modelu nawet w przypadku nieosiągnięcia progu oceny

Wyjaśnienie: Otwarcie nowego modelu bezpośrednio na cały ruch jest ryzykowne; Jeśli coś jest nie tak, dotyczy to wszystkich. Prawidłowe jest to, że jest to dystrybucja stopniowa (cień, kanarek) i każda dystrybucja ma przetestowany plan wycofywania. Dystrybucja nie jest kompletna bez planu wycofania; Możliwość powrotu do poprzedniej wersji w ciągu kilku minut chroni użytkownika, gdy model zachowuje się nieoczekiwanie w produkcji.

12. W jaki sposób model ML może „po cichu” zawieść w produkcji i jak to wyłapać?

  • A) Model się zapada; logi serwera to pokazują
  • B) Tworząc błędne prognozy bez popełniania błędów; ✔ Przechwytuje monitorowanie operacyjne, wejściowe i wyjściowe
  • C) Model nigdy nie może zawieść po cichu, zawsze alarmować
  • D) Samo monitorowanie opóźnień wystarczy, aby wykryć wszelkie degradacje

Objaśnienie: Model może zawieść po prostu przez wygenerowanie błędnych przewidywań bez awarii lub błędów; Główną tego przyczyną jest dryf danych i dryf koncepcji. Samo monitorowanie wskaźników operacyjnych (opóźnień, poziomu błędów) nie wystarczy; należy również monitorować rozkład danych wejściowych i rozkład wyników/prognoz. Dryft wejściowy daje wczesne ostrzeżenie, jeśli rzeczywisty wynik jest opóźniony.

13. Jaka zasada jest niezbędna, gdy LLM jest sędzią do oceny systemu LLM?

  • A) Sędzia LLM ma zawsze rację, weryfikacja przez człowieka nie jest konieczna
  • B) Sędzia musi podjąć decyzję wyłącznie na podstawie długości odpowiedzi.
  • C) W przypadku korzystania z sędziów należy całkowicie odrzucić kontrolę opartą na zasadach i ocenę ludzką
  • D) Wyniki sędziów należy skalibrować na podstawie próbki oznaczonej przez człowieka, a ich stronniczość zmierzyć, zanim będzie można im zaufać ✔

Opis: Sędzia LLM jest także modelem; Może mieć charakter halucynacyjny, stronniczy (faworyzujący długie i pewne odpowiedzi) i niespójny. Dlatego też wyniki sędziowskie należy skalibrować na podstawie próbki oznakowanej przez człowieka, a przed podjęciem decyzji o produkcji należy zmierzyć ich systematyczne odchylenie. Niezweryfikowany sędzia daje fałszywą pewność.

14. Dlaczego sprawdzanie ogólnej dokładności nie jest wystarczające przy ocenie obciążenia modelu?

  • A) Ogólna dokładność jest wystarczająca, ponieważ zawsze odzwierciedla wyniki najgorszej grupy
  • B) Sama ogólna dokładność jest niewystarczająca, ponieważ może zaciemnić systematyczne różnice (ukrytą dyskryminację) pomiędzy podgrupami ✔
  • C) Ponieważ dokładność jest metryką, która nie ma nic wspólnego z uprzedzeniami
  • D) Błąd pochodzi wyłącznie z modelu i nie ma nic wspólnego z danymi.

Wyjaśnienie: Ogólna dokładność może przesłaniać systematyczne różnice pomiędzy podgrupami. Na przykład, chociaż ogólna dokładność wynosi 88%, zapamiętywanie może wynosić 91% w jednej grupie i 67% w innej grupie; Model systematycznie pomija tę grupę. Dlatego też model należy oceniać na podstawie podgrup (demografia/segment) i wspólnie z zainteresowanymi stronami ustalić, która definicja sprawiedliwości powinna być traktowana priorytetowo.

15. Jakie cztery rzeczy muszą zostać połączone, aby wynik ML był powtarzalny?

  • A) Tylko nazwa modelu, rozmiar, cena i data premiery
  • B) Tylko marka GPU i prędkość Internetu
  • C) Tylko ostateczny wynik dokładności modelu; resztę można zachować w pamięci
  • D) Ziarno losowości, wersja danych, środowisko (wersje zależności) i śledzenie eksperymentu ✔

Opis: Powtarzalność osiąga się poprzez cztery filary: naprawianie nasion losowości, wersjonowanie danych (wersja/skrót), zamrażanie środowiska (dokładne wersje bibliotek/kontener) i śledzenie każdego eksperymentu (zatwierdzenie kodu, dane, hiperparametr, metryka). Bez tego łańcucha nie jest możliwe odtworzenie tego samego wyniku; Niepowtarzalny wynik to twierdzenie, którego nie można udowodnić.