Jednostka 11 / 11

Produkcja kompleksowa: weryfikacja, monitorowanie i etyka

Zyski:

  • Potrafi zaprojektować kompleksową architekturę, która przenosi funkcję LLM od pomysłu do produkcji
  • Ustanawia warstwy egzekwowania weryfikacji, zatwierdzania przez ludzi i śledzenia (rejestrowanie/metryki)
  • Granice przekładają zasady etyki i prywatności na decyzje produkcyjne

W poprzednich dziesięciu rozdziałach poznawaliśmy poszczególne części: strukturę żądań, ekonomię tokenów, przepływ, monit systemowy, wybór modelu, pamięć podręczną, partię, zarządzanie błędami, bezpieczny klucz i automatyzację. W tej ostatniej jednostce łączymy części i ustanawiamy holistyczną architekturę, która przenosi funkcję LLM od pomysłu do produkcji. Produkcja różni się od „działającego demo”: weryfikacja jest obowiązkowa, wyniki muszą być monitorowane, a decyzje muszą uwzględniać granice i zasady etyczne. Jednostka ta jest kolumną nośną modułu; Wszystkie poprzednie spotykają się tutaj.

Warstwy architektury produkcji

Solidna kwalifikacja LLM składa się z mniej więcej pięciu warstw:

  1. Warstwa wejściowa: Zbieraj dane, oczyszczaj je, maskuj wrażliwe obszary, przesyłaj tylko to, co konieczne.
  2. Warstwa modelu: Wybierz właściwy model (jednostka 5), ​​ustaw monit systemowy i parametry (jednostka 4), pamięć podręczną (jednostka 6).
  3. Warstwa walidacji: Sprawdź dane wyjściowe pod kątem schematu/reguły, źródła i, jeśli to konieczne, zgody człowieka.
  4. Warstwa akcji: wykonaj akcję ze zweryfikowanymi wynikami; Uchwyć działania o dużym wpływie.
  5. Warstwa monitorowania: Rejestruj i mierz każdą rozmowę, koszt, błąd i jakość.

Warstwy te są rurociągiem; każdy sprawdza wynik poprzedniego.

Dlaczego wymagana jest weryfikacja?

LLM mogą generować płynne, ale czasami niedokładne wyniki. Nazywa się to halucynacją: model może sfabrykować informacje, które wydają się być prawdziwe, ale tak nie jest. W grze na czacie jest to tolerowane; nie mogą być tolerowane w systemie produkcyjnym (faktura, zdrowie, prawo, finanse). Okazało się, że jest to ślepo zawodne; jest potwierdzone.

Warstwy weryfikacji (rosnące o wpływ):

  • Walidacja formatu/schematu: czy dane wyjściowe są zgodne z oczekiwanym schematem JSON? (Ustrukturyzowany wynik w dużej mierze to gwarantuje.)
  • Weryfikacja reguły/logiki: czy wartości są rozsądne? (Czy kwota jest ujemna, czy data przypada w przyszłości, czy kategoria jest ważna?)
  • Weryfikacja źródła: Czy roszczenie opiera się na dostarczonej dokumentacji? Czy model mówi coś, czego nie ma w dokumencie?
  • Akceptacja człowieka: ekspert dokonuje przeglądu decyzji mających duży wpływ lub niejednoznacznych.
Uwaga: „Model jest tak dobry, że nie wymaga dalszej weryfikacji” to najniebezpieczniejszy błąd produkcyjny. Niezależnie od tego, jak dobry jest model, warstwa weryfikacyjna stanowi zabezpieczenie przy podejmowaniu decyzji o dużym wpływie. Nawet jedna zła, automatyczna decyzja może zabrać cały zaoszczędzony czas.

Człowiek w pętli

Nie każda decyzja musi być w pełni automatyczna. W podejściu human-in-the-loop model przyspiesza pracę, a człowiek to akceptuje. Właściwy balans zależy od wpływu decyzji i niezawodności modelu na to zadanie.

Wpływ decyzji

Podejście

Niski (sugestia etykiety, wersja robocza)

Pełna automatyzacja; błąd jest tani i odwracalny

Średni (trasowanie, ustalanie priorytetów)

Automatyka + kontrola pobierania próbek

Wysoki (pieniądze, kontrakt, zdrowie, usunięcie)

Zgoda człowieka jest obowiązkowa; model tylko sugeruje

Monitorowanie: nie możesz zarządzać tym, czego nie widzisz

Na produkcji musisz monitorować każde połączenie. Bez monitorowania nie można poprawić kosztów, jakości ani wcześnie wykryć problemu. Kluczowe wskaźniki do zarejestrowania:

  • Użycie/koszt: na żądanie i łączna liczba tokenów, dystrybucja modeli, dzienne wydatki.
  • Opóźnienie: średni i najgorszy czas reakcji.
  • Poziom błędów: stawki 429/500, ponowne próby, porzucenia.
  • Jakość: odrzucony współczynnik wyjściowy w warstwie weryfikacji, współczynnik korekcji po zatwierdzeniu przez człowieka, informacja zwrotna od użytkownika.
Wskazówka: Nie zapisuj wrażliwych danych (danych osobowych, kluczy) w logach monitorowania. Rozważ logi w zakresie poufności; zapisz, jeśli to konieczne, maskując (część 9).

Etyka i granice

Odpowiedzialność etyczna jest w równym stopniu częścią decyzji produkcyjnej, jak dokładność techniczna:

  • Przejrzystość: użytkownik powinien wiedzieć, czy rozmawia ze sztuczną inteligencją, czy z człowiekiem.
  • Uczciwość i stronniczość: model może zawierać stronniczość wynikającą z danych, na których jest szkolony; Monitoruj konsekwencje dyskryminacji w decyzjach o dużym wpływie (zatrudnienie, kredyt).
  • Odpowiedzialność: Jeśli zautomatyzowana decyzja wyrządzi szkodę, ponosisz za to odpowiedzialność; „Modelka tak powiedziała” nie jest obroną.
  • Akceptacja ograniczeń: Model nie może wiarygodnie wykonywać niektórych zadań; brak ich automatyzacji jest również decyzją projektową.

Szablony do kopiowania

# Lista kontrolna walidacji (po wygenerowaniu danych wyjściowych)1) Czy schemat jest prawidłowy? (walidacja wyników strukturalnych)2) Czy wartości mają sens? (sprawdzanie reguły: zakres, data, wyliczenie)3) Czy twierdzenie opiera się na źródle? (odrzucić, jeśli nie ma go w dokumencie)4) Czy wpływ jest duży? → wyślij do zatwierdzenia przez człowieka5) Jeśli wszystko przeszło → zezwól na działanie, zapisz

# Podpowiedź systemowa wymuszająca poleganie na źródle. Polegaj tylko na informacjach zawartych w dostarczonym dokumencie. Nie dodawaj niczego, czego nie ma w dokumencie. Jeżeli danej informacji nie ma w dokumencie, należy wpisać „Nie znaleziono w dokumencie”. Nigdy nie zgaduj ani nie wymyślaj rzeczy.

# Próg akceptacji przez człowieka (reguła decyzji)IF typ_decyzji w [pieniądze, kontrakt, usunięcie, zdrowie] → zatwierdzenie przez człowieka obowiązkoweIF model_trust < próg LUB weryfikacja „niepewna” → prześlij do zatwierdzenia przez człowieka INNE → automatyczne zastosowanie + kontrola pobierania próbek

# Szablon dziennika śledzenia (zapisywanie wrażliwych danych){ "time":"...", "model":"...", "input_token":..., "output_token":..., "delay_ms":..., "stop_reason":"...", "authentication":"passed|rejected|human", "cost_usd":... } // dane osobowe i klucz NIGDY nie są zapisywane

Słaby monit / Silny monit (niezawodność produkcji)

# SŁABY (brak weryfikacji, brak źródła, stosuje się automatycznie) Oceń tę prośbę, podejmij decyzję o zwrocie środków i złóż wniosek.

# SILNY (na podstawie źródła, generuje rekomendacje, pozostawia do zatwierdzenia przez człowieka) Oceń tę prośbę o zwrot wyłącznie na podstawie dokumentu dotyczącego zasad zwrotów. Polecaj decyzję wraz z uzasadnieniem, ale nie wdrażaj: {"recommendation":"approve|reject","reason":"...""policy_clause":"..."}. Jeżeli w dokumencie polityki nie ma jasnej podstawy, wpisz „niejasne”. Ostateczną decyzję zatwierdzi przedstawiciel.

Potężna wersja; Przypisuje decyzję źródłu, pozycjonuje model jako „sugestię”, a nie „wykonawcę”, i stawia krok o dużym wpływie za aprobatą człowieka. To jest istota niezawodności produkcji.

Trzy mini etui

Przypadek 1 — Dzień, w którym warstwa weryfikacyjna została zapisana. Fintech zlecił modelowi klasyfikację opisów transakcji i utworzenie automatycznych zapisów księgowych. Dodali weryfikację reguły: gdy model wypisał niepoprawną kwotę (12 500 zamiast 1250 w dokumencie), reguła „kwota niezgodna z dokumentem” odrzuciła dane wyjściowe i rekord przypadł człowiekowi. W przypadku braku weryfikacji nieprawidłowy rekord po cichu dostałby się do systemu.

Przypadek 2 – Zbieg złapany przez obserwację. Zespół SaaS utworzył panel monitorujący; Pewnego ranka dzienne koszty potroiły się. Z dzienników wynikało, że klient wszedł w pętlę i wysłał to samo żądanie tysiące razy. Dodali limity i deduplikację; Problem został rozwiązany w ciągu kilku godzin. Bez śledzenia rachunek byłby niespodzianką na koniec miesiąca.

Przypadek 3 — Akceptacja limitu. Startup z sektora opieki zdrowotnej planował w pełni automatycznie formułować zalecenia diagnostyczne i pokazywać je pacjentowi. W ramach przeglądu etyki i odpowiedzialności uznali, że jest to niedozwolone: ​​model dostarcza lekarzowi jedynie podsumowania i możliwych punktów, a on stawia diagnozę. Brak automatyzacji zadania to także dojrzała decyzja projektowa.

Typowe błędy

  • Pomijanie sprawdzania poprawności: ślepe stosowanie wyników, mówiąc „model jest dobry”.
  • Automatyzacja decyzji o dużym wpływie: akceptacja człowieka jest niezbędna w kwestiach finansowych/zdrowia/prawa.
  • Brak monitorowania: Problemy z kosztami i jakością są wykrywane późno.
  • Zapisywanie wrażliwych danych w logach: Naruszenie prywatności; Zapisz go, maskując.
  • Nie próbuj polegać na źródle: Model może stanowić to, czego nie ma w dokumencie.
  • Ignorowanie ograniczeń: Brak automatyzacji niektórych zadań jest właściwą decyzją; Przejrzystość i odpowiedzialność należą do Ciebie.

Głębiej: zarządzanie wersjami, wycofywanie zmian i wdrażanie przyrostowe

Wdrożenie funkcji LLM w środowisku produkcyjnym nie polega na jej skonfigurowaniu i zapomnieniu o niej; polega na bezpiecznym modyfikowaniu działającego systemu w miarę upływu czasu. Ma trzy filary.

Wersjonowanie. Podpowiedzi systemowe, wybór modelu i zasady weryfikacji zmieniają się z biegiem czasu. Wersjonuj każdą znaczącą zmianę i zapisuj, która wersja jest aktywna. Jeśli pewnego dnia jakość spadnie, „co zmieniliśmy?” Powinieneś być w stanie odpowiedzieć na pytanie w ciągu kilku minut. W systemie bez wersji znalezienie pierwotnej przyczyny regresji zajmuje kilka dni.

Wycofanie. Jeśli nowy monit lub model zachowuje się gorzej niż oczekiwano na żywo, powinieneś móc szybko wrócić do poprzedniej, dobrze znanej wersji. Zmiana bez planu wycofania jest ślepą akceptacją rzeczywistego ryzyka. „Zmieniłem coś, zrobiło się źle, nie mogę wrócić” to najdroższy scenariusz produkcji.

Stopniowe wdrażanie. Zamiast wprowadzać zmianę do całego ruchu na raz, najpierw wprowadź ją do niewielkiego odsetka (np. 5%) i monitoruj wskaźniki (jakość, koszt, błędy). Jeśli jest dobrze, zwiększasz procent; Jeśli jest zły, odzyskasz go, ale dotyczy to tylko małej części. To znacznie ogranicza ryzyko.

Te trzy praktyki łączą techniki ze wszystkich poprzednich jednostek: eval (jednostka 5) mierzy zmiany z wyprzedzeniem, monitorowanie (ta jednostka) daje wczesne ostrzeżenie podczas propagacji, warstwa weryfikacji wyłapuje błędne dane wyjściowe, zanim staną się one przydatne do działania. Produkcja nie jest pojedynczą poprawną konfiguracją; Jest to ciągła dyscyplina, która mierzy, monitoruje i może zmieniać się z pewnością. Cały moduł jest dla Ciebie, aby ustalić tę dyscyplinę.

Podsumowując

Produkcja to coś więcej niż działające demo: to potok warstw wejściowych, modelowych, weryfikacyjnych, akcji i monitorowania. Dane wyjściowe są niewiarygodne bez weryfikacji; decyzje o dużym wpływie są powiązane z aprobatą człowieka; Każde połączenie jest monitorowane pod kątem kosztów, błędów i jakości. Etyka, przejrzystość, kontrola uprzedzeń, odpowiedzialność i akceptacja limitów są integralną częścią decyzji technicznych. Wszystkie elementy poznane w tym module łączą się w całościowy projekt.

Zadanie aplikacji

Zaprojektuj kompleksowo funkcję LLM. (1) Wypełnij pięć warstw (wejście, model, weryfikacja, działanie, monitorowanie) dla konkretnego zadania. (2) Zaznacz poprzez wpływ, które decyzje będą wymagały zatwierdzenia przez człowieka. (3) Napisz co najmniej trzy kontrole walidacyjne (schemat, reguła, źródło). (4) Określ kluczowe wskaźniki, które będziesz śledzić, a które nie będą rejestrowane. (5) Wpisz w tym obiekcie ograniczenie i zasadę etyczną, którą akceptujesz.

lista kontrolna

  • [ ] Potrafię zaprojektować pięć warstw rurociągu produkcyjnego.
  • [ ] Potrafię zweryfikować dane wyjściowe pod kątem schematu, reguły i źródła.
  • [ ] Mogę ustawić próg akceptacji przez ludzi na podstawie wpływu decyzji.
  • [ ] Monitoruję koszty, błędy i jakość i ćwiczę nie zapisywanie wrażliwych danych w logach.
  • [ ] Potrafię przekształcić etykę, odpowiedzialność i granice w decyzje produkcyjne.

Egzamin modułowy

1. Do czego służy rola „systemowa” w interfejsie API czatu LLM?

  • A) Daje modelowi stałe instrukcje i zasady zachowania, które obowiązują przez całą rozmowę ✔
  • B) Zachowuje ostatnie pytanie napisane przez użytkownika
  • C) Przechowuje odpowiedź wytworzoną przez model
  • D) Szyfruje klucz API

Opis: Rola systemowa zapewnia modelowi trwałe instrukcje, osobowość i zasady, które obowiązują przez całą rozmowę; Jest to przekierowanie wysokiego poziomu, niezależne od wiadomości użytkownika.

2. Dlaczego historia rozmów (poprzednie wiadomości) jest wysyłana za każdym razem w żądaniu API?

  • A) Konieczne jest wykonanie kopii zapasowej, ponieważ serwer usuwa historię
  • B) Wywołania API są bezstanowe; ✔ Kontekst jest odtwarzany przy każdym żądaniu, ponieważ model nie pamięta historii
  • C) Wymagane tylko do fakturowania, nie ma wpływu na model
  • D) Wysyłanie historii jest obowiązkowe, aby uniknąć spowolnienia odpowiedzi

Objaśnienie: Wywołania API LLM są bezstanowe; Model nie pamięta poprzednich rund, więc na każde żądanie wyświetlana jest cała istotna historia, aby zachować kontekst.

3. Czym jest „token” w cenach LLM?

  • A) Hasło jednorazowe służące do logowania się do API
  • B) Opłata stała pobierana od każdego żądania
  • C) Najmniejsza jednostka, w której model przetwarza tekst; zwykle odpowiada części słowa ✔
  • D) Jednostka, która mierzy tylko długość wyjścia

Opis: Token to najmniejsza jednostka, w której model przetwarza tekst; Zwykle odpowiada fragmentowi słowa, a opłaty za wejście i wyjście są naliczane na podstawie liczby tokenów.

4. Dlaczego tokeny wyjściowe są droższe niż tokeny wejściowe u większości dostawców LLM?

  • A) Żetony wyjściowe są zawsze dłuższe niż wejściowe
  • B) Tokeny wejściowe są bezpłatne
  • C) Tokeny wyjściowe są wysyłane dwukrotnie przez Internet
  • D) Koszt jednostkowy jest wyższy, ponieważ generowanie wyników wymaga dodatkowych obliczeń dla każdego tokena ✔

Opis: Każdy z żetonów wyjściowych wymaga, aby model wykonał generację krok po kroku (obliczenia); Ten koszt produkcji jest wyższy niż przetworzenie całości wejścia na raz, więc jednostkowa cena produktu wyjściowego jest zwykle wyższa.

5. W jakiej sytuacji korzystanie ze streamingu jest najbardziej korzystne?

  • A) W długich odpowiedziach; Zmniejsza odczuwalne opóźnienie i zapobiega przekroczeniu limitu czasu ✔
  • B) Tylko w bardzo krótkich, jednowyrazowych odpowiedziach
  • C) Aby obniżyć koszty do zera
  • D) Aby ukryć klucz API

Opis: w przypadku długich odpowiedzi przesyłanie strumieniowe zmniejsza postrzegane opóźnienia, powodując natychmiastowe pojawienie się pierwszych słów i zapobiega przekroczeniu limitu czasu HTTP przy dużych wartościach max_tokens.

6. Na co ogólnie wpływa zwiększenie parametru „wysiłku” we współczesnych modelach?

  • A) Zawsze skracaj odpowiedź
  • B) Automatycznie obraca klucz API
  • C) Zmniejsza jedynie cenę tokena wejściowego
  • D) Zwiększa głębię myślenia i wydatki symboliczne; Może to poprawić jakość, ale zwiększa również opóźnienia i koszty ✔

Opis: Parametr wysiłku reguluje, jak głęboko model będzie myślał o zadaniu i ile żetonów wyda; Aktualizacja może poprawić jakość, ale zwiększa również opóźnienia i koszty. Do prostych zadań wystarczy niewielki wysiłek.

7. Jakie jest ogólnie najbardziej opłacalne podejście do prostego zadania klasyfikacji o dużej objętości?

  • A) Zawsze używaj najdroższego i najpotężniejszego modelu
  • B) Wywoływanie wszystkich modeli jednocześnie dla każdego żądania
  • C) Wybór najlżejszego/najtańszego modelu spełniającego zadanie poprzez weryfikację go małą ewaluacją ✔
  • D) utrzymywanie niepotrzebnie zbyt wysokiej wartości max_tokens

Wyjaśnienie: Jeżeli zadanie nie jest skomplikowane, wybranie szybszego i tańszego modelu, który z łatwością wykona zadanie (np. klasy Haiku) zamiast najdroższego i najmocniejszego modelu znacznie obniży koszty.

8. W którym scenariuszu buforowanie podpowiedzi najbardziej obniża koszty?

  • A) Gdy w wielu żądaniach wielokrotnie używany jest duży i stały kontekst ✔
  • B) Gdy przy każdym żądaniu wysyłany jest zupełnie inny tekst
  • C) Gdy złożono tylko jedno żądanie
  • D) Aby zmniejszyć liczbę żetonów wyjściowych

Opis: Buforowanie to dopasowanie prefiksu; W przypadkach, gdy duży, niezmienny kontekst (podpowiedź systemowa, dokumenty) jest ponownie wykorzystywany w wielu żądaniach, odczyt z pamięci podręcznej stanowi niewielki ułamek (~0,1x) pełnej ceny.

9. Jak powinienem edytować zachętę, aby pamięć podręczna podpowiedzi trafiła?

  • A) Umieszczenie zmiennej treści na początku i stałej treści na końcu
  • B) Dla każdego żądania umieść bieżącą datę i godzinę w wierszu poleceń systemu
  • C) Umieszczenie stałej treści (podpowiedź systemowa, dokumenty) na początku i zmiennej treści na końcu ✔
  • D) Zmiana kolejności listy narzędzi przy każdym żądaniu

Objaśnienie: Ponieważ pamięć podręczna jest zgodna z prefiksem, inicjowana jest stała/niezmieniona treść (podpowiedź systemowa, dokumenty); zmienna treść (data, pytanie użytkownika, identyfikator żądania) jest umieszczana na końcu. Nawet pojedynczy bajt zmieniony na początku spowoduje unieważnienie pamięci podręcznej.

10. Do jakiego rodzaju obciążenia najlepiej nadaje się przetwarzanie wsadowe?

  • A) Czat na żywo, gdzie użytkownik oczekuje natychmiastowej odpowiedzi na ekranie
  • B) Tylko jedno krótkie pytanie
  • C) Generowanie klucza API
  • D) Zadania tolerujące opóźnienia, wymagające dużych nakładów i niewymagające natychmiastowych rezultatów ✔

Opis: Przetwarzanie wsadowe jest odpowiednie w przypadku dużych ilości zadań, które nie wymagają natychmiastowej reakcji i tolerują opóźnienia; wyniki pojawiają się po pewnym czasie, ale koszt jednostkowy jest zwykle niższy.

11. Co służy do pewnego dopasowania żądania, do którego należą wyniki w partii?

  • A) Kolejność wysyłania (pozycja) żądań
  • B) Długość odpowiedzi
  • C) Ostatnie 4 cyfry klucza API
  • D) Unikalny identyfikator niestandardowy nadawany każdemu żądaniu ✔

Uwaga: Wyniki zbiorcze mogą zostać przesłane w innej kolejności niż kolejność zgłoszeń; dlatego konieczne jest dopasowanie wyników według identyfikatora, a nie lokalizacji, z unikalnym identyfikatorem niestandardowym nadawanym każdemu żądaniu.

12. Jakie jest zalecane zachowanie, gdy otrzymasz z API błąd 429 (limit szybkości)?

  • A) Wymuszanie poprzez wysłanie większej liczby żądań jednocześnie
  • B) Ponowna próba z wykładniczym wycofaniem, zgodnie z nagłówkiem „Ponowna próba” ✔
  • C) Całkowicie anuluj żądanie i pokaż użytkownikowi błąd jako awarię
  • D) Zmiana klucza API

Objaśnienie: 429 to błąd, który można ponowić; Prawidłowe podejście polega na ponownej próbie z wykładniczym wycofaniem, z uwzględnieniem nagłówka retry-after. Większość oficjalnych zestawów SDK robi to automatycznie.

13. Które z poniższych kodów błędów HTTP są ogólnie uważane za możliwe do powtórzenia?

  • A) 400 (nieprawidłowe żądanie)
  • B) 401 (błąd uwierzytelnienia)
  • C) 529 (serwer przeciążony) ✔
  • D) 404 (nie znaleziono)

Objaśnienie: 429 (ograniczenie prędkości), 500 (błąd serwera) i 529 (przeciążenie) to błędy tymczasowe i można je powtórzyć, wycofując się. Błędy takie jak 400 i 401 są problemami związanymi z żądaniami/tożsamością; Ponowna próba nie rozwiąże problemu.

14. Który z poniższych sposobów jest bezpiecznym sposobem zarządzania kluczami API?

  • A) Przechowywanie w zmiennej środowiskowej/ukrytym menadżerze, nie osadzanie jej w kodzie i regularna rotacja ✔
  • B) Zapisz klucz bezpośrednio w kodzie źródłowym i wyślij go do repozytorium
  • C) Umieszczenie klucza po stronie klienta (przeglądarki) JavaScript
  • D) Udostępnienie jednego klucza całemu zespołowi za pośrednictwem poczty elektronicznej

Opis: klucze nigdy nie są zapisywane w kodzie źródłowym ani w repozytorium; Jest przechowywany w zmiennej środowiskowej lub ukrytym narzędziu do zarządzania, nadawany z minimalnymi uprawnieniami i regularnie zmieniany.

15. Jakie jest najlepsze podejście do integracji LLM z narzędziem do automatyzacji (n8n, Zapier, Make) pod kątem prywatności?

  • A) Przesyłanie wszystkich surowych danych do modelu, nawet jeśli nie jest to konieczne
  • B) Zapisanie klucza API zwykłym tekstem w kroku przepływu
  • C) Minimalizowanie i maskowanie wrażliwych danych oraz przechowywanie klucza jako tajne dane uwierzytelniające ✔
  • D) Trwałe przechowywanie danych osobowych w historii przepływu

Opis: W miarę jak automatyczne wprowadzanie danych przechodzi przez systemy i modele innych firm, dane wrażliwe/osobiste należy minimalizować, maskować i wysyłać tylko wymagane pola; Klucz API jest również przechowywany w narzędziu jako tajne dane uwierzytelniające.

16. Dlaczego walidacja wyników jest obowiązkowa w przypadku funkcji produkcyjnej opartej na LLM?

  • A) Wymagane jest jedynie formatowanie, ponieważ model nigdy nie popełnia błędów
  • B) Ponieważ model może produkować płynnie, ale czasami niepoprawnie; Schemat/reguła musi zostać poddana audytowi za zgodą zasobów i ludzi ✔
  • C) Należy unikać walidacji, ponieważ zwiększa to tylko koszty
  • D) Weryfikacja ma na celu jedynie zmniejszenie liczby tokenów

Opis: LLM mogą generować płynne, ale czasami niedokładne (halucynacyjne) wyniki; więc okazało się, że decyzje miały duży wpływ; Należy go poddać audytowi poprzez sprawdzenie schematu/reguł, weryfikację źródła i, jeśli to konieczne, zatwierdzenie przez człowieka.