Jednostka 10 / 10

Kompleksowe zastosowanie: ocena, walidacja, etyka i granice

Zyski:

  • Możliwość skonfigurowania małego zestawu testowego (eval), który ocenia model na podstawie własnych danych
  • Włącz weryfikację przez człowieka, limity i zasady odpowiedzialnego użytkowania do przepływu pracy
  • Rozpoznaj ryzyko halucynacji, prywatności i etyczne oraz wdrażaj środki łagodzące

Wybrałeś właściwy model; Czy praca została wykonana? Nie, prawdziwa praca zaczyna się teraz. Wdrożenie modelu w Twojej firmie sprowadza się do przetestowania go na podstawie własnych danych, sprawdzenia jego wyników i odpowiedzialnego sformułowania go. Ta ostatnia jednostka zamienia cały moduł w kompleksową aplikację: dowiesz się, jak skonfigurować mały zestaw testów (eval), włączyć weryfikację przez człowieka do przepływu pracy, zarządzać halucynacjami i ryzykiem związanym z prywatnością oraz wyznaczać granice etyczne. Gdy urządzenie będzie już gotowe, będziesz mógł nie tylko wybrać model, ale także bez obaw go oddać do użytku.

Ocena (Eval): Testowanie na własnych danych

Teraz wiesz, że tylko rzeczywiste dane, a nie reklamy, mogą stwierdzić, czy model pasuje do Twojej firmy. Sposobem na zmierzenie tego jest utworzenie zestawu ewaluacyjnego (eval): małego zbioru próbek z Twojej pracy, dla których znana jest prawidłowa odpowiedź.

Prostą ewaluację konfiguruje się w następujący sposób:

  1. Zbierz 10-30 prawdziwych próbek. Wybierz dane wejściowe typowe dla Twojej pracy (łącz trudne i łatwe).
  2. Określ „poprawny/oczekiwany wynik” dla każdego przykładu. Co odpowiedziałby ekspert?
  3. Przeprowadź kandydatów przez te same przykłady. Przetestuj porównywane modele jeden po drugim z tym samym zestawem.
  4. Oceń wyniki. W ilu przykładach jest to prawda? Gdzie popełnił błąd? Czy błędy są dopuszczalne?
  5. Porównaj i wybierz. Wybierz nie najwyższy ogólny wynik, ale ten, który jest najbardziej wiarygodny w najbardziej krytycznych dla Ciebie przykładach.
Wskazówka: nie ufaj ślepo rankingom. Model może zajmować pierwsze miejsce na świecie, ale osiągać gorsze wyniki niż model znajdujący się na drugim miejscu w konkretnych tureckich tekstach prawnych. Twoja własna ocena 20 próbek jest warta więcej niż setki publicznych testów.

Halucynacje: najbardziej podstępne ryzyko modelki

Halucynacja ma miejsce, gdy model wytwarza informacje, które w rzeczywistości nie są prawdziwe, w pewnym języku. Zamiast mówić „nie wiem”, model może stworzyć nieistniejący akt prawny, zmyśloną statystykę lub fałszywą datę; Co więcej, robi to niezwykle przekonującym językiem. Jest to najniebezpieczniejszy aspekt sztucznej inteligencji, ponieważ błąd udaje prawdę.

Nie możesz całkowicie wyeliminować halucynacji, ale możesz ją zmniejszyć i złapać:

  • Oprzyj się na źródle: poproś model, aby wygenerował odpowiedzi na podstawie dostarczonych dokumentów, a nie z własnej „pamięci” (logika RAG).
  • Źródła żądań: Powiedz: „Obok każdego roszczenia wpisz dokument/sekcję, na której jest ono oparte”; Jeśli nie może podać źródła, nabierz podejrzeń.
  • Nakłonienie ludzi do powiedzenia, że ​​nie są pewni: Instrukcja „Jeśli nie jesteś pewien, napisz „niejasno”” ogranicza dopasowanie modelu.
  • Weryfikacja przez człowieka: Wyniki krytyczne muszą być weryfikowane przez człowieka.
Przestroga: Nigdy nie używaj wyników modelu bez sprawdzenia ich pod kątem decyzji prawnych, medycznych lub finansowych. „Artykuł prawny” lub „informacje o dawce” utworzone przez model mogą zostać całkowicie sfabrykowane. W tych obszarach sztuczna inteligencja jest narzędziem wstępnym/wstępnym; Kompetentna osoba zawsze ma ostatnie słowo.

Wymóg weryfikacji przez człowieka

Sztuczna inteligencja najlepiej sprawdza się jako narzędzie, które przyspiesza ludzi, a nie pozbawia ich pracy. Prawidłowa konfiguracja jest następująca: tworzy lub wstępnie kwalifikuje wersję roboczą modelu; człowiek przegląda, poprawia i zatwierdza. To, jak rygorystyczna musi być weryfikacja, zależy od kosztu błędu.

Zadanie

Koszt błędu

weryfikacja przez człowieka

Projekt opisu produktu

niski

Wystarczy kontrola próbki

Odpowiedź e-mail klienta

średni

Przegląd przed złożeniem

Analiza ryzyka kontraktu

wysoki

Artykuł po artykule potwierdzenie eksperta

Porady medyczne/finansowe

bardzo wysoki

Pełna weryfikacja ekspercka, tylko wsparcie AI

Ta tabela zapewnia równowagę pomiędzy „ręcznym sprawdzaniem każdego wyniku” a „nie sprawdzaniem wcale”. Podczas gdy kontrola próbki jest wystarczająca w przypadku niskokosztowych zadań, każdy wynik musi zostać zweryfikowany w przypadku kosztownych zadań.

Etyczne i odpowiedzialne użytkowanie

Chociaż wybór modelu może wydawać się decyzją techniczną, kryje się za nią odpowiedzialność etyczna:

  • Przejrzystość: Poinformuj swoich klientów lub pracowników, że korzystasz ze sztucznej inteligencji w odpowiednich miejscach. Klient ma prawo wiedzieć, czy rozmawia z człowiekiem, czy ze sztuczną inteligencją.
  • Odchylenie: modele mogą dziedziczyć odchylenie z danych, na których są szkolone. Monitoruj uczciwość wyników w wrażliwych obszarach, takich jak rekrutacja i ocena kredytowa.
  • Prywatność: Włącz zasady ochrony danych, których nauczyłeś się w części 8, do przepływu pracy; Nie przesyłaj danych osobowych lekkomyślnie.
  • Odpowiedzialność: Kiedy pojawia się błąd, obrona w stylu „AI to zrobiła” nie wystarczy. Odpowiedzialność spoczywa na instytucji korzystającej z pojazdu. Dlatego dokumentuj procesy weryfikacji.
Wskazówka: wpisz do swojego przepływu pracy małą „zasadę odpowiedzialnego użytkowania”: jakie zadania mogą wykorzystywać sztuczną inteligencję, jakie dane nie mogą być wysyłane, kto będzie to weryfikował i w jaki sposób będą zgłaszane błędy. Ten jednostronicowy dokument zapobiegnie poważnym problemom w przyszłości.

Trzy realistyczne przypadki

Przypadek 1 — Żal bez ustalenia ewaluacji. Zespół ubezpieczeniowy rozpoczyna podsumowywanie szkód bez testowania najpopularniejszego modelu. Po dwóch tygodniach orientują się, że modelka często popełnia błędy w języku tureckim i błędnie odczytuje niektóre kwoty. Kiedy ustalają ocenę 20 próbek i porównują trzy modele, wybierają model, który nie jest najpopularniejszy, ale jest dokładniejszy w tureckich tekstach technicznych. Strata: dwa tygodnie i praca związana z korektą. Lekcja: najpierw ewaluuj, wdrażaj później.

Przypadek 2 — Proces rejestrujący halucynację. Asystent prawny widzi na wydruku modelowym odniesienie do „orzeczenia Sądu Najwyższego”. Ponieważ w ich procesie obowiązuje zasada „weryfikuj każde odwołanie”, szuka decyzji i stwierdza, że ​​taka decyzja nie istnieje; Stworzył model. Dzięki ludzkiej weryfikacji sfabrykowane informacje nigdy nie docierają do klienta. Bez zasady weryfikacji utrata reputacji mogłaby być poważna.

Przypadek 3 – Zaufaj przejrzystości. Firma zajmująca się handlem elektronicznym tworzy odpowiedzi na wsparcie klienta za pomocą sztucznej inteligencji, ale pod każdą odpowiedzią dodaje notatkę: „Ta odpowiedź została przygotowana przy wsparciu sztucznej inteligencji i została sprawdzona przez jednego z naszych przedstawicieli”. Klienci są bardziej zadowoleni zarówno z szybkiej reakcji, jak i pewności, że widzą zaangażowaną osobę. Przejrzystość nie jest słabością do ukrycia, ale źródłem zaufania.

Słaba zachęta / silna zachęta: możliwy do zweryfikowania wynik

Słaba zachęta:

Opowiedz mi o ryzykownych klauzulach tej umowy.

Może pasować do modelu; żadnego źródła, żadnych oznak niepewności.

Potężny monit:

Twoja rola: analityk kontraktowy (ostateczna decyzja należy do prawnika). Zadanie: Podkreśl potencjalnie ryzykowne klauzule w poniższej umowie. Dla każdego ustalenia: (1) numer klauzuli i dosłowny cytat, (2) dlaczego jest to ryzykowne, (3) Twój poziom pewności (wysoki/średni/niski). Opieraj się wyłącznie na klauzulach w tekście; Nie wymyślaj niczego, czego nie ma w tekście. Jeżeli nie jesteś pewien, napisz „wymagane potwierdzenie prawnika”. [umowa]

Silna zachęta łączy każde twierdzenie ze źródłem (numer artykułu + cytat), wymaga poziomu zaufania i zabrania fabrykacji; Dzięki temu halucynacje można uchwycić.

Szablony do kopiowania

1. Scenografia ewaluacyjna:

Zaprojektuj zbiór ewaluacyjny dla następującego zadania [ZADANIE]. Zaproponuj 15 przykładowych danych wejściowych (mieszanych łatwych, średnich i trudnych), w jaki sposób można zdefiniować „oczekiwany prawidłowy wynik” dla każdego z nich i określ kryterium punktacji (1-5).

2. Okład redukujący halucynacje:

Przepisz następujący monit, aby ograniczyć produkcję: „[PROMPT]”. Dodaj reguły cytowania źródeł, określając poziom pewności i „powiedz mi, jeśli nie jesteś pewien”.

3. Projekt przepływu weryfikacji:

W poniższym przepływie pracy [PRACA] Zaprojektuj etap weryfikacji przez człowieka wyników AI. Określ, jak rygorystyczna powinna być weryfikacja, w oparciu o koszt błędu; napisz kto sprawdzi co, kiedy.

4. Projekt polityki odpowiedzialnego użytkowania:

Przygotuj jednostronicową „politykę odpowiedzialnego korzystania z AI” dla zespołu w [BRANŻA]. Uwzględnij następujące nagłówki: dozwolone zastosowania, zabronione dane, odpowiedzialność za weryfikację, raportowanie dotyczące przejrzystości, raportowanie błędów.

Typowe błędy

  • Wdrażanie bez Eval: Uruchamianie modelu bez testowania go na własnych danych i zauważania błędów po ich odzwierciedleniu w kliencie/zleceniu.
  • Poleganie na halucynacjach: Używanie pewnego języka modelki jako prawdy bez sprawdzania referencji.
  • Pomijanie weryfikacji przez człowieka: pozostawianie wyników bez kontroli w przypadku podejmowania kosztownych decyzji; Opieranie się na obronie „AI to zrobiła”.
  • Unikanie przejrzystości: ukrywanie korzystania z sztucznej inteligencji; doświadcza utraty pewności siebie, kiedy to nastąpi.
  • Ignorowanie etyki i uprzedzeń: Podejmowanie wrażliwych decyzji (zatrudnienie, kredyt) bez monitorowania uczciwości wyników.

Podsumowując

  • Przed wdrożeniem modelu skonfiguruj mały zestaw ewaluacyjny z własnymi danymi i przetestuj kandydatów; ogólne rankingi nie reprezentują Twojej firmy.
  • Halucynacje to pewne wypowiadanie się przez modelkę fałszywego języka; Uchwycone na podstawie źródła, poziomu zaufania i weryfikacji przez człowieka.
  • Rygoryzm weryfikacji przez człowieka jest dostosowywany w zależności od kosztu błędu; W krytycznych obszarach AI jest jedynie wsparciem, decyzja należy do człowieka.
  • Przejrzystość, kontrola stronniczości, poufność i odpowiedzialność; to cztery filary odpowiedzialnego wykorzystania sztucznej inteligencji. Polityka jednej strony zapobiega poważnym zagrożeniom.

Zadanie aplikacji

Przygotuj zestaw ewaluacyjny składający się z 15 przykładów z szablonem 1 w tej jednostce (projekt zbioru ewaluacyjnego) dla modeli kandydujących wybranych w module i porównaj co najmniej dwa modele z tym zestawem. Następnie zaprojektuj, w jaki sposób wyniki będą weryfikowane przez ludzi, korzystając z szablonu 3 (przebieg walidacji) i opracuj jednostronicową politykę dla swojego zespołu za pomocą szablonu 4 (polityka odpowiedzialnego użytkowania). Te trzy elementy przekształcają cały moduł w wykonalny plan wdrożenia.

lista kontrolna

  • [ ] Korzystając z własnych danych, mogę skonfigurować mały zestaw ewaluacyjny i porównać modele.
  • [ ] Potrafię rozpoznać halucynacje i zastosować środki łagodzące i zatrzymujące.
  • [ ] Mogę dostosować rygorystyczność weryfikacji przez człowieka w oparciu o koszt błędu.
  • [ ] Potrafię włączyć do przepływu pracy zasady przejrzystości, stronniczości, poufności i odpowiedzialności.
  • [ ] Potrafię przygotować jednostronicową politykę odpowiedzialnego korzystania z AI.

Egzamin modułowy

1. Jaka jest różnica między „dostawcą” sztucznej inteligencji a „rodziną modelową”?

  • A) Dostawca to firma opracowująca model, a rodzina modeli to grupa modelowa tej firmy pod marką ✔
  • B) Są dokładnie tym samym i są używane zamiennie
  • C) Dostawca to cena modelu, rodzina modeli to prędkość modelu.
  • D) Rodzina modeli odnosi się do firmy, dostawca odnosi się do pojedynczej wersji modelu

Opis: dostawcą jest firma, która opracowała model (np. Anthropic); Rodzina modeli to grupa modeli, którą firma gromadzi pod marką (na przykład Claude). Wersja modelu to konkretna wersja w obrębie rodziny.

2. Jak najdokładniej określić „wagi” modelu?

  • A) Jest to liczba żetonów, które model może wyprodukować w ciągu minuty
  • B) To miliardy parametrów numerycznych, których model uczy się podczas uczenia i przechowuje informacje. ✔
  • C) Jest to miesięczna opłata abonamentowa modelu
  • D) Jest to liczba języków obsługiwanych przez model

Opis: Wagi to miliardy parametrów numerycznych, których model uczy się podczas uczenia; Jest tam przechowywane „wszystko, co wie model”. Rozróżnienie wag zamkniętych/jawnych zależy od tego, czy te parametry można pobrać i uruchomić.

3. Które stwierdzenie dotyczące „open-weight” i „open-source” jest prawdziwe?

  • A) Są to dokładnie te same koncepcje i obie dają nieograniczone wykorzystanie komercyjne
  • B) Otwarty ciężar zawsze udostępnia publicznie dane treningowe
  • C) To nie jest to samo; W przypadku ważenia otwartego udostępniane są zwykle tylko parametry, a warunki licencji mogą ograniczać wykorzystanie komercyjne ✔
  • D) Nie można pobrać modeli typu open source, można pobrać modele o otwartej wadze

Wyjaśnienie: W otwartym ważeniu współdzielone są tylko parametry modelu; dane i procesy szkoleniowe często nie są ujawniane, a niektóre licencje ograniczają wykorzystanie komercyjne. Zatem „otwarta waga” nie jest dokładnie tym samym, co „otwarte oprogramowanie”.

4. Która z poniższych cech jest najbardziej decydującą cechą modelu dla zespołu prawnego czytającego i analizującego długie umowy?

  • A) Posiadanie najniższej ceny tokena
  • B) Posiadanie zdolności przetwarzania wizualnego (multimodalnego).
  • C) Posiadanie licencji Open Weight
  • D) Posiadanie szerokiego okna kontekstowego ✔

Objaśnienie: Model potrzebuje dużego okna kontekstowego do przetwarzania długich dokumentów jako całości; Okno kontekstowe to całkowita liczba tokenów, o których model może jednocześnie pamiętać.

5. Jaka jest prawda odnośnie cen tokenów dla modeli z wagą zamkniętą?

  • A) Token wyjściowy jest zwykle znacznie droższy niż token wejściowy ✔
  • B) Wejście i wyjście mają zawsze dokładnie tę samą cenę
  • C) Pobierana jest tylko stała opłata miesięczna, kwota wykorzystania nie ma znaczenia
  • D) Token wejściowy jest zawsze wielokrotnie droższy niż wynik

Objaśnienie: Cena jest obliczana za token, a token wyjściowy wytwarzany przez model jest zwykle kilka razy droższy niż token wejściowy, który wysyłasz. Dlatego długie i niepotrzebne wydruki szybko zwiększają koszty.

6. Która funkcja modelu jest niezbędna dla zespołu księgowego, który chce automatycznie wyodrębniać dane z obrazów faktur?

  • A) Najszersze możliwe okno kontekstowe
  • B) Multimodalność (zdolność przetwarzania wizualnego) ✔
  • C) Licencja Open Weight
  • D) Najwyższy poziom rozumowania

Wyjaśnienie: Aby zrozumieć treść wizualną, model musi być w stanie przetwarzać zarówno obrazy, jak i tekst, to znaczy musi być multimodalny. Multimodalność to zdolność modelu do obsługi wielu typów danych, takich jak tekst, obrazy, a czasem także dźwięk.

7. Jaki jest najbardziej logiczny wybór w przypadku prostego zadania o dużej objętości (np. pozytywna/negatywna klasyfikacja tysięcy recenzji)?

  • A) Zawsze najsilniejszy i najdroższy model rozumowania
  • B) Model działający tylko na otwartej wadze i na własnym serwerze
  • C) Lekki i tani model, ponieważ zadanie jest proste, a głośność duża ✔
  • D) Model z najszerszym oknem kontekstowym

Opis: Lekki, niedrogi model sprawdza się w przypadku prostych zadań o dużej objętości; Korzystanie z najmocniejszego i najdroższego modelu generuje tutaj niepotrzebne koszty. Prawidłowe podejście polega na dopasowaniu trudności zadania do poziomu modelu.

8. Co powoduje wysłanie tekstu zawierającego dane osobowe do zagranicznego dostawcy AI w ramach KVKK?

  • A) Nie powoduje to żadnej odpowiedzialności prawnej
  • B) Ma znaczenie tylko wtedy, gdy dostawca znajduje się w UE, w żadnym innym przypadku
  • C) Jest to surowo zabronione w każdych okolicznościach, niezależnie od tego, czy dane są anonimowe, czy nie
  • D) Transfer danych za granicę jest brany pod uwagę i podlega specjalnym warunkom KVKK ✔

Wyjaśnienie: Dane operacyjne na serwerach dostawcy za granicą są uważane za „przesyłanie danych za granicę” i podlegają specjalnym warunkom KVKK w tym zakresie (takim jak wyraźna zgoda, decyzja stwierdzająca odpowiedniość, odpowiednie gwarancje).

9. Do czego służy tryb „rozumowania” modelu i jak wpływa na koszty?

  • A) Zwiększa dokładność w przypadku złożonych problemów, ale zwiększa koszty i opóźnienia, ponieważ generuje więcej tokenów ✔
  • B) Zawsze uwalnia model
  • C) Zwiększa jedynie liczbę języków obsługiwanych przez model
  • D) Zawsze skracaj odpowiedzi i redukuj koszty

Opis: Tryb rozumowania pozwala modelowi „myśleć” krok po kroku przed udzieleniem odpowiedzi; Zwiększa dokładność w przypadku wieloetapowych i złożonych problemów, ale zwiększa również koszty i opóźnienia, ponieważ generuje więcej tokenów.

10. Jakie jest najbardziej wiarygodne podejście do oceny (ewaluacji) modelu własnego biznesu?

  • A) Wystarczy wybrać najpopularniejszy model i używać go bez testowania
  • B) Stwórz mały zestaw testowy swoich rzeczywistych zadań i porównaj z nim modele ✔
  • C) Wystarczy spojrzeć na wynik testu porównawczego wspomniany w reklamach
  • D) Automatycznie zaakceptuj model z najwyższym oknem kontekstowym jako najlepszy

Wyjaśnienie: Zamiast ślepo polegać na tabelach wyników, utwórz mały zestaw testowy składający się z własnych, rzeczywistych zadań i porównaj modele na tym zestawie, aby odkryć ten, który naprawdę pasuje do Twojej firmy.

11. W jaki sposób wiedza, że ​​wyniki modelu mogą zawierać „halucynacje”, powinna kształtować Twój przepływ pracy?

  • A) Wynik należy zawsze uważać za prawidłowy i bezpośrednio publikować
  • B) Halucynacje są widoczne tylko w modelach bezpłatnych, a nie płatnych
  • C) W przypadku kluczowych decyzji wynik musi zostać zweryfikowany przez człowieka, a źródła muszą zostać potwierdzone ✔
  • D) Halucynacje można całkowicie wyeliminować, po prostu zmieniając model

Wyjaśnienie: Halucynacja ma miejsce wtedy, gdy model wytwarza informacje, które w pewnym stopniu nie są prawdziwe. Ze względu na to ryzyko, w szczególności w przypadku decyzji prawnych, medycznych i finansowych, powinna być wymagana weryfikacja wyników przez człowieka.

12. Jaka jest podstawowa logika podejścia „portfela modelowego” przyjętego przez dojrzałe instytucje?

  • A) Aby zapewnić prostotę, wykonując każde zadanie przez jeden, najdroższy model.
  • B) Używanie tylko najtańszego modelu i całkowite ignorowanie jakości
  • C) Nie używaj żadnych modeli i wykonuj całą pracę ręcznie
  • D) Optymalizacja kosztów i zmniejszenie zależności od jednego dostawcy poprzez zastosowanie różnych modeli w zależności od zadania ✔

Opis: Portfolio modeli ma wykorzystywać różne modele w zależności od zadania: tani model do prostych i nieporęcznych zadań, wydajny model do złożonych zadań, model otwarty/regionalny do poufnych danych. Optymalizuje to koszty i zmniejsza zależność od jednego dostawcy.

13. Dlaczego kraj pochodzenia i polityka przechowywania danych mogą stanowić kryterium wyboru modelu?

  • A) Ponieważ ma to bezpośredni wpływ na wymogi regulacyjne, dotyczące suwerenności danych i prywatności ✔
  • B) Tylko dlatego, że określa szybkość reakcji modelu
  • C) Ponieważ określa formaty plików obsługiwane przez model
  • D) Ponieważ nie ma to żadnego praktycznego skutku, jest to jedynie szczegół marketingowy

Opis: Kraj, w którym znajduje się siedziba twórcy modelu i gdzie/ile jest przechowywanych danych; Ma decydujące znaczenie z punktu widzenia regulacji prawnych, suwerenności danych i prywatności. Na przykład dla organizacji, która chce gościć na terenie UE, ważny staje się dostawca regionalny lub opcja zerowej przestrzeni dyskowej.

14. Co najlepiej wyjaśnia, dlaczego szukanie w zadaniu „jednego najlepszego modelu” wprowadza w błąd?

  • A) Wszystkie modele mają właściwie dokładnie te same możliwości
  • B) Modele są mocne w różnych rozmiarach, więc „najlepszy” zależy od wymagań pracy ✔
  • C) Najdroższy model jest automatycznie najlepszy w każdym zadaniu
  • D) Wybór modelu powinien być dokonany całkowicie losowo

Opis: Modele są mocne w różnych wymiarach, takich jak szybkość, koszt, kontekst, multimodalność, prywatność i rozumowanie. Model będący liderem w jednym wymiarze może być słaby w innym; więc „najlepszy” zawsze zależy od wymagań stanowiska.