Jednostka 3 / 12

Pełne testowanie populacji z analizą danych: od próbki do całości

Zyski:

  • Zrozumieć ryzyko próbkowania i logikę pełnego testowania populacji (testowanie 100%) oraz potrafić wykorzystywać sztuczną inteligencję do przygotowywania danych, pisania reguł i interpretacji wyników.
  • Umiejętność projektowania i wdrażania testów dopasowania, kompletności i dokładności w dużych zbiorach danych przy wsparciu sztucznej inteligencji
  • Umiejętność zrozumienia, że lista wyjątków w teście pełnej populacji nie jest wynikiem, ale początkiem, który audytor zbada i że ostateczna ocena należy do audytora.

Jednym z najbardziej podstawowych ograniczeń zawodu audytora było to, że audytor musiał pracować z próbkowaniem przez wiele lat. Nie możesz ręcznie sprawdzić 180 000 faktur wystawianych przez firmę w ciągu roku; Wybierasz więc kilkaset rekordów, stosując metodę statystyczną lub osądową, testujesz je i uogólniasz wynik na całą populację. Pobieranie próbek jest skuteczną i uzasadnioną techniką, ale niesie ze sobą nieodłączne ryzyko: ryzyko pobierania próbek — wybrana próbka może nie być reprezentatywna dla populacji, a prawdziwy błąd w niej może nie mieścić się dokładnie w tym, czego szukasz.

Analityka danych i sztuczna inteligencja zmieniają ten obraz: teraz można testować całą populację, czyli 100%. Nazywa się to pełnym badaniem populacji. Poświęcamy tę część zrozumieniu przejścia od „próbki do całości”, mocy, jaką ze sobą niesie, oraz nowych obowiązków, które wiele osób przeocza. Ponieważ pełne badanie populacji nie ułatwia inspekcji; Zmienia to charakter egzaminu i nakłada na egzaminatora nowe obciążenia.

Różnica między pobieraniem próbek a badaniem pełnej populacji

W przypadku klasycznego próbkowania logika jest następująca: „Pozwólcie mi dokładnie przetestować małą, ale reprezentatywną grupę i zinterpretować wynik jako całość”. W teście pełnej populacji logika jest odwrotna: „Pozwólcie mi przeskanować całość według pewnych reguł, znaleźć wyjątki od reguły i dokładnie je zbadać”. W pierwszym podejściu ryzyko polega na „wyborze niewłaściwej próbki”; W drugim przypadku ryzyko polega na „napisaniu niewłaściwej reguły” i „pracy z niekompletnymi/błędnymi danymi”.

Poniższa tabela porównuje oba podejścia:

Rozmiar

pobieranie próbek

Pełne badanie populacji (100%)

Zakres

część populacji

cała populacja

Główne ryzyko

Ryzyko pobierania próbek (błąd reprezentacji)

Błąd reguły + błąd integralności danych

wyjście

Ograniczona liczba wyników testów

Lista wyjątków, które nie spełniają reguły

Ciężar audytora

wybór + test

Projekt reguły + ocena wyjątku

Rola sztucznej inteligencji

Pomoc w wyborze próbki

Przygotowanie danych, pisanie reguł, oznaczanie wyjątków

Uwaga: pełne badanie populacji nie oznacza „przetestowałem wszystko i robota została wykonana”. Wręcz przeciwnie, zazwyczaj daje więcej elementów do sprawdzenia. Kiedy sprawdzisz regułę zatwierdzania wszystkich 180 000 faktur według daty i kwoty, znajdziesz może 900 wyjątków. Każde z nich jest pytaniem; nie odpowiedź. W tym miejscu do akcji wkracza sądownictwo kontrolne.

Kompletność danych: niewidzialna podstawa testowania

Największą pułapką testów całej populacji jest to, że jakość testu zależy od jakości danych. „Przetestowałem 100% danych” ma sens tylko wtedy, gdy posiadane dane dotyczą w rzeczywistości 100% populacji. Jeśli podczas pobierania danych z systemu filtr był nieprawidłowy, pominięto niektóre rekordy lub kolumna kwoty została przeniesiona z błędem dziesiętnym, „pełny” test zostanie faktycznie przeprowadzony na niekompletnych lub uszkodzonych danych. Dlatego potwierdzenie kompletności i dokładności danych jest pierwszym i niezbędnym krokiem w pełnym badaniu populacji.

Praktyczne kontrole sprawdzające kompletność:

  • Uzgadnianie liczby rekordów: czy liczba wierszy w pobranym zbiorze danych odpowiada całkowitej liczbie rekordów w systemie?
  • Uzgadnianie kwot: Czy łączna kwota w zbiorze danych jest zgodna z sumą odpowiedniego konta w saldzie próbnym/spółce zależnej?
  • Zakres dat: Czy dane obejmują pierwszy i ostatni dzień okresu; Czy brakuje miesiąca/dnia?
  • Skanowanie pustej i złej przestrzeni: Czy w wymaganych polach (data, kwota, kod konta) znajdują się spacje lub wartości bez znaczenia?

Sztuczna inteligencja pomaga we wszystkich tych kontrolach: przeszukuje dane, pobiera sumy, liczy puste przestrzenie, raportuje zakres dat. Jednak to audytor decyduje, czy umowa „jest spełniona”, bada różnicę i potwierdza, że ​​dane nadają się do celów audytu.

Uwaga: Nie pisz w arkuszu „Przetestowałem wszystkie dane” bez sprawdzenia kompletności danych. Pełny test populacji na brakujących danych daje pozornie pełną, ale mylącą pewność.

Pełne badanie populacji za pomocą sztucznej inteligencji: krok po kroku

  1. Przygotuj dane w bezpieczny sposób. Anonimizuj pola osobiste/prywatne lub zastąp je obiektami zastępczymi. Jeśli to możliwe, korzystaj z pojazdu służbowego, zakontraktowanego.
  2. Potwierdź kompletność. Uzgodnij liczbę rekordów i kwotę.
  3. Jasno zdefiniuj regułę testową. Co liczy się jako „wyjątek”? (Na przykład: niezatwierdzona faktura, faktura wystawiona w weekend, duża płatność okrągła, dochód zarejestrowany po dacie granicznej.)
  4. Zastosuj regułę za pomocą AI. AI stosuje regułę do danych i tworzy listę wyjątków; Zapisz regułę jasno, aby można było ją skontrolować.
  5. Ustal priorytety i przejrzyj wyjątki. Zbadaj każdy wyjątek za pomocą dowodów; zaradzić fałszywym alarmom i uzasadnić faktyczne ustalenia.
  6. Udokumentuj wynik. Połącz regułę, liczbę wyjątków, zbadane elementy i wnioski z arkuszem.

trzy mini etui

Przypadek 1 – Próba cięcia. Audytor chciał przetestować ograniczenie przychodów na koniec roku. Wziął 42 000 faktur sprzedaży jako całą populację i kazał AI egzekwować „rekordy list z datami faktur do 31 grudnia, ale datami wysyłki/dostawy 1 stycznia lub później”. YZ zaznaczył 118 rekordów. Audytor zbadał je: 96 było transakcjami zgodnymi z prawem, bez różnic w terminach (dostawa tego samego dnia), 22 stanowiły faktycznie przychody za rok następny i zostały zarejestrowane w poprzednim okresie. Te 22 pozycje zostały zgłoszone, ponieważ wykazywały pewien wzór, choć poniżej istotności. AI zadała 118 pytań; Audytor znalazł 22 odpowiedzi.

Przypadek 2 – Gdy pominięto kompletność. Jeden z członków zespołu powiedział, że przeprowadził pełne testy populacyjne na 180 000 fakturach; Nie było wyjątków i poczuł ulgę. Osoba odpowiedzialna porównała całkowitą ilość zbioru danych z saldem próbnym: dane 155 milionów TL, saldo próbne 210 milionów TL. Okazuje się, że podczas pobierania danych z systemu gałąź została odfiltrowana i pominięta. „Pełny” test faktycznie pominął jedną czwartą danych. Test został przeprowadzony z poprawnymi danymi. Lekcja: nie ma pełnego badania populacji bez potwierdzenia kompletności.

Przypadek 3 – Błąd w przepisach. Audytor kazał AI napisać regułę „Wykaz niezatwierdzonych płatności powyżej 50 000 TL”, ale nie zdawał sobie sprawy, że pole „zatwierdzenie” było przechowywane w dwóch różnych kolumnach systemu (zatwierdzenie elektroniczne i zatwierdzenie ręczne). Sztuczna inteligencja oznaczyła 300 płatności jako „odrzucone”, ponieważ uwzględniła tylko jedną; Po sprawdzeniu okazało się, że większość z nich została zatwierdzona w drugiej kolumnie. Zła reguła spowodowała powstanie setek fałszywych alarmów. Audytor skorygował regułę tak, aby obejmowała obie kolumny. Lekcja: audytor sprawdza, czy reguła jest zgodna z danymi i procesem biznesowym.

Słaba zachęta/silna zachęta

Słaba zachęta:

Znajdź problematyczne rekordy w danych faktury.

Problem: Brak definicji słowa „problematyczny”. Sztuczna inteligencja nie wie, co uznać za wyjątek; Działa albo według przypadkowych sygnałów, albo według wymyślonego przez siebie kryterium. Nie jest to powtarzalne i kontrolowane.

Potężny monit:

Twoja rola: jesteś asystentem niezależnego audytora ds. analityki danych. Ocena należy do mnie; Zastosujesz regułę i wygenerujesz listę wyjątków. Kontekst: Poniżej znajdują się zanonimizowane dane faktury sprzedaży (kolumny: nr faktury, data_faktury, data_dostawy, kwota, status_zatwierdzenia, oddział). Koniec roku: 31.12.KROK 1 - Kompletność: Podaj całkowitą liczbę rekordów i łączną kwotę, abym mógł to porównać z saldem próbnym. Zgłoś, czy jest jakieś puste/brakujące miejsce. KROK 2 - Reguła testu cięcia: Wypisz rekordy z datą_faktury <= 31.12 ORAZ datą_dostawy >= 01.01 jako „wyjątek odcięcia”. KROK 3 - Zapisz regułę zwykłym tekstem (jaki warunek zastosowałeś), aby można ją było sprawdzić. Zasady: Podałem regułę, nie zmieniaj jej. Prześlij rekordy, które oznaczyłeś jako „wyjątki do przeglądu”; Nie mów „błąd/znalezienie”. Nie wymyślaj tego, czego nie możesz wywnioskować z danych.

To żądanie ma ogromne znaczenie, ponieważ najpierw potwierdza kompletność, jasno definiuje regułę wyjątku, wymaga jawnego tekstu reguły (możliwość kontroli) i umieszcza dane wyjściowe jako „wyjątek”.

Typowe błędy

  • Pomijanie weryfikacji kompletności. Przeprowadzanie „pełnych” testów na niekompletnych/uszkodzonych danych i dawanie fałszywych zapewnień.
  • Mylenie wyjątku z ustaleniem. Liczenie błędów bez weryfikacji zapisu zaznaczonego przez AI; unikając eliminacji fałszywych alarmów.
  • Nie sprawdzam reguły. Generowanie setek fałszywych flag bez sprawdzania, czy reguła jest zgodna z danymi i procesem biznesowym.
  • Pisanie niejasnych zasad. Uzyskiwanie niepowtarzalnych wyników za pomocą niezdefiniowanych monitów, takich jak „znajdź problematyczne rekordy”.
  • Zadowolenie z jednego startu. Brak odpytywania reguły lub danych, jeśli liczba wyjątków znacznie różni się od oczekiwanej.
Wskazówka: należy się niepokoić, jeśli liczba wyjątków jest zbyt mała (bliska zeru) lub zbyt duża. Zero zwykle oznacza „niepoprawnie napisaną regułę” lub „brak danych”; Niezwykle duża liczba wskazuje, że reguła jest zbyt szeroka. Dobry audytor podejrzewa zarówno „żadnych wyjątków”, jak i „wszystko jest wyjątkami”.

Podsumowując

Pełne badanie populacji to ogromny krok naprzód w audytowaniu: eliminuje ryzyko pobierania próbek, sprawdzając 100% danych. Ale to nie jest darmowe. Wiąże się to z dwoma nowymi obowiązkami: (1) weryfikacją kompletności i dokładności danych, (2) oceną poszczególnych pojawiających się wyjątków. AI przygotowuje dane, stosuje regułę, oznacza wyjątek i skraca godziny skanowania do sekund; Jednak dokładność reguły, kompletność danych i ocena wyjątków należą do audytora. Wyjątek nie jest wynikiem, jest początkiem.

Zadanie aplikacji

Rozważ istniejący (lub hipotetyczny) zbiór danych transakcji. Najpierw zdefiniuj dwie kontrole kompletności (liczba rekordów i uzgodnienie kwot). Następnie napisz jasną regułę wyjątków do celów audytu (np. faktury wystawiane w weekendy lub wycinanie wyjątków). Dzięki powyższemu potężnemu wzorcowi podpowiedzi poproś sztuczną inteligencję o wykonanie najpierw kompletności, a następnie reguły. Pierwsze 10 z pojawiających się wyjątków to „prawdziwe wyniki czy fałszywe alarmy?” Przećwicz klasyfikację w następujący sposób i zapisz, jakich dowodów będziesz szukać dla każdego z nich.

lista kontrolna

  • [ ] Zanonimizowałem dane i jechałem bezpiecznie.
  • [ ] Potwierdziłem kompletność danych, uzgadniając liczbę rekordów z ich ilością.
  • [ ] Przeskanowałem w poszukiwaniu wolnego/złego miejsca.
  • [ ] Jasno i powtarzalnie zdefiniowałem regułę wyjątku.
  • [ ] Otrzymałem od AI czysty tekst reguły i zweryfikowałem jej zgodność z danymi i procesem biznesowym.
  • [ ] Kwestionowałem zasadność liczby wyjątków (za mało/nie za dużo).
  • [ ] Każdy wyjątek traktowałem jako kwestię do zbadania, a nie ustalenie; Wyeliminowałem fałszywe alarmy.