Üksus 3 / 12

Täieliku populatsiooni testimine andmeanalüüsiga: proovist tervikuks

Kasu:

  • Saama aru valimi riskist ja täispopulatsiooni testimise loogikast (100% testimine) ning oskama kasutada tehisintellekti andmete ettevalmistamisel, reeglite kirjutamisel ja tulemuste tõlgendamisel.
  • Võimalus kavandada ja rakendada tehisintellekti toega tehisintellekti toega tehisintellekti toega tehisintellekti toega tehisintellekti toega tehisintellekti toega sobitamise, täielikkuse ja täpsuse teste
  • Võime mõista, et erandite loend kogu populatsiooni testis ei ole tulemus, vaid algus, mida audiitor uurib, ja et lõplik hinnang kuulub audiitorile.

Üks audiitori elukutse põhilisemaid piiranguid oli see, et audiitor pidi valimiga töötama paljude aastate jooksul. Te ei saa käsitsi üle vaadata 180 000 arvet, mille ettevõte aasta jooksul väljastab; Seega valite statistilise või hinnangulise meetodi abil paarsada kirjet, testite neid ja üldistate tulemuse kogu populatsioonile. Valimi võtmine on võimas ja õigustatud tehnika, kuid sellega kaasneb omane risk: valimi risk – teie valitud valim ei pruugi üldkogumit esindada ja selle tegelik viga ei pruugi langeda täpselt sinna, kuhu vaatate.

Andmeanalüütika ja tehisintellekt muudavad seda pilti: nüüd saate testida kogu populatsiooni, st 100%. Seda nimetatakse täielikuks populatsiooni testimiseks. Pühendame selle üksuse, et mõista üleminekut „proovilt tervikule”, selle võimsust ja uusi kohustusi, mis paljudel inimestel kahe silma vahele jäävad. Kuna populatsiooni täielik testimine ei hõlbusta kontrolli; See muudab testi olemust ja paneb eksamineerijale uue koormuse.

Valimi ja täieliku populatsiooni testimise erinevus

Klassikalise valimi puhul on loogika järgmine: "Las ma testin põhjalikult väikest, kuid esinduslikku rühma ja tõlgendan tulemust tervikuna." Täispopulatsiooni testis on loogika vastupidine: "Las ma skaneerin teatud reeglite järgi terviku, leian välja erandid, mis jäävad reeglist välja ja uurin neid põhjalikult." Esimese lähenemise korral on risk "vale valimi valimine"; Teises on riskiks "vale reegli kirjutamine" ja "puudulike/vigaste andmetega töötamine".

Järgmises tabelis võrreldakse kahte lähenemisviisi.

Suurus

proovide võtmine

Täielik populatsiooni testimine (100%)

Ulatus

osa elanikkonnast

kogu elanikkond

Peamine risk

Valimi risk (esitusviga)

Reegli viga + andmete terviklikkuse viga

väljund

Piiratud arv testitulemusi

Nimekiri eranditest, mis reeglile ei vasta

Audiitori koorem

valik + test

Reegli kujundamine + erandi hindamine

AI roll

Abi näidiste valimisel

Andmete ettevalmistamine, reeglite kirjutamine, erandite märgistamine

Märkus: täielik populatsiooni testimine ei tähenda "katsetasin kõike, töö tehtud". Vastupidi, see annab teile tavaliselt rohkem üksusi, mida uurida. Kui käitate kõik 180 000 arvet kuupäeva-summa-kinnitusreegli kaudu, leiate võib-olla 900 erandit. Igaüks neist on küsimus; mitte vastus. Siin tulebki mängu auditi kohtusüsteem.

Andmete täielikkus: testimise nähtamatu alus

Kogu populatsiooni testimise suurim lõks on see, et testi kvaliteet sõltub andmete kvaliteedist. "Ma testisin 100% andmetest" on mõttekas ainult siis, kui teie käsutuses olevad andmed on tegelikult 100% elanikkonnast. Kui filter oli süsteemist andmete tõmbamisel vale, mõned kirjed jäeti välja või summa veerg kanti üle kümnendveaga, tehakse teie "täielik" test tegelikult mittetäielike või rikutud andmetega. Seetõttu on andmete täielikkuse ja täpsuse kinnitamine täieliku populatsiooni testimise esimene ja hädavajalik samm.

Praktilised kontrollid täielikkuse kontrollimiseks:

  • Kirjete arvu vastavusse viimine: kas kogutud andmestiku ridade arv ühtib süsteemi kirjete koguarvuga?
  • Summa vastavusseviimine: kas andmekogumis olev kogusumma ühtib proovibilansi/tütarettevõtte vastava konto kogusummaga?
  • Kuupäevavahemik: kas andmetes sisalduvad perioodi esimene ja viimane päev; Kas kuu/päev on puudu?
  • Tühjade ja vigaste alade skannimine: kas kohustuslikel väljadel (kuupäev, summa, kontokood) on tühikuid või mõttetuid väärtusi?

Tehisintellekt aitab kõigis nendes kontrollides: indekseerib andmeid, hangib kogusummasid, loendab tühikuid, annab aru kuupäevavahemikust. Aga audiitor on see, kes otsustab, kas kokkulepe "kehtib", uurib erinevust ja kinnitab, et andmed on auditi eesmärgi jaoks sobivad.

Ettevaatust. Ärge kirjutage töölehel "Testisin kõiki andmeid" ilma andmete täielikkust kontrollimata. Puuduvate andmete täielik populatsioonitest annab näiliselt täieliku, kuid eksitava kindluse.

Täielik populatsiooni testimine tehisintellektiga: samm-sammult

  1. Valmistage andmed turvaliselt ette. Muutke isiklikud/privaatsed väljad anonüümseks või asendage need kohahoidjatega. Võimalusel kasutage ettevõtte lepingulist sõidukit.
  2. Kinnitage täielikkus. Viige kirjete arv ja summa kokku.
  3. Määrake selgelt testi reegel. Mida loetakse "erandiks"? (Näiteks: kinnitamata arve, nädalavahetusel väljastatud arve, suur ümmargune makse, tulu, mis on registreeritud pärast maksetähtaega.)
  4. Rakendage reeglit tehisintellektiga. AI rakendab andmetele reeglit ja koostab erandite loendi; Kirjutage reegel selgelt, et seda saaks auditeerida.
  5. Seadistage erandid tähtsuse järjekorda ja vaadake need üle. Uurige iga erandit tõenditega; käsitleda valepositiivseid tulemusi, põhjendada tegelikke leide.
  6. Dokumenteerige tulemus. Siduge reegel, erandite arv, uuritud üksused ja järeldus töölehega.

kolm minikarpi

Juhtum 1 – lõikekatse. Audiitor soovis testida aastalõpu tulude piirmäära. Ta võttis täiskoguks 42 000 müügiarvet ja lasi tehisintellektil jõustada "loendikirjed arvete kuupäevadega 31. detsembriks, kuid tarne-/tarnekuupäevad 1. jaanuaril või hiljem". YZ märkis 118 rekordit. Audiitor kontrollis neid: 96 olid legitiimsed tehingud ilma ajavahedeta (samal päeval tarnimine), 22 olid tegelikult järgmise aasta tulud ja need registreeriti eelmisel perioodil. Nendest 22 üksusest teatati, kuna need näitasid mustrit, ehkki alla olulisuse. AI esitas 118 küsimust; Audiitor leidis 22 vastust.

Juhtum 2 – kui täielikkus on välja jäetud. Üks meeskonnaliige ütles, et tegi 180 000 arvel täieliku populatsiooni testimise; Erandeid polnud ja ta tundis kergendust. Vastutav isik võrdles andmestiku kogumahtu proovibilansiga: andmed 155 miljonit TL, proovisaldo 210 miljonit TL. Selgub, et süsteemist andmete tõmbamise ajal filtreeriti filiaal ja jäeti see välja. "Täis" testis jäi tegelikult veerand andmetest puudu. Test jooksis üle õigete andmetega. Õppetund: täielikku populatsiooni testimist pole võimalik ilma täielikkuse kinnituseta.

Juhtum 3 – reeglite viga. Audiitor lasi tehisintellektil kirjutada reegli "Loetlege kinnitamata maksed üle 50 000 TL", kuid ta ei mõistnud, et välja "heakskiitmine" hoiti süsteemis kahes erinevas veerus (elektrooniline kinnitus ja käsitsi kinnitamine). Tehisintellekt märkis 300 makset "tagasi lükatuks", kuna vaatas ainult ühte; Uurimisel oli näha, et enamik neist kiideti teises veerus heaks. Vale reegel andis sadu valepositiivseid tulemusi. Audiitor parandas reeglit nii, et see hõlmaks mõlemat veergu. Õppetund: audiitor kontrollib, kas reegel on andmete ja äriprotsessiga kooskõlas.

Nõrk viip / Tugev viip

Nõrk viip:

Otsige nendest arveandmetest probleemsed kirjed.

Probleem: mõiste "probleemne" määratlus puudub. AI ei tea, mida pidada erandiks; Ta töötab kas juhuslike signaalide või enda väljamõeldud kriteeriumi järgi. See ei ole korratav ja auditeeritav.

Võimas viip:

Teie roll: olete sõltumatu audiitori andmeanalüütika assistent. Kohtuotsus on minu; Rakendate reegli ja loote erandite loendi. Kontekst: allpool on anonüümsed müügiarvete andmed (veerud: arve_nr, arve_kuupäev, tarnekuupäev, summa, kinnituse_olek, haru). Aasta lõpp: 31.12.1. SAMM – Täielikkus: Andke kirjete koguarv ja kogusumma, et saaksin seda võrrelda proovisaldoga. Teatage tühjast/puuduvast ruumist. 2. SAMM – katsereegli lõikamine: loetlege kirjed, mille arve_kuupäev on <= 31.12 JA tarnekuupäev >= 01.01, kui "lõpetamise erand". 3. SAMM – kirjutage reegel lihttekstina (mis tingimust rakendasite), et seda saaks auditeerida. Reegleid ei muutnud. Esitage kirjed, mille märgite "ülevaatamiseks eranditena"; Ärge öelge "viga/leidmine". Ärge arvake välja seda, mida te andmete põhjal ei saa järeldada.

See taotlus on võimas, kuna see kinnitab esmalt täielikkust, määratleb selgelt erandireegli, nõuab reegli selget teksti (auditeeritavus) ja positsioneerib väljundi "erandina".

Levinud vead

  • Täielikkuse kontrollimise vahelejätmine. Mittetäielike/rikutud andmete "täieliku" testimise läbiviimine ja vale kinnituse andmine.
  • Erandiks ekslikult leidmine. Vigade loendamine ilma tehisintellekti poolt märgitud kirjet kontrollimata; vältides valepositiivsete tulemuste kõrvaldamist.
  • Ei kontrolli reeglit. Sadade valelippude genereerimine, kontrollimata, kas reegel vastab andmetele ja äriprotsessile.
  • Ebamääraste reeglite kirjutamine. Korramatute tulemuste saamine määratlemata viipade abil, nagu "leia probleemsed kirjed".
  • Olles rahul ühe algusega. Ei küsi reeglit ega andmeid, kui erandite arv on oodatust väga erinev.
Näpunäide. Olge mures, kui erandite arv on liiga väike (nullilähedane) või liiga suur. Null tähendab tavaliselt "valesti kirjutatud reeglit" või "andmed puuduvad"; Äärmiselt suur arv näitab, et reegel on liiga lai. Hea audiitor kahtlustab nii "erandeid pole" kui ka "kõik on erandid".

Kokkuvõttes

Täielik populatsiooni testimine on auditeerimisel tohutu samm edasi: see välistab valimi võtmise riski, sõeludes 100% andmetest. Kuid see pole tasuta. See toob kaasa kaks uut kohustust: (1) andmete täielikkuse ja täpsuse kontrollimine, (2) üksikute tekkivate erandite hindamine. AI valmistab andmed ette, rakendab reeglit, märgib erandi ja vähendab skannimistunnid sekunditeks; Aga reegli täpsus, andmete täielikkus ja erandite hindamine kuulub audiitorile. Erand ei ole tulemus, see on algus.

Rakenduse ülesanne

Kaaluge olemasolevat (või hüpoteetilist) tehinguandmestikku. Esmalt määratlege kaks täielikkuse kontrolli (kirjete arv ja summade vastavus). Seejärel kirjutage auditeerimise eesmärgil selge erandi reegel (nt nädalavahetusel väljastatud arved või erandite kärpimine). Ülaltoodud võimsa viipamustri abil laske tehisintellektil esmalt täita täielikkus ja seejärel reegel. Esimesed 10 erandit on "tõelised leiud või valepositiivsed tulemused?" Harjutage klassifitseerimist järgmiselt ja kirjutage üles, milliseid tõendeid te igaühe kohta otsite.

kontrollnimekiri

  • [ ] Muutsin andmed anonüümseks ja sõitsin turvaliselt.
  • [ ] Kinnitasin andmete täielikkust kirjete arvu ja summa vastavusse viimisega.
  • [ ] Otsisin vaba/halva ruumi leidmist.
  • [ ] Määratlesin erandireegli selgelt korrataval viisil.
  • [ ] Sain tehisintellektilt reegli lihtteksti ja kontrollisin selle vastavust andmetele ja äriprotsessidele.
  • [ ] Seadsin kahtluse alla erandite arvu (liiga vähe / mitte liiga palju) mõistlikkuse.
  • [ ] Ma käsitlesin iga erandit kui küsimust, mida tuleb uurida, mitte kui leitust; Kõrvaldasin valepositiivsed tulemused.