Jednotka 12 / 12

Analýza těžebních dat s Pythonem a hranicemi AI

zisky:

  • Schopnost vytvářet skripty, které čistí a vizualizují vrtání, produkci a monitorování dat pomocí Pythonu, s podporou AI
  • Schopnost rozpoznat rizika kvality dat, přeučení a extrapolace při vytváření jednoduchých predikčních a anomálií
  • Schopnost ověřit kód a výsledek generovaný umělou inteligencí pomocí řízení jednotky, nezávislého výpočtu a technické věrohodnosti

V každé jednotce tohoto modulu jste viděli, že umělá inteligence je výkonná v kódování: čištění vrtů, hmotnostní bilance, kostra krigingu, shrnutí flotily, analýza vibrací, skenování prostředí. Tato poslední jednotka se zaměřuje na Python, konkrétní nástroj pro tento kód, a správnou disciplínu generování kódu pomocí AI. Python se stal de facto standardem v analýze těžebních dat, protože je zdarma, má výkonné knihovny (pandy: tabulková manipulace s daty; numpy: numerický počet; matplotlib: vykreslování; scikit-learn: strojové učení) a automatizuje opakující se úkoly. AI násobí rychlost, s jakou tento kód píšete; ale kód, který vytváří, není vždy správný. Ústřední princip této jednotky: Nikdy nespouštějte kód, který AI zapíše, aniž byste jej nejprve přečetli, neověřili jeho jednotku a otestovali ji s malým množstvím známých dat. Kód může v tichosti vytvořit nesprávný výsledek, který se může změnit ve špatné technické rozhodnutí při těžbě.

Základní tok generování kódu pomocí AI

Získávání kódu z AI je inženýrský cyklus, nikoli konverzace:

  1. Jasně popište úkol. Vstup (sloupce, jednotky, řádek vzorku), požadovaný výstup a omezení. Nejednoznačný požadavek vytváří nejednoznačný kód.
  2. Požádejte, aby byl malý a čitelný. Požádejte o krok za krokem komentovaný kód než o jednu obrovskou funkci.
  3. Přečtěte si a pochopte. Pochopte, co každý řádek dělá; Nespouštějte kód, kterému nerozumíte.
  4. Testujte s malými daty. Spusťte jej ručně s 5-10 řádky, jejichž výsledky znáte a ověřte očekávaný výstup.
  5. Okrajové případy otázek. Prázdná buňka, záporná hodnota, míchání jednotek, opakující se záznam Jak se kód chová?
  6. Měřítko a kontrola logiky. Spustit na všechna data; Je výsledek technicky rozumný?
Tip: Nejběžnější chyby, které zadávají kód AI, jsou tiché: nesprávný název sloupce, míchání jednotek (m vs ft, g/t vs ppm), tiše vynechané řádky (jako dropna), špatný průměr (prostý průměr, když by měl být vážený). Tyto nezpůsobují chyby; Jen to vygeneruje špatné číslo. Takže „nedostal chybu“ nikdy neznamená „správně“.

Typické úlohy Pythonu v těžbě

  • Čištění dat: Sloučení tabulek vrtání/výroby/monitorování, označování nekonzistence, normalizace jednotek.
  • Shrnutí a vizualizace: Histogram, časová řada, třídotonážní křivka, OEE grafy.
  • Statistika a geostatistika: Souhrnná statistika, korelace, variogram/kriging (se speciálními knihovnami).
  • Detekce anomálií: Zachycení driftu založené na prahu nebo jednoduchém modelu.
  • Jednoduché predikční modely: Například vztah mezi velikostí a výtěžkem mletí s regresí.

Pro většinu těchto úkolů poskytuje AI vynikající startovací kód. Jsou tu ale dvě úskalí: kvalita dat a limity modelu. Znalost obojího je klíčem k bezpečnému používání kódu AI.

Limity modelu: přeučení a extrapolace

Jednoduché prediktivní modely, které umělá inteligence snadno vytváří, jsou zranitelné dvěma hlavními riziky. Overfitting: Model si zapamatuje tréninková data, ale na nových datech funguje špatně; Budování složitých modelů s malým množstvím dat k tomu vyzývá. Extrapolace: Model se stává nespolehlivým, když je nucen provést předpověď v rozsahu mimo trénovací data; Například model získaný v rozsahu 0,3-0,8 g/t může poskytnout nesmyslné výsledky pro 5 g/t. AI za vás tato rizika neřídí „spontánně“; Je na vás, abyste si kriticky přečetli model, udělali rozdíl mezi tréninkem a testem, podívali se na interval spolehlivosti a zkontrolovali, zda je předpověď fyzicky věrohodná. Bez ohledu na to, jak přesné se číslo modelu jeví, nemůže být základem pro technické rozhodnutí mimo rozsah dat.

tři mini pouzdra

Případ 1 — Chyba tiché hlasitosti. Inženýr chce kód, díky kterému umělá inteligence vypočítá průměrnou známku z dat testu. Kód funguje, výsledek je 2,1 g/t. Inženýr přečte kód; Všimněte si, že průměr není vážen délkou intervalu, ale je brán jako přímý průměr. Vysoké známky v krátkých intervalech nespravedlivě přibíraly na váze. Při přechodu na vážený průměr hodnota klesá na 1,7 g/t. Kód nevykazoval žádné chyby; čtení zachytilo chybu.

Případ 2 – Tichý výpadek čáry. V kódu produkčního souhrnu AI vyčistila řádky s chybějícími hodnotami pomocí dropna. Kód běží hladce, ale celková tonáž je podhodnocena, protože některé platné řádky byly úplně vypuštěny kvůli jednomu prázdnému sloupci. Když technik porovná počet řádků mezi vstupem a výstupem, uvidí rozdíl a opraví logiku čištění. Ponaučení: vždy porovnejte počet vstupních a výstupních řádků.

Případ 3 – Extrapolační past. Tým aplikuje regresní model naučený v rozsahu nízkého stupně na oblast vysokého stupně; Model poskytuje absurdně vysoký odhad výnosu. Naštěstí inženýr výsledek odmítá s tím, že „tato oblast je daleko mimo rozsah viděný modelem“ a požaduje metalurgické testování. Lekce: znát rozsah dat, pro který je model platný; Nepoužívejte odhad mimo stát.

Kopírovatelné šablony výzev

ZABEZPEČENÝ KÓD ČIŠTĚNÍ DAT "Role: Jste asistentem analytika dat Pythonu. Napište kód s pandami, který vyčistí následující tabulku. Sloupce a jednotky: [seznam]. Pravidla: (1) vytiskněte počet řádků PŘED a PO vypuštění řádků; (2) nahlaste, které řádky byly vypuštěny a proč; (3) místo toho použijte komentář průměrné váhy s 4 kroky; řádek."

ŽÁDOST O REVIZE KÓDU"Vysvětlete následující kód Pythonu řádek po řádku a upozorněte na následující rizikové body: nesprávný předpoklad názvu sloupce, záměna jednotek, tichý pokles řádku, chyba plochého/váženého průměru, okrajové (null/negativní) chování. NEOPRAVUJTE kód, pouze vyjmenujte rizika. Kód: [vložit]."

NASTAVENÍ TESTU S MALÝMI DATA "Pro tuto funkci ručně vytvořte malá testovací data (5-6 řádků), o kterých znám výsledek a očekávaný výstup; napište testovací blok, který zkontroluje, zda funkce na těchto datech funguje správně. Otestujte také extrémní případy (prázdná buňka, zápor, extrémní hodnota jednotky). Funkce: [vložit]."

JEDNODUCHÝ MODEL + VAROVÁNÍ HRANICE"Nastavte jednoduchou regresi pro [x -> y] s následujícími údaji. Rozlišujte mezi tréninkem/testováním, nahlaste metriku chyb a jasně uveďte rozsah x, pro který je model PLATNÝ. Upozorněte, pokud jsou předpovědi provedeny MIMO tento rozsah. Komentář k riziku přetrénování a řídkosti dat:[paste dat]."

Slabá výzva / Silná výzva

SLABÁ VÝZVA: "Vypočítejte průměrnou známku z těchto dat."

SILNÁ VÝZVA: "Role: Jste asistent jazyka Python. Sloupce: ID díry, Od (m), Do (m), Au (g/t). Vypočítejte VÁŽENÝ průměrný stupeň s délkou intervalu. Kód: (1) vytiskněte počet vstupních/výstupních řádků; (2) nahlaste nulové/záporné hodnoty, než je vypustím; (3) před vypuštěním ověřím součet, abych také potvrdil výsledek. [vložit]."

Srovnávací tabulka: riziko a preventivní opatření

Riziko

symptom

preventivní opatření

Rušení jednotky

Rozumné, ale špatné číslo

Zakomentujte jednotku v kódu, zkontrolujte ji

Tichý pokles linky

Celkem chybí

Porovnejte počet vstupních/výstupních řádků

Obyčejný vs vážený průměr

špatný průměr

Ověřte vážení

přeučení

Špatné na testovacích datech

Oddělení školení/testování, jednoduše

extrapolace

Nesmyslný odhad mimo rozsah

Omezte platný rozsah

Časté chyby

  • Spuštění kódu bez jeho čtení. "Neobsahuje žádné chyby" neznamená, že je to pravda.
  • Netestování s malými daty. Důvěra bez ověřitelného příkladu je falešná.
  • Neporovnává počet vstupních/výstupních linek. Tak unikají tiché ztráty.
  • Ignorování modelové řady. Extrapolační odhady jsou nespolehlivé.
  • Důvěřovat kráse grafu. Stylový graf může skrýt špatné číslo.
Upozornění: Pokud kód AI ​​přejde do technického účtu, je tento kód stejně zodpovědný jako účet. Kdekoli se výsledkem stane rozhodnutí o těžbě, spusťte kód a jeho výstup prostřednictvím nezávislé kontroly logiky a porovnání s druhou metodou, pokud je to možné.

V souhrnu

Python je de facto nástroj pro analýzu těžebních dat a umělá inteligence výrazně zvyšuje rychlost, s jakou je píšete. Ale kód AI může obsahovat tiché chyby (záměna jednotek, vypadávání řádků, nesprávné průměrování) a modelové pasti (přeučení, extrapolace). Bezpečný tok: popište jasně, požadujte malé a čitelné, čtěte a pochopte, testujte s malými známými daty, dotazujte se na okrajové případy, škálujte a kontrolujte logiku. Výstup modelu nemůže být základem pro rozhodnutí mimo rozsah dat; a každý kód nese stejnou odpovědnost jako účet, pokud se změní v rozhodnutí o těžbě.

Aplikační úkol

Použijte šablonu "Kód bezpečné sanitace dat" s úkolem zprůměrování známek nebo souhrnu produkce, abyste získali kód od AI; Nechte kód zbavit rizika pomocí šablony „Žádost o kontrolu kódu“. Poté pomocí šablony „Test setup with small data“ ručně vytvořte datovou sadu, jejíž výsledky znáte, a ověřte kód. Nakonec pro jednoduchý vztah nastavte model se šablonou „Jednoduchý model + upozornění na limit“ a vyzkoušejte, zda dává varování, když překročí platný rozsah.

kontrolní seznam

  • [ ] Přečetl jsem kód AI a rozuměl každému řádku, nespouštěl jsem to naslepo.
  • [ ] Testoval jsem to s malými, ručně ověřitelnými údaji.
  • [ ] Porovnal jsem počet vstupních a výstupních linek.
  • [ ] Ověřil jsem jednotkovou konzistenci a váhu.
  • [ ] Omezil jsem rozsah platných dat modelu a vyhnul jsem se extrapolaci.
  • [ ] Výsledek, který se změnil v rozhodnutí, jsem zkontroloval metodou nezávislá logika/sekunda.

Modulová zkouška

1. Stážista se zeptá chatovacího nástroje AI na průměrnou kvalitu tělesa rudy a zapíše výslednou hodnotu '1,8 g/t zlata' přímo do zprávy o rezervách. Jaká je zásadní chyba tohoto přístupu?

  • A) Hodnota stupně musí pocházet z dat vlastního vrtání/analýzy projektu a ověřené prognózy; Číslo generované umělou inteligencí může být nezdrojovaný výmysl ✔
  • B) Mělo být požadováno AI v uncích místo v gramech
  • C) Hodnota je správná, pouze místo čárky měla být použita tečka
  • D) Stačí položit AI třikrát stejnou otázku a vzít průměr

Vysvětlení: Jazykový model nezná vrtací data vašeho projektu; produkuje číslo, které se zdá nejpravděpodobnější (halucinace). Stupeň pochází pouze z vlastních složených vrtných dat a geostatistického odhadu; Výstup AI nelze do zprávy zařadit bez souhlasu kompetentní osoby.

2. Co umožňuje „klasifikace založená na riziku“ při použití umělé inteligence v těžebním inženýrství?

  • A) Snižte cenu nástroje AI
  • B) Určete roli AI a povinnou hloubku ověření podle míry rizika úkolu ✔
  • C) Výzvy by měly být psány kratší
  • D) Automaticky delegovat všechna rozhodnutí na AI

Vysvětlení: Ne každá mise je na stejné úrovni rizika. Klasifikace úlohy jako nízká/střední/vysoká/kritická určuje, který výstup lze volně používat a který vyžaduje standardní ověření a ověření v terénu a schválení kompetentním technikem.

3. Co znamená 'variogram' model v geostatistice?

  • A) Spotřeba paliva zařízení
  • B) Změna ceny kovu v čase
  • C) Prostorová spojitost v závislosti na vzdálenosti; ✔ jak se podobnost snižuje, když se body vzdalují
  • D) Frekvence vibrací vytvořená tryskáním

Popis: Variogram popisuje, jak se vzájemná podobnost vzorků (prostorová kontinuita) snižuje s rostoucí vzdáleností mezi dvěma body. Kriging používá tento model k odhadu neměřených bodů s určitou mírou nejistoty.

4. Jaký je nejlepší přístup, když AI předběžně klasifikuje litologii z fotografie vrtných jader?

  • A) Zpracování typu horniny daného AI přímo do vrtného kmene
  • B) Zkopírování textu AI do zprávy bez zkoumání fotografie
  • C) Zrušení geologova pozorování a spoléhání se pouze na AI
  • D) Považujte výstup za předběžnou předpověď/hypotézu a ověřte ji geologovým pozorováním a laboratorní analýzou ✔

Popis: Umělá inteligence dokáže z obrázku generovat předpovědi a seznam pozornosti; Konečné rozhodnutí o litologii/úpravě je však učiněno geologovým pozorováním a laboratorní analýzou. Výstup AI je začátek, hypotéza, kterou je třeba ověřit.

5. Co znamená „poměr stripování“ při plánování otevřené jámy?

  • A) Množství rzi (odpadní hornina), které musí být odstraněno, aby se dostalo na jednu jednotku rudy ✔
  • B) Procento kovu v rudě
  • C) Denní počet jízd kamionů
  • D) Množství trhaviny použité při odstřelu

Popis: Rychlost stírání je množství odpadu (striž/odpad), které musí být odstraněno, aby se získala jedna jednotka rudy. Na tomto poměru do značné míry závisí konečný limit jam a hospodárnost; I když AI generuje scénáře, rozhodnutí o hranicích je na kompetentním inženýrovi.

6. Co to znamená v prediktivní údržbě, když AI najde „anomálie“ v údajích o vibracích a teplotě?

  • A) Důkaz, že zařízení rozhodně selhalo
  • B) Upozornění, že se údaje odchylují od normálu; Nejde o definitivní diagnózu poruchy, ale o znamení, které je třeba potvrdit fyzikálním vyšetřením ✔
  • C) Nařiďte, aby se zařízení automaticky zastavilo
  • D) Zaručit, že data byla zaznamenána nesprávně

Vysvětlení: Anomálie je odchylka dat od normálního chování a může znamenat poruchu; ale není to definitivní diagnóza. Rozhodnutí o zastavení zařízení nebo výměně dílů se provádí po fyzické prohlídce týmu údržby a se souhlasem vedoucího provozu.

7. Co je zásadní pro bezpečnost při použití umělé inteligence v konstrukci tryskání?

  • A) Implementace doporučení AI přímo v terénu
  • B) Vynechání měření vibrací
  • C) Ověření návrhu navrženého AI s měřením v terénu, regulačním limitem a schválením autorizovaného odborníka na trhací práce ✔
  • D) Stanovení množství výbušnin s maximem daným AI

Popis: Tryskání; Nese s sebou vážná bezpečnostní a regulační rizika, jako jsou vibrace, nárazy vzduchu a odletující kameny. AI může vytvořit návrhový náčrt a doporučení parametrů; Konečný návrh však musí projít měřením v terénu, regulačními limity a schválením autorizovaného odborníka na trhací práce (rozbuška/odpovědný).

8. Jaký je typický vztah mezi „výtěžností“ a „třídou koncentrátu“ při zpracování nerostů a na co by AI měla pamatovat, když to interpretuje?

  • A) Oba se vždy zvyšují společně
  • B) Není mezi nimi žádný vztah
  • C) Vztah je konstantní a stejný ve všech zařízeních
  • D) Obvykle existuje reverzní zůstatek (výnos klesá s rostoucím stupněm); skutečné hodnoty musí být ověřeny metalurgickými zkouškami a hmotnostní bilancí ✔

Vysvětlení: Obecně platí, že když se snažíme získat vyšší koncentrovaný stupeň, výnos klesá (rovnováha mezi stupněm a výnosem). AI může tento trend vysvětlit, ale skutečné provozní hodnoty musí být potvrzeny metalurgickým testováním a hmotnostní bilancí; obecný trend nenahrazuje realitu specifickou pro lokalitu.

9. Jaké je nejvhodnější využití analýzy dat o téměř neúspěchu/nehodě s AI v oblasti bezpečnosti práce?

  • A) Klasifikujte záznamy volného textu a extrahujte vzorce opakujících se rizik; Nechte rozhodnutí na odborníkovi na BOZP ✔
  • B) Automaticky určit viníka nehod
  • C) Delegování příkazů k zastavení práce na AI
  • D) Archivace záznamů o téměř neúspěchu bez jejich kontroly

Popis: AI dokáže klasifikovat velké množství záznamů volného textu a rychle extrahovat opakující se vzory a rizikové stavy. Rozhodnutí o zastavení díla, evakuaci prostoru nebo příčině však rozhoduje v rámci experta BOZP a legislativy; Výstup AI je vstup, nikoli rozhodnutí.

10. Proč je „zrychlení rychlosti deformace“ kritickým znakem v datech radaru/hranolu při monitorování svahu?

  • A) Rozhodně to znamená, že je měřicí zařízení rozbité.
  • B) Může to být předzvěstí postupné porážky; Rozhodnutí o včasném varování a evakuaci náleží geotechnikovi ✔
  • C) Ukazuje, že svah je zcela bezpečný
  • D) Má význam pouze v případě srážek a lze jej ignorovat

Vysvětlení: Před porušením svahů je obecně pozorováno postupné zvyšování rychlosti deformace (zrychlení); Může to být známka progresivního selhání. Umělá inteligence může zvýraznit trend, ale rozhodnutí o evakuaci/včasném varování se provádí na základě analýzy a protokolu geotechnického inženýra.

11. Jaká je při monitorování životního prostředí nejpřesnější odezva na znak „překročení“, který AI najde v časové řadě kvality vody?

  • A) Hlášení výstupu umělé inteligence přímo vládní agentuře
  • B) Ignorujte varování a pokračujte ve sledování
  • C) Ověřte pomocí výsledku akreditované laboratoře, regulačního limitu a hodnocení environmentálního inženýra ✔
  • D) Spoléhat se pouze na AI a zrušit laboratorní analýzu

Popis: AI může včas signalizovat možné narušení; Oficiální rozhodnutí o shodě však činí akreditovaná laboratorní analýza, limitní hodnoty v legislativě a hodnocení environmentálního inženýra. Výstup AI je prověřovací výstraha, nikoli právní/technické rozhodnutí.

12. Jaký je nejspolehlivější způsob, jak se vyhnout vymyšlené (halucinační) referenci, když požádáte AI o číslo klauzule normy, jako je JORC nebo NI 43-101?

  • A) Spoléhání se na číslo položky dané AI
  • B) Znovu položit stejnou otázku jinými slovy
  • C) Místo standardního pohledu na příspěvek na blogu
  • D) Otevření a potvrzení každého odkazu na článek z aktuálního oficiálního textu normy a získání souhlasu kompetentní osoby ✔

Vysvětlení: Přestože jazykový model zná název normy správně, může způsobit halucinace čísla článku a textu. Každý odkaz na látku musí být otevřen a potvrzen z aktuálního oficiálního textu normy a konečná shoda musí být potvrzena kompetentní osobou (CP/QP).

13. Jaká je nejdůležitější kontrola před spuštěním skriptu pro analýzu Pythonu napsaného AI?

  • A) Čtení kódu a ověřování shody jednotek/sloupců, testování s malými známými daty a kontrola věrohodnosti výsledku ✔
  • B) Spuštění kódu přímo na celém souboru dat bez jeho čtení
  • C) Stačí vidět, že tam není chyba a přijmout výsledek
  • D) Spoléhat se na to, že grafika výstupu bude vypadat hezky.

Popis: Kód AI může míchat jednotky, nesprávně předpokládat názvy sloupců nebo tiše pouštět řádky. Je nezbytné přečíst kód, ověřit shodu objemu a sloupce, otestovat s malým množstvím známých dat a zkontrolovat, zda je výsledek technicky přiměřený.

14. Jaké je nejlepší chování z hlediska ochrany soukromí při poskytování těžebních dat cloudovému nástroji umělé inteligence?

  • A) Vložení všech nezpracovaných dat tak, jak jsou
  • B) Anonymizujte kontext a vyčistěte citlivá data z rezerv/koordinace/výroby a použijte firemní nástroj, který je v souladu se zásadami ✔
  • C) Za předpokladu, že poskytnutí skutečných souřadnic je zásadní pro kvalitu výsledku
  • D) Ignorování zásad ochrany osobních údajů vůbec

Vysvětlení: Čísla rezerv, informace o licencích/souřadnicích a výrobní údaje jsou citlivé z hlediska obchodního tajemství a legislativy. Je nutné anonymizovat kontext, vymazat skutečné souřadnice a jména, zvolit korporátní/privacy garantující nástroj a dodržovat firemní politiku.