Jednotka 8 / 11

Datování, statistika a vědecká analýza: radiokarbon, typologie a série

zisky:

  • Schopnost používat umělou inteligenci při radiokarbonové kalibraci, sériovosti a multivariační analýze a pochopit, že výběr metod a předpoklady jsou těmi, které provádí odborník.
  • Schopnost rozpoznat, že radiokarbonový výsledek má určitý rozsah pravděpodobnosti a že snížení nejistoty na jeden rok je vědeckým zkreslením
  • Schopnost zpochybnit validitu vzorku s principem „odpadky dovnitř, odpadky ven“ a aplikovat reflex nezaměňování korelace a kauzality

Archeologie se při zodpovězení otázky „kdy“ spoléhá na laboratorní vědy a statistiky. V této jednotce uvidíme, jak AI urychluje úkoly, jako je datování (určení stáří nálezu nebo vrstvy), radiokarbonová (C14) analýza, typologie (třídění a periodizace nálezů podle jejich formálních charakteristik) a seriace (způsob chronologického řazení kontextů podle změny typů nálezů v čase), ale proč je interpretace vědeckých výsledků vždy správná metoda ponechána na odborníkovi a odborníkovi.

Základní princip: AI urychluje výpočty, kalibraci, statistické vzorování a vizualizaci; Ale která metoda je vhodná, zda je vzorek platný nebo ne a co výsledek znamená, vyžaduje vědecký úsudek. Pokud do pěkného grafu vložíte špatnou statistiku, nebude to správné.

Seznamovací metody a AI

Radiokarbon (C14). Stáří se počítá z rozpadu radioaktivního uhlíku v organických zbytcích. Hrubý výsledek je kalibrován pomocí křivky založené na stromořadích (kalibrace — korekce, která převádí nezpracované stáří radioaktivního uhlíku na skutečný kalendářní rok). AI urychluje kalibrační výpočty a srovnávací vizualizaci více dat. Ale AI nezná pasti, jako je problém starého dřeva (vzorek odebraný ze stromu, který žil stovky let, je mnohem starší než událost, při které byl použit); Vzorová kritika je práce odborníka.

Typologie a řada. Četnost typů nálezů se v průběhu času mění; Objevuje se typ, rozšiřuje se, ubývá. Seriation třídí kontexty pomocí tohoto vzoru „přikrývky“. Umělá inteligence je mocná při hledání těchto vzorů ve velkých souborech dat a v multivariační analýze (statistiky, které vyhodnocují mnoho funkcí současně). Odborník však dokáže rozlišit, zda je výsledek způsoben chronologickým nebo funkčním/regionálním rozdílem.

Jiné metody. Metody jako dendrochronologie (stromový prstenec), termoluminiscence a archeomagnetismus jsou také užitečné při výpočtu a srovnání AI; Výběr metody a interpretace jsou ponechány na odborníkovi.

Tip: Když necháte AI spouštět statistiku, zeptejte se „jakou metodu jste použili a jaké jsou její předpoklady?“ požádat. Pokud je metoda nesprávná (např. zprůměrování nesekvenčních dat, ignorování odlehlých hodnot), bude výsledek vizuálně „čistý“, ale vědecky nesprávný. Bez pochopení metody nedůvěřujte grafu.

Silné a slabé stránky AI ve statistikách

Výkonné: Opakované výpočty, kalibrace, skenování vzorů ve velkých souborech dat, generování vizualizačního kódu, rychlé testování různých metod.

Slabé/rizikové:

  • Nenavrhujte špatnou metodu. AI může s jistotou doporučit test, který neodpovídá datům.
  • Vzorková slepota. Nevidí malý, zkreslený nebo kontaminovaný vzorek; "To jsou data," říká.
  • Extrémní komentář. Může představovat slabou korelaci jako silný výsledek; korelace není kauzalita (to, že se dvě věci společně mění, neznamená, že jedna způsobuje druhou).
  • Vymyšlené číslo. Pokud je to žádoucí, může vytvořit "věrohodné", ale nerealistické datum nebo pravděpodobnost.
Upozornění: Radiouhlíkové datum není nikdy jeden „přesný rok“; je rozsah pravděpodobnosti (např. 750-680 př.nl s 95% spolehlivostí). Nenechte AI snížit výsledek na jeden rok; Vždy noste nejistotu. Skrývání nejistoty je vědecké zkreslení.

tři mini pouzdra

Případ 1 — Kalibrace zrychlena. Jeden projekt by provedl kalibraci a srovnávací vizualizaci 48 vzorků radioaktivního uhlíku. AI ​​vygenerovala kalibrační kód a srovnávací grafy v minutách, nikoli v hodinách; Sám znalec posoudil kontexty odběru a rizikovost starého dřeva a dva vzorky označil za „nespolehlivé“.

Případ 2 – Chybná metoda. Jeden student použil test navržený umělou inteligencí k nalezení typových frekvencí a získal „statisticky významný“ výsledek. Statistický poradce ukázal, že data nebyla pro tento test vhodná (byly porušeny předpoklady); Při správné metodě byl výsledek nesmyslný. Poučení: výběr metody určuje výsledek.

Případ 3 – Nejistota odstraněna. Tým by nahlásil jediné datum ze souhrnu AI pro vrstvu, „720 př.nl“. Expert uvedl, že rozsah ráží byl 800-680 před naším letopočtem a že jediný rok byl zavádějící. Zpráva opravena s rozsahem pravděpodobnosti. Snášet nejistotu je poctivost.

Čtyři kopírovatelné šablony

1) Dotaz na vhodnost metody:

Vaše role: poradce pro archeologickou statistiku. Popíšu následující údaje a otázku: [datový typ, velikost vzorku, otázka]. Řekněte mi o možnostech metody SCHVÁLENÉ s těmito údaji, PŘEDPOKLADY každého z nich a jak zkontrolovat, zda výnos splňuje tyto předpoklady. Nevhodné metody by se měly řešit také z důvodů.

2) Radiokarbonový interpretační rámec:

Níže mám své kalibrované radiokarbonové intervaly: [seznam]. Vysvětlete úskalí, kterých bych si měl být vědom při jejich interpretaci (staré dřevo, kontaminace, efekt mořské nádrže, vztah mezi vzorkem a událostí) a jak správně vyjádřit interval nejistoty. Nedávejte tomu jediný rok; udržovat intervaly.

3) Statistický audit:

Provedl jsem následující analýzu: [metoda a výsledek]. Kritizujte prosím: odpovídá metoda datům, platí předpoklady, je vzorek dostatečný, existují nějaké odlehlé hodnoty/směsi, je výsledek přeinterpretován? Uveďte své slabé stránky; Výsledek nepotvrzujte, zpochybňujte ho.

4) Vizualizace (upřímná):

Připravte graf/kód s následujícími údaji: [data]. MUSÍ ukazovat rozsahy nejistot (chybový pruh/rozsah). Nastavte osu a měřítko bez zavádějících řezů. NEPŘIDÁVEJTE žádné body, které nejsou v datech. Vysvětlete poznámkou, co graf zobrazuje a co ne.

Slabá výzva / Silná výzva

Slabá výzva:

Analyzujte tyto nálezové údaje a uveďte přesné datum naleziště.

Umělá inteligence může zvolit nevhodnou metodu a vytvořit jediné přesné datum; Skrývá nejistotu a nevidí problémy se vzorkováním.

Výkonná výzva:

Vaše role: statistický poradce. Výtěžek: [definice, velikost vzorku]. Nejprve mi řekněte metodu a její předpoklady vhodné pro tato data, pak dejte výsledek s rozsahem nejistoty, pokud ji použijeme. Nedávejte jediné definitivní datum. Uveďte také, která rizika spojená se vzorkem (malé n, mix, staré dřevo) mohou výsledek oslabit.

Rozdíl: první produkuje falešnou jistotu; za druhé, metoda zachovává otevřené předpoklady a nejistotu.

Bayesovský přístup, vzorkování a „odpadky dovnitř, odpadky ven“

Výkonnou metodou v moderním archeologickém datování je bayesovské modelování (statistický přístup, který kombinuje existující předchozí informace – např. „vrstva A podloží B“ – s měřeními pro vytvoření užších, realističtějších datových rozsahů), které kombinuje více radiokarbonových dat se stratigrafickými sekvencemi. Tento přístup zužuje širokou nejistotu jednotlivých dat tím, že je omezuje na známé pořadí vrstev. AI může pomoci vytvořit a vypočítat tyto modely; ale to, jaké předběžné informace (stratigrafické vztahy) vstoupí do modelu, je rozhodnutí odborníka a nesprávné předběžné omezení vytváří jistý, ale nepřesný výsledek.

Odtud se dostáváme k nejzákladnějšímu statistickému principu modulu: "odpadky dovnitř, odpadky ven." Ani ta nejpokročilejší umělá inteligence a nejelegantnější statistiky nemohou ze špatných dat přinést dobré výsledky. Kontaminovaný radiouhlíkový vzorek, nálezy ze smíšeného kontextu nebo vychýlený vzorek zůstanou neplatné bez ohledu na to, kolik zpracování bylo provedeno. AI tyto problémy nevidí, protože se nedívá na data „zvenčí“; Přijímá čísla, která mu uvedete, jako skutečná. Pouze odborník znalý oboru může vyhodnotit, jak byl vzorek sebrán, z jakého kontextu pocházel a co představuje.

Než tedy důvěřujete jakýmkoli statistickým výsledkům, položte si tyto tři otázky: Je vzorek dostatečně velký a reprezentativní? Jsou kontexty spolehlivé a nepřehledné? Je metoda měření vhodná pro tuto otázku? Pokud na tyto tři otázky nedokážete odpovědět „ano“, nezáleží na tom, jak „významný“ výsledek vypadá.

Tip: Při vyhodnocování výstupu statistiky se nejprve dívejte na vstup, nikoli na výsledek. "Odkud se tato data vzala, jak, s kolika vzorky?" otázka eliminuje většinu chybných závěrů ještě předtím, než se podíváte na graf.

Tabulka analytických úloh

Quest

Role AI

lidské rozhodnutí

ověření

Kalibrace C14

Výpočet, vizualizace

Platnost vzorkování

Souvislosti, staré dřevo

série

skenování vzorů

Chronologie/funkční oddělení

Srovnání se stratigrafií

multivariabilní

statistická kalkulačka

Výběr metody

kontrola předpokladů

vizualizace

Grafika/kód

poctivá reprezentace

nejistota, měřítko

Komentář

Souhrnný návrh

význam, limit

odborník, literatura

Časté chyby

  • Použití metody bez dotazů. Špatný test dává „čistý“, ale špatný výsledek.
  • Snížení nejistoty na jeden rok. Radiocarbon je rozsah; Jeden rok je zavádějící.
  • Obcházení problémů se vzorkováním. Malý/špinavý/zkreslený vzorek znehodnocuje výsledek.
  • Záměna korelace za příčinnou souvislost. Společná změna není příčina a následek.
  • Zavádějící grafikou. Přerušovaná osa, skrytá nejistota je vědecké zkreslení.

V souhrnu

AI v datování a statistikách; Je to výkonný akcelerátor pro kalibraci, skenování vzorů, výpočty a vizualizaci. Ale výběr metody, ukázková kritika, upřímné vyjádření nejistoty a interpretace výsledku patří k vědeckému úsudku. Nedůvěřujte grafu bez pochopení metody; vždy v sobě nesou nejistotu; a odolat naléhání na jediné „přesné datum“.

Aplikační úkol

Připravte vzorovou tabulku frekvencí hledání nebo sadu kalibrovaných radiokarbonových intervalů. Nechte příslušnou analýzu a její předpoklady identifikovat pomocí šablony "Dotaz na vhodnost metody" a poté nechte analýzu kritizovat pomocí šablony "Statistický audit". Vytvořte náčrt grafu zobrazující rozsahy nejistot pomocí šablony „Vizualizace (čestné)“ a vyhněte se jednoročnímu diskontování.

kontrolní seznam

  • [ ] Zkontroloval jsem výběr metody a předpoklady.
  • [ ] Zpochybnil jsem platnost vzorku (velikost, mix, staré dřevo).
  • [ ] Nejistotu jsem ponechal jako interval, nesnížil jsem ji na jediný rok.
  • [ ] Nepletl jsem si korelaci s kauzalitou.
  • [ ] V grafu jsem poctivě ukázal měřítko a nejistotu.