Печалби:
- Възможност за поддържане на целостта на данните при дигитализиране и стандартизиране на записващи единици като контекст/локус, стратиграфия и Harris Matrix с изкуствен интелект
- Възможност за защита на необработените данни и поддържане на всяка трансформация проследима срещу риска изкуственият интелект да допълни липсващите данни и да направи тихи промени
- Разберете защо контролираният речник, метаданните и отворените/FAIR принципи са от съществено значение за бъдещата използваемост на данните.
Научната стойност на разкопките не се крие в златните находки, които излизат от тях, а в качеството на записите. Находка, която не е добре документирана, е почти без значение за науката; Тъй като това е предмет, който неизвестно къде, в кой слой и с какво е намерен, той е просто красив предмет. В тази част ще разгледаме регистрирането на разкопки (систематичното преписване и база данни за всеки контекст, находка и наблюдение) и как AI може да ускори въвеждането, организацията и стандартизацията на данни, но защо отговорността за целостта на данните остава на хората.
Основен принцип: AI помага за организирането на разпръснати записи, стандартизирането им и намирането на несъответствия; Но кои данни са точни, дали даден запис отразява истината и целостта на данните са човешка отговорност. AI коригира формата на данните, но не гарантира тяхната точност.
Основни единици на археологическия запис
Контекст/локус. Всяко разкопаване разделя обекта на единици контекст (контекст/локус—индивидуално находище, слой, яма или стена; най-малката единица от значение на разкопките). Всеки контекст получава уникален номер и всички находки са свързани с този номер.
Стратиграфия и матрица на Харис. Стратиграфията (отношението преди-след на слоевете един спрямо друг) е в основата на относителното датиране. Матрицата на Харис (диаграма, показваща подреждането на контекстите един спрямо друг) визуализира тези взаимоотношения. AI помага за откриването на непоследователни стратиграфски връзки (напр. циклична грешка „A е едновременно над и под B“).
Намерете инвентар. Всяка находка; Контекстът се записва с номер, вид, размер, материал, състояние и снимка.
Стандарти за данни. Използват се общи стандарти, за да направят записите споделени и сравними. CIDOC-CRM (международна концептуална рамка/онтология, разработена за описание на данни за културно наследство) дава възможност на данните от различни институции да общуват помежду си. Използва се контролиран речник на термините (одобрен списък, който гарантира, че всеки използва един и същ термин за едно и също понятие).
Съвет: Използвайте AI, за да „организирате и одитирате“ данните, а не да ги „интерпретирате“. „Какви контекстни числа са противоречиви в тези записи?“ Това е добър въпрос; „Към кой период принадлежи този контекст?“ Това е експертно решение. Там, където AI е най-силен, е проверката на последователност.
Роли на AI в регистрацията и базата данни
- Дигитализация. Ръчно написани бележници за разкопки, инвентарни карти и стари рисунки се импортират в базата данни с разпознаване на текст, задвижвано от AI (това се свързва с HTR в блок 6).
- Стандартизация. Различни изписвания ("byzantium", "Byzantium", "byz.") са картографирани в контролирания речник; датите и измерванията се привеждат в единна форма.
- Проверка за последователност. Маркирани са грешки като липсващ контекстен номер, противоречива стратиграфия, използване на един и същи номер в две различни находки.
- Запитване и резюме. Заявки като „Всички стъклени находки в следния контекст“ и обобщени таблици се генерират бързо.
Внимание: При стандартизиране AI може тихо да модифицира данните, докато се опитва да ги „поправи“; например, той може да закръгли измерване до "разумна" стойност или да попълни несигурно показание със собствената си оценка. Всяка автоматична промяна трябва да бъде проследима и оригиналният запис трябва да бъде запазен. Суровите данни никога не се презаписват.
три мини калъфа
Случай 1 — Дигитализацията спаси архива. Музей съхранява 40 години ръкописни инвентарни карти (около 22 000 карти) с риск да бъдат изгубени. Разпознаването на текст и стандартизацията, задвижвани от AI, импортираха картите в база данни с възможност за търсене; Всяка карта беше проверена на базата на извадка от човек-изследовател и нечетливите области бяха маркирани като „неясни“.
Случай 2 — Проверката за несъответствие откри грешки. Екип за разкопки накара AI да одитира базата данни в края на сезона; YZ отбеляза, че три находки имат един и същ контекстен номер, но противоречива информация за слоя. Прегледът разкри грешка при въвеждане на данни; ако не беше коригирано, това би изкривило стратиграфската интерпретация.
Случай 3 — Уловена тиха промяна. Докато стандартизира измерванията, асистент забеляза, че AI интерпретира някои стойности „0“ като „нула“, а не като „липсващи“; това изкриви дължините на счупените парчета. Процесът беше преустроен, за да се запазят оригиналните данни, но да се запазят промените в отделна колона.
Четири копируеми шаблона
1) Стандартизация (контролиран речник):
Вашата роля: асистент за обработка на данни. Картирайте стойностите на [field:material/period/type] в следните записи към следния контролиран речник: [dictionarylist]. СМЕНЕТЕ стойности, които нямат еквиваленти в речника; Маркирайте го като „няма съвпадение“. Отчитайте всяка промяна като двойка оригинал-нова; изтриване на необработени данни.
2) Проверка на последователност:
Открийте несъответствия в следните записи на разкопки: повтарящи се контекстни числа, липсващи задължителни полета, противоречиви стратиграфски връзки, неудобни дати/измервания. Избройте всеки проблем с регистрационен номер и го оставете на МЕН да го коригира; не го променяй сам.
3) Логически контрол на Harris Matrix:
По-долу са стратиграфските връзки между контекстите (A над/под B). Има ли логическо противоречие (примка, двупосочна връзка)? Покажете кои контексти, ако има такива. Не коментирайте; просто проверете за логическа последователност.
4) Заявка и обобщена таблица:
Следният извлечение от дъмпа на базата данни по-долу: [напр. намиране на разпределение на типа по контекст]. Дайте резултата като таблица, като посочите от кои записи е извлечен всеки ред. НЕ ДОБАВЯЙТЕ стойност, която не съществува в данните; Ако е празно, напишете "няма данни".
Слаба подкана / Силна подкана
Слаба подкана:
Коригирайте тези данни от разкопките и попълнете липсващите елементи.
„Попълване на празнините“ позволява на AI да пасва на данни; Резултатът е ненадеждна база данни, в която се смесват факти и измислици.
Мощна подкана:
Отбележете САМО формални несъответствия (правопис, формат на дата, дубликат ID) в данните от разкопките по-долу. ПОВЪРШЕТЕ липсващите стойности; Оставете го като "незавършен". Избройте всяка предложена промяна заедно с оригинала; Аз ще дам одобрението. Промяна на необработените данни.
Разлика: първият поврежда данните тихо; Вторият контролира и оставя решението на човека.
Добър модел на данни: полета, връзки и метаданни
Археологическата база данни не е произволна таблица, а обмислен модел на данни (план на кои таблици, кои полета и в какви връзки ще бъдат организирани данните). Основният принцип е, че всичко зависи от контекста: находките към контекста, контекстите един към друг (стратиграфия) и към полето. Всеки запис носи уникална идентичност (ID) и връзките се установяват чрез тези идентичности; Находката се отнася до единичен контекст, един контекст може да съдържа много находки.
Също толкова важни, колкото и записът, са метаданните (данни за самите данни: кой ги е записал, кога, по какъв метод, каква версия). Запис, който неизвестно от кого, кога и с какво доверие е въведен, не може да бъде поставен под съмнение в бъдеще. AI е полезен при проверка на последователното попълване на полета с метаданни и маркиране на липсващи метаданни.
Друг важен принцип е отвореният и устойчив формат. Вместо да заключва данните в патентован, затворен софтуер, поддържането им близо до отворени стандарти (текстово базирани таблици, документирани схеми) гарантира, че данните могат да бъдат прочетени десетилетия по-късно. Археологическите данни се произвеждат не за една публикация, а за бъдещите поколения; Ето защо принципите FAIR (намиране, достъпност, оперативна съвместимост и повторно използване на данни) стават все по-стандартни. AI е полезен при етикетиране на вашите данни в съответствие с тези принципи и намиране на недостатъци; Но зависи от вас да решите кои данни ще останат отворени и кои ще останат чувствителни (поверителни).
Съвет: Когато настройвате своята база данни, запитайте се: „Може ли някой, който не знае това, да я отвори и да я разбере след 10 години?“ попитайте. Обяснете вашите съкращения в речник, попълнете полетата за метаданни и архивирайте необработените данни в отворен формат.
Таблица със задачи за запис/база данни
Мисия
Роля на AI
човешко решение
правило за защита
дигитализация
разпознаване на текст
Неясно потвърждение за четене
Необработеното сканиране се съхранява
стандартизация
Карта към речника
Решение за несъответстваща стойност
Оригиналът е запазен
Последователност
Маркиране на противоречие
корекция
Промяната се проследява
стратиграфия
Логически контрол
Коментирайте
Експертно одобрение на Matrix
Запитване/обобщение
Производство на маса
Коментар, избор
Верност към данните
Често срещани грешки
- Попълване на липсващите данни. AI прави; Липсващите трябва да останат „непълни“.
- Презаписване на необработените данни. Оригиналът винаги е запазен; промените се съхраняват отделно.
- Незабелязване на тихи промени. Всяко автоматично преобразуване трябва да се докладва и одитира.
- Прескачане на стандарта. Без контролиран речник и общ модел данните не могат да бъдат споделяни.
- Извършването на AI за стратиграфска интерпретация. AI открива логическо противоречие; Коментарът е за експерта.
В обобщение
ИИ в записа на разкопките и базата данни; Той осигурява голяма скорост при дигитализация, стандартизация, проверка на последователност и работа със заявки. Но целостта на данните е свещена: нито една липсваща част не остава непокътната, необработените данни се запазват, всяка промяна се проследява, а стратиграфската интерпретация принадлежи на експерта. Добрите записи са най-ценното наследство, което разкопките оставят на бъдещето.
Задача за приложение
Подгответе малка примерна таблица с данни за разкопки (10-20 записа); умишлено постави няколко несъответствия там (дублиращ се идентификатор, деформирана дата, конфликтен слой). Накарайте AI да ги намери с моделите „проверка на последователност“ и „проверка на логическата матрица на Харис“; след това напишете контролиран речник и съпоставете материалното поле към шаблона „Стандартизация“ и се уверете, че запазвате необработените данни.
контролен списък
- [ ] Съхраних необработените данни отделно, непроменени.
- [ ] Не накарах AI да завърши липсващите части; Оставих го като "незавършен".
- [ ] Проверих всяка автоматична промяна с оригинала.
- [ ] Използвах контролиран речник и стандарт за данни.
- [ ] Направих стратиграфската интерпретация въз основа на експертна преценка.