Прибуток:
- Здатність підтримувати цілісність даних під час оцифровки та стандартизації одиниць запису, таких як контекст/локус, стратиграфія та матриця Харріса за допомогою штучного інтелекту
- Здатність захищати необроблені дані та відстежувати кожне перетворення від ризику штучного інтелекту завершити відсутні дані та внести тихі зміни
- Зрозумійте, чому контрольований словник, метадані та принципи відкритості/FAIR важливі для майбутнього використання даних.
Наукова цінність розкопок полягає не в золотих знахідках, які з’являються під час них, а в якості їх записів. Знахідка, яка недостатньо задокументована, майже не має значення для науки; Тому що це предмет, який невідомо де, в якому шарі і з чим він знайдений, це просто красивий предмет. У цьому розділі ми розглянемо журнал розкопок (систематична транскрипція та база даних кожного контексту, знахідки та спостереження) і те, як ШІ може прискорити введення, організацію та стандартизацію даних, але чому відповідальність за цілісність даних залишається на людях.
Основний принцип: штучний інтелект допомагає упорядковувати розрізнені записи, стандартизувати їх і знаходити невідповідності; Але люди відповідають за те, які дані є точними, чи відображають записи правду, а також за цілісність даних. AI коригує форму даних, але не гарантує їх точність.
Основні одиниці археологічного запису
Контекст/локус. Кожні розкопки поділяють місце на одиниці контексту (контекст/локус — окреме відкладення, шар, яма або стіна; найменша одиниця значення розкопок). Кожен контекст отримує унікальний номер, і всі знахідки пов’язуються з цим номером.
Стратиграфія та матриця Харріса. Стратиграфія (відношення шарів до-після один відносно одного) є основою відносного датування. Матриця Гарріса (діаграма, що показує порядок контекстів відносно один одного) візуалізує ці зв’язки. ШІ допомагає виявляти непослідовні стратиграфічні зв’язки (наприклад, циклічну помилку «А знаходиться як вище, так і нижче В»).
Знайти інвентар. Кожна знахідка; Контекст записується з номером, типом, розміром, матеріалом, станом і фотографією.
Стандарти даних. Загальні стандарти використовуються, щоб зробити записи придатними для спільного використання та порівняння. CIDOC-CRM (міжнародна концептуальна основа/онтологія, розроблена для опису даних культурної спадщини) дозволяє даним різних установ спілкуватися одна з одною. Використовується контрольований словник термінів (затверджений список, який гарантує, що кожен використовує той самий термін для того самого поняття).
Порада: використовуйте штучний інтелект для «організації та аудиту» даних, а не для їх «інтерпретації». «Які номери контексту є суперечливими в цих записах?» Це гарне запитання; «До якого періоду відноситься цей контекст?» Це експертне рішення. Штучний інтелект є найсильнішим у перевірці узгодженості.
Роль ШІ в реєстрації та базі даних
- Оцифровка. Рукописні блокноти з розкопок, інвентарні картки та старі малюнки імпортуються в базу даних за допомогою розпізнавання тексту на основі ШІ (це посилання на HTR у блоці 6).
- Стандартизація. Різноманітні варіанти написання («візантія», «Візантія», «биз.») відображаються в контрольованому словнику; дати і вимірювання приведені в єдину форму.
- Перевірка узгодженості. Позначено такі помилки, як відсутність номера контексту, суперечлива стратиграфія, використання одного номера в двох різних знахідках.
- Запит і резюме. Швидко генеруються такі запити, як «Усі скляні знахідки в наступному контексті» та зведені таблиці.
Застереження: під час стандартизації ШІ може мовчки модифікувати дані, намагаючись їх «виправити»; наприклад, він може округлити вимірювання до «розумного» значення або заповнити непевні показання власною оцінкою. Кожна автоматична зміна має бути відстежуваною, а оригінальний запис має зберігатися. Необроблені дані ніколи не перезаписуються.
три міні-чохла
Кейс 1 — Оцифрування врятувало архів. У музеї зберігалися 40-річні рукописні інвентарні картки (близько 22 000 карток), під загрозою втрати. Розпізнавання та стандартизація тексту на основі ШІ імпортували картки в базу даних з можливістю пошуку; Експерт перевіряв кожну картку на вибірковій основі, і нечитабельні ділянки були позначені як «нечіткі».
Випадок 2 — перевірка невідповідності виявила помилки. Команда розкопок змусила штучний інтелект перевірити базу даних наприкінці сезону; YZ зазначив, що три знахідки мали однаковий контекстний номер, але суперечливу інформацію про шар. Перевірка виявила помилку введення даних; якби не було виправлено, це спотворило б стратиграфічну інтерпретацію.
Випадок 3 — Зловлено тиху зміну. Під час стандартизації вимірювань помічник помітив, що штучний інтелект інтерпретує деякі значення «0» як «нуль», а не як «відсутні»; це спотворило довжину зламаного шматка. Процес було перебудовано, щоб зберегти вихідні дані, але зберегти зміни в окремому стовпці.
Чотири шаблони, які можна копіювати
1) Стандартизація (контрольований словник):
Ваша роль: помічник із обробки даних. Зіставте значення [field:material/period/type] у наступних записах із таким контрольованим словником: [dictionarylist]. ЗМІНИТИ значення, що не мають еквівалентів у словнику; Позначте це як "не збігається". Повідомляйте про кожну зміну як пару оригінальний-новий; видалення необроблених даних.
2) Перевірка узгодженості:
Знайдіть невідповідності в таких записах розкопок: повторювані номери контексту, відсутні обов’язкові поля, суперечливі стратиграфічні зв’язки, незручні дати/вимірювання. Перелічіть кожну проблему з реєстраційним номером і залиште її виправити МЕНЕ; не змінюй сам.
3) Логічне керування матрицею Харріса:
Нижче наведено стратиграфічні зв’язки між контекстами (A вище/під B). Чи є логічне протиріччя (петля, двосторонній зв’язок)? Покажіть, які контексти, якщо такі є. Не коментуйте; просто перевірте логічну послідовність.
4) Запит і зведена таблиця:
Наступний витяг із дампа бази даних нижче: [наприклад, знайти розподіл типів за контекстом]. Подайте результат у вигляді таблиці, вказавши, з яких записів походить кожен рядок. НЕ ДОДАВАЙТЕ значення, якого немає в даних; Якщо воно порожнє, напишіть «немає даних».
Слабка підказка / Сильна підказка
Слабка підказка:
Виправте ці дані розкопок і заповніть пропущені елементи.
«Заповнити прогалини» дозволяє AI підганяти дані; Результатом є ненадійна база даних, у якій змішуються факти та вигадка.
Потужна підказка:
Позначте ТІЛЬКИ формальні невідповідності (орфографію, формат дати, повторний ідентифікатор) у даних розкопок нижче. ЗАВЕРШІТЬ відсутні значення; Залиште це як "незавершене". Перелічіть кожну запропоновану зміну разом з оригіналом; Я дам схвалення. Зміна вихідних даних.
Відмінність: перший мовчки пошкоджує дані; Другий контролює і залишає рішення людині.
Хороша модель даних: поля, зв’язки та метадані
Археологічна база даних — це не довільна таблиця, а продумана модель даних (схема таблиць, полів і зв’язків, у які дані будуть організовані). Основний принцип полягає в тому, що все залежить від контексту: знахідки до контексту, контексти один до одного (стратиграфія) і до поля. Кожен запис має унікальний ідентифікатор (ID), і через ці ідентифікатори встановлюються зв’язки; Знахідка відноситься до одного контексту, контекст може містити багато знахідок.
Так само важливими, як і запис, є метадані (дані про самі дані: хто їх записав, коли, яким методом, яка версія). Запис, який невідомо ким, коли і з якою впевненістю був введений, не може бути підданий сумніву в майбутньому. AI допомагає перевіряти послідовність заповнення полів метаданих і позначати відсутні метадані.
Іншим важливим принципом є відкритий і стійкий формат. Замість того, щоб блокувати дані у закритому програмному забезпеченні, наближеному до відкритих стандартів (текстові таблиці, документовані схеми), гарантує, що дані можна буде прочитати через десятиліття. Археологічні дані створюються не для однієї публікації, а для майбутніх поколінь; Ось чому принципи FAIR (знаходження, доступність, взаємодію та повторне використання даних) стають все більш стандартними. AI корисний для позначення ваших даних відповідно до цих принципів і пошуку недоліків; Але вам вирішувати, які дані залишатимуться відкритими, а які – чутливими (конфіденційними).
Порада: коли ви налаштовуєте свою базу даних, запитайте себе: «Чи може хтось, хто цього не знає, відкрити її та зрозуміти це через 10 років?» запитати. Поясніть свої скорочення в глосарії, заповніть поля метаданих і створіть резервну копію необроблених даних у відкритому форматі.
Таблиця завдань запису/бази даних
Квест
Роль ШІ
людське рішення
правило захисту
оцифрування
розпізнавання тексту
Розпливчасте підтвердження прочитання
Необроблений скан зберігається
стандартизація
Карта до словника
Рішення про невідповідне значення
Оригінал збережено
Послідовність
Позначення протиріч
корекція
Зміни відстежуються
стратиграфія
Логічний контроль
коментар
Експертне затвердження матриці
Запит/резюме
Виготовлення столу
Коментар, вибір
Вірність даним
Поширені помилки
- Заповнення відсутніх даних. ШІ складає; Відсутнє має залишатися «неповним».
- Перезапис необроблених даних. Оригінал завжди зберігається; зміни зберігаються окремо.
- Не помічаючи тихих змін. Кожне автоматичне перетворення має бути звітовано та перевірено.
- Пропуск стандарту. Без контрольованого словника та загальної моделі дані не можуть надаватися спільно.
- Наявність ШІ виконує стратиграфічну інтерпретацію. ШІ знаходить логічне протиріччя; Коментар для експерта.
Підсумовуючи
ШІ в записах розкопок і базі даних; Він забезпечує велику швидкість оцифрування, стандартизації, перевірки узгодженості та роботи із запитами. Але цілісність даних — це святе: жодна втрачена частина не залишається недоторканою, необроблені дані зберігаються, кожна зміна відстежується, а стратиграфічна інтерпретація належить експерту. Добрі записи — це найцінніший спадок, який залишають у майбутньому розкопки.
Аплікаційне завдання
Підготуйте невелику таблицю даних розкопок (10-20 записів); навмисно додали туди кілька невідповідностей (дублікат ідентифікатора, деформована дата, конфліктний шар). Нехай штучний інтелект знайде їх за допомогою шаблонів «перевірка узгодженості» та «перевірка логіки матриці Харріса»; потім напишіть контрольований словник і зіставте поле матеріалу з шаблоном «Стандартизація» та переконайтеся, що зберегли необроблені дані.
контрольний список
- [ ] Я зберіг необроблені дані окремо, без змін.
- [ ] Я не змусив ШІ завершити відсутні частини; Я залишив це як "незавершене".
- [ ] Я перевірив кожну автоматичну зміну з оригіналом.
- [ ] Я використовував контрольований словник і стандарт даних.
- [ ] Я зробив стратиграфічну інтерпретацію на основі експертної оцінки.