одиниці
1. Вступ до штучного інтелекту в археології та культурній спадщині: ролі, межі, автентифікація, етика та конфіденційність 2. Класифікація знахідок і аналіз зображень: кераміка, монети, камені та дрібні знахідки 3. Дистанційне зондування та виявлення об’єктів: супутник, аерофотозйомка та LiDAR 4. 3D-документація та фотограмметрія: виготовлення моделей, вимірювання та зйомка 5. Запис розкопок, база даних і стандарти даних 6. Читання та переклад епіграфіки, давніх рукописів і текстів 7. Огляд літератури, перевірка джерела та боротьба з галюцинаціями 8. Датування, статистика та науковий аналіз: Радіовуглець, типологія та серіація 9. Управління, охорона та моніторинг культурної спадщини 10. Громадська археологія, музейний наратив і етика цифрової реконструкції 11. Етика, право, боротьба з розкраданням і наскрізний робочий процес
одиниця 6 / 11

Читання та переклад епіграфіки, давніх рукописів і текстів

Прибуток:

  • Можливість зберігати прочитаний символ і очікуване завершення окремо та позначати під час транскрибування написів і рукописів у чернетку тексту за допомогою OCR/HTR
  • Здатність розпізнавати форми галюцинацій, такі як розмите завершення тексту, фальшивий переклад і сфабриковане присвоєння авторства, а також звіряти переклад з джерелом і зворотним перекладом.
  • Здатність зрозуміти, як контекст мови, письма та жанру визначає надійність штучного інтелекту та що остаточне читання та інтерпретація належить експерту-філологу

Одним із найбезпосередніших джерел, що залишилися нам із минулого, є письмові джерела: написи, висічені на камені, глиняні таблички, папіруси, пергаментні рукописи, надгробки та печатки. У цьому розділі ми побачимо, як епіграфіка (наука про вивчення написів, вигравіруваних на твердих поверхнях, таких як камінь, метал, кераміка), палеографія (експертиза читання та датування стародавніх почерків) та штучний інтелект прискорюють читання, переклад і редагування цих текстів, але чому кожне читання має бути підтверджено експертом-філологом.

Основний принцип: ШІ допомагає читати слабкий текст, перекладати мову та пропонувати можливі доповнення; але остаточне прочитання напису, доповнення пропущених літер і значення — це рішення фахівця, який знає мову і період. Саме в цій області штучний інтелект піддається найбільшому ризику галюцинації, оскільки модель дуже схильна заповнювати відсутній або слабкий текст чимось «правдоподібним», але вигаданим.

Етапи роботи з письмовими джерелами

1. Документація. Напис або рукопис відображаються у форматі високої роздільної здатності з підвищеним контрастом. Для затемнених поверхонь використовується спеціальне освітлення (бічне світло) і методи, такі як RTI; AI допомагає збільшити контрастність і краї літер.

2. Розпізнавання персонажів. OCR (оптичне розпізнавання символів) використовується для друкованого тексту, а HTR (розпізнавання рукописного тексту) використовується для рукописного тексту. HTR на основі штучного інтелекту є потужним інструментом для транскрибування старих рукописів.

3. Переписування та доповнення. Для вицвілих або зламаних частин експерт пропонує можливі реставрації на основі граматики та паралельних текстів. Завершені букви завжди позначаються такими знаками, як квадратні дужки; Те, що прочитано, і те, що передбачено, ніколи не плутають.

4. Переклад. Текст перекладено з мови оригіналу (латинської, давньогрецької, османської, клинопису тощо). AI дає перший чернетковий переклад; експертний нюанс коригує термінологію та історичний контекст.

5. Прокоментуйте. Те, про що йдеться в тексті, хто його написав і про яку подію в ньому йдеться, є історичними інтерпретаціями і належать експертам.

Порада: якщо ви накажете штучному інтелекту «прочитати та завершити» незрозумілий текст, він безпечно заповнить пробіли. Замість цього скажіть «вводьте лише чіткі символи, залиште поле порожнім і позначте ті області, де ви не впевнені». Вимагайте заповнення в окремому кроці з обґрунтуванням і обов’язково підтвердженим експертом.

Галюцинації: найбільша небезпека цієї сфери

Найбільш руйнівною помилкою ШІ в гуманітарних науках є фабрикація. У цій галузі є чотири типові форми:

  • Вигадування тексту: «Добудовує» неіснуючу частину ледве помітного напису, додаючи неіснуюче слово.
  • Фальшивий переклад: перекладає слово, яке він не розуміє вільно, але неправильно; Читач не може помітити, бо не знає джерела.
  • Сфабрикована довідка: там написано «Цей напис опубліковано в тому виданні», але цієї публікації не існує.
  • Помилкове датування/атрибуція: впевнено поміщає стиль написання в неправильний період.

Усе це ніколи не можна використовувати без підтвердження експерта, який бачить джерело та знає мову.

Увага: те, що переклад плавний і переконливий, не означає, що він правильний. ШІ може навіть перетворити клинописний знак, який він не розуміє, на впевнене речення. Хтось, хто не може прочитати вихідний текст, ніколи не зможе перевірити точність перекладу штучного інтелекту самостійно.

три міні-чохла

Випадок 1 — HTR відкрив архів. В одному архіві зберігалися тисячі сторінок османських рукописів, закритих для дослідників, оскільки їх читання вимагало досвіду та часу. HTR на основі штучного інтелекту транскрибує записні книжки в чорновий текст з можливістю пошуку; Фахівці виправили чернетку та позначили нечитабельні ділянки. Це не повний текст, але з’явився потужний інструмент сканування.

Випадок 2 — Виявлено сфабриковане завершення. Студент мав ШІ прочитати розбитий латинський надгробок; ШІ «дописав» відсутній рядок плавним реченням. Епіграф показав, що запропоноване завершення було фізично неможливим, оскільки в камені не залишилося місця. Завершення було реконструйовано та позначено на основі паралельних написів.

Випадок 3 — виправлено фальшивий переклад. Одна команда повідомить про переклад давньогрецького напису, зроблений ШІ; Коли філолог перевірив, він виявив, що штучний інтелект переклав дієслово в неправильному часі, перевернувши значення тексту (незалежно від того, було це підношення або меморіал). Повернення до джерела зберегло коментар.

Чотири шаблони, які можна копіювати

1) Консервативна транскрипція:

Ваша роль: помічник транскрипції. На цьому зображенні напису/рукопису використовуйте ЛИШЕ чіткі читабельні символи. Не читайте незрозумілі, пошкоджені або невпевнені місця; Позначте це як "[нечитабельно]". ДОПОВНІТЬ НЕПУСТІ ЧАСТИНИ. Також зверніть увагу на персонажів, яких ви підозрюєте.

2) Обґрунтована пропозиція доопрацювання:

Нижче наведено текст із точним читанням частин і [пробілів]. Запропонуйте МОЖЛИВІ доповнення для пропусків, але для кожної пропозиції: (a) обґрунтування (граматика, паралельний текст), (b) чи відповідає пропуск кількості літер, (c) альтернативи. Це пропозиції; Не остаточне прочитання. Вкажіть, що потрібен експертний дозвіл.

3) Чернетка перекладу (джерело захищено):

Перекладіть [мова] текст нижче. Зберігайте вихідний текст біля кожного речення (вирівнюйте рядок за рядком). Позначте слова, в яких ви не впевнені, і дайте альтернативний переклад. НЕ вигадуйте умови; Якщо не знаєте, напишіть «невпевнено». Це чернетка; Перевірить фахівець-філолог.

4) Перевірка перекладу (зворотний переклад):

Перекладіть цей переклад НАЗАД мовою оригіналу та порівняйте його з текстом оригіналу. Позначте частини, де значення змінено, додано або опущено. Особливо перевіряйте час, підмет і числа.

Слабка підказка / Сильна підказка

Слабка підказка:

Прочитайте цей стародавній напис і скажіть, що в ньому написано.

У слабкому написі штучний інтелект заповнює пропуски, може неправильно перекласти мову, і той, хто не бачить джерело, цього не помітить.

Потужна підказка:

У цьому зображенні напису спочатку транскрибуйте ЛИШЕ чітко читабельні символи, залишаючи затемнені частини "[нечитабельними]". Потім ОКРЕМО запропонуйте можливі доповнення для прогалин з обґрунтуванням, але не пропонуйте жодних конкретних. Нарешті, надайте чернетку перекладу та позначте слова, у яких ви не впевнені. Усі вони підлягають експертному погодженню.

Відмінність: перший дає фіктивне «читання»; останній зберігає прочитані, передбачені та перекладені шари окремо та їх можна перевірити.

Мови, сценарії та передові знання ШІ

Археологічні тексти охоплюють широкий діапазон мов і писемностей: латинські та давньогрецькі написи, османські та арабські рукописи, клинописні таблички, єгипетські ієрогліфи, рунічні написи тощо. Володіння ШІ цими мовами та шрифтами дуже неоднакове. У той час як чернетка перекладу може бути доцільною для мов із великою кількістю цифрового тексту, таких як латинська та давньогрецька, для текстів, які мало задокументовані, розшифровані або прочитані лише кількома експертами, штучний інтелект майже повністю ненадійний; створює переконливі, але цілком сфабриковані «переклади» в цих областях.

Є також питання контексту та жанру. Одне й те саме слово може мати різне значення в юридичному документі, тексті молитви, на надгробку. Експерт-філолог розпізнає тип тексту (присвята, пам'ятник, контракт, лист) і читає слово в правильному контексті; ШІ не має цієї загальної чутливості та нав’язує найбільш поширене значення. Скорочення, формули та фондові вирази (особливо дуже поширені в написах) легко вводять ШІ в оману.

Отже, золоте правило таке: використовуйте ШІ як прискорювач для мов, які ви знаєте, мов, якими ви можете керувати; Ніколи не покладайтеся лише на переклад штучного інтелекту мовою, яку ви не читаєте. Хтось, хто не може прочитати джерело, не може перевірити точність перекладу і, отже, не може перетворити цей переклад на наукове твердження.

Порада: передаючи текст до ШІ, вкажіть його мову, приблизний період і тип (напис/лист/документ). Знання контексту частково зменшує дрейф ШІ до найпоширенішого, але неправильного читання, але не усуває потребу в підтвердженні.

Таблиця завдань із письмового ресурсу

Квест

Роль ШІ

людське рішення

перевірка

покращення зображення

Контраст/край

Критерії відбору

Порівняння з оригіналом

OCR/HTR

проект тексту

невизначений характер

експертна коректура

завершення

Рекомендація (обґрунтована)

Прийняти/відхилити

Паралельний текст, контроль розташування

Переклад

проект

нюанс, термін

Зворотний переклад, джерело

коментар

Резюме контексту

історичний зміст

експерт, література

Поширені помилки

  • Завершення слабкого тексту. ШІ заповнює прогалини; Читання та передбачення повинні бути розділені та позначені.
  • Довіряти перекладу, не бачачи джерела. Повільний переклад не є правильним перекладом.
  • Прийняття вигаданої атрибуції. Щоб сказати "Це в цій трансляції", потрібне підтвердження.
  • Не перевіряється фізичне місце завершення. Пропозиція повинна вписуватися в розбитий простір.
  • Залишаючи інтерпретацію ШІ. Історичний сенс тексту – справа фахівця-філолога.

Підсумовуючи

ШІ в епіграфіці та античних текстах; Це значно пришвидшує покращення зображення, чернетки HTR/OCR, пропозиції щодо завершення та чернетки перекладу, а також відкриває закриті архіви для дослідження. Але це та область, де ризик галюцинацій найвищий: читання відокремлюється від передбачення, доповнення позначаються, переклади перевіряються на джерело та зворотний переклад, а остаточне читання та інтерпретація належать експерту-філологу.

Аплікаційне завдання

Виберіть напис або зображення рукопису (з колекції відкритого доступу). Вилучайте лише чіткі символи за допомогою шаблону «Консервативна транскрипція», а потім отримуйте пропозиції щодо пробілів за допомогою «Обґрунтованої пропозиції завершення». Створіть чернетку перекладу та перекладіть його назад за допомогою шаблону «Перевірка перекладу» та позначте, де зміст змінився. Якщо можливо, порівняйте з опублікованими матеріалами.

контрольний список

  • [ ] Я позначив прочитаний персонаж і завершення передбачення окремо.
  • [ ] Я перевірив, чи завершення підходять до розбитої області.
  • [ ] Я порівняв переклад із вихідним текстом і попереднім перекладом.
  • [ ] Я підтвердив публікації/цитати, надані YZ у справжньому каталозі.
  • [ ] Остаточне читання та інтерпретацію я залишив на схвалення експерта.