единици
1. Въведение в изкуствения интелект в археологията и културното наследство: роли, граници, автентификация, етика и поверителност 2. Класификация на находките и анализ на изображения: керамика, монети, литика и малки находки 3. Дистанционно наблюдение и откриване на място: сателит, въздушна фотография и LiDAR 4. 3D документация и фотограметрия: производство на модели, измерване и геодезия 5. Запис на разкопките, база данни и стандарти за данни 6. Четене и превод на епиграфики, древни ръкописи и текстове 7. Преглед на литературата, проверка на източника и борба с халюцинациите 8. Датиране, статистика и научен анализ: радиовъглерод, типология и серия 9. Управление, опазване и мониторинг на културното наследство 10. Публична археология, музеен разказ и етика на цифровата реконструкция 11. Етика, закони, борба с ограбването и работен процес от край до край
единица 6 / 11

Четене и превод на епиграфики, древни ръкописи и текстове

Печалби:

  • Възможност за запазване на прочетения знак и очакваното завършване отделно и маркирани при транскрибиране на надписи и ръкописи в чернова на текст с OCR/HTR
  • Способност за разпознаване на форми на халюцинации, като замъглено довършване на текст, фалшив превод и измислено приписване, и за проверка на превода спрямо източника и обратния превод.
  • Способност да се разбере как контекстът на езика, писането и жанра определя надеждността на изкуствения интелект и че окончателното четене и тълкуване принадлежи на експерта филолог

Един от най-преките звуци, останали ни от миналото, са писмените източници: надписи, издълбани в камък, глинени плочки, папируси, пергаментови ръкописи, надгробни паметници и печати. В този раздел ще видим как епиграфиката (науката за изучаване на надписи, гравирани върху твърди повърхности като камък, метал, керамика), палеографията (експертното четене и датиране на древни почерци) и AI ускоряват четенето, превода и редактирането на тези текстове, но защо всяко четене трябва да бъде потвърдено от експерт филолог.

Основен принцип: AI помага за четене на слаб текст, превод на език и предлага възможни допълнения; но окончателното разчитане на надпис, допълването на липсващите букви и значението е решение на експерт, който познава езика и периода. Именно в тази област изкуственият интелект е изложен на най-голям риск от халюцинации, тъй като моделът е много склонен да запълва липсващ или блед текст с нещо „правдоподобно“, но измислено.

Стъпки за работа с писмени източници

1. Документация. Надписът или ръкописът се показва във формат с висока разделителна способност и контраст. За неясни повърхности се използва специално осветление (странична светлина) и техники като RTI; AI помага за изостряне на контраста и ръбовете на буквите.

2. Разпознаване на символи. OCR (Optical Character Recognition) се използва за печатен текст, а HTR (Handwritten Text Recognition) се използва за ръкописен текст. Базираният на изкуствен интелект HTR е мощен при транскрибиране на стари ръкописи.

3. Препис и дописване. За избледнели или счупени части експертът предлага възможни реставрации въз основа на граматика и паралелни текстове. Завършените букви винаги се обозначават със знаци като квадратни скоби; Прочетеното и предсказаното никога не се бъркат.

4. Превод. Текстът е преведен от изходния език (латински, старогръцки, османски, клинописни езици и др.). AI дава първи чернови на превод; експертен нюанс коригира терминологията и историческия контекст.

5. Коментирайте. Какво казва текстът, кой го е написал и за какво събитие се отнася са исторически интерпретации и принадлежат на експерта.

Съвет: Ако кажете на AI ​​да „чете и довършва“ неясен текст, той безопасно ще компенсира празните места. Вместо това кажете „давайте само ясно четими знаци, оставете празно и маркирайте областите, в които не сте сигурни“. Поискайте попълване в отделна стъпка, с обосновка и не забравяйте да я потвърдите от експерта.

Халюцинации: най-голямата опасност в тази област

Най-опустошителната грешка на ИИ в хуманитарните науки е измислицата. В тази област има четири типични форми:

  • Измисляне на текст: „Допълва“ несъществуващата част от слаб надпис, добавяйки несъществуваща дума.
  • Фалшив превод: Превежда дума, която не разбира свободно, но неправилно; Читателят не може да забележи, защото не знае източника.
  • Изфабрикувана справка: Пише "Този надпис е публикуван в тази публикация", но тази публикация не съществува.
  • Грешна датировка/приписване: Уверено поставя стил на писане в грешен период.

Всичко това никога не може да се използва без потвърждение от експерт, който вижда източника и знае езика.

Внимание: Само защото преводът е гладък и убедителен, не означава, че е правилен. AI може дори да трансформира клинописен знак, който не разбира, в уверено изречение. Някой, който не може да прочете изходния текст, никога не може сам да провери точността на превода на AI.

три мини калъфа

Случай 1 — HTR отвори архива. Един архив пази хиляди страници от османски ръкописи, затворени за изследователите, защото четенето им изисква опит и време. Базираният на изкуствен интелект HTR транскрибира тетрадките в текст с възможност за търсене; Експертите коригираха черновата и нечетливите участъци бяха маркирани. Това не е пълен текст, но се появи мощен инструмент за сканиране.

Случай 2 — Уловено изфабрикувано завършване. Студент накара изкуствен интелект да разчете счупен латински надгробен камък; AI "допълни" липсващия ред в плавно изречение. Епиграфът показа, че предложеното завършване е физически невъзможно, защото в камъка не е останало място. Завършекът е реконструиран и маркиран въз основа на паралелни надписи.

Случай 3 — Коригиран фалшив превод. Един екип ще докладва превода на AI на старогръцки надпис; Когато филологът провери, той установи, че изкуственият интелект е превел глагол в грешно време, обръщайки значението на текста (независимо дали е приношение или възпоменание). Връщането към източника запази коментара.

Четири копируеми шаблона

1) Консервативна транскрипция:

Вашата роля: асистент по транскрипция. В този надпис/ръкописно изображение давайте САМО ясни четливи знаци. Не четете области, които са неясни, повредени или несигурни; Маркирайте го като „[нечетливо]“. ПОПЪЛНЕТЕ ЛИПСВАЩИТЕ ЧАСТИ. Обърнете внимание и на героите, които подозирате.

2) Мотивирано предложение за завършване:

По-долу има текст с точно четене на части и [интервали]. Предложете ВЪЗМОЖНИ допълнения за празнините, но за всяко предложение: (а) обосновка (граматика, паралелен текст), (б) дали празнината отговаря на броя на буквите, (в) алтернативи. Това са предложения; Не е окончателно прочетено. Посочете, че се изисква експертно одобрение.

3) Чернова на превод (защитен източник):

Преведете текста на [език] по-долу. Запазете изходния текст до всяко изречение (подравнете ред по ред). Маркирайте думите, за които не сте сигурни, и дайте алтернативен превод. НЕ си измисляйте условията; Ако не знаете, напишете "несигурно". Това е чернова; Експертът филолог ще провери.

4) Проверка на превода (обратен превод):

Преведете този превод ОБРАТНО на изходния език и го сравнете с оригиналния изходен текст. Маркирайте частите, където значението е променено, добавено или изпуснато. Особено проверете времето, темата и числата.

Слаба подкана / Силна подкана

Слаба подкана:

Прочетете този древен надпис и ни кажете какво пише.

В слаб надпис AI компенсира пропуските, може да преведе неправилно езика и човекът, който не вижда източника, няма да забележи това.

Мощна подкана:

В това изображение на надпис първо транскрибирайте САМО ясно четливите знаци, оставяйки скритите части "[нечетими]". След това ОТДЕЛНО предложете възможни допълнения за пропуските с обосновка, но не предлагайте никакви категорични. Накрая предоставете чернова на превод и маркирайте думите, за които не сте сигурни. Всички подлежат на експертно одобрение.

Разлика: първият дава фиктивен "четене"; последният държи прочетените, прогнозираните и преведените слоеве разделени и подлежащи на проверка.

Езици, скриптове и границата на познанието на AI

Археологическите текстове обхващат широк спектър от езици и писмености: латински и старогръцки надписи, османски и арабски ръкописи, клинописни плочки, египетски йероглифи, рунически надписи и др. Владеенето на AI на тези езици и скриптове е много неравномерно. Докато черновата на превод може да е разумна за езици с изобилен цифров текст, като латински и старогръцки, за текстове, които са оскъдно документирани, дешифрирани или прочетени само от няколко експерти, AI е почти напълно ненадежден; произвежда убедителни, но напълно измислени "преводи" в тези области.

Съществува и въпросът за контекста и жанра. Една и съща дума може да има различни значения в правен документ, молитвен текст и надгробен камък. Експертът филолог разпознава вида на текста (поклонение, паметник, договор, писмо) и чете думата в правилния контекст; ИИ няма тази обща чувствителност и налага най-често срещаното значение. Съкращения, формули и фондови изрази (особено често срещани в надписи) лесно подвеждат AI.

Така че златното правило е: използвайте AI като ускорител за езици, които знаете, езици, които можете да контролирате; Никога не разчитайте само на AI превод на език, който не можете да четете. Някой, който не може да прочете източника, не може да провери точността на превода и следователно не може да превърне този превод в научно твърдение.

Съвет: Когато давате текст на AI, посочете неговия език, приблизителен период и вид (надпис/писмо/документ). Познаването на контекста частично намалява отклонението на AI към най-често срещаното, но неправилно четене — но не премахва необходимостта от потвърждение.

Таблица със задачи за писмен ресурс

Мисия

Роля на AI

човешко решение

проверка

подобряване на изображението

Контраст/ръб

Избор на критерии

Сравнение с оригинала

OCR/HTR

чернова на текст

неопределен характер

експертна корекция

завършване

Препоръка (мотивирана)

Приемам/отхвърлям

Паралелен текст, контрол на местоположението

Превод

проект

нюанс, срок

Обратен превод, източник

Коментирайте

Обобщение на контекста

исторически смисъл

експерт, литература

Често срещани грешки

  • Довършване на бледия текст. AI отговаря на пропуските; Четенето и прогнозата трябва да бъдат разделени и маркирани.
  • Доверете се на превода, без да видите източника. Плавният превод не е правилен превод.
  • Приемане на измисленото приписване. Казването на „Това е в това предаване“ изисква потвърждение.
  • Не се проверява физическото местоположение на завършване. Предложението трябва да се впише в разчупеното пространство.
  • Оставяме интерпретацията на AI. Историческият смисъл на текста е работа на експерта филолог.

В обобщение

AI в епиграфиката и античните текстове; Той значително ускорява подобряването на изображението, HTR/OCR черновата, предложението за завършване и черновата на превода и отваря затворени архиви за изследване. Но това е областта, в която рискът от халюцинации е най-висок: четенето е отделено от прогнозирането, допълненията се маркират, преводите се проверяват спрямо източника и обратния превод, а окончателното четене и тълкуване принадлежат на експерта филолог.

Задача за приложение

Изберете изображение на надпис или ръкопис (от колекция с отворен достъп). Извличайте само ясни знаци с шаблона „Консервативна транскрипция“, след което получете предложения за интервали с „Обосновано предложение за завършване“. Създайте чернова на превод и го преведете обратно с шаблона „Проверка на превода“ и маркирайте къде значението е изместено. Сравнете с публикуваното четене, ако е възможно.

контролен списък

  • [ ] Маркирах отделно прочетения символ и завършването на прогнозата.
  • [ ] Проверих дали завършванията пасват в счупената област.
  • [ ] Проверих превода спрямо изходния текст и обратния превод.
  • [ ] Потвърдих публикациите/цитатите, дадени от YZ в действителния каталог.
  • [ ] Оставих окончателното четене и тълкуване на експертното одобрение.