Прибыль:
- Способность настроить рабочий процесс HTR и транслитерации и объяснить, почему черновой вариант требует экспертной проверки построчно.
- Возможность защитить нечитаемые области, запрашивая альтернативы вместо навязывания точного чтения в случае двусмысленности гласных/букв в османском турецком языке.
- Возможность отделить оригинальную транслитерацию от отдельного слоя упрощения, сохраняя окончательную научную ответственность за палеографом.
Пожалуй, самая сложная часть исторических исследований — это расшифровка рукописей и старых письменных документов в удобочитаемый текст. Письмо, записная книжка, протокол суда или османский документ становятся доступными для поиска только после того, как они будут расшифрованы. Транскрипция — это процесс перевода содержания документа (чаще всего рукописного или древнего письма) в письменный, читаемый текст. В случае с османским языком это часто сопровождается транслитерацией: переводом текста арабскими буквами в латинский алфавит с его побуквенными эквивалентами.
Мы использовали OCR для печатных текстов; Для рукописного ввода требуется другая технология: HTR (распознавание рукописного текста). HTR — это технология, похожая на OCR, но гораздо более сложная, которая преобразует рукописные документы в машинный текст. В этом разделе мы увидим, как использовать HTR и AI в османской транскрипции и транскрипции рукописей, пределы погрешности и почему проверка здесь еще более важна.
Почему писать почерком так сложно?
Почерк гораздо более изменчив, чем печатный текст: у каждого писателя своя уникальная рука, буквы сцеплены между собой, используются сокращения и специальные знаки, чернила растекаются, бумага изнашивается. В османском турецком языке сложность умножается:
- Контекстные формы букв: одна и та же буква пишется по-разному в начале, середине и конце слова.
- Не писать гласные: Краткие гласные часто не пишутся; читатель завершает из контекста. Это создает двусмысленности, такие как «принятие или отклонение?»
- Различные стили письма. Существуют разные стили почерка, такие как рик'а, дивани, талик; Каждый из них требует разных навыков чтения.
- Османский словарь: слова арабского и персидского языков, которых нет в современном турецком языке.
Таким образом, HTR и AI работают с гораздо большей погрешностью на османском турецком языке, чем печатное OCR. Глаз эксперта-палеографа (палеография — наука о чтении древних писаний) здесь не инструмент, а необходимость.
Рабочий процесс: шаг за шагом
1. Подготовьте качественный документ. Как и в случае с оптическим распознаванием текста, важное значение имеют высокое разрешение и хороший контраст. Это еще более важно для почерка.
2. Выберите модель HTR. Модели османского, арабского почерка или модели HTR, специально обученные для определенного периода, гораздо более успешны, чем общие модели. Проверьте, какая модель подходит для определенного периода и стиля письма.
3. Создайте необработанную транскрипцию. Модель HTR создает контур. На османском турецком языке этот черновик представляет собой начало, полное ошибок, которые опытный глаз должен тщательно проверить.
4. Контекстное улучшение с помощью ИИ. У вас могут быть несоответствия флагов AI, возможные альтернативы чтения и подозрительные места в необработанных выходных данных. Но «коррекция» ИИ здесь особенно рискованна: она может указывать на надуманное прочтение.
5. Транслитерация и упрощение (послойное). Транслитерация текста арабскими буквами латинскими буквами с последующим его упрощенным прочтением на современный турецкий язык производится отдельными слоями. Оригинал никогда не ломается.
6. Экспертная проверка. Окончательная транскрипция утверждается экспертом, обладающим палеографическими и историческими знаниями, путем сравнения ее с документом.
Внимание: в османском турецком языке при «угадывании» слова с ненаписанной гласной по контексту ИИ может произвести совершенно неверное прочтение и представить его на уверенном языке. Разница в буквах, например «кабул» вместо «кабил» или «алем» вместо «алим», полностью меняет смысл. Каждое сомнительное прочтение должно быть представлено с альтернативами, и не следует навязывать одно окончательное прочтение.
Слои и ответственность с таблицей
слой
Содержание
Роль ИИ
Роль эксперта
Изображение
оригинал документа
—
Источник
Проект HTR
Необработанное машинное чтение
производит
Контроль от начала до конца
транслитерация
Перестановка латинских букв
проект предлагает
Исправляет, исправляет
Ноты неопределенности
[?] и альтернативы
знаки
решает
Упрощение
Сегодняшний турецкий
проект предполагает
Разрешения
научная публикация
Окончательный текст + примечания
—
Только эксперт
три мини-кейса
Случай 1. HTR ускорила первый черновик в 5 раз. Докторант переписывал 200-страничную османскую тетрадь. Полная ручная транскрипция оценивалась в 60 рабочих дней. Благодаря модели HTR, подготовленной к этому периоду, черновой вариант вышел через несколько часов; Студент исправил этот проект и сократил работу до 12 рабочих дней. Но ему приходилось сравнивать каждую страницу с документом, строчка за строчкой; Около 30% проекта было неправильным.
Случай 2 — Одна буква, одно значение. Один исследователь опирался на слово, которое ИИ читает как «губернатор». Под экспертным контролем выяснилось, что на самом деле это слово «опекун» (ответственный за ребенка/человека), а поскольку гласная не была отмечена, ИИ угадал ее неправильно. Юридический смысл документа полностью менялся. Урок: в османском турецком языке разница в одну букву/гласную приводит к тому, что документ интерпретируется с самого начала; требуется эксперт.
Случай 3 — Надуманное завершение. В строке, в которой закончились чернила и одно слово из которой было нечитабельным, ИИ заполнил пробел «логическим» словом. Эксперт понял, что этот пробел на самом деле был названием места и что ИИ его восполнил. Пробел оставлен как [неразборчиво]. Урок: нечитаемое пространство не заполняется, оно помечается.
Четыре копируемых шаблона
1) Транслитерация, сохраняющая двусмысленность:
Ниже приведен необработанный вывод/транслитерация HTR османского документа. Ваша задача — просмотреть текст и отметить возможные ошибки чтения. Правила: (1) Предложите 2–3 возможных варианта прочтения для каждого слова, в котором вы не уверены, но не навязывайте его. (2) Оставьте [неразборчиво] в неразборчивых местах, не заполняйте их. (3) ДОБАВЛЕНИЕ слов, которых нет в тексте. (4) Покажите альтернативы в словах с неоднозначными гласными. Текст: [здесь]
2) Послойное чтение (оригинал + упрощение):
Создайте ДВА столбца для следующей проверенной османской транслитерации: (1) Исходная транслитерация (прикосновение), (2) Упрощенное чтение на современный турецкий язык. ДОБАВЛЕНИЕ смысла, добавление интерпретации в упрощении; просто обновите язык. Отмечать места с неоднозначным значением[неразборчиво]. Транслитерация: [здесь]
3) Срок и выделение лица:
Личные имена, географические названия, титулы и периодические термины, упомянутые в транскрипции ниже, представлены в отдельных списках. Берите только те, которые ЧЕТКО упомянуты в тексте; Не добавляйте путем угадывания. Отметьте знаком [?], если вы не уверены в произношении. Текст: [здесь]
4) Подозрительный контроль чтения:
В роли опытного палеографического контролера. В приведенной ниже транскрипции отметьте слова, противоречивые по смыслу, не соответствующие периоду или не вписывающиеся в контекст, и напишите, почему они вызывают подозрения. Наложение окончательной коррекции; Создайте список подозрений, который эксперт-человек сравнит с документом. Текст: [здесь]
Слабая подсказка / Сильная подсказка
Слабый:
Прочитайте этот османский текст и дайте мне его перевод.
Это заставляет ИИ производить единое, окончательное чтение, скрывая двусмысленности и заполняя пробелы. В османском турецком языке это почти гарантированная ошибка.
Сильный:
Ознакомьтесь с османской транслитерацией ниже. Окончательное прочтение: НАВЯЗАНИЕ. Приведите возможные альтернативы каждому неоднозначному слову, исключите [неразборчивые] части, не добавляйте ничего, чего нет в тексте. Упрощенное чтение на сегодняшнем турецком языке вынесите в отдельную колонку, но сохраните оригинал. Отметьте все, в чем вы не уверены, знаком [?], чтобы эксперт мог сравнить это с документом. Текст: [здесь]
Разница: строгий запрет на чтение, запрос альтернатив, сохранение пробелов и многоуровневый вывод позволяют проводить экспертную проверку.
Распространенные ошибки
- Ошибочно принять проект HTR за правильный. В османском турецком языке большая часть чернового варианта может быть неточной; Построчный контроль обязателен.
- Единственное окончательное прочтение — навязывать. Если альтернативы скрыты в словах, гласные которых не написаны, будет записан неправильный смысл.
- Заполнение нечитаемой области. Его следует защищать пробелами [неразборчиво], а не заполнять.
- Смешение оригинала с упрощением. Упрощение должно быть отдельным слоем; Исходная транслитерация не должна быть искажена.
- Отключение эксперта. Без знания палеографии и периода показания ИИ — это догадка, не имеющая научной ценности.
В итоге
Транскрипцию османского языка и рукописей можно значительно ускорить на этапе черновика с помощью HTR и AI; Вы получаете первый результат, который сокращает дни работы до часов. Но именно в этой области одна-единственная буква, одна-единственная разница в гласных меняет смысл; ИИ имеет тенденцию скрывать неопределенность и заполнять пробелы. Правильный метод многослойный: необработанный набросок, альтернативные замечания о неясностях, отдельный слой упрощения и, прежде всего, построчная проверка документа экспертом, знакомым с палеографией. ИИ ускоряет первоначальное чтение; Научная ответственность принадлежит эксперту.
Задача приложения
Получите транслитерацию османского или рукописного документа (вашего собственного производства или опубликованной копии). Попросите ИИ об альтернативном прочтении с помощью шаблона «транслитерации, сохраняющей двусмысленность». Затем сгенерируйте слой упрощения отдельно с помощью «многоуровневого чтения». Сравните каждое неясно отмеченное слово с экспертным источником или словарем; Обратите внимание, сколько ошибок выдал бы ИИ, если бы он навязал одно чтение.
контрольный список
- [ ] Я использовал HTR/модель, соответствующую периоду и стилю письма.
- [ ] Я попросил у ИИ альтернативы точному прочтению.
- [ ] Я защитил нечитаемые части с помощью [нечитаемо].
- [ ] Я сохранил исходную транслитерацию отдельно от упрощения.
- [ ] Окончательный текст был проверен экспертом/документалистом, знающим палеографию.