Прибуток:
- Можливість налаштувати HTR і робочий процес транслітерації та пояснити, чому необхідна чернетка вимагає експертної перевірки рядок за рядком
- Можливість захистити нечитабельні області, запитуючи альтернативи замість нав’язування точного читання у випадку неоднозначності голосних/літер в османській турецькій мові
- Можливість відокремити оригінальну транслітерацію від окремого шару спрощення, зберігаючи остаточну наукову відповідальність за палеографом
Мабуть, найвимогливішою частиною історичних досліджень є транскрибування рукописів і старих письмових документів у читабельний текст. Лист, зошит, судовий протокол або османський документ стає доступним для пошуку лише після того, як він був переписаний. Транскрипція — це акт перенесення змісту документа (найчастіше рукописного або старовинного письма) у письмовий, читабельний текст. У випадку османської мови це часто супроводжується транслітерацією: перенесенням тексту арабськими літерами в латинський алфавіт з його побуквеними еквівалентами.
Ми використовували OCR для друкованих текстів; Для рукописного введення потрібна інша технологія: HTR (Розпізнавання рукописного тексту). HTR — це технологія, схожа на OCR, але набагато складніша, яка перетворює рукописні документи на машинний текст. У цьому розділі ми побачимо, як використовувати HTR і AI в османській мові та транскрипції рукописів, допустимі похибки та чому перевірка тут ще більш критична.
Чому так складно писати від руки?
Почерк набагато різноманітніший, ніж друкований текст: у кожного, хто пише, своя рука, літери пов’язані між собою, використовуються скорочення та спеціальні знаки, чорнило стікає, папір зношується. У турецькій імперії складність збільшується:
- Контекстні форми літер: та сама літера пишеться по-різному на початку, в середині та в кінці слова.
- Не написання голосних: короткі голосні часто не пишуться; читач завершує з контексту. Це створює двозначність, наприклад "прийняття чи відмова?"
- Різні стилі письма: Існують різні стилі почерку, такі як rik'a, divani, ta'lik; Кожен вимагає різного досвіду читання.
- Османська лексика: слова з арабської та перської мов, яких немає в сучасній турецькій.
Таким чином, HTR та AI працюють із набагато більшою похибкою османською турецькою мовою, ніж OCR для друку. Око досвідченого палеографа (палеографія - наука про читання стародавніх писань) тут не знаряддя, а необхідність.
Хід роботи: крок за кроком
1. Підготуйте якість документів. Як і в OCR, висока роздільна здатність і хороший контраст є важливими. Це ще важливіше для почерку.
2. Виберіть модель HTR. Османський, арабський почерк або моделі HTR, спеціально навчені для певного періоду, набагато успішніші, ніж загальні моделі. Перевірте, яка модель підходить для періоду та стилю написання.
3. Згенеруйте необроблену транскрипцію. Модель HTR створює контур. Османською турецькою мовою ця чернетка — це початок, повний помилок, які досвідчене око має ретельно перевірити.
4. Покращення контексту за допомогою ШІ. Ви можете мати невідповідності прапорів AI, можливі альтернативи читання та підозрілі місця в необробленому виведенні. Але «виправлення» штучного інтелекту тут особливо ризиковано: воно може запропонувати надумане читання.
5. Транслітерація та спрощення (пошарове). Транслітерація тексту арабськими літерами латинськими літерами з наступним його спрощеним читанням сучасною турецькою мовою виконується окремими шарами. Оригінал ніколи не ламається.
6. Експертна перевірка. Остаточна транскрипція затверджується експертом з палеографії та періоду шляхом порівняння з документом.
Увага: в османській турецькій мові, «вгадуючи» з контексту слово з невиписаною голосною, штучний інтелект може видати абсолютно неправильне прочитання та представити його впевненою мовою. Різниця в буквах, наприклад «кабул» замість «кабіл» або «алем» замість «алім», повністю змінює значення. Кожне невизначене читання має бути представлено з альтернативами, і жодного остаточного читання не слід нав’язувати.
Шари та відповідальність зі столом
шар
Зміст
Роль ШІ
Роль експерта
Зображення
оригінал документа
—
Джерело
Проект HTR
Необроблене машинне читання
виробляє
Контроль від початку до кінця
транслітерація
Транспозиція латинських літер
проект пропонує
Виправляє, виправляє
Нотки невизначеності
[?] та альтернативи
знаки
вирішує
Спрощення
Сьогоднішня турецька
проект пропонує
Дозволи
наукове видання
Кінцевий текст + примітки
—
Тільки експерт
три міні-чохла
Випадок 1 — HTR пришвидшив першу чернетку в 5 разів. Докторант переписував би 200-сторінковий зошит Османської імперії. Повна ручна транскрипція оцінювалася в 60 робочих днів. З моделлю HTR, натренованою на цей період, необроблений проект вийшов за кілька годин; Студент виправив цей проект і скоротив роботу до 12 робочих днів. Але він мав порівняти кожну сторінку з документом, рядок за рядком; Близько 30% чернетки були неправильними.
Випадок 2 — Одна літера, одне значення. Один дослідник покладався на слово, яке ШІ прочитав як «губернатор». Під експертним контролем було зрозуміло, що слово насправді було «опікун» (відповідає за дитину/людину), і оскільки голосна не була позначена, ШІ вгадав її неправильно. Правовий зміст документа повністю змінювався. Урок: в османській турецькій різниця в одній букві/голосному спричиняє інтерпретацію документа з самого початку; потрібен експерт.
Випадок 3 — Надумане завершення. У рядку, у якому закінчилося чорнило і одне слово якого було нечитабельним, ШІ заповнив прогалину «логічним» словом. Експерт зрозумів, що ця прогалина насправді була назвою місця, і що штучний інтелект вигадав її. Пробіл, залишений як [нерозбірливо]. Урок: нечитабельне місце не заповнюється, позначається.
Чотири шаблони, які можна копіювати
1) Транслітерація, що зберігає двозначність:
Нижче наведено необроблений вихід HTR/транслітерацію османського документа. Ваше завдання — переглянути текст і позначити можливі помилки читання. Правила: (1) Запропонуйте 2-3 можливі варіанти читання для кожного слова, у якому ви не впевнені, не нав’язуйте жодного. (2) Залиште [нерозбірливо] у нерозбірливих областях, не заповнюйте їх. (3) ДОДАВАННЯ слів, яких немає в тексті. (4) Показати варіанти в словах із неоднозначними голосними. Текст: [тут]
2) Пошарове читання (оригінал + спрощення):
Згенеруйте ДВА стовпці для такої перевіреної османської транслітерації: (1) оригінальна транслітерація (сенсорним дотиком), (2) спрощене читання сучасною турецькою мовою. ДОДАВАННЯ значення, додавання тлумачення в спрощенні; просто оновіть мову. Позначте місця з неоднозначним значенням [нечітким]. Транслітерація: [тут]
3) Вилучення терміну та особи:
Особисті імена, топоніми, назви та періодичні терміни, згадані в наведеній нижче транскрипції, представлені в окремих списках. Беріть лише ті, які ЧІТКО згадуються в тексті; Не додавайте відгадками. Позначте [?], якщо ви не впевнені у вимові. Текст: [тут]
4) Контроль підозрілого читання:
Досвідчений контролер палеографії в ролі. У наведеній нижче транскрипції позначте суперечливі за значенням слова, не підходять до крапки чи не вписуються в контекст і напишіть, чому вони викликають підозру. Накладення остаточної корекції; Створіть список підозр, які людина-експерт буде порівнювати з документом. Текст: [тут]
Слабка підказка / Сильна підказка
Слабкий:
Прочитайте цей османський текст і дайте мені його переклад.
Це спонукає штучний інтелект виробляти єдине остаточне читання, приховуючи неоднозначності та вписуючи прогалини. У османській турецькій мові це майже гарантована помилка.
Сильний:
Перегляньте османську транслітерацію нижче. Остаточне читання: НАВ’ЯЗАННЯ. Надайте можливі варіанти для кожного двозначного слова, виключіть [нерозбірливі] частини, не додавайте нічого, чого немає в тексті. Дайте спрощене читання сучасній турецькій мові в окремій колонці, але збережіть оригінал. Позначте все, у чому ви не впевнені, [?], щоб експерт міг порівняти це з документом. Текст: [тут]
Відмінність: сувора заборона читання, запит альтернатив, збереження пробілів і багатошаровий вивід дозволяють експертну перевірку.
Поширені помилки
- Приймаючи чернетку HTR як правильну. У османській турецькій мові більша частина необробленого тексту може бути неточною; Построковий контроль є обов’язковим.
- Єдине остаточне прочитання - це накладення. Якщо в словах, голосні не записані, приховані альтернативи, буде записано неправильне значення.
- Заповнення нечитабельної області. Він має бути захищений пробілом [нерозбірливо], а не вигаданий.
- Змішування оригіналу зі спрощенням. Спрощення має бути окремим шаром; Оригінальна транслітерація не повинна бути спотворена.
- Відключення експерта. Без знання палеографії та періоду читання ШІ є припущенням без наукової цінності.
Підсумовуючи
Османську транскрипцію та транскрипцію рукописів можна значно прискорити на етапі необробленої чернетки за допомогою HTR та AI; Ви отримуєте перший результат, який скорочує робочі дні до годин. Але саме в цій області одна буква, одна різниця голосних змінює значення; ШІ прагне приховати невизначеність і заповнити прогалини. Правильний метод є багатошаровим: необроблений контур, альтернативні примітки двозначності, окремий шар спрощення і, перш за все, построкова перевірка документа експертом, знайомим з палеографією. AI прискорює початкове читання; Наукова відповідальність належить експерту.
Аплікаційне завдання
Отримайте транслітерацію османського або рукописного документа (вашого власного виробництва або опублікованої копії). Попросіть штучного інтелекту альтернативне читання за допомогою шаблону «транслітерація, що зберігає неоднозначність». Потім створіть шар спрощення окремо за допомогою «пошарового читання». Порівняйте кожне нечітко позначене слово з експертним джерелом або словником; Зверніть увагу, скільки помилок створив би штучний інтелект, якщо нав’язати одне зчитування.
контрольний список
- [ ] Я використовував HTR/модель, що відповідає періоду та стилю написання.
- [ ] Я запитав ШІ про альтернативи точного читання.
- [ ] Я захистив нечитабельні частини за допомогою [нечитабельно].
- [ ] Я зберіг оригінальну транслітерацію окремо від спрощеної.
- [ ] Остаточний текст перевірив експерт/документаліст, який знає палеографію.