Gewinne:
- Fähigkeit, den HTR- und Transliterations-Workflow einzurichten und zu erklären, warum der Rohentwurf Zeile für Zeile von Experten überprüft werden muss
- Möglichkeit, unleserliche Bereiche zu schützen, indem bei Vokal-/Buchstaben-Mehrdeutigkeiten im osmanischen Türkisch nach Alternativen gefragt wird, anstatt eine genaue Lesart vorzuschreiben
- Fähigkeit, die ursprüngliche Transliteration von einer separaten Vereinfachungsebene zu trennen, wobei die endgültige wissenschaftliche Verantwortung beim Paläographen verbleibt
Der vielleicht anspruchsvollste Teil der historischen Forschung ist die Transkription von Manuskripten und alten schriftlichen Dokumenten in lesbaren Text. Ein Brief, ein Notizbuch, eine Gerichtsakte oder ein osmanisches Dokument wird erst durchsuchbar, nachdem es transkribiert wurde. Unter Transkription versteht man die Übertragung des Inhalts eines Dokuments (meistens handschriftlich oder in alter Schrift) in einen geschriebenen, lesbaren Text. Im Fall des Osmanischen geht dies oft mit einer Transliteration einher: der Übertragung des Textes in arabischen Buchstaben in das lateinische Alphabet mit seinen buchstabenweisen Entsprechungen.
Für gedruckte Texte haben wir OCR verwendet; Handschrift erfordert eine andere Technologie: HTR (Handschriftliche Texterkennung). HTR ist eine der OCR ähnliche, aber viel anspruchsvollere Technologie, die handschriftliche Dokumente in maschinellen Text umwandelt. In dieser Einheit werden wir sehen, wie man HTR und KI in der osmanischen Transkription und in Manuskripttranskriptionen verwendet, welche Fehlergrenzen es gibt und warum die Verifizierung hier noch wichtiger ist.
Warum ist das Schreiben mit der Hand so schwierig?
Handschrift ist viel vielfältiger als gedruckter Text: Jeder Schreiber hat eine einzigartige Handschrift, Buchstaben sind miteinander verbunden, es werden Abkürzungen und Sonderzeichen verwendet, Tinte verläuft, Papier nutzt sich ab. Im osmanischen Türkisch vervielfacht sich die Schwierigkeit:
- Kontextuelle Buchstabenformen: Der gleiche Buchstabe wird am Anfang, in der Mitte und am Ende des Wortes unterschiedlich geschrieben.
- Vokale nicht schreiben: Kurze Vokale werden oft nicht geschrieben; Der Leser ergänzt aus dem Kontext. Dadurch entstehen Unklarheiten wie „Akzeptanz oder Ablehnung?“
- Verschiedene Schreibstile: Es gibt verschiedene Handschriftstile wie Rik'a, Divani, Ta'lik; Jedes erfordert eine andere Lesekompetenz.
- Osmanischer Wortschatz: Wörter aus dem Arabischen und Persischen, die es im heutigen Türkisch nicht gibt.
Daher arbeiten HTR und AI im osmanischen Türkisch mit einer viel höheren Fehlerquote als gedruckte OCR. Das Auge eines erfahrenen Paläographen (Paläographie – die Wissenschaft des Lesens antiker Schriften) ist hier kein Werkzeug, sondern eine Notwendigkeit.
Arbeitsablauf: Schritt für Schritt
1. Bereiten Sie die Dokumentenqualität vor. Wie bei OCR sind eine hohe Auflösung und ein guter Kontrast unerlässlich. Dies ist bei der Handschrift noch kritischer.
2. Wählen Sie das HTR-Modell. Osmanische, arabische Handschrift- oder HTR-Modelle, die speziell für einen bestimmten Zeitraum trainiert wurden, sind viel erfolgreicher als allgemeine Modelle. Testen Sie, welches Modell für einen bestimmten Zeitraum und Schreibstil gut geeignet ist.
3. Erstellen Sie eine Rohtranskription. Das HTR-Modell erzeugt einen Umriss. Auf osmanisch-türkisch ist dieser Entwurf ein Anfang voller Fehler, die ein erfahrenes Auge gründlich prüfen muss.
4. Kontextbezogene Verbesserung mit KI. Sie können Inkonsistenzen, mögliche Lesealternativen und verdächtige Stellen durch die KI in der Rohausgabe kennzeichnen. Doch die KI-„Korrektur“ ist hier besonders riskant: Sie könnte auf eine erfundene Lesart schließen lassen.
5. Transliteration und Vereinfachung (geschichtet). Die Transliteration des Textes aus arabischen Buchstaben in lateinische Buchstaben und die anschließende vereinfachte Lektüre ins heutige Türkisch werden in separaten Schichten erstellt. Das Original geht nie kaputt.
6. Expertenüberprüfung. Die endgültige Transkription wird von einem Experten mit Paläographie- und Zeitkenntnissen durch Vergleich mit dem Dokument genehmigt.
Achtung: Im osmanischen Türkisch kann die KI beim „Erraten“ eines Wortes mit einem ungeschriebenen Vokal aus dem Kontext eine völlig falsche Lesart erzeugen und diese in einer sicheren Sprache darstellen. Ein Unterschied in den Buchstaben, etwa „kabul“ statt „kabil“ oder „alem“ statt „alim“, verändert die Bedeutung völlig. Zu jeder unsicheren Lesart sollten Alternativen vorgelegt werden, und es sollte keine einzige endgültige Lesart aufgezwungen werden.
Ebenen und Verantwortung mit einer Tabelle
Schicht
Inhalt
Rolle der KI
Rolle des Experten
Bild
Originaldokument
—
Quelle
HTR-Entwurf
Rohes maschinelles Lesen
produziert
Kontrolle von Anfang bis Ende
Transliteration
Umsetzung lateinischer Buchstaben
Entwurf schlägt vor
Korrigiert, korrigiert
Hinweise zur Unsicherheit
[?] und Alternativen
Zeichen
entscheidet
Vereinfachung
Das heutige Türkisch
Entwurf schlägt vor
Zulassungen
wissenschaftliche Veröffentlichung
Endgültiger Text + Anmerkungen
—
Nur für Experten
drei Mini-Koffer
Fall 1 – HTR beschleunigte den ersten Entwurf um das Fünffache. Ein Doktorand würde ein 200-seitiges osmanisches Notizbuch transkribieren. Die vollständige manuelle Transkription wurde auf 60 Werktage geschätzt. Mit einem für diesen Zeitraum trainierten HTR-Modell kam der Rohentwurf innerhalb weniger Stunden heraus; Der Student korrigierte diesen Entwurf und reduzierte die Arbeit auf 12 Arbeitstage. Aber er musste jede Seite Zeile für Zeile mit dem Dokument vergleichen; Etwa 30 % des Entwurfs waren fehlerhaft.
Fall 2 – Ein Buchstabe, eine Bedeutung. Ein Forscher stützte sich auf ein Wort, das die KI als „Gouverneur“ las. Unter Expertenkontrolle wurde verstanden, dass das Wort tatsächlich „Vormund“ (verantwortlich für ein Kind/eine Person) war, und da der Vokal nicht markiert war, hat die KI es falsch erraten. Die rechtliche Bedeutung des Dokuments änderte sich völlig. Lektion: Im osmanischen Türkisch führt ein einzelner Buchstaben-/Vokalunterschied dazu, dass das Dokument von Anfang an interpretiert wird; Experte ist erforderlich.
Fall 3 – Gekünstelte Vervollständigung. In einer Zeile, deren Tinte aufgebraucht war und von der ein Wort unlesbar war, füllte die KI die Lücke mit einem „logischen“ Wort. Der Experte erkannte, dass es sich bei dieser Lücke tatsächlich um einen Ortsnamen handelte und die KI sie erfunden hatte. Leerzeichen als [unleserlich] hinterlassen. Lektion: Nicht lesbarer Raum wird nicht ausgefüllt, er wird markiert.
Vier kopierbare Vorlagen
1) Transliteration, die Mehrdeutigkeit wahrt:
Nachfolgend finden Sie die HTR-Rohausgabe/Transliteration eines osmanischen Dokuments. Ihre Aufgabe besteht darin, den Text zu überprüfen und mögliche Lesefehler zu kennzeichnen. Regeln: (1) Bieten Sie für jedes Wort, bei dem Sie sich nicht sicher sind, 2-3 mögliche Lesealternativen an, drängen Sie sich keine auf. (2) Lassen Sie [unleserlich] in den unleserlichen Bereichen, füllen Sie sie nicht aus. (3) HINZUFÜGEN von Wörtern, die im Text nicht vorkommen. (4) Zeigen Sie Alternativen in Wörtern mit mehrdeutigen Vokalen auf. Text: [hier]
2) Mehrschichtiges Lesen (Original + Vereinfachung):
Generieren Sie ZWEI Spalten für die folgende verifizierte osmanische Transliteration: (1) Originaltransliteration (Touch), (2) Vereinfachte Lesart ins heutige Türkisch. Bedeutung hinzufügen, Interpretation zur Vereinfachung hinzufügen; Aktualisieren Sie einfach die Sprache. Markieren Sie Orte mit mehrdeutiger Bedeutung [undeutlich]. Transliteration: [hier]
3) Begriffs- und Personenextraktion:
Die in der nachstehenden Transkription genannten Personennamen, Ortsnamen, Titel und Periodenbezeichnungen erscheinen in separaten Listen. Nehmen Sie nur diejenigen, die im Text KLAR erwähnt werden; Fügen Sie nicht durch Raten hinzu. Markieren Sie mit [?], wenn Sie sich bei der Aussprache nicht sicher sind. Text: [hier]
4) Kontrolle verdächtiger Lesevorgänge:
Ein erfahrener Paläographie-Controller in der Rolle. Markieren Sie in der Transkription unten die Wörter, deren Bedeutung inkonsistent ist, die nicht in den Zeitraum passen oder nicht in den Kontext passen, und schreiben Sie, warum sie verdächtig sind. Auferlegung einer endgültigen Korrektur; Erstellen Sie eine Liste mit Verdachtsmomenten, die der menschliche Experte mit dem Dokument vergleicht. Text: [hier]
Schwache Eingabeaufforderung / Starke Eingabeaufforderung
Schwach:
Lesen Sie diesen osmanischen Text und geben Sie mir seine Übersetzung.
Dies zwingt die KI dazu, eine einzige, endgültige Lesart zu erstellen, Unklarheiten zu verbergen und Lücken zu schließen. Im osmanischen Türkisch ist dies fast ein garantierter Fehler.
Stark:
Schauen Sie sich unten die osmanische Transliteration an. Eine definitive Lektüre: IMPOSITION. Geben Sie für jedes mehrdeutige Wort mögliche Alternativen an, lassen Sie [unleserliche] Teile weg und fügen Sie nichts hinzu, was nicht im Text enthalten ist. Geben Sie die vereinfachte Lesart für das heutige Türkisch in einer separaten Spalte an, behalten Sie aber das Original bei. Markieren Sie alles, worüber Sie sich nicht sicher sind, mit [?], damit der Experte es mit dem Dokument vergleichen kann. Text: [hier]
Der Unterschied: striktes Leseverbot, Anfordern von Alternativen, Beibehaltung von Leerzeichen und geschichtete Ausgabe ermöglichen Expertenverifizierung.
Häufige Fehler
- Den HTR-Entwurf als korrekt verwechseln. Im osmanischen Türkisch kann ein Großteil des Rohentwurfs ungenau sein; Eine zeilenweise Kontrolle ist ein Muss.
- Die einzige definitive Lesart ist die, sie durchzusetzen. Wenn Alternativen in Wörtern verborgen sind, deren Vokale nicht geschrieben sind, wird die falsche Bedeutung aufgezeichnet.
- Den unlesbaren Bereich ausfüllen. Es sollte durch Leerzeichen [unleserlich] geschützt und nicht erfunden sein.
- Eine Mischung aus Original und Vereinfachung. Die Vereinfachung sollte eine separate Ebene sein; Die ursprüngliche Transliteration sollte nicht verfälscht werden.
- Den Experten deaktivieren. Ohne Kenntnisse der Paläographie und der Epoche ist die Interpretation der KI eine Vermutung ohne wissenschaftlichen Wert.
Zusammenfassend
Die Transkription von Osmanen und Manuskripten kann mit HTR und KI bereits im Rohentwurfsstadium erheblich beschleunigt werden; Sie erhalten einen ersten Output, der die Arbeitstage auf Stunden reduziert. Aber gerade in diesem Bereich verändert ein einzelner Buchstabe, ein einzelner Vokalunterschied die Bedeutung; KI neigt dazu, Unsicherheiten zu verbergen und Lücken zu schließen. Die richtige Methode ist geschichtet: grobe Gliederung, alternative Hinweise auf Mehrdeutigkeiten, eine separate Ebene der Vereinfachung und vor allem die zeilenweise Überprüfung des Dokuments durch einen mit Paläographie vertrauten Experten. KI beschleunigt das erste Lesen; Die wissenschaftliche Verantwortung liegt beim Experten.
Anwendungsaufgabe
Besorgen Sie sich eine Transliteration eines osmanischen oder handschriftlichen Dokuments (Ihre eigene Produktion oder eine veröffentlichte Kopie). Bitten Sie die KI um eine alternative Lesart mit der Vorlage „mehrdeutigkeitserhaltende Transliteration“. Anschließend wird die Vereinfachungsschicht separat mit „geschichtetem Lesen“ generiert. Vergleichen Sie jedes vage markierte Wort mit einer Expertenquelle oder einem Wörterbuch. Beachten Sie, wie viele Fehler die KI erzeugen würde, wenn sie einen einzigen Messwert vorgeben würde.
Checkliste
- [ ] Ich habe eine HTR/ein Modell verwendet, das zur Epoche und zum Schreibstil passt.
- [ ] Ich habe die KI nach Alternativen zum genauen Ablesen gefragt.
- [ ] Ich habe die nicht lesbaren Teile mit [unreadable] geschützt.
- [ ] Ich habe die ursprüngliche Transliteration von der Vereinfachung getrennt gehalten.
- [ ] Ich habe den endgültigen Text von einem Experten/Dokumentarfilm überprüfen lassen, der sich mit Paläographie auskennt.