ユニット 6 / 11

碑文、古代写本、文書の読解と翻訳

利益:

  • OCR/HTR を使用して碑文や原稿を草稿テキストに転写する際に、読み取った文字と完成予想を分けてマークする機能
  • ぼやけたテキスト補完、誤った翻訳、捏造された帰属などの幻覚の形式を認識し、翻訳を原文および逆翻訳と照合してチェックする能力。
  • 言語、文章、ジャンルの文脈が人工知能の信頼性をどのように決定するか、そして最終的な読み取りと解釈は専門の文献学者に属することを理解する能力

過去から私たちに残された最も直接的な音の 1 つは、石に刻まれた碑文、粘土板、パピルス、羊皮紙写本、墓石、印鑑などの文字による情報です。この単元では、碑文学 (石、金属、陶器などの硬い表面に刻まれた碑文を研究する科学)、古文書学 (古代の手書き文字の読み取りと年代測定の専門知識)、および AI がこれらの文書の読み取り、翻訳、編集をどのように加速するのかを説明しますが、なぜすべての読み取りが専門の文献学者によって確認されなければならないのかを見ていきます。

基本原則: AI は、かすかなテキストを読み、言語を翻訳し、可能な補完を提案するのに役立ちます。しかし、碑文の最終的な読み方、欠けている文字の補完と意味は、言語と時代を知っている専門家の判断に委ねられます。このモデルは、欠落しているテキストやかすかなテキストを「もっともらしい」がでっち上げられたもので埋める傾向が非常に強いため、AI が幻覚の危険に最もさらされるのはこの領域です。

書かれたソースを操作する手順

1. ドキュメント。碑文または原稿は、高解像度のコントラスト強調形式で表示されます。不明瞭な表面の場合は、特殊な照明 (サイド ライト) や RTI などの技術が使用されます。 AI により、コントラストと文字のエッジが鮮明になります。

2. 文字認識。印刷されたテキストには OCR (光学文字認識) が使用され、手書きには HTR (手書きテキスト認識) が使用されます。 AI ベースの HTR は古い原稿の転写に強力です。

3. 転記と完成。色あせたり壊れたりした部分については、専門家が文法と対訳に基づいて可能な修復を提案します。完成した文字は常に角括弧などの記号で示されます。読み取られた内容と予測された内容が混同されることはありません。

4. 翻訳。テキストはソース言語 (ラテン語、古代ギリシャ語、オスマン語、楔形文字など) から翻訳されています。 AI が初稿の翻訳を提供します。専門家のニュアンスにより用語と歴史的背景が修正されます。

5. コメントします。テキストに何が書かれているか、誰が書いたか、そしてどの出来事に言及しているかは歴史的解釈であり、専門家に属します。

ヒント: AI に不明瞭なテキストを「読んで完成させる」ように指示すると、安全に空白を埋めてくれます。代わりに、「はっきりと読める文字だけを入力し、空白のままにして、不明な部分にマークを付けてください」と言ってください。別のステップでの完了を正当な理由とともに要求し、必ず専門家による確認を受けてください。

幻覚: この地域の最大の危険

人文科学におけるAIの最も壊滅的な間違いは捏造です。このフィールドには 4 つの典型的な形式があります。

  • テキスト捏造:かすかな碑文の存在しない部分を「補完」し、存在しない単語を追加します。
  • 偽の翻訳: 流暢に理解できない単語を不正確に翻訳します。出典がわからないので読者は気づきません。
  • 捏造された参考文献: 「この碑文はその出版物に掲載されました」と記載されていますが、その出版物は存在しません。
  • 日付/帰属の誤り: 自信を持って間違った時代に文体を配置します。

これらはすべて、ソースを見てその言語を知っている専門家による確認なしに使用することはできません。

注意: 翻訳が流暢で説得力があるからといって、それが正しいとは限りません。 AI は、理解できない楔形文字を自信のある文章に変換することもできます。原文を読めない人がAI翻訳の正確さを自分で検証することは決してできません。

ミニケース3個

ケース 1 — HTR がアーカイブをオープンしました。あるアーカイブでは、数千ページに及ぶオスマン帝国の写本を研究者が閲覧できないように保管していました。これは、それらを読むには専門知識と時間が必要だったためです。 AI ベースの HTR は、ノートを検索可能なドラフト テキストに転写します。専門家が草稿を修正し、読めない部分にマークを付けた。全文ではありませんが、強力なスキャンツールが登場しました。

ケース 2 — 製造された完成品が捕捉されました。ある学生はAIに壊れたラテン語の墓石を読み取らせた。 AIが流暢な文章で欠落部分を「補完」した。碑文作者は、石にはスペースが残されていないため、提案されている完成は物理的に不可能であることを示しました。完成品は復元され、並行した碑文に基づいてマークが付けられました。

ケース 3 — 偽の翻訳を修正しました。あるチームは、AIによる古代ギリシャの碑文の翻訳を報告するだろう。文献学者がチェックしたところ、AIが動詞を間違った時制で翻訳し、テキストの意味(それが供物であったのか記念品であったのか)を逆転させていたことが判明した。ソースに戻るとコメントが保存されました。

コピー可能な 4 つのテンプレート

1) 保守的な転写:

あなたの役割: 文字起こしアシスタント。この碑文/原稿画像には、はっきりと読める文字のみを記載してください。不明瞭、壊れている、または不確実な部分は読まないでください。 「[読み取り不可]」としてマークします。不足している部分を完成させます。疑わしい文字にも注意してください。

2) 合理的な完成提案:

以下は正確な読み部分と [スペース] を含むテキストです。ギャップを補う可能性のあるものを提案します。ただし、各提案について: (a) 正当性 (文法、対訳)、(b) ギャップが文字数に適合するかどうか、(c) 代替案。これらは提案です。決定的な読み物ではありません。専門家の承認が必要であることを明記します。

3) 翻訳草案 (ソースは保護されています):

以下の [言語] テキストを翻訳してください。ソーステキストを各文の隣に配置します(行ごとに揃えます)。よくわからない単語にマークを付けて、別の訳を与えてください。用語をでっち上げないでください。分からない場合は「不明」とご記入ください。これは草案です。専門の文献学者がチェックします。

4) 翻訳検証 (逆翻訳):

この翻訳をソース言語に戻して翻訳し、元のソーステキストと比較します。意味が変更、追加、または削除された部分にマークを付けます。特に時制、件名、数字を確認してください。

弱いプロンプト / 強いプロンプト

弱いプロンプト:

この古代の碑文を読んで、そこに何が書かれているか教えてください。

かすかな碑文では、AI が隙間を補い、言語を誤訳する可能性があり、ソースを見ない人はこれに気づきません。

強力なプロンプト:

この碑文画像では、まずはっきりと読める文字のみを転写し、不明瞭な部分は「[判読不能]」のままにします。次に、別途、正当な理由を付けてギャップを補う可能性を提案しますが、明確なものは提供しません。最後に、下書きの翻訳を提供し、不明な単語にマークを付けます。すべて専門家の承認が必要です。

違い: 前者は架空の「読み方」を示します。後者では、読み取り、予測、翻訳された各レイヤーが分離され、検証可能に保たれます。

言語、文字、AI の知識フロンティア

考古学文書は、ラテン語と古代ギリシャ語の碑文、オスマン帝国とアラビア語の写本、楔形文字板、エジプトの象形文字、ルーン文字など、幅広い言語と文字に及びます。これらの言語とスクリプトに関する AI の習熟度には非常にばらつきがあります。ラテン語や古代ギリシャ語など、デジタル テキストが豊富にある言語では下書き翻訳が合理的かもしれませんが、文書化、解読、または少数の専門家のみがまばらに文書化、解読、または読んでいるテキストの場合、AI はほぼ完全に信頼できません。これらの分野では、説得力があるが完全に捏造された「翻訳」を作成します。

文脈やジャンルの問題もあります。法的文書、祈りの文書、墓石では、同じ単語が異なる意味をもつことがあります。専門の文献学者は、テキストの種類 (献身、記念碑、契約書、手紙) を認識し、正しい文脈で単語を読み取ります。 AI にはこの一般的な感受性が欠けており、最も一般的な意味を押し付けます。略語、数式、ストック表現 (特に碑文で非常に一般的) は、AI を誤解させやすくなります。

したがって、黄金律は次のとおりです。AI を、自分が知っている言語、自分が制御できる言語のアクセラレータとして使用します。読めない言語の AI 翻訳だけに頼らないでください。ソースを読めない人は翻訳の正確さを検証できないため、その翻訳を科学的主張に変えることはできません。

ヒント: AI にテキストを渡すときは、言語、推定期間、タイプ (碑文/手紙/文書) を指定します。コンテキスト知識は、最も一般的ではあるが誤った読み取りへの AI の偏りを部分的に軽減しますが、確認の必要性がなくなるわけではありません。

書き込みリソースタスクテーブル

クエスト

AIの役割

人間の決断

検証

画像補正

コントラスト/エッジ

基準の選択

オリジナルとの比較

OCR/HTR

ドラフトテキスト

不確定文字

専門家による校正

完成

推奨事項(理由あり)

承認/拒否

並列テキスト、位置制御

翻訳

ドラフト

ニュアンス、用語

逆翻訳、出典

コメント

コンテキストの概要

歴史的意味

専門家、文学者

よくある間違い

  • かすかなテキストを完成させます。 AI はギャップを補います。読み取りと予測は分離してマークする必要があります。
  • ソースを見ずに翻訳を信頼する。流暢な翻訳は正しい翻訳ではありません。
  • 捏造された帰属を受け入れる。 「あの放送に載っています」と言うには確認が必要です。
  • 完成品の物理的な場所を確認していない。提案書は壊れたスペースに収まる必要があります。
  • 解釈はAIに任せる。テキストの歴史的意味は専門の文献学者の問題です。

要約すると

碑文と古文書における AI。画像の改善、HTR/OCR ドラフト、完成提案書、およびドラフト翻訳を大幅にスピードアップし、閉じられたアーカイブを研究に公開します。しかし、これは幻覚のリスクが最も高い領域です。読書は予測から分離され、補語にはマークが付けられ、翻訳は原文と逆翻訳と照合され、最終的な読解と解釈は専門の文献学者が行います。

アプリケーションタスク

碑文または原稿の画像 (オープン アクセス コレクションから) を選択します。 「保守的な文字起こし」テンプレートで明確な文字のみを抽出し、「理由のある補完候補」でスペースの候補を取得します。ドラフト翻訳を作成し、「翻訳検証」テンプレートを使用して逆翻訳し、意味が変わった箇所にマークを付けます。可能であれば、出版された読み物と比較してください。

チェックリスト

  • [ ] 読んだ文字と予想の完了を分けてマークしました。
  • [ ] 完成品が壊れた領域に収まっていることを確認しました。
  • [ ] 翻訳を原文と逆翻訳と照合してチェックしました。
  • [ ] YZ が提供する出版物/引用を実際のカタログで確認しました。
  • [ ] 最終的な読解と解釈は専門家の承認に委ねました。