ユニット 4 / 11

古代テキスト、簡略化、音訳: オスマン帝国とディヴァンのテキストの操作

利益:

  • 簡略化と文字起こしの違いを理解し、限られた検証可能なタスク (理解のサポート、語彙の仮説、簡略化の下書き) にのみ AI を使用できるようにします。
  • 元のテキストと信頼できるソースを使用して各出力を検証し、不足しているテキストを補完したり、内容を修正したりするなどのトラップを回避する機能
  • 人間の文献学者が転写、韻律、科学編集などの作業に不可欠であることを理解できること。

トルコ文学の大部分は、今日の読者が直接読むことができない言語、オスマン・トルコ語(オスマン・トルコ語 - オスマン帝国時代に使用され、アラビア語とペルシア語の単語やフレーズが豊富に含まれた、アラビア語のアルファベットで書かれたトルコ語)で書かれています。ディヴァンの詩、歴史書、新聞、アーカイブ文書のほとんどはこの言語で書かれています。これらを今日の読者が利用できるようにするには、転写 (テキストをあるアルファベットから別のアルファベットに翻訳し、音を特別な記号で保持しながら、アラビア文字のテキストをラテン文字に変更するなど) と単純化 (テキストの古くて重い単語を今日の読者が理解できる言葉に置き換える) の 2 つのプロセスが必要です。

この単元では、これらのタスクのヘルパーとして AI を使用する方法を学びます。ただし、ここではこれまで以上に強い警告が発せられます。従来のテキスト作業では、AI エラーや幻覚のリスクが非常に高くなります。各出力は、元のテキストと比較することにより、現場の有能な担当者による検証なしに使用することはできません。 AI は単語を読み間違えたり、対句を「完成」させたり、存在しない意味をでっち上げたりすることがあります。ここで AI は概要とディスカッションのツールです。それは専門の文献学者に取って代わることは決してありません。

なぜこの地域ではリスクが高いのでしょうか?

理由は 3 つあります。

  1. 曖昧な読み方。アラビア文字では、短母音は書かれないことがよくあります。同じ文字列が複数の単語になる場合があります。正しく読むには文脈と専門知識が必要です。 AI は、最も可能性の高い予測を「確実」として提示できます。
  2. 語彙力が重い。ディヴァンのテキストにおけるアラビア語とペルシア語のフレーズ、メタファー(古典詩における定型的なイメージ)、およびアルズ(音節の長さに基づく尺度)の微妙な点は、表面的な単純化によって失われるか歪められます。
  3. 完了する傾向。 AI は、「あるべき」ものに従って、不足しているテキストや使い古されたテキストを自動的に埋めることができます。これは文献学における重大な誤りです。存在しない文章をでっち上げることです。
注意: AI に「このオスマン帝国の対句を翻訳する」ように指示し、その出力を検証せずに公開することは、この分野で最も危険な間違いです。転写と簡略化の出力は、常に元のテキスト、信頼できる辞書、可能であれば既存の版 (学術出版物) と比較する必要があります。

AIを安全に使うには

古いテキストでは、次の限定的ではあるが有用なタスクに AI を使用します。

  • 理解(要点)サポート: ラテン文字のテキストの重い単語に相当する今日の内容を下書きとして学習します。
  • 辞書仮説: 単語の考えられる意味をリスト化し、信頼できる辞書と照合して検証します。
  • 簡略化草案: 現在のトルコ語で段落の大まかな草案を作成し、専門家に修正してもらいます。
  • 比較: 自分の単純化と AI の単純化を比較し、見落とされている領域を確認します。

一方で、次のタスクを AI に単独で実行させないでください。アラビア文字の画像からの音訳。科学版。不足しているテキストの補完。決定的な意味を主張します。

ヒント: 2 つのバージョンの簡略化を要求してください: (1) 意味を保持する厳密な簡略化、(2) 同等の単語を説明するリスト。 2 番目のリストにより、専門家が迅速に確認しやすくなり、AI がでっち上げた応答が可視化されます。

ミニケース3個

ケース 1 — 辞書仮説により時間を節約できました。ある大学院生は、AIからラテン文字で書かれた歴史文書の重い単語30語に相当する草案を受け取りました。信頼できる辞書から30相当物を確認。 4件は間違いがありましたので修正しました。辞書の閲覧時間は大幅に短縮されましたが、検証ステップは省略されませんでした。

ケース 2 — 完了エラーが発生しました。研究者は AI に、使い古された対句の欠けている部分について質問しました。 AI は韻律にぴったりの、流暢な、しかし完全に捏造された完成度を与えました。研究者が版注を見たところ、この章が実際には異なっていることがわかりました。 「文字の欠落をAIが補完する」という罠が具体的になりました。

ケース 3 — 単純化により意味が歪められる。編集者は、ディバンの対句を AI で簡略化しました。 AIがメタファー(固定観念)を文字通りに翻訳したため、対句の本来の意味は失われてしまった。編集者は現場の専門家と相談し、内容を維持したまま簡略化しました。

コピー可能な 4 つのテンプレート

1) 同等の重い単語 (確認が条件):

以下のラテン文字を使用した古いトルコ語のテキストで悪化した単語の、今日の考えられる同等のリストを示してください。それぞれの単語について、「確かではないので辞書で確認する必要があります」とメモします。テキストにない単語を追加してテキストを完成させます。テキスト: [ここにテキストを貼り付けます]

2) 2 つのバージョンの簡略化:

次のテキストを 2 つの方法で簡略化します: (1) 意味とイメージを保持する近いバージョン、(2) 変更した各単語の新旧の同等物を示す表。欠けている部分を埋め、存在しない意味を加える。不明な点にマークを付けてください。テキスト: [テキストを貼り付け]

3) 単純化制御:

以下は実際のテキストと私による簡略化です。私のバージョンで意味が歪められたり、省略されたり、誤って伝えられている箇所にマークを付けてください。自分のバージョンを押し付けないでください。問題のある領域を指摘し、その理由を本文にリンクするだけです。オリジナル: [...] 私のバージョン: [...]

4) プロット/コンセプトの説明:

次の対句で古典的なイメージと比喩を説明してください。それぞれについて、考えられる意味、伝統での使用法、および「専門家の情報源から検証する必要がある」という注意事項があります。断定的な判断はせず、別の読み方も述べてください。対句: [対句を書く]

弱いプロンプト / 強いプロンプト

弱者: 「このオスマン帝国のテキストを今日のトルコ語に翻訳してください。」

強者: 「以下の古いトルコ語のテキストをラテン文字で簡略化します。イメージと比喩を保持し、文字通りの意味に還元しないでください。変更した各単語を古い/新しい表に表示します。不足している部分またはあいまいな部分を補完し、「不確実であるため、専門家による検証が必要」とマークします。テキストにない単語や節は追加しないでください。」

強力なプロンプトは完了トラップを閉じ、コンテンツの損失を防ぎ、検証を容易にする表を表示します。プロンプトが弱いと、AI がスムーズにフィットするための扉が開いたままになります。

タスクとセキュリティのテーブル

ビジネス

AI単体

正しい使い方

ラテン文字のテキストにある「重い」という言葉の意味

危険な

下書き+辞書確認

アラビア文字からの音訳

終わっていない

専門の文献学者

簡略化

ドラフト

専門家のオーバーホール

不足しているテキストを補完する

絶対に終わってない

エディション/エキスパート

説明

仮説

専門筋からの確認

科学版

終わっていない

文献学者

アルツとメーター: なぜ AI は特に難しいのでしょうか?

トルコの古典的な詩のほとんどは、アルズ (パターンに基づいて音節の長さと短さを測定するシステム) で書かれています。対句がどのアルズパターンにあるかを判断するには、音節が長いか短いかを 1 つずつ解読し、いくつかの微妙な点 (1 つの長い音節を 2 つの短い音節として数えたり、母音を省略したりするなど) を知る必要があります。これは定期的ではありますが、非常に微妙な作業であり、AI がよく失敗する箇所です。パターンの名前を間違えたり、音節の測定を間違えたり、「良さそうに聞こえる」が間違っているパターンを提案したりする可能性があります。

したがって、アルツメーターの決定は、AI によってやみくもに実行できる仕事ではありません。せいぜい「候補」を与えるだけであり、この候補はメーターの知識のある人によってカプレット自体で検証される必要があります。同じことが、音節拍子(各行の音節数に基づく民俗詩の拍子)におけるストップとパターンの分析にも当てはまります。 AI は音節の数え間違いをすることもあります。メーターは文学分析の正確さがテストされる場所です。メーターに虚偽の主張があると、エッセイは最初から信頼できなくなります。

注意: AI によって与えられた韻律パターン名を検証せずにスタディに入力しないでください (「failatün fadeatün...」など)。測定は技術的かつ文化的な知識であり、この分野では人間の専門知識が不可欠です。 AI は、せいぜい「この対句の尺度をどこで調べればよいか、どのようなパターンが考えられるか?」という質問に対するガイドとして使用する程度にしてください。

よくある間違い

  • 書き起こし・簡略化したものを検証せずに公開します。各出力は元のテキストと比較されます。
  • 足りないテキストをAIに埋めてもらう。これは存在しないテキストをでっち上げています。それは絶対に行われていません。
  • 意味を文字通りの意味に還元すること。古典的なイメージは保存されなければなりません。
  • 読むだけが確実だと思っている。アラビア文字では複数の読み方が一般的です。代替案について質問してください。
  • 専門家に相談せずに重要な文章を結論付ける。この分野では人間の文献学者が不可欠です。

要約すると

古文書におけるAI。これは、理解のサポート、語彙の仮説、および単純化スケッチのための便利ですが、リスクの高いツールです。転写、編集、欠落テキストの完成などの作業は、専門の文献学者が担当します。各印刷物をオリジナルのテキスト、信頼できる辞書、最新の版で確認します。完成と平坦化の罠にはまらないようにしてください。この分野では、スピードよりも人間の専門知識が優先されます。

アプリケーションタスク

ラテン文字で書かれた短く単純化されていない古代のテキスト (二句の対句または歴史の段落) を見つけます。 「2 バージョンの簡素化」テンプレートを使用して AI から青写真を取得します。次に、単語テーブル内の各単語を信頼できる辞書で検証します。間違っているものにチェックを入れてください。画像を文字通りの意味に縮小したかどうかを確認し、必要に応じて修正します。

チェックリスト

  • [ ] AI にアラビア文字の書き起こしを独自に行わせたわけではありません。
  • [ ] 不足/曖昧な部分を埋めていませんでした。
  • [ ] 信頼できる辞書から該当語を確認しました。
  • [ ] 画像・画像が保存されていることを確認しました。
  • [ ] 私は批評文書を専門とする文献学者に相談しました。