利益:
- 人工知能を使用して、文脈/軌跡、層序、ハリス マトリックスなどの記録単位をデジタル化および標準化しながら、データの整合性を維持する機能
- 生データを保護し、人工知能が欠落データを補完してサイレント変更を行うリスクに対して、各変換を追跡可能に保つ機能
- 制御された辞書、メタデータ、およびオープン/FAIR 原則がデータの将来の有用性にとって不可欠である理由を理解します。
発掘の科学的価値は、そこから出てくる金の発見物にあるのではなく、その記録の質にあります。十分に文書化されていない発見は、科学とはほとんど無関係です。どこのどの地層で何が見つかったかも分からない物体ですから、ただ美しいだけです。この単元では、発掘記録 (あらゆるコンテキスト、発見、観察の体系的な転写とデータベース) と、AI がデータの入力、編成、標準化をどのようにスピードアップできるかについて見ていきますが、データの整合性に対する責任はなぜ人間にあるのかを見ていきます。
基本原則: AI は散在する記録を整理し、標準化し、矛盾を見つけるのに役立ちます。しかし、どのデータが正確であるか、記録が真実を反映しているかどうか、そしてデータの完全性は人間の責任です。 AIはデータの形状を補正するものであり、その正確性を保証するものではありません。
考古学的記録の基本単位
コンテキスト/軌跡。各発掘では、現場をコンテキストの単位 (コンテキスト/軌跡 - 個々の堆積物、層、穴、または壁、発掘の意味の最小単位) に分割します。各コンテキストは一意の番号を受け取り、すべての検索結果はその番号に関連付けられます。
層序とハリス・マトリックス。層序(層の相互の前後関係)は相対年代測定の基礎です。ハリス マトリックス (コンテキストの相互の順序を示す図) は、これらの関係を視覚化します。 AI は、一貫性のない層位関係 (例: 周期的な「A は両方とも B より上であり、下である」エラー) の検出に役立ちます。
在庫を検索します。あらゆる発見。コンテキストは、番号、タイプ、サイズ、素材、状態、写真とともに記録されます。
データ標準。共通の標準を使用して、記録を共有および比較できるようにします。 CIDOC-CRM (文化遺産データを記述するために開発された国際的な概念フレームワーク/オントロジー) により、さまざまな機関からのデータが相互に通信できるようになります。管理された用語辞書 (全員が同じ概念に対して同じ用語を使用することを保証する承認されたリスト) が使用されます。
ヒント: AI はデータを「解釈」するのではなく、「整理して監査」するために使用します。 「これらの記録で矛盾しているコンテキスト番号は何ですか?」良い質問ですね。 「この文脈はどの時代のものですか?」それは専門家の判断です。 AI が最も優れているのは一貫性チェックです。
登録とデータベースにおけるAIの役割
- デジタル化。手書きの発掘ノート、目録カード、古い図面は、AI を活用したテキスト認識によってデータベースにインポートされます (これはユニット 6 の HTR にリンクします)。
- 標準化。さまざまなスペル (「byzantium」、「Byzantium」、「byz.」) が管理された辞書にマッピングされます。日付と測定値は統一された形式になります。
- 整合性チェック。文脈番号の欠落、層序の矛盾、2 つの異なる発見での同じ番号の使用などのエラーはマークされます。
- クエリと要約。 「次のコンテキストですべてのガラスが検索される」などのクエリや要約テーブルがすぐに生成されます。
注意: 標準化する際、AI はデータを「修正」しようとしながら、黙ってデータを変更する可能性があります。たとえば、測定値を「妥当な」値に四捨五入したり、不確かな測定値を自分の推定値で埋めたりする場合があります。すべての自動変更は追跡可能でなければならず、元の記録は保存されなければなりません。生データは決して上書きされません。
ミニケース3個
ケース 1 — デジタル化によりアーカイブが保存されました。ある博物館では、40 年分の手書きの目録カード (約 22,000 枚) を紛失の危険にさらして保管していました。 AI を活用したテキスト認識と標準化により、カードが検索可能なデータベースにインポートされました。各カードは人間の検査官によってサンプルごとにチェックされ、判読できない領域には「不明瞭」とマークが付けられました。
ケース 2 — 不整合チェックでエラーが見つかりました。発掘チームはシーズンの終わりにAIにデータベースを監査させた。 YZ は、3 つの検索結果が同じコンテキスト番号を持つが、レイヤー情報が矛盾していることをマークしました。レビューの結果、データ入力エラーが判明しました。修正されなければ、層序解釈が歪められてしまうだろう。
ケース 3 — サイレント変更が検出されました。測定値を標準化しているときに、アシスタントは、AI が一部の「0」値を「欠落」ではなく「ゼロ」として解釈していることに気づきました。これにより、破損した部分の長さが歪んでしまいました。元のデータを保持しながら、変更内容を別の列に保持するためにプロセスが再構築されました。
コピー可能な 4 つのテンプレート
1) 標準化 (管理された辞書):
あなたの役割: データ ラングリング アシスタント。次のレコードの [フィールド:材料/期間/タイプ] の値を、次の管理された辞書: [dictionarylist] にマッピングします。辞書に同等の値がない CHANGE 値。 「一致しない」としてマークします。各変更を元と新しいペアとして報告します。生データを削除します。
2) 一貫性チェック:
次の発掘記録の不一致を見つけます: 文脈番号の繰り返し、必須フィールドの欠落、層位関係の矛盾、不自然な日付/測定。各問題を登録番号とともにリストし、それを解決するのは私に任せてください。自分で変更しないでください。
3) ハリス マトリックス ロジック制御:
以下はコンテキスト間の層序関係です (A 上/下 B)。論理矛盾(ループ、双方向関係)はありませんか?存在する場合は、どのコンテキストを表示します。コメントしないでください。論理的な一貫性をチェックするだけです。
4) クエリと要約テーブル:
以下のデータベース ダンプからの抜粋: [例:コンテキストごとのタイプの分布を見つける]。結果をテーブルとして与え、各行がどのレコードから派生したかを指定します。データに存在しない値を追加しないでください。空の場合は「データなし」と記入してください。
弱いプロンプト / 強いプロンプト
弱いプロンプト:
この発掘データを修正し、不足している項目を埋めてください。
「ギャップを埋める」ことで、AI がデータを適合させることができます。その結果、事実とフィクションが混在した信頼性の低いデータベースが作成されます。
強力なプロンプト:
以下の発掘データの形式的な不一致 (スペル、日付形式、ID の重複) のみをマークしてください。欠損値を完全に満たしてください。 「未完成」のままにしておきます。提案された各変更を元の変更とともにリストします。承認をさせていただきます。生データを変更する。
違い: 前者はデータを黙って破損します。 2 つ目は制御し、人間に決定を任せます。
優れたデータ モデル: フィールド、リレーションシップ、メタデータ
考古学データベースは任意のテーブルではなく、よく考えられたデータ モデル (データがどのテーブル、どのフィールド、どのような関係に編成されるかの青写真) です。基本原則は、すべてがコンテキストに依存するということです。つまり、コンテキストに合わせて検索し、コンテキスト同士 (層序学) とフィールドにコンテキストを合わせます。各レコードには一意の ID (ID) が含まれており、これらの ID を通じて関係が確立されます。検索は単一のコンテキストを参照します。コンテキストには多数の検索が含まれる場合があります。
録音と同じくらい重要なのは、メタデータ (データ自体に関するデータ: 誰が、いつ、どのような方法で、どのバージョンで録音したか) です。誰が、いつ、どのような自信を持って入力したのかが不明な記録は、将来的に疑問を呈することはできません。 AI は、メタデータ フィールドの一貫した入力をチェックし、欠落しているメタデータにフラグを立てるのに役立ちます。
もう 1 つの重要な原則は、オープンで持続可能な形式です。データを独自のクローズド ソフトウェアにロックするのではなく、オープン標準 (テキスト ベースのテーブル、文書化されたスキーマ) に近い状態に保つことで、数十年後でもデータを読み取ることができます。考古学データは単一の出版物のためではなく、将来の世代のために作成されます。そのため、FAIR 原則 (データの検索、アクセス可能、相互運用可能、再利用可能) がますます標準になってきています。 AI は、これらの原則に従ってデータにラベルを付けたり、欠陥を見つけたりするのに役立ちます。ただし、どのデータを公開したままにし、どのデータを機密(機密)のままにするかを決定するのはあなた次第です。
ヒント: データベースを設定するときは、「これを知らない人が 10 年後に開いて理解できるだろうか?」と自問してください。聞く。用語集で略語を説明し、メタデータ フィールドに入力し、生データをオープン形式でバックアップします。
レコード/データベースタスクテーブル
クエスト
AIの役割
人間の決断
保護ルール
デジタル化
テキスト認識
曖昧な読み取り確認
生のスキャンが保存される
標準化
辞書へのマッピング
値の不一致の決定
オリジナルは保存されています
一貫性
矛盾マーキング
修正
変更は追跡されます
層序学
ロジック制御
コメント
マトリックスの専門家の承認
クエリ/サマリー
テーブル製作
コメント、選択肢
データへの忠実性
よくある間違い
- 不足しているデータを補完します。 AIが補う。欠けているものは「不完全」のままでなければなりません。
- 生データを上書きします。オリジナルは常に保存されます。変更は個別に保持されます。
- 静かな変化に気づかない。すべての自動変換は報告され、監査される必要があります。
- 標準をスキップします。管理された辞書と共通のモデルがなければ、データを共有することはできません。
- AIに層序解釈を行わせる。 AIは論理矛盾を発見します。コメントは専門家向けです。
要約すると
発掘記録とデータベースのAI。デジタル化、標準化、整合性チェック、クエリ作業を大幅に高速化します。しかし、データの整合性は神聖です。欠落した部分はそのまま残されず、生データは保存され、すべての変更が追跡され、層序的な解釈は専門家に属します。良好な記録は、発掘が未来に残す最も貴重な遺産です。
アプリケーションタスク
小規模なサンプル発掘データ テーブル (10 ~ 20 レコード) を準備します。そこに意図的にいくつかの不一致 (ID の重複、日付の変形、レイヤーの競合) を入れます。 AI に「一貫性チェック」と「ハリス マトリックス ロジック チェック」パターンを使用してこれらを見つけさせます。次に、管理された辞書を作成し、マテリアル フィールドを「標準化」テンプレートにマップし、生データを確実に保存します。
チェックリスト
- [ ] 生データを変更せずに別に保存しました。
- [] 足りない部分を AI に補完させたわけではありません。 「未完成」のままにしておきました。
- [ ] 各自動変更をオリジナルで確認しました。
- [ ] 管理された辞書とデータ標準を使用しました。
- [ ] 層序解釈は専門家の判断に基づいて行いました。