سود:
- توانایی حفظ یکپارچگی داده ها در حین دیجیتالی کردن و استانداردسازی واحدهای ضبط مانند زمینه/منبع، چینه نگاری و هریس ماتریس با هوش مصنوعی
- توانایی محافظت از داده های خام و قابل ردیابی هر تبدیل در برابر خطر تکمیل داده های گمشده توسط هوش مصنوعی و ایجاد تغییرات بی صدا
- درک کنید که چرا فرهنگ لغت کنترل شده، ابرداده، و اصول باز/عادلانه برای قابلیت استفاده آینده داده ها ضروری هستند.
ارزش علمی یک کاوش نه در یافته های طلایی که از آن بیرون می آید، بلکه در کیفیت سوابق آن است. یافته ای که به خوبی مستند نشده باشد تقریباً به علم بی ربط است. زیرا شیئی است که معلوم نیست در کجا، در کدام لایه و با چه چیزی یافت می شود، فقط یک شیء زیباست. در این بخش به گزارش حفاری (رونویسی سیستماتیک و پایگاه داده هر زمینه، یافتن و مشاهده) و اینکه چگونه هوش مصنوعی میتواند سرعت ورود، سازماندهی و استانداردسازی دادهها را افزایش دهد، میپردازیم، اما چرا مسئولیت یکپارچگی دادهها بر عهده انسان است.
اصل اساسی: هوش مصنوعی به سازماندهی رکوردهای پراکنده، استانداردسازی آنها و یافتن ناسازگاری ها کمک می کند. اما اینکه کدام داده ها دقیق هستند، آیا یک رکورد منعکس کننده حقیقت است یا خیر، و یکپارچگی داده ها مسئولیت انسان است. هوش مصنوعی شکل داده ها را تصحیح می کند، صحت آن را تضمین نمی کند.
واحدهای اساسی پرونده باستان شناسی
زمینه / مکان. هر حفاری محل را به واحدهای زمینه (زمینه/موقعیت - یک رسوب، لایه، گودال یا دیوار؛ کوچکترین واحد معنایی کاوش) تقسیم می کند. هر زمینه یک عدد منحصر به فرد دریافت می کند و همه یافته ها با آن عدد مرتبط هستند.
چینه شناسی و ماتریس هریس. چینه نگاری (رابطه قبل و بعد لایه ها نسبت به یکدیگر) اساس تاریخ گذاری نسبی است. ماتریس هریس (نمودار که ترتیب زمینه ها را نسبت به یکدیگر نشان می دهد) این روابط را به تصویر می کشد. هوش مصنوعی به شناسایی روابط چینه شناسی ناسازگار کمک می کند (مثلاً یک خطای چرخه ای "A هم بالا و هم پایین B است").
موجودی را پیدا کنید هر یافته؛ زمینه با تعداد، نوع، اندازه، مواد، شرایط و عکس ثبت می شود.
استانداردهای داده استانداردهای رایج برای قابل اشتراک گذاری و مقایسه کردن رکوردها استفاده می شود. CIDOC-CRM (یک چارچوب مفهومی/هستیشناسی بینالمللی که برای توصیف دادههای میراث فرهنگی ایجاد شده است) دادههای مؤسسات مختلف را قادر میسازد تا با یکدیگر صحبت کنند. یک فرهنگ لغت کنترل شده از اصطلاحات (لیست تایید شده ای که تضمین می کند همه از یک اصطلاح برای یک مفهوم استفاده می کنند) استفاده می شود.
نکته: از هوش مصنوعی برای «سازماندهی و حسابرسی» دادهها استفاده کنید، نه «تفسیر» آنها. "چه اعداد زمینه متناقض در این سوابق هستند؟" سوال خوبی است؛ این بافت متعلق به چه دوره ای است؟ این یک تصمیم کارشناسی است. جایی که هوش مصنوعی قویتر است، بررسی سازگاری است.
نقش هوش مصنوعی در ثبت و پایگاه داده
- دیجیتالی شدن دفترچههای حفاری دستنویس، کارتهای موجودی و نقشههای قدیمی با تشخیص متن مبتنی بر هوش مصنوعی به پایگاه داده وارد میشوند (این به HTR در واحد 6 پیوند میدهد).
- استانداردسازی املای مختلف ("byzantium"، "Byzantium"، "byz.") در فرهنگ لغت کنترل شده ترسیم شده است. تاریخ ها و اندازه گیری ها به شکل یکنواخت آورده می شوند.
- بررسی سازگاری خطاهایی مانند از دست دادن شماره زمینه، چینه نگاری متناقض، استفاده از یک عدد در دو یافته مختلف مشخص شده است.
- پرس و جو و خلاصه. پرس و جوهایی مانند "همه شیشه ها در زمینه زیر" و جداول خلاصه به سرعت ایجاد می شوند.
احتیاط: هنگام استانداردسازی، هوش مصنوعی ممکن است در حالی که سعی میکند آنها را "اصلاح کند" بیصدا دادهها را تغییر دهد. برای مثال، او ممکن است یک اندازه گیری را به یک مقدار "معقول" گرد کند یا یک قرائت نامطمئن را با برآورد خود پر کند. هر تغییر خودکار باید قابل ردیابی باشد و رکورد اصلی باید حفظ شود. داده های خام هرگز رونویسی نمی شوند.
سه کیف کوچک
مورد 1 - دیجیتالی کردن بایگانی را ذخیره کرد. یک موزه 40 سال کارت های موجودی دست نویس (حدود 22000 کارت) را در معرض خطر گم شدن ذخیره می کرد. تشخیص و استانداردسازی متن مبتنی بر هوش مصنوعی، کارتها را به یک پایگاه داده قابل جستجو وارد کرد. هر کارت بر اساس یک نمونه توسط یک آزمایشگر انسانی بررسی شد و نواحی غیرقابل خواندن "نامشخص" علامت گذاری شدند.
مورد 2 - بررسی ناسازگاری خطاهای پیدا شده است. یک تیم حفاری در پایان فصل، هوش مصنوعی پایگاه داده را ممیزی کرد. YZ مشخص کرد که سه یافته دارای شماره زمینه یکسان اما اطلاعات لایه متضاد هستند. بررسی یک خطای ورود داده را نشان داد. اگر اصلاح نمی شد، تفسیر چینه شناسی را مخدوش می کرد.
مورد 3 - تغییر بی صدا به دست آمد. هنگام استانداردسازی اندازهگیریها، یک دستیار متوجه شد که هوش مصنوعی برخی از مقادیر «0» را بهجای «فقدان» بهعنوان «صفر» تفسیر میکند. این باعث تحریف طول قطعه شکسته شد. این فرآیند برای حفظ داده های اصلی بازسازی شد، اما تغییرات را در یک ستون جداگانه نگه داشت.
چهار قالب قابل کپی
1) استانداردسازی (فرهنگ لغت کنترل شده):
نقش شما: دستیار جدال داده ها. مقادیر [field:material/period/type] را در رکوردهای زیر به فرهنگ لغت کنترل شده زیر نگاشت کنید: [Dictionarylist]. CHANGE مقادیری که معادل در فرهنگ لغت ندارند. آن را به عنوان "بدون مطابقت" علامت گذاری کنید. گزارش هر تغییر به عنوان یک جفت اصلی-جدید. حذف داده های خام
2) بررسی سازگاری:
ناهماهنگیها را در سوابق حفاری زیر بیابید: اعداد متن تکراری، میدانهای اجباری از دست رفته، روابط چینهشناسی متناقض، تاریخها/اندازهگیریهای نامناسب. هر مشکل را با شماره ثبت لیست کنید و آن را به من بسپارید تا آن را برطرف کنم. خودت عوضش نکن
3) کنترل منطقی هریس ماتریس:
در زیر روابط چینه شناسی بین زمینه ها (A بالا/پایین B) آمده است. آیا تناقض منطقی (حلقه، رابطه دو طرفه) وجود دارد؟ در صورت وجود، کدام زمینه ها را نشان دهید. نظر ندهید؛ فقط سازگاری منطقی را بررسی کنید.
4) پرس و جو و جدول خلاصه:
استخراج زیر از پایگاه داده dump زیر: [به عنوان مثال. یافتن توزیع نوع در هر زمینه]. نتیجه را به صورت جدول ارائه دهید و مشخص کنید که هر ردیف از کدام رکورد مشتق شده است. هیچ مقداری را که در داده ها وجود ندارد اضافه نکنید. اگر خالی است بنویسید "no data".
اعلان ضعیف / اعلان قوی
اعلان ضعیف:
این داده های حفاری را تصحیح کنید و موارد از دست رفته را پر کنید.
"پر کردن شکاف ها" به هوش مصنوعی اجازه می دهد تا داده ها را جا دهد. نتیجه یک پایگاه داده غیر قابل اعتماد است که در آن واقعیت و داستان با هم ترکیب می شوند.
اعلان قدرتمند:
فقط تناقضات رسمی (املا، قالب تاریخ، شناسه تکراری) را در دادههای حفاری زیر علامت بزنید. مقادیر کامل از دست رفته. آن را به عنوان "ناقص" بگذارید. هر تغییر پیشنهادی را به همراه نسخه اصلی فهرست کنید. من تایید می کنم. تغییر داده های خام
تفاوت: اولی بی سر و صدا داده ها را خراب می کند. دومی کنترل می کند و تصمیم گیری را به انسان واگذار می کند.
مدل داده خوب: فیلدها، روابط و ابرداده
یک پایگاه داده باستان شناسی یک جدول دلخواه نیست، بلکه یک مدل داده متفکرانه است (نمونه ای از کدام جداول، کدام زمینه ها، و داده ها در چه روابطی سازماندهی خواهند شد). اصل اساسی این است که همه چیز به زمینه بستگی دارد: یافته ها به زمینه، زمینه ها به یکدیگر (چینه شناسی) و زمینه. هر رکورد دارای یک هویت منحصر به فرد (ID) است و روابط از طریق این هویت ها برقرار می شود. یک یافته به یک زمینه واحد اشاره دارد، یک زمینه ممکن است حاوی یافته های زیادی باشد.
به همان اندازه که ضبط مهم است فراداده است (داده های مربوط به خود داده ها: چه کسی آن را ضبط کرده است، چه زمانی، با چه روشی، چه نسخه ای). سابقه ای که معلوم نیست توسط چه کسی، کی و با چه اطمینانی وارد شده است، در آینده قابل تردید نیست. هوش مصنوعی در بررسی پر شدن مداوم فیلدهای ابرداده و پرچم گذاری ابرداده های گمشده مفید است.
یک اصل مهم دیگر یک قالب باز و پایدار است. به جای قفل کردن داده ها در نرم افزار اختصاصی و بسته، نزدیک نگه داشتن آن به استانداردهای باز (جدول های مبتنی بر متن، طرحواره های مستند) تضمین می کند که داده ها می توانند دهه ها بعد خوانده شوند. داده های باستان شناسی نه برای یک نشریه بلکه برای نسل های آینده تولید می شود. به همین دلیل است که اصول FAIR (یافتن، قابل دسترسی، قابلیت همکاری و استفاده مجدد از داده ها) به طور فزاینده ای استاندارد شده است. هوش مصنوعی در برچسب گذاری داده های شما مطابق با این اصول و یافتن کاستی ها مفید است. اما این شما هستید که تصمیم می گیرید کدام داده باز و کدام یک حساس (محرمانه) باقی بماند.
نکته: هنگامی که پایگاه داده خود را راه اندازی می کنید، از خود بپرسید: "آیا کسی که این را نمی داند می تواند آن را باز کند و ظرف 10 سال آن را درک کند؟" بپرسید اختصارات خود را در یک واژه نامه توضیح دهید، فیلدهای فراداده را پر کنید و از داده های خام در قالب باز نسخه پشتیبان تهیه کنید.
جدول وظایف رکورد/پایگاه داده
تلاش
نقش هوش مصنوعی
تصمیم انسانی
قانون حفاظت
دیجیتالی شدن
تشخیص متن
تایید خواندن مبهم
اسکن خام ذخیره می شود
استانداردسازی
نقشه به فرهنگ لغت
تصمیم ارزشی ناسازگار
اصل حفظ شده است
سازگاری
علامت گذاری تضاد
تصحیح
تغییر پیگیری می شود
چینه شناسی
کنترل منطقی
نظر دهید
تایید کارشناس ماتریس
پرس و جو/خلاصه
تولید میز
نظر، انتخاب
وفاداری به داده ها
اشتباهات رایج
- تکمیل داده های از دست رفته هوش مصنوعی تشکیل می دهد. گمشده باید "ناقص" باقی بماند.
- بازنویسی داده های خام اصل همیشه حفظ می شود. تغییرات جدا نگهداری می شوند
- عدم توجه به تغییرات بی صدا هر تبدیل خودکار باید گزارش و ممیزی شود.
- رد شدن از استاندارد بدون یک فرهنگ لغت کنترل شده و یک مدل مشترک، داده ها نمی توانند به اشتراک گذاشته شوند.
- داشتن هوش مصنوعی تفسیر چینه شناسی را انجام می دهد. هوش مصنوعی تناقض منطقی پیدا می کند. نظر برای کارشناس است.
به طور خلاصه
هوش مصنوعی در سوابق حفاری و پایگاه داده؛ سرعت فوق العاده ای در دیجیتال سازی، استانداردسازی، بررسی سازگاری و کارهای پرس و جو فراهم می کند. اما یکپارچگی داده ها مقدس است: هیچ بخش از دست رفته دست نخورده باقی نمی ماند، داده های خام حفظ می شوند، هر تغییری ردیابی می شود، و تفسیر چینه شناسی متعلق به متخصص است. سوابق خوب با ارزش ترین میراثی است که حفاری برای آیندگان به جا می گذارد.
وظیفه کاربردی
یک نمونه کوچک جدول داده های حفاری (10-20 رکورد) تهیه کنید. عمداً چند تناقض را در آنجا قرار دهید (ID تکراری، تاریخ بدشکل، لایه متناقض). از هوش مصنوعی بخواهید اینها را با الگوهای «بررسی سازگاری» و «بررسی منطقی ماتریس هریس» بیابد. سپس یک فرهنگ لغت کنترل شده بنویسید و زمینه مواد را به الگوی "Standardization" ترسیم کنید و مطمئن شوید که داده های خام را حفظ می کنید.
چک لیست
- [ ] من داده های خام را به طور جداگانه، بدون تغییر ذخیره کردم.
- [ ] من کاری نکردم که هوش مصنوعی قسمت های از دست رفته را کامل کند. من آن را به عنوان "ناقص" گذاشتم.
- [ ] من هر تغییر خودکار را با نسخه اصلی بررسی کرده ام.
- [ ] من از فرهنگ لغت کنترل شده و استاندارد داده استفاده کردم.
- [ ] تفسیر چینه شناسی را بر اساس قضاوت کارشناسان انجام دادم.