سود:
- امکان استخراج الگوها از مجموعه های بزرگ متن با استفاده از تکنیک هایی مانند NER، استخراج رابطه، جدول زمانی و تحلیل شبکه
- توانایی دیدن الگو به عنوان یک فرضیه به جای شواهد، پیوند دادن موجودیت ها به منبع و عادی سازی آنها با تایید انسان
- توانایی درک اینکه چگونه اعداد به دلیل داده های از دست رفته و سوگیری نمونه گیری گمراه کننده هستند و از روابط ساختگی و زمان بندی جلوگیری می کند.
تحقیق تاریخی فقط خواندن اسناد فردی نیست. اغلب به دنبال الگوها در مجموعه های بزرگ اسناد هستند. یک نام خاص در طول سال ها در چه زمینه هایی ظاهر می شود؟ کدام افراد با یک شهرک مرتبط هستند؟ چگونه یک موضوع در طول زمان تغییر می کند؟ چه کسی با چه کسی مکاتبه می کند؟ چنین سؤالاتی مستلزم بررسی نه یک سند، بلکه صدها سند به طور جمعی است. این اغلب علوم انسانی دیجیتال نامیده می شود - کاربرد روش های محاسباتی در زمینه هایی مانند تاریخ و ادبیات.
هوش مصنوعی در استخراج اطلاعات ساختاریافته از مجموعههای بزرگ متن قدرتمند است. در این بخش، NER (تشخیص موجودیت با نام)، استخراج الگو و رابطه، منطق مدلسازی موضوع و ایجاد جدول زمانی را یاد خواهید گرفت. اما ما همچنین خطرناک ترین دام این تکنیک ها را مورد بحث قرار خواهیم داد – هوش مصنوعی که خود را به عنوان «پیدا کردن» الگویی که وجود ندارد نشان می دهد.
تکنیک های اساسی
- NER (Named Entity Recognition): استخراج خودکار موجوداتی مانند شخص، مکان، موسسه، تاریخ از متن. فهرستی مانند "همه نام مکان های ذکر شده در این 500 سند" را در عرض چند دقیقه ایجاد می کند.
- استنتاج رابطه: علامت گذاری پیوندها بین موجودیت ها («شخص X در مکان Y»، «A مطابق با B است»).
- مدلسازی موضوع: یافتن آماری خوشههایی از موضوعات تکرارشونده در یک مجموعه بزرگ از متن. نشان می دهد که کدام موضوعات در کدام دوره متمرکز شده اند.
- استنتاج خط زمانی: ترتیب وقایع تاریخ در اسناد به ترتیب زمانی.
- تجزیه و تحلیل شبکه: تجسم روابط بین فردی / نهادی به عنوان یک شبکه (چه کسی مرکز است، چه کسی نقطه اتصال است).
هدف مشترک همه اینها آشکار ساختن ساختارهایی است که در یک سند ظاهر نمی شوند بلکه در کل مجموعه ظاهر می شوند. این تکنیک ها الگوهای قابل مشاهده ای را می سازند که هرگز از طریق خواندن به تنهایی قابل مشاهده نیستند. اما هر یک از آنها «نشانه» است، نه «مدرک»; بررسی آنچه در سند اصلی یافت می شود ضروری است.
مفهومی که اغلب در این زمینه مورد استفاده قرار می گیرد، تمایز بین خواندن نزدیک (خواندن متن در عمق، خط به خط) و خواندن از راه دور (نگاه کردن به صدها / هزاران متن به طور جمعی، آماری) است. هوش مصنوعی خواندن از راه دور را امکانپذیر میکند: شما الگوهایی را در مجموعهای میبینید که به اندازه کافی بزرگ است تا یک عمر انسان را دوام بیاورد. اما هنگامی که خواندن از راه دور به یک الگو اشاره می کند، لازم است به خواندن نزدیک، یعنی به سند اصلی برگردیم تا آن را معنا کنیم. این دو روش قابل تعویض نیستند. یکی الگو را نشان می دهد، دیگری معنای آن را می دهد. قوی ترین تحقیقات از هر دو با هم استفاده می کنند.
نکته: از تجزیه و تحلیل الگو به عنوان یک مولد فرضیه استفاده کنید: "هوش مصنوعی یک الگو را در اینجا مشاهده کرده است، آیا واقعی است؟" سپس آن الگو را در اسناد یکی یکی بررسی کنید. الگو نقطه شروع تحقیق شماست نه نتیجه.
گردش کار: گام به گام
1. سوال را روشن کنید. "کدام افراد بیشتر در این مجموعه با هم ظاهر می شوند؟" یک سوال الگوی روشن مانند.
2. داده ها را آماده و برچسب گذاری کنید. متن را با منابع منبع سازماندهی کنید تا هر دارایی یافت شده بتواند به سند پیوند داده شود.
3. موجودیت/الگو ظاهر می شود. NER، رابطه یا جدول زمانی را با هوش مصنوعی ایجاد کنید.
4. عادی کنید. املای مختلف یک شخص/مکان را با هم ترکیب کنید ("استانبول / استانبول / کوستانتینیه" در همان مکان؟). این مرحله حیاتی است. اگر حذف شود، الگو از بین می رود.
5. تأیید در سند. اسناد واقعی را برای الگوهای مهمی که پرچم گذاری شده اند بررسی کنید. مطمئن شوید که هوش مصنوعی پیوند ساختگی اضافه نمی کند.
6. نظر دهید. معنای الگو، قضاوت مورخ است. هوش مصنوعی فقط الگو را مشخص می کند.
تله اعداد و آمار
تجزیه و تحلیل الگو اغلب اعداد را تولید می کند: "نام X 47 بار رخ می دهد"، "این موضوع در 30٪ اسناد وجود دارد". این اعداد عینی به نظر می رسند اما می توانند گمراه کننده باشند:
- دادههای گمشده: اگر مجموعه قبلاً ناقص باشد (اسناد گم شدهاند، گروهی هرگز ثبت نشده است)، تعداد اسناد باقیمانده را نشان میدهد نه واقعیت.
- خطای عادی سازی: اگر املای یک نفر متفاوت باشد و به طور جداگانه شمارش شود، عدد نادرست خواهد بود.
- از دست دادن زمینه: "47 بار رخ می دهد" چیزی نمی گوید. نحوه گذراندن آن (مثبت / منفی، موضوع / مفعول) مهم است.
خروجی الگو
معنی ظاهری
ریسک واقعی
"X 47 بار رخ می دهد"
شخص مهم
مجموعه ناقص، تنوع املایی
"تم 30%"
موضوع غالب
سوگیری نمونه گیری
"A-B اغلب با هم"
رابطه صمیمی
تصادف، زمینه از دست رفته
"خط زمانی"
گاهشماری دقیق
اسناد بدون تاریخ، سفارش ساختگی
سه کیف کوچک
مورد 1 - تجزیه و تحلیل شبکه یک واسطه پنهان را نشان داد. یک محقق مجموعه مکاتباتی از 800 نامه را بررسی کرد. با هوش مصنوعی که به چه کسی مینویسد مشخص شد و شبکه ایجاد شد. این شبکه نشان داد که یک فرد به ظاهر بی اهمیت در نگاه اول در واقع نقطه کلیدی تماس بین دو گروه است. محقق روی نامه های این شخص تمرکز کرد و به یافته جدیدی رسید. اما ابتدا تمام پیوندهای موجود در اسناد را تأیید کرد.
مورد 2 - خطای عادی سازی شماره را خراب کرد. دانش آموزی از آنها خواست تعداد دفعاتی که یک مکان در اسناد ظاهر شده است بشمارند. از آنجایی که هوش مصنوعی سه املای مختلف یک مکان را جداگانه شمارش کرد، این عدد یک سوم عدد واقعی بود. هنگامی که املاها با هم ترکیب شدند، مکان در واقع در جایگاه سوم قرار داشت. درس: بدون عادی سازی نمی توان به عدد اعتماد کرد.
مورد 3 - جدول زمانی ساخته شده. یک محقق یک جدول زمانی از اسناد بدون تاریخ ایجاد کرد. هوش مصنوعی وقایع ناشناخته را به ترتیب «منطقی» مرتب کرد و یک زمان بندی دقیق ارائه کرد. با این حال، این دنباله در اسناد نبود، هوش مصنوعی آن را ساخته بود. درس: جدول زمانی فقط از رویدادهایی ساخته می شود که تاریخ در سند دارند. بقیه "بدون تاریخ" باقی می ماند.
چهار قالب قابل کپی
1) NER (استنتاج موجودیت):
افراد، مکانها، مؤسسات و تاریخهای ذکر شده در اسناد زیر بهعنوان فهرستهای مجزا ظاهر میشوند. مشخص کنید که در کدام سند (مرجع) هر موجودیت ذکر شده است. فقط آنچه را که به وضوح در متن آمده است در نظر بگیرید. با حدس زدن اضافه کنید اگر از تلفظ مطمئن نیستید، [؟] را علامت بزنید. اسناد: [اینجا]
2) عادی سازی موجودیت:
در فهرست موجودیت زیر، املای متفاوتی را که میتوانند یک فرد/مکان باشند گروهبندی کنید (مثلاً «استانبول / کنستانتینیه»). فرمت مشترک احتمالی را برای هر گروه پیشنهاد کنید، اما ترکیب دقیق را تحمیل نکنید. یادداشت را اضافه کنید "شاید یکسان باشد، اجازه دهید افراد تایید کنند". اگر مطمئن نیستید آن را به حال خود رها کنید. فهرست: [اینجا]
3) طرح کلی رابطه/شبکه:
پیوندهای "چه کسی با چه کسی مرتبط است" را از مجموعه مکاتبات/اسناد زیر استخراج کنید. برای هر پیوند، مشخص کنید که بر اساس کدام سند (مرجع) است. رابطه ای ایجاد کرد که به وضوح در سند وجود ندارد. پیوندهای مبهم [نامشخص] را علامت گذاری کنید. مستندات: [اینجا]
4) جدول زمانی تاریخ:
فقط وقایعی را که به وضوح در اسناد زیر بیان شده اند به ترتیب زمانی فهرست کنید. هر رویداد را به منبع آن پیوند دهید. رویدادهای دارای تاریخ نامشخص را به طور جداگانه تحت عنوان "بدون تاریخ" فهرست کنید، آنها را به ترتیب قرار ندهید. تاریخ تخمینی را تعیین نکنید. مستندات: [اینجا]
اعلان ضعیف / اعلان قوی
ضعیف:
این اسناد را تجزیه و تحلیل کنید و الگوهای مهم، روابط و جدول زمانی را استخراج کنید.
«استخراج الگوهای مهم» هوش مصنوعی را به اختراع اتصالات غیرموجود و زمانشناسی دقیق سوق میدهد و اعداد را بدون عادیسازی ارائه میکند.
قوی:
با اتصال هر یک به مرجع سند، شخص/مکان/موسسه را از اسناد زیر استخراج می کند. املاهای مختلفی را علامت بزنید که ممکن است با "ممکن است ادغام شوند" یکسان باشند، اما ادغام نشوند. روابطی که به وضوح در سند بیان نشده است و رویدادهایی با تاریخ نامشخص جعلی نیستند. آنهایی که تاریخ ندارند را جدا نگه دارید مستندات: [اینجا]
تفاوت: انتساب به منبع، واگذاری عادی سازی به انسان، ممنوعیت پیوندهای ساختگی/تاریخ، و جداسازی رویدادهای بدون تاریخ، این الگو را قابل دفاع می کند.
اشتباهات رایج
- اشتباه گرفتن الگو برای شواهد الگوی فرضیه است. در سند تأیید می شود.
- رد شدن از عادی سازی املای مختلف یک موجودیت، عدد و شبکه را تحریف می کند.
- اعتماد کورکورانه به اعداد گردآوری ناقص و سوگیری نمونه گیری باعث گمراه شدن تعداد می شود.
- جدول زمانی ساخته شده رویدادهای بدون تاریخ در گاهشماری گنجانده نشده است.
- نادیده گرفتن زمینه مهم این است که «چند بار تصویب شد»، بلکه «چگونه گذشت» است.
به طور خلاصه
تجزیه و تحلیل محتوا و کشف الگو یک زمینه قدرتمند است که در آن هوش مصنوعی ساختارهای قابل مشاهده ای را ایجاد می کند که تنها از طریق خواندن قابل مشاهده نیستند: استخراج موجودیت، شبکه های ارتباطی، خوشه های موضوعی، جدول زمانی. اما هر الگوی یک فرضیه است، نه مدرک. دارایی ها را به منبع پیوند دهید، با دقت و با اعتبار انسانی، اعداد پرس و جو برای داده های از دست رفته و سوگیری را عادی سازی کنید، از روابط ساختگی و زمان بندی اجتناب کنید. هوش مصنوعی الگو را مشخص می کند. معنای آن و اینکه آیا درست است قضاوت مورخ است.
وظیفه کاربردی
حداقل 15 قطعه سند (با منابع) جمع آوری کنید. افراد و موجودیت های مکان را با الگوی "NER" استخراج کنید. سپس املای مختلف را با "هنجارسازی نهاد" گروه بندی کنید و خودتان گروه ها را تایید کنید. در نهایت، الگوی «خط زمانی تاریخ» را اجرا کنید و ببینید چه تعداد از رویدادها «بدون تاریخ» باقی میمانند. مقایسه کنید که هوش مصنوعی چه تعداد پیوند یا گاهشماری ساختگی را با درخواست ضعیف ایجاد می کند.
چک لیست
- [ ] من سوال الگوی خود را به وضوح تعریف کرده ام.
- [ ] من هر نهادی را به مرجع سند پیوند داده ام.
- [ ] من تایپ موجودیت را عادی کردم و آن را با تایید انسانی ترکیب کردم.
- [ ] من اعداد را به دلیل داده های از دست رفته و سوگیری زیر سوال بردم.
- [ ] من رویدادهای بدون تاریخ را در گاه شماری قرار ندادم، آنها را جداگانه نگه داشتم.