واحد 3 / 11

زبانشناسی و تجزیه و تحلیل بدنه: خواندن واژگان با اعداد

سود:

  • امکان پیش‌نویس اندازه‌گیری‌های پیکره‌ای مانند فراوانی کلمات، هم‌آهنگی، غنای واژگان و کلمات کلیدی با هوش مصنوعی
  • دانستن این که هوش مصنوعی در شمارش دقیق غیرقابل اعتماد است و قادر به تأیید هر شمارش با یک ابزار جداگانه
  • توانایی درک اینکه یک عدد به خودی خود چیزی نمی گوید و تفسیر زبانی که معنی را مشخص می کند متعلق به انسان است.

مطالعات ادبیات و زبان فقط «تفسیر» نیستند. همچنین جنبه قابل اندازه گیری و شمارش دارد. نویسنده چقدر از کلمات مختلف استفاده می کند، دوست دارد کدام کلمات را با کدام کلمات به کار ببرد، کدام کلمات در یک دوره رایج می شود - اینها از طریق زبان شناسی (علمی که صدا، ساختار، معنا و کاربرد زبان را مطالعه می کند) و به ویژه زبان شناسی پیکره بررسی می شود. مجموعه مجموعه ای از متون است، مانند آثار کامل یک نویسنده، آرشیو سالانه یک روزنامه، یا اشعار یک دوره. تجزیه و تحلیل بدنه به دنبال الگوهای عددی در این بخش است.

در این بخش، ما یاد خواهیم گرفت که از هوش مصنوعی به عنوان دستیار تجزیه و تحلیل پیکره استفاده کنیم: استخراج سریع معیارهایی مانند بسامد کلمه (تعداد دفعاتی که یک کلمه در متن رخ می دهد)، ترکیب (جفت کلماتی که اغلب با هم اتفاق می افتد، به عنوان مثال "سیاه" + "بخت من")، غنای واژگان، و تنوع فصلی. اما یک هشدار از ابتدا: هوش مصنوعی هنگام شمارش به تنهایی ممکن است اشتباه کند. ابزارهای خاصی برای شمارش های بزرگ و دقیق مورد نیاز است و شما زبان شناس هستید که معنای هر عدد را تعیین می کنید.

هوش مصنوعی کجا در تحلیل پیکره قوی و کجا ضعیف است؟

نقاط قوت آن عبارتند از: شناخت الگوها در متون کوچک و متوسط، ایجاد فرضیه در مورد واژگان یک متن، پیشنهاد نامزدها برای ترکیب، تفسیر یک نتیجه، توصیف یک روش. هوش مصنوعی می پرسد "چه عباراتی در این نویسنده برجسته است؟" این یک شروع سریع به سوال می دهد.

ضعف: شمارش دقیق. هوش مصنوعی یک مدل زبان است، نه یک ماشین حساب. می تواند به سؤال «چند بار اتفاق افتاده» در یک متن طولانی پاسخ تقریبی و گاهی نادرست بدهد. برای فرکانس دقیق، آمار دقیق هم‌مکانی یا اسکن پیکره بزرگ هزاران کلمه، از نرم‌افزار تخصصی (مانند ابزارهای پیکره‌ای مانند AntConc یا صفحه‌گسترده) استفاده می‌شود. هوش مصنوعی در تفسیر خروجی این ابزارها ارزشمند است. اما او را مجبور نکنید کورکورانه شمارش خام را انجام دهد.

نکته: اگر به عدد دقیق نیاز دارید، از دو راه استفاده کنید: از ابزاری استفاده کنید که شمارش را در متن کوچک انجام دهد و هوش مصنوعی آن را تفسیر کند. یا تعداد هوش مصنوعی را داشته باشید و آن را به روش دیگری تأیید کنید. هرگز از جمله "AI گفت 47 بار رخ می دهد" را بدون تایید استفاده نکنید.

مطالعه بدنه گام به گام

  1. یک سوال مطرح کنید کلمات رنگی در این شاعر چگونه توزیع می شوند؟ شمارش بدون سوال واضحی مانند:
  2. پیکره را تعریف کنید. کدام متن ها؟ کدام نسخه؟ کدام دوره؟ مرز باید مشخص باشد.
  3. اندازه گیری را انتخاب کنید. بسامد، هم نشینی، غنای واژگان؟
  4. اندازه گیری و تأیید کنید. شمارش را انجام دهید، سپس راه دوم را تأیید کنید.
  5. نظر دهید. عدد به تنهایی چیزی نمی گوید. این نظر شماست که این یافته را معنادار می کند که "کلمات رنگی در دوره دوم دو برابر شد".

یک معیار پرکاربرد برای غنای واژگان، نسبت تعداد کلمات مختلف به تعداد کل کلمات (نسبت نوع/نشانه) است. اگر این نسبت زیاد باشد متن کلمه- تنوع است و اگر کم باشد به معنای تکراری است. اما این نسبت تحت تأثیر طول متن است. هنگام مقایسه مستقیم متون کوتاه و بلند مراقب باشید.

سه کیف کوچک

مورد 1 - تجمیع یک سبک را نشان داد. محققی جفت‌های صفت و اسم را در 3 رمان یک رمان‌نویس بررسی کرد. هوش مصنوعی پیشنهاد کرد که کلمه "رنگ پریده" با 5 اسم مختلف مطابقت دارد. محقق 4 متن را تأیید و 1 متن را ساختگی حذف کرد. الگوی تایید شده به بیانیه پایان نامه ای در مورد سبک توصیفی نویسنده تبدیل شد.

مورد 2 - خطای شمارش کشف شد. دانشجویی از هوش مصنوعی پرسید که چند بار کلمه "شب" در یک متن 2000 کلمه ای ظاهر می شود. هوش مصنوعی گفت: "23". وقتی دانش‌آموز متن را در صفحه‌گسترده انداخت و آن را شمارش کرد، عدد واقعی 17 بود. مشخص شده است که شمارش خام هوش مصنوعی غیرقابل اعتماد است.

مورد 3 - تغییرات دوره ای بحث و جدل را برانگیخت. یک گروه نسبت کلمات انتزاعی را در شعرهای اولیه و متأخر یک شاعر مقایسه کردند. اولین پیش نویس هوش مصنوعی یک روند را پیشنهاد می کرد. هنگامی که گروه به متن بازگشت و شمارش را تأیید کرد، این روند واقعی بود، اما "علل" پیشنهاد شده توسط هوش مصنوعی حدس و گمان غیرقابل تایید بود و حذف شد.

چهار قالب قابل کپی

1) طرح کلی فراوانی کلمه (با تأیید):

15 کلمه پرکاربرد محتوایی (به استثنای کلمات تابعی مانند حروف ربط و حروف اضافه) را با فراوانی تقریبی آنها در متن زیر فهرست کنید. هشدار: توجه داشته باشید که شمارش‌ها ممکن است دقیق نباشند و توجه داشته باشید که "برای دقیق بودن، باید با یک ابزار شمارش جداگانه تأیید شوند." متن: [متن را اینجا بچسبانید]

2) نامزدهای همکار:

جفت‌هایی از کلمات (هم‌آهنگی) را که اغلب با هم در متن زیر وجود دارند، پیشنهاد کنید. برای هر جفت حداقل یک نقل قول از متن ارائه دهید. جعل مضاعف که معادلی در متن ندارد. اگر مطمئن نیستید، آن را به‌عنوان «نیاز به تأیید» علامت‌گذاری کنید. متن: [paste text]

3) مقایسه واژگان:

من دو متن به شما می دهم. برای هر کدام: کل کلمات تقریبی، مشاهدات در مورد انواع مختلف کلمات، و حوزه های برجسته کلمه (مانند رنگ، طبیعت، احساسات). بیان کنید که اعداد تقریبی هستند. تفسیر مقایسه را به تایید من بسپارید. متن الف: [...] متن ب: [...]

4) تفسیر نتیجه:

من نتایج زیر را از یک ابزار شمارش به دست آوردم: [پست کردن نتایج]. 2-3 فرضیه درباره معنای زبانی این اعداد ایجاد کنید. هر فرضیه را به عنوان "نیاز به شواهد" علامت گذاری کنید و به من بگویید چگونه می توانم آن را آزمایش کنم. از اظهار نظر بیش از حد خودداری کنید.

اعلان ضعیف / اعلان قوی

ضعیف: "کدام کلمه بیشتر در این متن آمده است؟"

Strong: "پرتکرارترین کلمات محتوای این متن را با فراوانی تقریبی آنها فهرست کنید؛ کلمات تابع را حذف کنید. مشخص کنید که اعداد دقیق نیستند و باید با ابزار جداگانه تأیید شوند. برای هر کلمه یک جمله مثال بزنید."

اعلان قدرتمند باعث می شود هوش مصنوعی محدودیت تعداد را بپذیرد و از قبل به شما می گوید که تأیید لازم است. در اعلان ضعیف، هوش مصنوعی یک عدد را می دهد و شما نمی دانید که ممکن است اشتباه باشد.

جدول اندازه گیری و قابلیت اطمینان

اندازه گیری

آنچه نشان می دهد

هوش مصنوعی به تنهایی

راه درست

فراوانی کلمه

کلمات مکرر

درباره، خطرناک

شمارنده + تفسیر هوش مصنوعی

محل سکونت

کسانی که با هم گذشتند

نامزد تولید می کند

تایید از متن

نسبت نوع/توکن

تنوع کلامی

می تواند گمراه کننده باشد

حساب با ابزار

تغییر فصلی

روند در طول زمان

فرضیه ایجاد می کند

اندازه گیری و تأیید کنید

نظر پایانی

معنی

قدرتمند اما اغراق آمیز

قضاوت انسان

کلمات کلیدی و مفاهیم n-gram

دو مفهوم کار شما را در تحلیل پیکره آسان تر می کند. اولین مورد کلمه کلیدی است (کلمه کلیدی در انگلیسی - کلمه ای که در یک متن یا نویسنده در مقایسه با زبان عمومی بسیار بیشتر از حد انتظار وجود دارد و به آن متن "شخصیت" آن می دهد). کلمات کلیدی نویسنده علایق و سبک او را آشکار می کند. برای مثال، اگر «دریا» و «جدایی» بیش از آنچه انتظار می رود در شاعری رخ دهد، این برآمدگی آماری نقطه شروع یک تفسیر می شود. برای شناسایی کلمات کلیدی، لازم است فرکانس های یک متن را با فرکانس های یک پیکره مرجع (متن کلی و بزرگی که برای مقایسه استفاده می شود) مقایسه کنیم. این مقایسه یک کار ابزار قطعی است، این یک محاسبه است که هوش مصنوعی به تنهایی نمی تواند آن را به طور قابل اعتماد انجام دهد.

دومی n-gram است (توالی از n کلمه متوالی در یک متن؛ دنباله ای از دو کلمه "bigram" نامیده می شود، دنباله ای از سه کلمه "تریگرام" نامیده می شود). تجزیه و تحلیل N-gram عبارات فرمولی نویسنده و عبارات پرکاربرد را نشان می دهد. برای مثال، اگر نویسنده‌ای از عباراتی مانند «نوعی» یا «اما» به‌طور مکرر استفاده کند، این نشان‌دهنده عادت او به جمله‌سازی است. هوش مصنوعی می تواند این عبارات را به عنوان نامزد پیشنهاد کند. اما برای فراوانی واقعی و اهمیت آماری لازم است به ابزار شمارش برگردیم.

نکته: به هوش مصنوعی بگویید: "عبارات قابل توجه (دو یا سه کلمه) در این متن را به عنوان نامزد فهرست کنید و برای هر یک از متن یک مثال بزنید." لیست نامزدها را بردارید و فرکانس واقعی را با ابزار جداگانه اندازه گیری کنید. هوش مصنوعی را به عنوان «اطلاع دهنده»، عامل را به عنوان «مشتری» و خود را به عنوان «مترجم» قرار دهید.

اشتباهات رایج

  • با تکیه بر تعداد خام هوش مصنوعی. هوش مصنوعی یک ماشین حساب نیست. عدد دقیق را با ابزار جداگانه بررسی کنید.
  • ارائه شماره بدون نظر. "47 بار گذشت" چیزی نمی گوید; شما معنا را ایجاد می کنید.
  • نادیده گرفتن طول متن نرخ های تنوع شعر به طول حساس هستند.
  • ساخت پایان نامه بدون تایید همتای. زوج های غیر هوش مصنوعی ممکن است پیشنهاد دهند؛ از روی متن تایید کنید.
  • نظر افراطی "دلایل" پیشنهاد شده توسط هوش مصنوعی را بدون مدرک نپذیرید.

به طور خلاصه

تجزیه و تحلیل پیکره، جنبه قابل شمارش ادبیات را باز می کند: فراوانی، ترکیب، واژگان، تغییرات دوره ای. هوش مصنوعی در این زمینه در تشخیص الگوها و تفسیر نتایج قدرتمند است. اما در شمارش مطلق غیر قابل اعتماد است. شماره را با ابزار جداگانه تأیید کنید، ترکیب‌بندی‌ها را از متن تأیید کنید و معنای هر عدد را خودتان مشخص کنید. عدد مدرک نیست، دری است برای شواهد.

وظیفه کاربردی

یک متن کوتاه (500-1000 کلمه) انتخاب کنید. یک کلمه محتوا را شناسایی کنید (مثلاً "شب" یا "جاده"). ابتدا خود را در متن حساب کنید. سپس از هوش مصنوعی بخواهید آن را بشمارد. دو نتیجه را مقایسه کنید؛ در صورت وجود اختلاف علت را بررسی کنید. سپس یک نظر یک پاراگرافی در مورد عملکرد آن کلمه در متن بنویسید - تبدیل عدد به معنی.

چک لیست

  • [ ] من یک سوال زبانشناختی واضح مطرح کردم.
  • [ ] من مرزهای پیکره (متن، ویرایش، نقطه) را مشخص کردم.
  • [ ] من تعداد هوش مصنوعی را به روش دوم تأیید کردم.
  • [ ] من ترکیب های متن را تأیید کردم.
  • [ ] شماره را بدون نظر نگذاشتم. معنا را خودم ساختم.