واحد 2 / 11

هوش مصنوعی در فهرست نویسی و تولید فراداده

سود:

  • امکان کوتاه کردن زمان فهرست نویسی با تولید پیش نویس ابرداده مطابق با استانداردهایی مانند MARC و Dublin Core از اطلاعات چاپ واقعی
  • امکان تأیید فیلدهای با خطر ساخت بالا، مانند سال انتشار، ISBN، نام نویسنده، با منبع اصلی و عبارات موضوع نقشه از واژگان کنترل شده
  • امکان ایجاد فرمت های نویسنده و موضوع به صورت تک مورد تایید با کنترل قدرت و حفظ ثبات کاتالوگ

فهرست نویسی نامرئی اما اساسی ترین کار کتابداری است. کشف منبع (کتاب، مقاله، نقشه، ضبط صدا، فایل دیجیتال) با ابرداده صحیح امکان پذیر است. فراداده به معنای «داده‌های مربوط به داده‌ها» است: اطلاعات ساختاری که عنوان، نویسنده، سال انتشار، موضوع، زبان و ویژگی‌های فیزیکی منبع را توصیف می‌کند. اگر ابرداده خوب باشد، کاربر منبع را پیدا می کند. اگر بد یا ناقص باشد، منبع حتی اگر وجود داشته باشد از بین می رود. در این بخش شما یاد خواهید گرفت که چگونه از هوش مصنوعی در تولید پیش نویس ابرداده استفاده کنید، اما چگونه از انطباق و دقت استانداردها اطمینان حاصل کنید.

اجازه دهید ابتدا این دو مفهوم را تعریف کنیم. MARC (Machine-Readable Cataloging) فرمت رکوردی است که کتابخانه ها برای چندین دهه از آن استفاده کرده اند و هر بخش از اطلاعات را در فیلدهای شماره گذاری شده قرار می دهد. به عنوان مثال، فیلد 245 دارای عنوان و فیلد 100 دارای نویسنده اصلی است. Dublin Core یک استاندارد فراداده ساده شده برای منابع دیجیتال است که از 15 زمینه اصلی (عنوان، خالق، موضوع، تاریخ، ژانر و غیره) تشکیل شده است. این استانداردها تضمین می کنند که رکوردهای کتابخانه های مختلف می توانند با یکدیگر صحبت کنند.

گام به گام: ایجاد پیش نویس ابرداده با هوش مصنوعی

1. اطلاعات هویتی منبع را جمع آوری کنید. جلد کتاب، صفحه عنوان، مطالب یا متن یک فایل دیجیتالی. هوش مصنوعی فقط بر اساس اطلاعاتی که به آن می دهید کار می کند. اگر اطلاعات ناقص ارائه دهید، ابرداده ناقص یا ساختگی تولید می کند.

2. استاندارد هدف را مشخص کنید. به هوش مصنوعی یک هدف واضح بدهید، مانند «توسط فیلدهای هسته دوبلین» یا «با فیلدهای MARC 245، 100، 260، 650». اگر استانداردی را مشخص نکنید، یک قالب دلخواه تولید می کند.

3. پیش نویس را تهیه کنید. هوش مصنوعی عنوان، بیانیه مسئولیت، اطلاعات انتشارات و پیشنهاد موضوع را از اطلاعاتی که ارائه می‌دهید تهیه می‌کند.

4. اعمال کنترل اختیار. سوابق معتبر رکوردی است که شکل واحد و استاندارد نام، مؤسسه یا موضوع یک نویسنده را تعیین می کند (به عنوان مثال، "آتاتورک، مصطفی کمال، 1881-1938"). هوش مصنوعی می تواند یک نام را به روش های مختلف بنویسد. شما فرمت مرجع تایید شده را بررسی و تصحیح کنید.

5. تایید و تایید کنید. هر فیلد را با منبع اصلی مقایسه کنید. به ویژه، اطلاعات دقیقی مانند سال انتشار، ISBN و نام نویسنده بسیار مستعد جعل شدن توسط هوش مصنوعی هستند.

نکته: به هوش مصنوعی عکس یا متنی از صفحه اعتبار واقعی منبع بدهید. نگویید «نام کتاب را حدس بزنید». ابرداده های پیش بینی کننده قابلیت اطمینان کاتالوگ را تضعیف می کند. هوش مصنوعی هنگام پیش بینی با اطمینان می نویسد و این شما را گمراه می کند.

واژگان کنترل شده و سازگاری

ثبات همه چیز در فهرست نویسی است. اگر یک موضوع با دو عبارت مختلف در دو رکورد مختلف نوشته شود، کاربر یکی را پیدا می کند و دیگری را از دست می دهد. به همین دلیل است که کتابخانه‌ها از واژگان کنترل‌شده استفاده می‌کنند - یک فهرست استاندارد و تأیید شده از اصطلاحات. When suggesting terms from free text, AI can choose its colloquial equivalent rather than the official term in this list. به عنوان مثال، AI ممکن است "حمله قلبی" را بنویسد. در حالی که اصطلاح تایید شده ممکن است "انفارکتوس میوکارد" باشد.

راه حل این است که واژگان کنترل شده را به هوش مصنوعی بدهید و بگویید "فقط از این لیست انتخاب کنید". بنابراین، هوش مصنوعی به جای اینکه اصطلاحات را آزادانه بسازد، مناسب ترین مورد را از لیست تایید شده مطابقت می دهد.

احتیاط: اگر اصطلاح موضوعی پیشنهاد شده توسط هوش مصنوعی در واژگان کنترل شده وجود ندارد، آن عبارت را به کاتالوگ اضافه نکنید. تصمیم برای افزودن شرایط جدید به عهده کارشناس مسئول مدیریت مرجع است. افزودن عبارات دلخواه، انسجام کاتالوگ را مختل می کند.

سه کیف کوچک

مورد 1 - جمع آوری کمک ها تسریع شد. یک کتابخانه عمومی 1200 جلد کتاب اهدا کرد. متخصص فهرست‌نویسی از هوش مصنوعی خواسته بود که صفحه چاپ هر کتاب را بخواند و پیش‌نویسی از هسته دوبلین تهیه کند. زمان هر ضبط از 9 دقیقه به 3.5 دقیقه کاهش یافت. کارشناس زمان باقیمانده را به بررسی و تأیید اعتبار اختصاص داد. زمان کل تقریباً 55٪ کاهش یافت، اما هیچ رکوردی بدون تأیید به سیستم وارد نشد.

مورد 2 - ISBN جعلی دستگیر شد. یک متخصص از هوش مصنوعی خواست پیش نویس 30 کتاب را تهیه کند. او در حین بررسی متوجه شد که شابک موجود در 4 رکورد جعلی است: هوش مصنوعی یک عدد 13 رقمی نوشته بود که معقول به نظر می رسید، حتی با وجود اینکه شماره واقعی کتاب را نمی دانست. مرحله تأیید از ماندگاری چهار ISBN نادرست در کاتالوگ جلوگیری کرد.

مورد 3 - تناقض اختیار اصلاح شد. کتابخانه ای نویسنده ای را به نام «جی. اسمیت» در برخی اسناد، «جان اسمیت» در برخی دیگر، «اسمیت، جان» در برخی دیگر یافت. هوش مصنوعی با فایل مرجع تطبیق داده شد و تمام رکوردها را در یک قالب تایید شده قرار داد ("Smith, John, 1965-"). اگر این کار به صورت دستی انجام می شد روزها طول می کشید اما با پیشنهاد هوش مصنوعی به چند ساعت کاهش یافت اما هر مسابقه توسط کارشناس تایید شد.

تبدیل گذشته نگر و سوابق قدیمی

بسیاری از کتابخانه ها دارای سوابق ناقص یا قدیمی هستند که سال ها پیش با قوانین مختلف وارد شده اند. انتقال این موارد به استاندارد فعلی تبدیل گذشته نگر نامیده می شود و زمانی که به صورت دستی انجام شود بسیار پر زحمت است. هوش مصنوعی می تواند یک رکورد قدیمی را بخواند و یک پیش نویس ایجاد کند تا آن را به ساختار فیلد فعلی منتقل کند: به عنوان مثال، می تواند یک نقل قول متن آزاد را تجزیه کرده و آن را در فیلدهای صحیح توزیع کند. با این حال، در اینجا دو خطر وجود دارد. اول، هوش مصنوعی می‌تواند اطلاعات از دست رفته را برای "تشکیل" جبران کند. دوم، ممکن است با کپی کردن آن در فرمت جدید به جای اصلاح، یک خطا را در رکورد قدیمی تداوم بخشد. بنابراین، در تبدیل گذشته نگر، خروجی هوش مصنوعی باید به طور سیستماتیک بررسی شود، نه با نمونه گیری، بلکه توسط زمینه های بحرانی (نویسنده، سال، اعداد شناسایی). یک روش خوب این است که رکوردهای قبل و بعد از تبدیل را در کنار هم نمایش دهید و هر تغییر را قابل مشاهده کنید. بنابراین متخصص می تواند در یک نگاه متوجه شود که چه چیزی جابجا شده است، چه چیزی تغییر کرده است و چه چیزی ممکن است ساخته شده باشد.

توجه: پیش نویس ابرداده تولید شده توسط هوش مصنوعی نباید به صورت دسته ای بدون بررسی یک به یک به سیستم منتقل شود. یک خطای انبوه صدها رکورد را به طور همزمان خراب می کند و بازیابی بسیار مشکل تر از تولید است. تولید و تأیید در دسته های کوچک ایمن ترین است.

چهار قالب قابل کپی

1) طرح کلی Dublin Core:

نقش شما: دستیار فهرست نویس. فیلدهای Dublin Core را از متن زیر پر کنید: عنوان، سازنده، موضوع، توضیحات، ناشر، تاریخ، ژانر، قالب، زبان. فقط از اطلاعاتی استفاده کنید که در متن واضح باشد. فیلد گم شده "[بدون اطلاعات]" را رها کنید، حدس نزنید. چاپ متن: [اینجا]

2) طرح کلی میدان MARC:

طرح‌هایی را برای فیلدهای MARC زیر از اطلاعات کتاب زیر پیشنهاد کنید: 245 (عنوان/اعتبار)، 100 (نویسنده اصلی)، 260/264 (نشر)، 300 (توضیحات فیزیکی)، 650 (موضوع). هر فیلدی را که مطمئن نیستید به عنوان «[نیاز به تأیید]» علامت بزنید. اطلاعات: [اینجا]

3) تطبیق موضوع از واژگان کنترل شده:

در زیر خلاصه ای از منبع و فهرستی از اصطلاحات موضوع تایید شده آمده است. فقط 3-5 مناسب ترین عبارت را از فهرست با منبع مطابقت دهید. اگر اصطلاح مناسبی در لیست وجود ندارد، بنویسید "هیچ عبارت مناسبی در لیست وجود ندارد"، اصطلاحات جدیدی را ایجاد نکنید. خلاصه: [اینجا] / فهرست اصطلاحات: [اینجا]

4) کنترل فرم مرجع:

نام نویسندگان زیر را با فرم‌های تایید شده در فهرست مرجعی که ارائه کردم، مطابقت دهید. برای هر نام: قالب در رکورد -> فرمت تایید شده. اگر معادلی در لیست وجود ندارد، بنویسید «عدم سابقه معتبر». نام ها: [اینجا] / فهرست مقامات: [اینجا]

اعلان ضعیف / اعلان قوی

اعلان ضعیف:

اطلاعات فهرست نویسی کتاب زیر را استخراج کنید: «هوش مصنوعی و جامعه».

فقط عنوان داده شده است؛ هوش مصنوعی مجبور است نویسنده، سال، ناشر و ISBN را تشکیل دهد. هیچ استاندارد هدفی وجود ندارد. نتیجه: یک رکورد قانع کننده اما احتمالاً نادرست.

اعلان قدرتمند:

نقش شما: دستیار فهرست نویس. در زیر متن کامل صفحه چاپ کتاب آمده است. فیلدهای Dublin Core را از این قسمت پر کنید. فقط از اطلاعاتی استفاده کنید که به وضوح در متن بیان شده است. فیلد غیر متنی را خالی بگذارید و «[no information]» را بنویسید. هیچ تاریخ، نام یا ISBN ساخته نشده است. چاپ متن: [متن کامل اینجا]

دستور قدرتمند هوش مصنوعی را به اطلاعات خطی واقعی محدود می‌کند و آن را مجبور می‌کند به جای ساختن آنها، صادقانه جاهای خالی بگذارد.

فیلد فوق داده و جدول اعتبار سنجی

منطقه

خطر ساخت

نحوه تایید

عنوان

پایین

مقایسه با صفحه چاپ

فرمت نویسنده/مرجع

متوسط

جستجو در فایل مرجع

سال انتشار

بالا

با imprint/colophone تایید کنید

شابک

بسیار بالا

کنترل یک به یک با بارکد/منبع

اصطلاح موضوع

بالا

مطابقت در واژگان کنترل شده

اشتباهات رایج

  • فقط درخواست ابرداده از عنوان. اطلاعات ناقص هوش مصنوعی را وادار می کند تا همه چیز را درست کند.
  • عدم تعیین استاندارد هدف قالب بندی خودسرانه هماهنگی رکوردها را مختل می کند.
  • پذیرش ISBN و سال بدون تأیید آن. این مناطق بیشترین خطر ساخت را دارند.
  • گرفتن اصطلاح موضوعی از خارج از واژگان کنترل شده. سازگاری و در دسترس بودن به خطر افتاده است.
  • دور زدن کنترل قدرت همان نویسنده در قالب های مختلف پراکنده می شود، کاربر منبع را از دست می دهد.

به طور خلاصه

در تولید ابرداده، هوش مصنوعی دستیار قدرتمندی است که به سرعت اطلاعات چاپی را استخراج می کند و زمان فهرست نویسی را به میزان قابل توجهی کوتاه می کند. اما قیمت بهره‌وری اعتبارسنجی دقیقی در برابر خطرات ساخت است: استاندارد هدف (MARC، Dublin Core) را شفاف کنید، هوش مصنوعی را فقط با دانش واقعی کلمات کلیدی اجرا کنید، اصطلاحات موضوع را از واژگان کنترل‌شده ترسیم کنید، و فرم‌های معتبر را تأیید کنید. به جای جبران شکاف ها، هوش مصنوعی باید صادقانه آن را خالی بگذارد. شما تایید نهایی را حفظ کنید.

وظیفه کاربردی

متن صفحه چاپ یک کتاب واقعی را با الگوی "Dublin Core draft" به هوش مصنوعی بدهید و یک پیش نویس بگیرید. سپس همان کتاب را فقط با عنوان ("سریع ضعیف") تولید کنید و این دو خروجی را با هم مقایسه کنید: کدام فیلدها ساخته شده اند؟ سپس، با الگوی «نگاشت موضوع از واژگان کنترل‌شده»، فهرست کوتاهی از اصطلاحات تأیید شده ارائه دهید تا موضوع مطابقت داشته باشد و بررسی کنید که آیا هوش مصنوعی از فهرست خارج می‌شود یا خیر.

چک لیست

  • [ ] من اطلاعات هویت واقعی منبع را به هوش مصنوعی دادم، آن را به حدس زدن نگذاشتم.
  • [ ] من استاندارد فراداده هدف (MARC/Dublin Core) را به وضوح مشخص کرده ام.
  • [ ] من سال انتشار و ISBN را کلمه به کلمه با منبع اصلی تأیید کرده ام.
  • [ ] من عبارات موضوع را از واژگان کنترل شده ترسیم کردم.
  • [ ] من فرم های اختیار را با سابقه تایید شده تایید کرده ام.