واحد 10 / 11

تایید، توهم، و یکپارچگی علمی

سود:

  • توانایی درک اینکه توهم در مدل زبانی ذاتی است و روش تأیید مناسب را برای هر نوع خروجی انتخاب کنید.
  • مقادیر بحرانی را به دو روش مستقل با مثلث بندی بررسی کنید و روان بودن را با دقت اشتباه نگیرید
  • توانایی اعمال شفافیت، ردیابی، یکپارچگی داده ها و مسئولیت انسانی به عنوان پایه یکپارچگی علمی

یک عبارت واحد بارها و بارها در سراسر این ماژول بازگشت: "هوش مصنوعی تولید می کند، انسان ها تایید می کنند." در این واحد آن جمله را به یک سیستم تبدیل می کنیم. هدف شناسایی توهم (تولید اطلاعات نادرست/ساخته با زبانی مطمئن) که خطرناک ترین رفتار هوش مصنوعی است، ایجاد یک روش راستی آزمایی مشخص برای هر نوع خروجی و قرار دادن همه اینها در چارچوب یکپارچگی علمی (صداقت، شفافیت، قابلیت ردیابی) است. یک خروجی AI تایید نشده در شیمی فقط یک اشتباه نیست. این می تواند آزمایشی در حال انفجار، مسموم شدن فردی یا جمع شدن کاغذ باشد.

چرا توهم اجتناب ناپذیر است؟

مدل زبان بزرگ «محتمل ترین کلمه بعدی» را تولید می کند. هدف آن چیزی است که ممکن است، نه آنچه حقیقت است. بنابراین او می تواند یک وزن مولکولی، یک DOI یا یک نقطه جوش را با مقداری که «معقول به نظر می رسد» پر کند - بدون اینکه بررسی کند که آیا واقعی است یا خیر. توهم یک نقص در عملکرد نیست، بلکه نتیجه ماهیت این فناوری است. راه حل «تلاش برای اصلاح» مدل نیست، بلکه ایجاد یک پوسته اعتبارسنجی در اطراف هر خروجی است.

موذیانه ترین جنبه توهم، زبان مطمئن آن است. یک وزن مولکولی نادرست دقیقاً با همان اطمینان وزن صحیح ارائه می شود. بنابراین "با اعتماد به نفس به نظر می رسد" هرگز به معنای "درست" نیست.

توجه: اینکه هوش مصنوعی چقدر روان و مطمئن در مورد یک موضوع صحبت می کند به صحت آن اطلاعات ارتباطی ندارد. روانی متقاعد می کند؛ فقط منبع مستقل صحت را تعیین می کند.

اعتبارسنجی بر اساس نوع خروجی در شیمی

هر نوع خروجی روش تأیید خاص خود را دارد. به جای حفظ کردن یک قانون، از ابزار مناسب برای خروجی استفاده کنید:

نوع خروجی

روش تایید

وسیله نقلیه

وزن مولکولی، فرمول

محاسبه مجدد از فرمول

RDKit / به صورت دستی

لبخند/ساختار

تجزیه + متعارف کردن

RDKit

نقل قول/DOI

در پایگاه داده حل کنید

doi.org، Crossref

ثابت فیزیکی (kn، pKa)

پایگاه داده مرجع

PubChem، کتاب راهنما

محاسبه عددی

کد را بنویسید + اجرا کنید

پایتون

واکنش/شرایط

تایید ادبیات

Reaxys، مقاله

ادعای امنیتی

SDS/GHS

SDS رسمی

تخصیص طیف

چند فنی + انسانی

طیف تجربی

این جدول در واقع خلاصه ای از این ماژول است: هر واحد یک ردیف است.

مثلث سازی: سه مسیر مستقل

قوی‌ترین تکنیک تأیید «مثلث‌سازی» است: رسیدن به یک نتیجه از سه راه مستقل. به عنوان مثال، برای یک وزن مولکولی: (1) آنچه YZ می گوید، (2) محاسبه RDKit، (3) محاسبه با دست از فرمول. اگر این سه با هم همپوشانی داشته باشند، اعتماد بالاست. اگر کسی منحرف است، توقف کنید و تحقیق کنید. هرگز به یک منبع واحد در شیمی تکیه نکنید. حداقل به دنبال دو مسیر مستقل باشید.

گام به گام: گردش کار تأیید

  1. طبقه بندی خروجی: آیا این یک عدد، ساختار، اسناد، ادعای امنیتی است؟
  2. ابزار مناسب را انتخاب کنید: مسیر تأیید مناسب برای نوع خروجی را از جدول بالا دریافت کنید.
  3. محاسبه/جستجو مستقل: وسیله نقلیه را مستقل از هوش مصنوعی اجرا کنید. نتیجه را مقایسه کنید
  4. اگر انحراف وجود دارد، توقف کنید: اگر مقادیر مطابقت نداشتند، بدون بررسی درست بودن کدام یک ادامه ندهید.
  5. علامت خود را بگذارید: آنچه را که تأیید کردید و چگونه (صداقت علمی) را ثبت کنید.
  6. مشخص کردن عدم قطعیت: چیزی را که نمی توان تأیید کرد به عنوان «تأیید نشده» علامت گذاری کنید، آن را پنهان نکنید.

چهار قالب قابل کپی

1) خود تأیید:

شما فقط خروجی زیر را دادید: [OUTPUT]. وظیفه: هر ادعای عددی/واقعی این خروجی را در یک خط جداگانه فهرست کنید. برای هر ادعا: "چگونه به طور مستقل آن را تأیید کنیم؟" روش نوشتن (کدام ابزار/پایگاه داده). ادعا نکنید که ادعا درست است. فقط راهی برای تأیید آن ارائه دهید.

2) کنترل مثلثی:

من می خواهم وزن مولکول زیر را به سه روش بررسی کنم: [لبخند]. وظیفه: 1) فرمول مولکولی را استخراج کنید. 2) محاسبه وزن مولکولی را اتم به اتم نشان دهید (مشارکت هر عنصر). توجه: من آن را در RDKit هم محاسبه می کنم و ثالثاً آن را با چیزی که شما داده اید مقایسه می کنم. اگر این سه با هم همپوشانی ندارند، هشدار دهید.

3) علامت ابهام:

چندین ادعای واقعی در متن زیر وجود دارد:[TEXT]وظیفه: یک برچسب سطح اطمینان در کنار هر ادعا قرار دهید:[VERIFIED] / [VERIFIED] / [نامشخص]. اگر مطمئن نیستید چیزی را [تأیید شده] علامت‌گذاری نکنید.

4) پرس و جو متقابل سازگاری:

من همان سؤال را به دو صورت مختلف خواهم پرسید. ببینید آیا پاسخ های شما منسجم هستند یا خیر. سوال الف: فرمول مولکولی ترکیب چیست؟

اعلان ضعیف / اعلان قوی

ضعیف:

هر آنچه در مورد این ترکیب می دانید را بنویسید.

هوش مصنوعی اطلاعات قابل راستی‌آزمایی و ساختگی را بی‌رویه مخلوط می‌کند. معلوم نیست کدام یک واقعی است.

قوی:

اطلاعاتی در مورد این ترکیب ارائه دهید، اما هر ادعا را به عنوان: [قطعی - تأیید شده توسط ابزار] به عنوان مثال برچسب بزنید. فرمول مولکولی، [تجربی - استناد مورد نیاز] به عنوان مثال. نقطه ذوب، [نامشخص - مطمئن نیستم]. هیچ ادعای بدون برچسب ننویسید.

تفاوت: ما هوش مصنوعی را مجبور کردیم تا عدم قطعیت خود را مشخص کند. ما کار تأیید را قابل برنامه ریزی کردیم.

تمامیت علمی: صداقت و قابلیت ردیابی

تأیید فقط یک مرحله فنی نیست، یک موضوع اخلاقی است. یکپارچگی علمی مستلزم:

  • شفافیت: پنهان نکنید که از هوش مصنوعی استفاده می کنید. با توجه به خط مشی انتشار/گزارش خود مشخص کنید.
  • قابلیت ردیابی: آنچه را که خروجی از هوش مصنوعی آمده است و نحوه تأیید آن ثبت کنید.
  • یکپارچگی داده ها: "زیباسازی" نتایج با هوش مصنوعی، دور انداختن موارد پرت بدون توجیه، تقلب است.
  • مسئولیت: شما مسئول نتیجه نهایی هستید. "هوش مصنوعی چنین گفته است" بهانه ای نیست.
نکته: از همان ابتدا بپذیرید که هرگز نمی توانید از عبارت "هوش مصنوعی چنین گفته است" در گزارش یا دفاع استفاده کنید. این پذیرش به طور خودکار عادت تأیید هر خروجی را به همراه دارد.

موارد کوچک

مورد 1 - مثلث یک خطا را گرفت. یک دانش آموز وزن مولکولی را از سه طریق بررسی کرد: YZ گفت 178.2، محاسبه دستی 180.16، RDKit 180.16 را نشان داد. دو مسیر مستقل با هم تداخل داشتند و هوش مصنوعی را حذف کردند. درس: دو راستی‌آزمایی مستقل در سکوت یک خروجی نادرست را شکست می‌دهند.

مورد 2 - زبان امن، اطلاعات اشتباه. هوش مصنوعی بسیار مطمئن نوشت که یک واکنش "به طور خود به خود در دمای اتاق اجرا می شود." ادبیات نشان داد که این نیاز به گرمایش و کاتالیزور دارد. دانش آموز به منبع اعتماد کرد، نه به زبان امن. درس: تسلط به معنای دقت نیست.

مورد 3 - شفافیت به دست آورد. در بخش روش مقاله خود، یکی از محققین به وضوح بیان کرد که در چه مراحلی از هوش مصنوعی (ویرایش متن، پیش نویس کد) استفاده کرده است و نوشته است که به طور مستقل تمام نتایج عددی را تأیید می کند. روند داوری به آرامی پیش رفت. درس: شفافیت اعتماد ایجاد می کند، پنهان کاری خطر ایجاد می کند.

اشتباهات رایج

  • اعتماد به زبان امن لحن مطمئن هوش مصنوعی نشانه دقت نیست.
  • تکیه بر یک منبع واحد. پذیرش یک خروجی بدون مثلث.
  • عدم تفکیک نوع خروجی به این فکر می کنم که شماره، انتساب و ادعای امنیتی را با همان روش "بررسی" کردم.
  • پنهان کردن عدم قطعیت گزارش چیزی که نمی توان آن را تأیید کرد، به گونه ای که گویی قطعی است.
  • پنهان کردن استفاده از هوش مصنوعی عدم شفافیت یکپارچگی علمی را تضعیف می کند.
  • تفویض مسئولیت. عذر «هوش مصنوعی گفت» نامعتبر است. مسئولیت بر عهده شخص است.

به طور خلاصه

  • توهم در مدل زبانی ذاتی است. راه حل این است که یک پوسته اعتبارسنجی در اطراف هر خروجی ایجاد کنید.
  • هر نوع خروجی روش تأیید خاص خود را دارد. خروجی را طبقه بندی کرده و از ابزار مناسب استفاده کنید.
  • مثلث (دو مسیر مستقل) قوی ترین کنترل است. به یک منبع واحد اعتماد نکنید.
  • تسلط و زبان مطمئن ارتباطی با دقت ندارد.
  • یکپارچگی علمی نیازمند شفافیت، قابلیت ردیابی، یکپارچگی داده ها و مسئولیت انسانی است.

وظیفه کاربردی

به طور عمدی در یک جلسه هوش مصنوعی خروجی های مختلفی تولید کنید: یک وزن مولکولی، یک مرجع، یک ثابت فیزیکی، یک ادعای امنیتی، یک محاسبه عددی. هر کدام را به طور مستقل با روش صحیح تأیید کنید (جدول را ببینید). سعی کنید حداقل یک توهم داشته باشید. سپس یک "ماتریس اعتبارسنجی" آماده کنید: خروجی ردیف ها، ستون ها (مقدار AI / مقدار مستقل / آیا همپوشانی داشت / چگونه آن را تأیید کردم). این جلسه را از نظر یکپارچگی علمی چگونه گزارش می دهید؟

چک لیست

  • [ ] من درک می کنم که چرا توهم اجتناب ناپذیر است.
  • [ ] من هر خروجی را بر اساس نوع آن طبقه بندی می کنم و با روش مناسب آن را تأیید می کنم.
  • [ ] من مثلث سازی (دو مسیر مستقل) را روی مقادیر بحرانی انجام می دهم.
  • [ ] من به منبع اعتماد دارم، نه به زبان امن.
  • [ ] چیزی را که نمی توان تأیید کرد به عنوان «نامشخص» علامت گذاری می کنم.
  • [ ] من در استفاده از هوش مصنوعی شفاف هستم و خود را مسئول نتیجه می دانم.