واحد 1 / 11

مقدمه‌ای بر هوش مصنوعی در شیمی: نقش‌ها، مرزها، اعتبارسنجی و اخلاق

سود:

  • توانایی تشخیص اینکه هوش مصنوعی کجا در جریان کار شیمی در زمان صرفه جویی می کند (ایده، طراحی، تجزیه و تحلیل، گزارش) و جایی که ساختار، تعداد، منابع و تصمیمات ایمنی بسته به سطح خطر به انسان واگذار می شود.
  • امکان اعمال رشته ای که به طور مستقل هر خروجی را با چهار مرحله ساختار - شماره - منبع - امنیت بررسی می کند.
  • درک کنید که چرا ترکیبات و اعداد ساخته شده، ارجاعات نادرست و تصورات غلط امنیتی خطراتی برای این حرفه هستند که باید از همان ابتدا مورد توجه قرار گیرند.

شیمی یک علم تجربی است که به مطالعه ساختار، تبدیل و خواص ماده می پردازد. یک شیمیدان در آزمایشگاه وزن می کند، حل می کند، گرم می کند و اندازه می گیرد. او پشت میزش مولکول ها را ترسیم می کند، واکنش ها را برنامه ریزی می کند، طیف ها را تفسیر می کند، ادبیات را اسکن می کند و گزارش می نویسد. هوش مصنوعی (به اختصار AI، در اینجا به‌ویژه نرم‌افزاری که متن را با پیش‌بینی «محتمل‌ترین کلمه بعدی» که بر روی یک مدل زبان بزرگ آموزش داده شده، یعنی داده‌های متنی عظیم) تولید می‌کند) می‌تواند به طور چشمگیری سرعت بسیاری از این کارهای میز را افزایش دهد. اما خود آزمایشگاه را نمی‌سازد، مقیاس‌ها را نمی‌خواند، و مهمتر از همه: هیچ عدد، فرمول یا نقل قولی را که از طرف شما تولید می‌کند تأیید نمی‌کند. این ماژول نحوه استفاده از هوش مصنوعی در شیمی را به صورت سرتاسر اما مسئولانه آموزش می دهد.

در این واحد اول، می خواهم یک ایده را در ذهن شما بکارم: هوش مصنوعی یک دستیار در شیمی است، نه یک شیمیدان. کد می نویسد، خطوط کلی تولید می کند، چارچوب رتروسنتز را می سازد، به تفسیر قله های طیف کمک می کند، ادبیات را خلاصه می کند. با این حال، این شیمیدان صالح است که تصمیم می گیرد که آیا مولکول واقعاً می تواند سنتز شود، آیا یک واکنش بی خطر است یا نه، آیا یک مرجع واقعی است یا نه، و مسئولیت نهایی.

هوش مصنوعی کجا در جریان کار شیمی قرار می گیرد؟

بیایید تقریباً یک پروژه شیمی را به پنج مرحله تقسیم کنیم: (1) ایده و ادبیات، (2) طراحی مولکول و واکنش، (3) کاربرد آزمایشگاهی، (4) تجزیه و تحلیل و خصوصیات، (5) گزارش. هوش مصنوعی در این مراحل دارای مقادیر بسیار متفاوتی است.

  • ایده ها و ادبیات: هوش مصنوعی به سرعت یک موضوع را خلاصه می کند، مفاهیم کلیدی را توضیح می دهد، عبارات جستجو را ایجاد می کند. اما او می تواند انتساب را بسازد. این را در یک لحظه خواهیم دید.
  • طراحی: SMILES را ایجاد می کند (شکلی از نوشتن مولکول به عنوان یک رشته متن، در ادامه بیشتر در مورد آن توضیح خواهیم داد)، مراحل رتروسنتز را پیشنهاد می کند، جایگزین های واکنشی را فهرست می کند. پیشنهاد خوب است، تضمینی نیست.
  • آزمایشگاه: هوش مصنوعی در اینجا هیچ کاری انجام نمی دهد. توزین، گرمایش و اقدامات امنیتی توسط انسان انجام می شود. هوش مصنوعی فقط به نوشتن رویه کمک می کند. قبل از انجام این روش، یک انسان باید برای ایمنی آن را تحت نظر داشته باشد.
  • تجزیه و تحلیل: در تفسیر NMR، IR، طیف جرمی (اینها تکنیک‌های اندازه‌گیری هستند که ساختار مولکول را نشان می‌دهند)، YZ به گروه‌بندی قله‌ها و فهرست کردن ساختارهای ممکن کمک می‌کند. تکلیف نهایی با شماست.
  • گزارش: نوت بوک آزمایشی، پیش نویس مقاله، پیش نویس فرم ایمنی را تولید می کند. بسیار قدرتمند است؛ اما اعداد باید با شما مطابقت داشته باشند.
نکته: امن‌ترین مکان برای استفاده از هوش مصنوعی در قسمت‌های «اگر مشکلی پیش بیاید متوجه می‌شود و بلافاصله برطرف می‌شود» است: متن پیش‌نویس، اسکلت کد، شرح اصطلاح. خطرناک‌ترین مکان‌ها مناطق «اگر نادرست است، بی‌صدا پخش می‌شود» هستند: ثابت‌ها، مراجع، ادعاهای امنیتی، نتایج عددی.

چرا باید مراقب باشیم؟ سه ریسک ساختاری

مدل زبان بزرگ یک ماشین حساب یا یک موتور شیمی نیست. متنی را تولید می کند که از نظر آماری "محتمل به نظر می رسد". این منجر به سه خطر مشخص در شیمی می شود:

  1. ساخته شده (توهم): می تواند با اطمینان ترکیبی را بنویسد که مدل نیست، واکنشی که وجود ندارد یا وزن مولکولی نادرست دارد. به عنوان مثال، می گوید: "وزن مولکولی ترکیب X 154.2 گرم بر مول است، در حالی که مقدار صحیح 168.2 است.
  2. نقل قول جعلی: ممکن است منبعی ارائه دهد که واقع بینانه به نظر می رسد اما اصلا وجود ندارد، مانند «اسمیت و همکاران، 2019، مجله شیمی آلی». او حتی می تواند یک شماره DOI بسازد.
  3. خطای ایمنی: می‌تواند ترکیب خطرناکی از معرف‌ها (مانند یک اکسیدکننده و یک حلال آلی در نسبت نامناسب) را به عنوان "بدون مشکل" نشان دهد.

این سه خطر بارها و بارها در هر واحد از این ماژول ظاهر می شوند. راه حل فرار از هوش مصنوعی نیست، بلکه ایجاد نظم و انضباط برای تأیید هر خروجی با یک منبع مستقل است.

موارد کوچک

مورد 1 - وزن مولکولی متناسب. یک دانشجوی فارغ التحصیل از هوش مصنوعی وزن مولکولی پارا نیتروفنول را پرسید. هوش مصنوعی گفت: 139.11 گرم در مول. دانش آموز اعتماد به نفس داشت و قصد داشت 6.96 گرم برای 0.05 مول وزن کند. با این حال، وزن مولکولی پارا نیتروفنول 139.11 گرم در مول است، و این بار درست بود - اما دانش آموز هرگز بررسی نکرده بود. در مورد ترکیب بعدی (پارامینوفنول، مقدار واقعی 109.13 گرم در مول) YZ گفت: "123.15". این بار دانش آموز آن را با محاسبه دستی از فرمول (C6H7NO2) گرفت: 6×12.011 + 7×1.008 + 14.007 + 2×15.999 = 109.13. درس: هر وزن مولکولی را بدون فرمول محاسبه کنید.

مورد 2 - DOI جعلی. محققی در بررسی ادبیات خود از هوش مصنوعی 5 منبع درخواست کرد. DOI دو مورد از پنج مورد پس از کلیک کردن، "یافت نشد" را برگرداند. تیترها واقعی بودند، اما مقالات نه. اتلاف وقت 40 دقیقه درس: هر نقل قولی نباید بدون تأیید در پایگاه داده (DOI، PubMed، Reaxys) استفاده شود.

مورد 3 - خطری که بی خطر به نظر می رسد. کاربر از هوش مصنوعی در مورد روش تمیز کردن سوال کرد. هوش مصنوعی به طور غیرمستقیم پیشنهادی برای مخلوط کردن یک محلول حاوی هیپوکلریت با یک محلول اسیدی ارائه کرد - ترکیبی که می‌تواند گاز کلر آزاد کند. خوشبختانه کاربر به برگه اطلاعات ایمنی (SDS) نگاه کرد و متوقف شد. درس: هر روشی قبل از اجرا از نظر SDS و خطر توسط انسان بررسی می شود.

اعلان ضعیف / اعلان قوی

اعلان ضعیف:

این مولکول را سنتز کنید.

این ادعا مبهم است: چه مولکولی، چه مواد اولیه، چه مقیاسی، چه محدودیت هایی؟ هوش مصنوعی شکاف ها را جبران می کند.

اعلان قدرتمند:

نقش: شما یک دستیار با تجربه در سنتز آلی هستید. مولکول هدف: 4-متوکسی استوفنون (SMILES: COc1ccc(cc1)C(C)=O). ما آنیسول را به عنوان ماده اولیه داریم. تکلیف: یک پیشنهاد رتروسنتز 2 مرحله ای ارائه دهید. برای هر مرحله: معرف ها، شرایط (دما، حلال)، و واکنش های جانبی احتمالی. محدودیت: در جایی که مطمئن نیستید، "VERIFY" را علامت بزنید. خروجی: مراحل شماره گذاری شده + لیست نقاطی که باید تأیید شوند.

تفاوت: نقش، هدف دقیق (با SMILES)، زمینه، تعداد مراحل، فرمت خروجی و محدودیت "مناسب". اینها پنج مؤلفه تشویق خوب در شیمی هستند: نقش، نمایش ساختار دقیق، زمینه، وظیفه، محدودیت تأیید.

انواع ابزارهای هوش مصنوعی: مدل زبان یا ابزار شیمی؟

در شیمی با دو "هوش مصنوعی" متفاوت روبرو می شوید و مهم است که آنها را اشتباه نگیرید:

ژانر

چه می کند

قابلیت اطمینان

مثال استفاده

مدل زبان عمومی

متن/کد تولید می کند، توضیح می دهد، پیش نویس می نویسد

اعداد کم، زبان زیاد

طرح کلی روش، توضیح اصطلاحات

کتابخانه شیمی (RDKit و غیره)

مولکول را به طور قطعی پردازش می کند، وزن مولکولی را محاسبه می کند

بالا (بر اساس قانون)

تأیید SMILES، حساب MA

مدل پیش‌بینی سفارشی (باز سنتز، ویژگی)

پیش بینی آموزش داده شده را ارائه می دهد

متوسط، بسته به منطقه

رتروسنتز، تخمین حلالیت

ادبیات / ابزار جستجو

پرس و جوهای پایگاه داده واقعی

بالا بسته به منبع

تایید انتساب، جستجوی واکنش

قوی ترین گردش کار این موارد را ترکیب می کند: مدل زبان ایده را تولید می کند، کتابخانه شیمی عدد را به طور قطعی محاسبه می کند، ابزار ادبیات اسناد را تأیید می کند، انسان اعتبار سنجی می کند. در واحدهای بعدی این زنجیره را برقرار خواهیم کرد.

نظم و انضباط تأیید: چهار مرحله

هر خروجی هوش مصنوعی را قبل از وارد کردن آن به آزمایشگاه یا گزارش، از طریق این چهار مرحله طی کنید:

  1. ساختار: آیا نماد مولکول/واکنش (SMILES/InChI) معتبر است؟ آیا می توان آن را با یک ابزار (RDKit) تجزیه کرد؟
  2. شماره: آیا وزن مولکولی، استوکیومتری، محاسبه بازده به طور مستقل (با دست یا کتابخانه) تأیید شده است؟
  3. منبع: آیا هر ادعا و انتساب در یک پایگاه داده واقعی تایید شده است؟
  4. ایمنی: آیا SDS برای هر معرف در روش خوانده شده است، آیا ترکیبات خطرناکی وجود دارد؟
توجه: این چهار مرحله "همیشه" اعمال می شود، نه "گاهی". 20 موقعیتی که در آن هوش مصنوعی صحیح است، 1 موقعیتی که در آن اشتباه است را توجیه نمی کند. زیرا در شیمی آن 1 وضعیت می تواند یک انفجار، مسمومیت یا یک مقاله جمع شده باشد.

اشتباهات رایج

  • اشتباه گرفتن خروجی هوش مصنوعی به عنوان یک "منبع". هوش مصنوعی یک منبع نیست، بلکه یک تولید کننده است که سعی می کند منابع را به خاطر بسپارد (گاهی اوقات به اشتباه). این پایگاه داده منبع است.
  • اعتماد به شماره استفاده از اعدادی مانند وزن مولکولی، pKa، نقطه جوش بدون تایید آنها. اینها را می توان به طور قطعی محاسبه/جستجو کرد. پرسیدن مدل زبان ضعیف ترین راه است.
  • برون سپاری امنیت به هوش مصنوعی "هوش مصنوعی نگفت خطرناک است" به این معنی نیست که ایمن است. ارزیابی خطر کار انسان و SDS است.
  • اعلان مبهم نام مولکول را نمی‌دهیم، بلکه با ساختار آن (SMILES/InChI) این به دلیل سردرگمی نام منجر به مولکول های نادرست می شود.
  • اعتماد فقط با یک بار تلاش پرسیدن دوباره همان سوال به روشی دیگر و عدم بررسی سازگاری.

به طور خلاصه

  • هوش مصنوعی یک دستیار میز قدرتمند در شیمی است: کد، خطوط کلی، توضیحات، اسکن اسکلت ها را تولید می کند. اما آزمایشگاه این کار را انجام نمی دهد و خروجی آن را تأیید نمی کند.
  • سه خطر ذاتی وجود دارد: ترکیب/عدد جعلی، انتساب جعلی، اشتباه امنیتی.
  • مدل زبان عمومی و ابزارهای شیمی قطعی (RDKit، پایگاه‌های داده) را جدا و ترکیب کنید.
  • هر خروجی را در چهار مرحله ساختار – شماره – منبع – امنیت طی کنید.
  • اعلان خوب: شامل نقش، نمایش ساختار صریح، زمینه، وظیفه، محدودیت اعتبارسنجی است.

وظیفه کاربردی

مولکولی را که خودتان مطالعه کرده اید انتخاب کنید (مثلاً آسپرین، لبخند: CC(=O)Oc1ccccc1C(=O)O). از هوش مصنوعی سه چیز بپرسید: (1) وزن مولکولی، (2) دو مقاله مرجع، (3) یک مرحله سنتز. سپس هر کدام را به طور مستقل تأیید کنید: وزن مولکولی را به صورت دستی از فرمول محاسبه کنید، نقل قول ها را با DOI تأیید کنید، مرحله سنتز را با یک چشم امنیتی بررسی کنید. کدام خروجی درست بود و کدام اصلاح نیاز داشت؟ یک نیم صفحه "گزارش تایید" نگه دارید.

چک لیست

  • [ ] متوجه شدم که هوش مصنوعی یک دستیار است، نه یک شیمیدان.
  • [ ] من خطرات جعل، اسناد نادرست و بی اعتمادی را با مثالها تشخیص می دهم.
  • [ ] من می توانم بین مدل زبان و ابزارهای شیمی قطعی تمایز قائل شوم.
  • [ ] من چهار مرحله Structure-Number-Source-Security را برای هر خروجی اعمال خواهم کرد.
  • [ ] من مولکول ها را با نماد ساختار (SMILES/InChI) توصیف می کنم، نه با نام.
  • [ ] من حداقل یک گزارش تأیید را نگه داشتم.