وحدة 1 / 11

مقدمة للذكاء الاصطناعي في الكيمياء: الأدوار والحدود والتحقق والأخلاق

المكاسب:

  • القدرة على التمييز بين الأماكن التي يوفر فيها الذكاء الاصطناعي الوقت في سير عمل الكيمياء (الفكرة والتصميم والتحليل وإعداد التقارير) والأماكن التي تُترك فيها قرارات الهيكل والعدد والموارد والسلامة للبشر، اعتمادًا على مستوى المخاطر.
  • القدرة على تطبيق نظام يتحقق بشكل مستقل من كل مخرجات من خلال الخطوات الأربع للهيكل-الرقم-الموارد-الأمن
  • افهم لماذا تشكل المركبات والأرقام المختلقة والمراجع الكاذبة والمفاهيم الأمنية الخاطئة مخاطر على هذه المهنة والتي يجب أخذها في الاعتبار منذ البداية.

الكيمياء هي علم تجريبي يدرس بنية المادة وتحولها وخصائصها. يقوم الكيميائي بالوزن، والحل، والتسخين، والقياس في المختبر؛ في مكتبه، يرسم الجزيئات، ويخطط للتفاعلات، ويفسر الأطياف، ويمسح الأدبيات ويكتب التقارير. يمكن للذكاء الاصطناعي (اختصار الذكاء الاصطناعي، وهنا على وجه التحديد البرامج التي تولد النص من خلال التنبؤ بـ "الكلمة التالية الأكثر احتمالية"، المدربة على نموذج لغة كبير، أي بيانات نصية ضخمة) أن يسرع بشكل كبير العديد من هذه الوظائف المكتبية. لكنه لا يبني المختبر نفسه، ولا يقرأ المقاييس، والأهم من ذلك: أنه لا يتحقق من أي أرقام أو صيغ أو استشهادات ينتجها نيابة عنك. تعلمك هذه الوحدة كيفية استخدام الذكاء الاصطناعي في الكيمياء بشكل شامل ولكن بطريقة مسؤولة.

في هذه الوحدة الأولى، أريد أن أزرع فكرة واحدة في عقلك: الذكاء الاصطناعي هو مساعد في الكيمياء، وليس كيميائيًا. يكتب التعليمات البرمجية، وينتج الخطوط العريضة، ويبني إطارًا للتركيب الرجعي، ويساعد في تفسير قمم الطيف، ويلخص الأدبيات. ومع ذلك، فإن الكيميائي المختص هو الذي يقرر ما إذا كان يمكن تصنيع الجزيء بالفعل، وما إذا كان التفاعل آمنًا أم لا، وما إذا كان المرجع حقيقيًا أم لا، والمسؤولية النهائية.

أين يتناسب الذكاء الاصطناعي مع سير عمل الكيمياء؟

دعونا نقسم مشروع الكيمياء تقريبًا إلى خمس مراحل: (1) الفكرة والأدب، (2) تصميم الجزيء والتفاعل، (3) التطبيق المعملي، (4) التحليل والتوصيف، (5) إعداد التقارير. يحمل الذكاء الاصطناعي قيمًا مختلفة جدًا في هذه المراحل.

  • الأفكار والأدب: يقوم الذكاء الاصطناعي بتلخيص الموضوع بسرعة، ويشرح المفاهيم الأساسية، ويولد مصطلحات البحث. ولكنه يستطيع أن يختلق الإسناد؛ سوف نرى هذا في لحظة.
  • التصميم: يُنشئ ابتسامات (شكل من أشكال كتابة الجزيء كسلسلة نصية؛ المزيد عن ذلك لاحقًا)، ويقترح خطوات التركيب الرجعي، ويسرد البدائل التفاعلية. الاقتراح جيد، وليس ضمانا.
  • المختبر: الذكاء الاصطناعي لا يفعل شيئًا هنا. يتم تنفيذ إجراءات الوزن والتدفئة والأمن من قبل البشر. الذكاء الاصطناعي يساعد فقط في كتابة الإجراء؛ قبل تنفيذ هذا الإجراء يجب على الإنسان الإشراف عليه من أجل السلامة.
  • التحليل: في تفسير الرنين المغناطيسي النووي، والأشعة تحت الحمراء، وطيف الكتلة (هذه هي تقنيات القياس التي تظهر بنية الجزيء)، يساعد YZ على تجميع القمم وقائمة الهياكل المحتملة. المهمة النهائية لك.
  • إعداد التقارير: إنتاج دفتر تجريبي، مسودة مقال، مسودة نموذج السلامة. إنها قوية جدًا؛ ولكن يجب أن تتطابق الأرقام مع أرقامك.
نصيحة: المكان الأكثر أمانًا لاستخدام الذكاء الاصطناعي هو المناطق "إذا حدث خطأ ما، فسيتم ملاحظته وإصلاحه على الفور": مسودة النص، والهيكل العظمي للكود، ووصف المصطلح. الأماكن الأكثر خطورة هي مناطق "إذا كان كاذبًا، فإنه ينتشر بصمت": الثوابت، المراجع، التأكيدات الأمنية، النتائج الرقمية.

لماذا علينا أن نكون حذرين؟ ثلاثة مخاطر هيكلية

نموذج اللغة الكبير ليس آلة حاسبة أو محركًا كيميائيًا. ينتج نصًا "يبدو مرجحًا" إحصائيًا. وهذا يؤدي إلى ثلاثة مخاطر ملموسة في الكيمياء:

  1. مختلق (هلوسة): يستطيع أن يكتب بثقة مركبًا ليس نموذجًا، أو تفاعلًا غير موجود، أو وزنًا جزيئيًا غير صحيح. على سبيل المثال، مكتوب "الوزن الجزيئي للمركب X هو 154.2 جم/مول"، بينما القيمة الصحيحة هي 168.2.
  2. اقتباس مزيف: قد يعطي مصدرًا يبدو واقعيًا ولكنه غير موجود على الإطلاق، مثل "Smith et al., 2019, Journal of Organic Chemistry". يمكنه حتى تكوين رقم DOI.
  3. مغالطة السلامة: يمكن أن تقدم مجموعة خطيرة من الكواشف (مثل المؤكسد والمذيب العضوي بنسبة غير مناسبة) على أنها "لا توجد مشكلة".

سوف تظهر هذه المخاطر الثلاثة مرارًا وتكرارًا في كل وحدة من هذه الوحدة. الحل لا يكمن في الهروب من الذكاء الاصطناعي، بل في إنشاء نظام للتحقق من كل مخرجات من خلال مصدر مستقل.

حالات صغيرة

الحالة 1 - الوزن الجزيئي المجهز. سأل أحد طلاب الدراسات العليا الذكاء الاصطناعي عن الوزن الجزيئي للبارانيتروفينول. وقال الذكاء الاصطناعي: "139.11 جم/مول". كان الطالب واثقًا من نفسه، وخطط لوزن 6.96 جم مقابل 0.05 مول. ومع ذلك، فإن الوزن الجزيئي للبارا نيتروفينول هو 139.11 جم/مول، وكان هذا الوزن صحيحًا هذه المرة، لكن الطالب لم يتحقق من ذلك مطلقًا. في المركب التالي (بارا أمينوفينول، القيمة الفعلية 109.13 جم/مول) قال YZ "123.15"؛ هذه المرة اكتشفها الطالب عن طريق حسابها يدويًا من الصيغة (C6H7NO2): 6×12.011 + 7×1.008 + 14.007 + 2×15.999 = 109.13. الدرس: حساب كل وزن جزيئي بدون صيغة.

الحالة 2 - DOI المزيف. سأل أحد الباحثين منظمة العفو الدولية عن 5 مصادر في مراجعة الأدبيات الخاصة به. تم إرجاع DOI لاثنين من الخمسة "غير موجود" عند النقر عليه؛ العناوين الرئيسية كانت واقعية، لكن المقالات لم تكن كذلك. مضيعة للوقت 40 دقيقة. الدرس المستفاد: لا ينبغي استخدام كل استشهاد دون التحقق منه في قاعدة البيانات (DOI، PubMed، Reaxys).

الحالة 3 - الخطر الذي يبدو آمنًا. سأل أحد المستخدمين الذكاء الاصطناعي عن إجراء التنظيف؛ أنتج الذكاء الاصطناعي بشكل غير مباشر اقتراحًا بخلط محلول يحتوي على هيبوكلوريت مع محلول حمضي، وهو مزيج يمكن أن يؤدي إلى إطلاق غاز الكلور. لحسن الحظ، نظر المستخدم إلى ورقة بيانات السلامة (SDS) وتوقف. الدرس المستفاد: يتم فحص كل إجراء من قبل الإنسان بحثًا عن مخزونات بيانات السلامة (SDS) والمخاطر قبل تنفيذها.

موجه ضعيف / موجه قوي

حث ضعيف:

توليف هذا الجزيء.

هذا الادعاء غامض: ما هو الجزيء، ما هي المواد الأولية، ما هو المقياس، ما هي القيود؟ الذكاء الاصطناعي يعوض الفجوات.

مطالبة قوية:

الدور: أنت مساعد ذو خبرة في التركيب العضوي. الجزيء المستهدف: 4-ميثوكسي أسيتوفينون (SMILES: COc1ccc(cc1)C(C)=O). لدينا الأنيسول كمادة البداية. المهمة: قدم مقترحًا للتركيب الرجعي من خطوتين. لكل خطوة: الكواشف، والظروف (درجة الحرارة، والمذيبات)، والتفاعلات الجانبية المحتملة. القيد: حدد "التحقق" حيث لا تكون متأكدًا، مناسبًا. الإخراج: خطوات مرقمة + قائمة النقاط المطلوب التحقق منها.

الفرق: الدور والهدف الدقيق (مع الابتسامات) والسياق وعدد الخطوات وتنسيق الإخراج والقيد "الملائم". هذه هي المكونات الخمسة للتحفيز الجيد في الكيمياء: الدور، والتمثيل الدقيق للبنية، والسياق، والمهمة، وقيود التحقق.

أنواع أدوات الذكاء الاصطناعي: نموذج اللغة أم أداة الكيمياء؟

في الكيمياء، تواجه نوعين مختلفين من "الذكاء الاصطناعي" ومن المهم عدم الخلط بينهما:

النوع

ماذا يفعل

الموثوقية

استخدام المثال

نموذج اللغة العامة

يولد نصًا/رمزًا، ويشرح، ويكتب المسودات

منخفضة في الأرقام، عالية في اللغة

مخطط الإجراء، شرح المصطلحات

مكتبة الكيمياء (RDKit وما إلى ذلك)

يعالج الجزيء بشكل حتمي، ويحسب الوزن الجزيئي

عالية (على أساس القواعد)

التحقق من الابتسامات، حساب MA

نموذج التنبؤ المخصص (التركيب الرجعي، الميزة)

يعطي التنبؤ المدربة على البيانات

متوسطة حسب المنطقة

التركيب الرجعي، وتقدير الذوبان

الأدب / أداة البحث

استعلامات قاعدة البيانات الحقيقية

عالية حسب المصدر

تأكيد الإسناد، بحث رد الفعل

يجمع سير العمل الأكثر قوة بين هذه العناصر: نموذج اللغة يولد الفكرة، ومكتبة الكيمياء تحسب الرقم بشكل حتمي، وأداة الأدب تتحقق من الإسناد، ويتحقق الإنسان من صحته. سنقوم بإنشاء هذه السلسلة في الوحدات القادمة.

نظام التحقق: أربع خطوات

اتبع كل مخرجات الذكاء الاصطناعي من خلال الخطوات الأربع التالية قبل إدخالها إلى المختبر أو التقرير:

  1. البنية: هل ترميز الجزيء/التفاعل (SMILES/InChI) صالح؟ هل يمكن تحليلها باستخدام أداة (RDKit)؟
  2. الرقم: هل تم التحقق من الوزن الجزيئي، وقياس العناصر المتفاعلة، وحساب العائد بشكل مستقل (باليد أو بالمكتبة)؟
  3. المصدر: هل تم التحقق من كل ادعاء وإسناد في قاعدة بيانات حقيقية؟
  4. السلامة: هل تمت قراءة SDS لكل كاشف في الإجراء، هل هناك أي مجموعات خطيرة؟
ملاحظة: تنطبق هذه الخطوات الأربع "دائمًا"، وليس "أحيانًا". 20 موقفًا يكون الذكاء الاصطناعي فيها صحيحًا لا يبرر موقفًا واحدًا يكون فيه غير صحيح؛ لأنه في الكيمياء يمكن أن تكون هذه الحالة انفجارًا أو تسممًا أو مادة منسحبة.

الأخطاء الشائعة

  • الخلط بين إخراج الذكاء الاصطناعي باعتباره "موردًا". الذكاء الاصطناعي ليس موردًا، ولكنه مولد يحاول تذكر الموارد (أحيانًا بشكل غير صحيح). وهي قاعدة البيانات المصدر.
  • الثقة بالرقم. استخدام أرقام مثل الوزن الجزيئي، pKa، نقطة الغليان دون التحقق منها. يمكن حسابها/البحث عنها بشكل حتمي؛ إن طرح نموذج اللغة هو أضعف طريقة.
  • الاستعانة بمصادر خارجية للأمن إلى الذكاء الاصطناعي. "لم يقل الذكاء الاصطناعي أنه خطير" لا يعني أنه آمن. تقييم المخاطر هو مهمة الإنسان وSDS.
  • موجه غامض. عدم إعطاء الجزيء باسمه ولكن ببنيته (SMILES/InChI)؛ وهذا يؤدي إلى جزيئات غير صحيحة بسبب ارتباك الاسم.
  • الثقة في محاولة واحدة فقط. طرح نفس السؤال مرة أخرى بطريقة مختلفة وعدم التحقق من الاتساق.

باختصار

  • يعد الذكاء الاصطناعي مساعدًا مكتبيًا قويًا في الكيمياء: فهو ينتج التعليمات البرمجية والخطوط العريضة والأوصاف ومسح الهياكل العظمية؛ لكن المختبر لا يفعل ذلك ولا يتحقق من مخرجاته.
  • هناك ثلاثة مخاطر متأصلة: مركب/رقم مزيف، والإسناد المزيف، والمغالطة الأمنية.
  • فصل ودمج نموذج اللغة العام وأدوات الكيمياء الحتمية (RDKit، قواعد البيانات).
  • خذ كل مخرجات من خلال الخطوات الأربع للهيكل – الرقم – المصدر – الأمان.
  • موجه جيد: يتضمن الدور، وتمثيل البنية الواضحة، والسياق، والمهمة، وقيد التحقق من الصحة.

مهمة التطبيق

اختر جزيءًا قمت بدراسته بنفسك (مثل الأسبرين، SMILES: CC(=O)Oc1ccccc1C(=O)O). اسأل الذكاء الاصطناعي عن ثلاثة أشياء: (1) الوزن الجزيئي، (2) ورقتين مرجعيتين، (3) خطوة تركيبية. ثم تحقق من كل منها بشكل مستقل: قم بحساب الوزن الجزيئي يدويًا من الصيغة، وتأكد من الاستشهادات باستخدام DOI، وافحص خطوة التوليف بعين أمنية. ما هو الناتج الذي خرج صحيحا والذي يتطلب التصحيح؟ احتفظ بـ "سجل التحقق" المكون من نصف صفحة.

قائمة مرجعية

  • [ ] أدركت أن الذكاء الاصطناعي هو مساعد وليس كيميائيًا.
  • [ ] أدرك مخاطر التلفيق والإسناد الكاذب وعدم الثقة في الأمثلة.
  • [ ] أستطيع التمييز بين نموذج اللغة وأدوات الكيمياء الحتمية.
  • [ ] سأطبق الخطوات الأربع للهيكل – الرقم – المصدر – الأمان على كل مخرجات.
  • [ ] أصف الجزيئات من خلال تدوين البنية (SMILES/InChI)، وليس بالاسم.
  • [ ] احتفظت بسجل تحقق واحد على الأقل.