יחידה 1 / 11

מבוא לבינה מלאכותית בכימיה: תפקידים, גבולות, אימות ואתיקה

רווחים:

  • היכולת להבחין היכן בינה מלאכותית חוסכת זמן בזרימת העבודה בכימיה (רעיון, עיצוב, ניתוח, דיווח) והיכן החלטות מבנה, מספר, משאבים ובטיחות נותרות לבני אדם, בהתאם לרמת הסיכון.
  • יכולת ליישם דיסציפלינה שבודקת באופן עצמאי כל פלט עם ארבעת השלבים של מבנה-מספר-משאב-אבטחה
  • הבינו מדוע תרכובות ומספרים מורכבים, הפניות כוזבות ותפיסות שגויות אבטחה הם סיכונים למקצוע זה שיש לקחת בחשבון כבר מההתחלה.

כימיה היא מדע ניסיוני החוקר את המבנה, הטרנספורמציה והתכונות של החומר. כימאי שוקל, ממיס, מחמם ומודד במעבדה; ליד שולחנו הוא מצייר מולקולות, מתכנן תגובות, מפרש ספקטרום, סורק את הספרות וכותב דוחות. בינה מלאכותית (בקיצור AI, כאן ספציפית תוכנה המייצרת טקסט על ידי חיזוי "המילה הקרובה ביותר", מאומנת על מודל שפה גדול, כלומר, נתוני טקסט מסיביים) יכולה להאיץ באופן דרמטי רבים מעבודות השולחן הללו. אבל היא לא בונה את המעבדה עצמה, היא לא קוראת את המאזניים, והכי חשוב: היא לא מאמתת שום מספרים, נוסחאות או ציטוטים שהיא מייצרת בשמך. מודול זה מלמד כיצד להשתמש ב-AI בכימיה מקצה לקצה אך באחריות.

ביחידה הראשונה הזו, אני רוצה לשתול רעיון אחד בראשכם: AI הוא עוזר בכימיה, לא כימאי. כותב קוד, מייצר קווי מתאר, בונה מסגרת רטרו-סינתזה, עוזר לפרש שיאי ספקטרום, מסכם ספרות. עם זאת, הכימאי המוסמך הוא זה שמחליט אם ניתן לסנתז את המולקולה באמת, האם התגובה בטוחה או לא, האם ההתייחסות היא אמיתית או לא, והאחריות הסופית.

איפה AI משתלב בזרימת העבודה בכימיה?

בואו נחלק באופן גס פרויקט כימיה לחמישה שלבים: (1) רעיון וספרות, (2) תכנון מולקולה ותגובה, (3) יישום מעבדה, (4) ניתוח ואפיון, (5) דיווח. AI נושאת ערכים שונים מאוד בשלבים אלה.

  • רעיונות וספרות: בינה מלאכותית מסכמת נושא במהירות, מסבירה מושגי מפתח, מייצרת מונחי חיפוש. אבל הוא יכול להמציא ייחוס; עוד רגע נראה את זה.
  • עיצוב: מייצר SMILES (צורה של כתיבת המולקולה כמחרוזת טקסט; על כך בהמשך), מציע שלבי רטרו-סינתזה, מפרט חלופות תגובתיות. ההצעה טובה, לא ערובה.
  • מעבדה: בינה מלאכותית לא עושה כאן כלום. אמצעי שקילה, חימום ואבטחה מבוצעים על ידי בני אדם. AI רק עוזר לכתוב את ההליך; לפני ביצוע הליך זה אדם צריך לפקח עליו ליתר ביטחון.
  • ניתוח: בפירוש NMR, IR, ספקטרום מסה (אלה טכניקות מדידה המראות את מבנה המולקולה), YZ עוזר לקבץ את הפסגות ולפרט מבנים אפשריים. המשימה הסופית היא שלך.
  • דיווח: מייצר מחברת ניסיונית, טיוטת מאמר, טיוטת טופס בטיחות. זה חזק מאוד; אבל המספרים צריכים להתאים למספרים שלך.
טיפ: המקום הבטוח ביותר להשתמש בבינה מלאכותית הוא באזורי "אם משהו משתבש יבחינו בו ויתוקנו מיד": טיוטה של ​​טקסט, שלד קוד, תיאור מונח. המקומות המסוכנים ביותר הם אזורי "אם שקרי, זה מתפשט בשקט": קבועים, הפניות, הצהרות ביטחוניות, תוצאות מספריות.

למה אנחנו צריכים להיזהר? שלושה סיכונים מבניים

מודל השפה הגדול אינו מחשבון או מנוע כימיה. מייצר טקסט שסטטיסטית "נראה סביר". זה מוביל לשלושה סיכונים קונקרטיים בכימיה:

  1. מורכב (הזיה): יכול לרשום בביטחון תרכובת שאינה מודל, תגובה שאינה קיימת או משקל מולקולרי שגוי. לדוגמה, זה אומר "המשקל המולקולרי של תרכובת X הוא 154.2 גרם/מול", בעוד שהערך הנכון הוא 168.2.
  2. ציטוט מזויף: עשוי לתת מקור שנראה ריאליסטי אך אינו קיים כלל, כגון "Smith et al., 2019, Journal of Organic Chemistry". הוא יכול אפילו להמציא מספר DOI.
  3. כשל בטיחותי: יכול להציג שילוב מסוכן של ריאגנטים (למשל מחמצן וממס אורגני ביחס לא הולם) כ"אין בעיה".

שלושת הסיכונים הללו יופיעו שוב ושוב בכל יחידה של מודול זה. הפתרון הוא לא לברוח מ-AI, אלא לבסס את הדיסציפלינה של אימות כל פלט עם מקור עצמאי.

מיני תיקים

מקרה 1 - משקל מולקולרי מותאם. סטודנט לתואר שני שאל את AI את המשקל המולקולרי של פארא-ניטרופנול. "139.11 גרם/מול", אמר ה-AI. התלמיד היה בטוח בעצמו ותכנן לשקול 6.96 גרם עבור 0.05 מול. עם זאת, המשקל המולקולרי של פארא-ניטרופנול הוא 139.11 גרם/מול, והפעם זה היה נכון - אבל התלמיד מעולם לא בדק. על התרכובת הבאה (פארא-אמינופנול, ערך בפועל 109.13 גרם/מול) YZ אמר "123.15"; הפעם התלמיד תפס אותו על ידי חישובו ביד מהנוסחה (C6H7NO2): 6×12.011 + 7×1.008 + 14.007 + 2×15.999 = 109.13. שיעור: חשב כל משקל מולקולרי ללא נוסחה.

מקרה 2 - DOI מזויף. חוקר ביקש מ-AI 5 מקורות בסקירת הספרות שלו. ה-DOI של שניים מתוך החמישה חזר "לא נמצא" לאחר לחיצה; הכותרות היו עובדתיות, אבל הכתבות לא. בזבוז זמן 40 דקות. לקח: לא יש להשתמש בכל ציטוט ללא אימות במסד הנתונים (DOI, PubMed, Reaxys).

מקרה 3 - מפגע שנראה בטוח. משתמש שאל את ה-AI על הליך ניקוי; AI הפיקה בעקיפין הצעה של ערבוב של תמיסה המכילה היפוכלוריט עם תמיסה חומצית - שילוב שעלול לשחרר גז כלור. למרבה המזל המשתמש הסתכל בגיליון נתוני הבטיחות (SDS) והפסיק. לקח: כל הליך נבדק על ידי אנוש לאיתור SDS וסכנה לפני יישום.

הנחיה חלשה / הנחיה חזקה

הנחיה חלשה:

סנתז את המולקולה הזו.

טענה זו מעורפלת: איזו מולקולה, אילו חומרי מוצא, איזה קנה מידה, אילו אילוצים? בינה מלאכותית משלימה את הפערים.

הנחיה עוצמתית:

תפקיד: אתה עוזר מנוסה בסינתזה אורגנית. מולקולת יעד: 4-מתוקסי-אצטופנון (חיוכים: COc1ccc(cc1)C(C)=O). יש לנו אניסול כחומר המוצא. משימה: תן הצעת רטרו-סינתזה בת 2 שלבים. לכל שלב: ריאגנטים, תנאים (טמפרטורה, ממס) ותגובות לוואי אפשריות. אילוץ: סמן "VERIFY" היכן שאינך בטוח, מתאים. פלט: שלבים ממוספרים + רשימת נקודות לאימות.

הבדל: תפקיד, יעד מדויק (עם SMILES), הקשר, מספר שלבים, פורמט פלט ואילוץ "התאמה". אלו הם חמשת המרכיבים של הנחיה טובה בכימיה: תפקיד, ייצוג מבנה מדויק, הקשר, משימה, אילוץ אימות.

סוגי כלי AI: מודל שפה או כלי כימיה?

בכימיה אתה נתקל בשני "AI" שונים וחשוב לא לבלבל ביניהם:

ז'אנר

מה עושה

אמינות

שימוש לדוגמה

מודל שפה כללי

מייצר טקסט/קוד, מסביר, כותב טיוטות

נמוך במספרים, גבוה בשפה

מתווה נוהל, הסבר טרמינולוגיה

ספריית כימיה (RDKit וכו')

מעבד את המולקולה באופן דטרמיניסטי, מחשב את המשקל המולקולרי

גבוה (מבוסס כללים)

אימות SMILES, חשבון MA

מודל חיזוי מותאם אישית (רטרו-סינתזה, תכונה)

נותן חיזוי מיומן בנתונים

בינוני, תלוי באזור

רטרו-סינתזה, הערכת מסיסות

ספרות/כלי חיפוש

שאילתות אמיתיות של מסד נתונים

גבוה תלוי במקור

אישור ייחוס, חיפוש תגובה

זרימת העבודה החזקה ביותר משלבת את אלה: מודל השפה מייצר את הרעיון, ספריית הכימיה מחשבת את המספר באופן דטרמיניסטי, כלי הספרות מאמת את הייחוס, האדם מאמת. את השרשרת הזו נקים ביחידות הבאות.

משמעת אימות: ארבעה שלבים

קח כל פלט AI דרך ארבעת השלבים הבאים לפני הכניסה למעבדה או לדיווח:

  1. מבנה: האם סימון המולקולה/תגובה (SMILES/InChI) חוקי? האם ניתן לנתח אותו עם כלי (RDKit)?
  2. מספר: האם משקל מולקולרי, סטוכיומטריה, חישוב תשואה אומתו באופן עצמאי (ביד או בספריה)?
  3. מקור: האם כל טענה וייחוס אומתו במסד נתונים אמיתי?
  4. בטיחות: האם קראו את SDS עבור כל מגיב בהליך, האם יש שילובים מסוכנים?
הערה: ארבעת השלבים האלה חלים "תמיד", לא "לפעמים". 20 מצבים בהם AI נכון אינם מתרצים מצב 1 בו הוא לא נכון; כי בכימיה המצב הזה יכול להיות פיצוץ, הרעלה או מאמר שנסוג.

טעויות נפוצות

  • טעות בפלט AI כ"משאב". AI הוא לא משאב, אלא מחולל שמנסה לזכור משאבים (לפעמים בצורה לא נכונה). זה מסד הנתונים של המקור.
  • סומך על המספר. שימוש במספרים כגון משקל מולקולרי, pKa, נקודת רתיחה מבלי לאמת אותם. ניתן לחשב/לחפש אותם באופן דטרמיניסטי; לשאול את מודל השפה היא הדרך החלשה ביותר.
  • מיקור חוץ של אבטחה ל-AI. "AI לא אמר שזה מסוכן" לא אומר שזה בטוח. הערכת סיכונים היא התפקיד של האדם ושל SDS.
  • הנחיה מעורפלת. לא נותן את המולקולה לפי שמה אלא לפי המבנה שלה (SMILES/InChI); זה מוביל למולקולות שגויות עקב בלבול שמות.
  • סומך על ניסיון אחד בלבד. שואלים שוב את אותה שאלה בצורה אחרת ולא בודקים עקביות.

לסיכום

  • AI הוא עוזר שולחני רב עוצמה בכימיה: הוא מייצר קוד, קווי מתאר, תיאורים, סריקת שלדים; אבל המעבדה לא עושה את זה ואינה מאמתת את הפלט שלה.
  • ישנם שלושה סיכונים מובנים: תרכובת/מספר מזויפים, ייחוס מזויף, כשל אבטחה.
  • הפרד ושלב מודל שפה כללי וכלי כימיה דטרמיניסטים (RDKit, מסדי נתונים).
  • קח כל פלט דרך ארבעת השלבים של מבנה–מספר–מקור–אבטחה.
  • הנחיה טובה: כוללת תפקיד, ייצוג מבנה מפורש, הקשר, משימה, אילוץ אימות.

משימת יישום

בחר מולקולה שחקרתם בעצמכם (למשל אספירין, SMILES: CC(=O)Oc1ccccc1C(=O)O). שאל את הבינה המלאכותית שלושה דברים: (1) משקל מולקולרי, (2) שני מאמרי עיון, (3) שלב סינתזה. לאחר מכן אמת כל אחד באופן עצמאי: חשב באופן ידני את המשקל המולקולרי מהנוסחה, אשר ציטוטים עם DOI, בחן את שלב הסינתזה בעין אבטחה. איזה פלט יצא נכון ואיזה דרש תיקון? שמור "יומן אימות" של חצי עמוד.

רשימת בדיקה

  • [ ] הבנתי ש-AI הוא עוזר, לא כימאי.
  • [ ] אני מזהה את הסיכונים של בדיה, ייחוס שווא וחוסר אמון בעזרת דוגמאות.
  • [ ] אני יכול להבחין בין מודל שפה לכלי כימיה דטרמיניסטים.
  • [ ] אני אחיל את ארבעת השלבים של מבנה–מספר–מקור–אבטחה על כל פלט.
  • [ ] אני מתאר מולקולות לפי סימון מבנה (SMILES/InChI), לא לפי שם.
  • [ ] שמרתי לפחות יומן אימות אחד.