Unit 1 / 11

Pengenalan kepada Kepintaran Buatan dalam Kimia: Peranan, Sempadan, Pengesahan dan Etika

Keuntungan:

  • Dapat membezakan di mana kecerdasan buatan menjimatkan masa dalam aliran kerja kimia (idea, reka bentuk, analisis, pelaporan) dan di mana struktur, nombor, sumber dan keputusan keselamatan diserahkan kepada manusia, bergantung pada tahap risiko.
  • Keupayaan untuk menerapkan disiplin yang secara bebas menyemak setiap output dengan empat langkah Struktur-Nombor-Sumber-Keselamatan
  • Fahami sebab sebatian dan nombor rekaan, rujukan palsu dan salah tanggapan keselamatan merupakan risiko kepada profesion ini yang mesti dipertimbangkan sejak awal lagi.

Kimia ialah sains eksperimen yang mengkaji struktur, penjelmaan dan sifat jirim. Seorang ahli kimia menimbang, melarutkan, memanaskan dan menyukat di makmal; Di mejanya, dia melukis molekul, merancang tindak balas, mentafsir spektrum, mengimbas kesusasteraan dan menulis laporan. Kecerdasan buatan (pendek kata AI, di sini khusus perisian yang menjana teks dengan meramalkan "perkataan kemungkinan besar seterusnya," yang dilatih pada model bahasa yang besar, iaitu, data teks besar-besaran) boleh mempercepatkan banyak kerja meja ini secara mendadak. Tetapi ia tidak membina makmal itu sendiri, ia tidak membaca skala, dan yang paling penting: ia tidak mengesahkan sebarang nombor, formula atau petikan yang dihasilkan bagi pihak anda. Modul ini mengajar cara menggunakan AI dalam kimia hujung ke hujung tetapi secara bertanggungjawab.

Dalam unit pertama ini, saya ingin menanam satu idea dalam fikiran anda: AI ialah pembantu dalam kimia, bukan ahli kimia. Menulis kod, menghasilkan garis besar, membina rangka kerja retrosintesis, membantu mentafsir puncak spektrum, meringkaskan kesusasteraan. Walau bagaimanapun, ahli kimia yang berwibawalah yang memutuskan sama ada molekul itu sebenarnya boleh disintesis, sama ada tindak balas adalah selamat atau tidak, sama ada rujukan itu tulen atau tidak, dan tanggungjawab muktamad.

Di manakah AI sesuai dengan aliran kerja kimia?

Mari kita bahagikan projek kimia secara kasar kepada lima fasa: (1) idea dan literatur, (2) reka bentuk molekul dan tindak balas, (3) aplikasi makmal, (4) analisis dan pencirian, (5) pelaporan. AI membawa nilai yang sangat berbeza pada peringkat ini.

  • Idea dan literatur: AI meringkaskan topik dengan cepat, menerangkan konsep utama, menjana istilah carian. Tetapi dia boleh membuat atribusi; Kita akan lihat ini sebentar lagi.
  • Reka bentuk: Menghasilkan SMILES (satu bentuk penulisan molekul sebagai rentetan teks; lebih lanjut mengenainya kemudian), mencadangkan langkah-langkah retrosintesis, menyenaraikan alternatif reaktif. Cadangan itu bagus, bukan jaminan.
  • Makmal: AI tidak melakukan apa-apa di sini. Menimbang, memanaskan dan langkah keselamatan dijalankan oleh manusia. AI hanya membantu menulis prosedur; Sebelum melakukan prosedur itu, manusia perlu mengawasinya untuk keselamatan.
  • Analisis: Dalam mentafsir NMR, IR, spektrum jisim (ini adalah teknik pengukuran yang menunjukkan struktur molekul), YZ membantu mengumpulkan puncak dan menyenaraikan kemungkinan struktur. Tugasan terakhir adalah milik anda.
  • Pelaporan: Menghasilkan buku nota eksperimen, draf artikel, draf borang keselamatan. Ia sangat berkuasa; tetapi nombor harus sepadan dengan anda.
Petua: Tempat paling selamat untuk menggunakan AI adalah di kawasan "jika berlaku kesilapan, ia akan disedari dan diperbaiki serta-merta": teks draf, rangka kod, perihalan istilah. Tempat paling berisiko ialah kawasan "jika palsu, ia merebak secara senyap": pemalar, rujukan, penegasan keselamatan, hasil berangka.

Mengapa kita perlu berhati-hati? Tiga risiko struktur

Model bahasa besar bukanlah kalkulator atau enjin kimia. Menghasilkan teks yang secara statistik "kelihatan berkemungkinan". Ini membawa kepada tiga risiko konkrit dalam kimia:

  1. Dibuat (halusinasi): Boleh menulis sebatian yang bukan model, tindak balas yang tidak wujud, atau berat molekul yang salah dengan yakin. Sebagai contoh, ia berkata "Berat molekul sebatian X ialah 154.2 g/mol", manakala nilai yang betul ialah 168.2.
  2. Petikan palsu: Boleh memberikan sumber yang kelihatan realistik tetapi tidak wujud sama sekali, seperti "Smith et al., 2019, Journal of Organic Chemistry." Dia juga boleh membuat nombor DOI.
  3. Kekeliruan keselamatan: Boleh mengemukakan gabungan berbahaya reagen (cth. pengoksida dan pelarut organik dalam nisbah yang tidak sesuai) sebagai "tiada masalah".

Ketiga-tiga risiko ini akan muncul berulang kali dalam setiap unit modul ini. Penyelesaiannya bukan untuk melarikan diri daripada AI, tetapi untuk mewujudkan disiplin mengesahkan setiap output dengan sumber bebas.

kes mini

Kes 1 — Berat molekul terpasang. Seorang pelajar siswazah bertanya kepada AI berat molekul untuk para-nitrophenol. "139.11 g/mol," kata AI. Pelajar itu yakin dan merancang untuk menimbang 6.96 g untuk 0.05 mol. Walau bagaimanapun, berat molekul para-nitrophenol ialah 139.11 g/mol, dan kali ini ia betul — tetapi pelajar tidak pernah menyemak. Pada sebatian seterusnya (para-aminophenol, nilai sebenar 109.13 g/mol) YZ berkata "123.15"; Kali ini pelajar menangkapnya dengan mengiranya dengan tangan daripada formula (C6H7NO2): 6×12.011 + 7×1.008 + 14.007 + 2×15.999 = 109.13. Pelajaran: kira setiap berat molekul tanpa formula.

Kes 2 — DOI Palsu. Seorang penyelidik meminta AI untuk 5 sumber dalam tinjauan literaturnya. DOI dua daripada lima dikembalikan "tidak dijumpai" apabila diklik; Tajuk berita adalah fakta, tetapi artikel itu tidak. Membuang masa 40 minit. Pengajaran: tidak setiap petikan harus digunakan tanpa pengesahan dalam pangkalan data (DOI, PubMed, Reaxys).

Kes 3 — Bahaya yang kelihatan selamat. Seorang pengguna bertanya kepada AI tentang prosedur pembersihan; AI secara tidak langsung menghasilkan cadangan mencampurkan larutan yang mengandungi hipoklorit dengan larutan berasid—gabungan yang boleh membebaskan gas klorin. Nasib baik pengguna melihat helaian data keselamatan (SDS) dan berhenti. Pengajaran: setiap prosedur diperiksa oleh manusia untuk SDS dan bahaya sebelum dilaksanakan.

Gesaan lemah / Gesaan kuat

Gesaan yang lemah:

Mensintesis molekul ini.

Tuntutan ini tidak jelas: molekul apa, bahan permulaan apa, skala apa, kekangan apa? AI membentuk jurang.

Gesaan kuat:

Peranan: Anda seorang pembantu berpengalaman dalam sintesis organik. Molekul sasaran: 4-methoxyacetophenone (SENYUM: COc1ccc(cc1)C(C)=O). Kami mempunyai anisole sebagai bahan permulaan. Tugasan: Berikan cadangan retrosintesis 2 langkah. Untuk setiap langkah: reagen, keadaan (suhu, pelarut), dan tindak balas sampingan yang MUNGKIN. Kekangan: Tandakan "VERIFY" di mana anda tidak pasti, sesuai.Output: langkah bernombor + senarai mata untuk disahkan.

Perbezaan: peranan, sasaran tepat (dengan SMILES), konteks, bilangan langkah, format output dan kekangan "penyesuaian". Ini adalah lima komponen dorongan yang baik dalam kimia: peranan, perwakilan struktur yang tepat, konteks, tugas, kekangan pengesahan.

Jenis alat AI: model bahasa atau alat kimia?

Dalam kimia anda menghadapi dua "AI" yang berbeza dan adalah penting untuk tidak mengelirukan mereka:

Genre

Apa yang boleh

kebolehpercayaan

Contoh penggunaan

Model bahasa umum

Menghasilkan teks/kod, menerangkan, menulis draf

Rendah pada nombor, tinggi pada bahasa

Garis besar prosedur, penjelasan istilah

Perpustakaan kimia (RDKit dll.)

Memproses molekul secara deterministik, mengira berat molekul

Tinggi (berasaskan peraturan)

Pengesahan SMILES, akaun MA

Model ramalan tersuai (retrosintesis, ciri)

Memberi ramalan terlatih data

Sederhana, bergantung pada kawasan

Retrosintesis, anggaran keterlarutan

Sastera/alat carian

Pertanyaan pangkalan data sebenar

Tinggi bergantung kepada sumber

Pengesahan atribusi, carian reaksi

Aliran kerja yang paling mantap menggabungkan ini: model bahasa menjana idea, perpustakaan kimia mengira nombor secara deterministik, alat kesusasteraan mengesahkan atribusi, manusia mengesahkan. Kami akan mewujudkan rantaian ini dalam unit seterusnya.

Disiplin pengesahan: EMPAT langkah

Ambil setiap output AI melalui empat langkah ini sebelum memasukkannya ke dalam makmal atau laporkan:

  1. Struktur: Adakah notasi molekul/tindak balas (SMILES/InChI) sah? Bolehkah ia dihuraikan dengan alat (RDKit)?
  2. Nombor: Adakah berat molekul, stoikiometri, pengiraan hasil telah disahkan secara bebas (dengan tangan atau perpustakaan)?
  3. Sumber: Adakah setiap tuntutan dan atribusi telah disahkan dalam pangkalan data sebenar?
  4. Keselamatan: Adakah SDS telah dibaca untuk setiap reagen dalam prosedur, adakah terdapat sebarang kombinasi berbahaya?
Nota: Empat langkah ini digunakan "selalu", bukan "kadang-kadang". 20 situasi di mana AI betul jangan alasan 1 situasi di mana ia tidak betul; kerana dalam kimia 1 situasi itu boleh menjadi letupan, keracunan atau artikel yang ditarik balik.

Kesilapan biasa

  • Menganggap output AI sebagai "sumber". AI bukan sumber, tetapi penjana yang cuba mengingati sumber (kadang-kadang salah). Ia adalah pangkalan data sumber.
  • Mempercayai nombor itu. Menggunakan nombor seperti berat molekul, pKa, takat didih tanpa mengesahkannya. Ini boleh dikira/dicari secara deterministik; Bertanya model bahasa adalah cara yang paling lemah.
  • Keselamatan penyumberan luar kepada AI. "AI tidak mengatakan ia berbahaya" tidak bermakna ia selamat. Penilaian bahaya adalah tugas manusia dan SDS.
  • Gesaan samar-samar. Tidak memberikan molekul dengan namanya tetapi dengan strukturnya (SENYUM/InChI); Ini membawa kepada molekul yang tidak betul kerana kekeliruan nama.
  • Percaya hanya dengan satu percubaan. Menanyakan soalan yang sama sekali lagi dengan cara yang berbeza dan tidak menyemak konsistensi.

Secara ringkasnya

  • AI ialah pembantu meja yang berkuasa dalam kimia: ia menghasilkan kod, garis besar, penerangan, rangka imbasan; tetapi makmal tidak melakukannya dan tidak mengesahkan outputnya.
  • Terdapat tiga risiko yang wujud: kompaun/nombor palsu, atribusi palsu, kesilapan keselamatan.
  • Asingkan dan gabungkan model bahasa am dan alat kimia deterministik (RDKit, pangkalan data).
  • Ambil setiap output melalui empat langkah Struktur–Nombor–Sumber–Keselamatan.
  • Gesaan yang baik: termasuk peranan, perwakilan struktur eksplisit, konteks, tugas, kekangan pengesahan.

Tugasan permohonan

Pilih molekul yang telah anda pelajari sendiri (cth. aspirin, SMILES: CC(=O)Oc1ccccc1C(=O)O). Tanya AI tiga perkara: (1) berat molekul, (2) dua kertas rujukan, (3) langkah sintesis. Kemudian sahkan setiap satu secara bebas: kira berat molekul secara manual daripada formula, sahkan petikan dengan DOI, periksa langkah sintesis dengan mata keselamatan. Output manakah yang keluar dengan betul dan yang manakah memerlukan pembetulan? Simpan "log pengesahan" separuh halaman.

senarai semak

  • [ ] Saya menyedari bahawa AI adalah pembantu, bukan ahli kimia.
  • [ ] Saya menyedari risiko pemalsuan, atribusi palsu dan ketidakpercayaan dengan contoh.
  • [ ] Saya boleh membezakan antara model bahasa dan alat kimia deterministik.
  • [ ] Saya akan menggunakan empat langkah Struktur–Nombor–Sumber–Keselamatan pada setiap output.
  • [ ] Saya menerangkan molekul mengikut tatatanda struktur (SMILES/InChI), bukan dengan nama.
  • [ ] Saya menyimpan sekurang-kurangnya satu log pengesahan.