หน่วย
1. ปัญญาประดิษฐ์เบื้องต้นในวิชาเคมี: บทบาท ขอบเขต การตรวจสอบความถูกต้อง และจริยธรรม 2. การเป็นตัวแทนระดับโมเลกุลและโครงสร้างทางเคมี: การตรวจสอบความถูกต้องด้วย SMILES, InChI และ RDKit 3. การทำนายปฏิกิริยาและกลไก: ผลิตภัณฑ์ สภาพ และการทำนายปฏิกิริยาที่ไม่พึงประสงค์ 4. รองรับการตีความสเปกตรัม: NMR, IR และ Mass Spectrometry 5. การทบทวนวรรณกรรมและการวางแผนการสังเคราะห์: แหล่งที่มา ขั้นตอน และแผนงาน 6. การวิเคราะห์ข้อมูลทางเคมีและ Python: แพนด้า ปริมาณสัมพันธ์ และการสอบเทียบ 7. การทำนายคุณสมบัติระดับโมเลกุลและ QSAR: ความละเอียด pKa และขีดจำกัดของโมเดล 8. เอกสารประกอบห้องปฏิบัติการ: สมุดบันทึกการทดลอง, ELN และความสามารถในการทำซ้ำ 9. การประเมินความปลอดภัยและอันตราย: GHS, SDS และขีดจำกัดของปัญญาประดิษฐ์ 10. การยืนยัน ภาพหลอน และความซื่อสัตย์ทางวิทยาศาสตร์ 11. มนุษย์ในการทดลอง: จริยธรรม ความเป็นส่วนตัว ความรับผิดชอบ และขั้นตอนการทำงานแบบครบวงจร
หน่วย 6 / 11

การวิเคราะห์ข้อมูลทางเคมีและ Python: แพนด้า ปริมาณสัมพันธ์ และการสอบเทียบ

กำไร:

  • ความสามารถในการยึดผลลัพธ์เชิงตัวเลขตามโค้ด Python ที่ดำเนินการ แทนที่จะคาดเดาโมเดลภาษาด้วยวาจา
  • ความสามารถในการเขียนปริมาณสัมพันธ์ การสอบเทียบ และโค้ดการล้างข้อมูลไปยังปัญญาประดิษฐ์ และทดสอบด้วยตัวอย่างพร้อมคำตอบที่ทราบ
  • ความสามารถในการป้องกันข้อผิดพลาดในการวิเคราะห์ข้อมูลโดยการระบุหน่วยและตรวจสอบลำดับอยู่เสมอ

เคมีเต็มไปด้วยตัวเลข การชั่งน้ำหนัก ปริมาตร ค่าการดูดกลืนแสง อัตราผลตอบแทน ความเข้มข้น การประมวลผลข้อมูลนี้ด้วยตนเองช้าและเกิดข้อผิดพลาดได้ง่าย AI ให้บริการหลักสองประการที่นี่: (1) เขียนโค้ด Python ที่ประมวลผลข้อมูล (2) รันโค้ดนั้น (ในสภาพแวดล้อมที่สามารถรันโค้ดได้) และให้ผลลัพธ์ตามที่กำหนด หลักการสำคัญคือ: ปล่อยให้การคำนวณอยู่ที่ผลลัพธ์ของโค้ดที่ดำเนินการ ไม่ใช่ "การทำนายด้วยวาจา" ของโมเดลภาษา โมเดลภาษา "142 × 0.05 คืออะไร" บางครั้งอาจตอบคำถามไม่ถูกต้อง แต่บรรทัด Python ที่เขาเขียนจะคำนวณอย่างถูกต้องเสมอ ในหน่วยนี้ เราจะเรียนรู้การวิเคราะห์ข้อมูลทางเคมีด้วย AI ด้วยปรัชญานี้

ทำไมโค้ดถึงดีกว่าการคาดเดาด้วยวาจา?

แบบจำลองภาษาคำนวณโดย "ทำนายผลลัพธ์ที่เป็นไปได้"; ดังนั้นจึงอาจผิดกับตัวเลขจำนวนมากหรือแคลคูลัสหลายขั้นตอนได้ ในขณะที่ใน Python นิพจน์ 142 * 0.05 ถูกกำหนดไว้ แต่จะส่งคืน 7.1 เสมอ ดังนั้นกลยุทธ์: อย่าให้ AI คำนวณ พิมพ์ CODE ของการคำนวณแล้วรันโค้ด ดังนั้นคุณจึงใช้ความคิดสร้างสรรค์ของ AI (การสร้างโค้ด) และปิดการใช้งานด้านที่ไม่น่าเชื่อถือ (เลขคณิตหัว)

เคล็ดลับ: เมื่อคุณได้รับผลลัพธ์ที่เป็นตัวเลขจาก AI ให้พูดว่า "แสดงสิ่งนี้ด้วยบรรทัดของ Python" รหัสจะยืนยันบัญชีและช่วยให้คุณสามารถเรียกใช้และยืนยันได้ หากคุณไม่เห็นรหัส อย่าเชื่อถือหมายเลขนั้น

งานวิเคราะห์ข้อมูลทั่วไปในวิชาเคมี

  • ปริมาณสัมพันธ์: โมล มวล สารจำกัด ผลผลิตทางทฤษฎี การคำนวณเปอร์เซ็นต์ผลผลิต
  • ความเข้มข้น: โมลาริตี, การเจือจาง (M1V1 = M2V2), การแปลง ppm
  • การสอบเทียบ: วาดเส้นสอบเทียบตามกฎเบียร์-แลมเบิร์ต (การดูดกลืนแสง ∝ ความเข้มข้น) และการคำนวณค่าที่ไม่ทราบ
  • การล้างข้อมูล: การอ่านตารางการวัดด้วยแพนด้า การทำเครื่องหมายค่าผิดปกติ ค่าเฉลี่ย/ส่วนเบี่ยงเบนมาตรฐาน
  • การแสดงภาพ: การวาดเส้นโค้งการสอบเทียบ กราฟจลนศาสตร์ เส้นโค้งการไตเตรท

ทีละขั้นตอน: การวิเคราะห์ข้อมูลที่ปลอดภัยด้วย AI

  1. กำหนดข้อมูล: ระบุคอลัมน์ หน่วย แถวตัวอย่างให้ชัดเจน หากไม่มียูนิต AI จะทำการสันนิษฐาน
  2. ถามรหัส ไม่ใช่ผลลัพธ์: พูดว่า "เขียนรหัส pandas/NumPy ที่คำนวณสิ่งนี้"
  3. รันโค้ด: รันด้วยตัวเองหรือในสภาพแวดล้อมที่สามารถรันโค้ดได้
  4. ทดสอบด้วยกรณีง่ายๆ: ทดสอบโค้ดด้วยตัวอย่างเล็กๆ น้อยๆ ที่คุณทราบคำตอบ
  5. การตรวจสอบหน่วยและคำสั่งซื้อ: หน่วยและขนาดของผลลัพธ์มีความสมเหตุสมผลทางกายภาพหรือไม่
  6. เอกสาร: เพิ่มโค้ดและส่งออกไปยังสมุดบันทึกการทดลอง (หน่วยที่ 8)

เทมเพลตที่สามารถคัดลอกได้สี่แบบ

1) ปริมาณสัมพันธ์และผลผลิตร้อยละ:

ปฏิกิริยา: กรดซาลิไซลิก (MA 138.12) + อะซิติกแอนไฮไดรด์ -> แอสไพริน (MA 180.16) ข้อมูล: ใช้กรดซาลิไซลิก 2.00 กรัม มีอะซิติกแอนไฮไดรด์มากเกินไป แอสไพรินที่ได้รับ: 2.15 กรัม งาน: เขียนโค้ด Python ที่คำนวณผลผลิตทางทฤษฎีและเปอร์เซ็นต์ผลผลิต กำหนดน้ำหนักโมเลกุลเป็นตัวแปร พิมพ์ผลลัพธ์เป็นหน่วย อย่าคำนวณในส่วนหัว เพียงแค่ให้รหัสปฏิบัติการ

2) การสอบเทียบเบียร์-แลมเบิร์ต:

ข้อมูลการสอบเทียบ (ความเข้มข้น โมล/ลิตร -> การดูดกลืนแสง): 0.00->0.02, 0.02->0.21, 0.04->0.40, 0.06->0.62, 0.08->0.79 การดูดกลืนแสงตัวอย่างที่ไม่รู้จัก: 0.50 ภารกิจ: ทำการสอบเทียบเชิงเส้นด้วย numpy.polyfit ความชัน/จุดตัด และคำนวณ R^2 ค้นหาความเข้มข้นที่ไม่ทราบ พล็อตข้อมูล + เส้นพอดีด้วย matplotlib

3) แผนภูมิการวัดด้วยแพนด้า:

ฉันมี CSV: คอลัมน์ = ตัวอย่าง, น้ำหนัก_กรัม, ปริมาตร_มล., การดูดกลืนแสง ภารกิจ: อ่านด้วยแพนด้า คำนวณความเข้มข้น (กรัม/ลิตร) สำหรับแต่ละตัวอย่าง ทำเครื่องหมายแถวที่มีค่าการดูดกลืนแสง < 0 ว่าไม่ถูกต้อง ให้รหัสเพื่อพิมพ์ค่าเฉลี่ยและส่วนเบี่ยงเบนมาตรฐานของกลุ่ม ระบุหน่วยด้วยบรรทัดแสดงความคิดเห็น

4) การตรวจสอบบัญชีเจือจาง:

ฉันต้องการเตรียมสารละลาย 0.05 โมลาร์ 100 มล. จากสารละลายสต๊อก 0.5 โมลาร์ ภารกิจ: เขียนบรรทัด Python ที่คำนวณปริมาณสต็อคที่ต้องการด้วย M1V1=M2V2 Print the result in mL and verify as a comment that a 10-fold dilution is expected for a logic check.

พรอมต์อ่อน / พรอมต์แรง

อ่อนแอ:

แอสไพรินมาจากกรดซาลิไซลิก 2 กรัมเท่าใด

AI ให้ตัวเลขจากหัว; หากจำน้ำหนักโมเลกุลไม่ถูกต้อง ผลลัพธ์ที่ได้จะบิดเบี้ยว และวิธีการคำนวณจะไม่ปรากฏให้เห็น

แข็งแกร่ง:

สมมติว่ากรดซาลิไซลิก MA=138.12 แอสไพริน MA=180.16 มวล=2.00 กรัม ให้ผลลัพธ์ 100% ภารกิจ: เขียนโค้ด Python ที่คำนวณมวลทางทฤษฎีของแอสไพริน แสดงความคิดเห็นในแต่ละขั้นตอน (โมล -> โมล -> มวล) พิมพ์ผลลัพธ์เป็น g

ความแตกต่าง: ให้น้ำหนักโมเลกุล, รหัสที่ร้องขอ, ขั้นตอนที่แสดงความเห็น, หน่วยที่ระบุ ผลลัพธ์ที่ได้มีทั้งความถูกต้องและตรวจสอบได้

การทำนายด้วยวาจา ฯลฯ ดำเนินการโค้ด

ขนาด

การทำนายด้วยวาจาแบบจำลองภาษา

วิ่งหลาม

ความแม่นยำทางคณิตศาสตร์

เปลี่ยนแปลงได้ อาจเกิดข้อผิดพลาดได้

กำหนดอย่างแน่นอน

ความสามารถในการตรวจสอบ

การแท้งบุตร (ไม่ชัดเจนว่าเกิดขึ้นได้อย่างไร)

สูง (มองเห็นโค้ดได้)

การทำซ้ำ

ต่ำ

สูง

การติดตามหน่วย

อ่อนแอ

สามารถเปิดเก็บไว้ในโค้ดได้

การใช้งานที่เหมาะสม

แนวคิดโครงสร้างอาคาร

ผลลัพธ์ตัวเลขสุดท้าย

กรณีขนาดเล็ก

กรณีที่ 1 — ข้อผิดพลาดทางคณิตศาสตร์ทางวาจา นักเรียนถาม AI “0.0145 mol × 180.16 g/mol?” เขาถาม; “2.72 กรัม” AI กล่าว จริงๆแล้วมันคือ 2.61g. เมื่อนักเรียนพูดว่า "แสดงสิ่งนี้ใน Python" YZ เขียน 0.0145 * 180.16 และออกมาเป็น 2,612; คำตอบด้วยวาจาครั้งแรกไม่ถูกต้อง บทเรียน: ชอบโค้ดมากกว่าแม้จะเป็นการคูณแบบง่ายๆ

กรณีที่ 2 — การตรวจสอบ R² ในการสอบเทียบ ผู้ใช้รายหนึ่งทำการสอบเทียบเบียร์-แลมเบิร์ตเสร็จแล้ว ปรากฎว่าR² = 0.981 AI บอกว่า "เชิงเส้น เชื่อถือได้" แต่จุดที่ความเข้มข้นสูงสุดอยู่ต่ำกว่าเส้น (ความอิ่มตัว) เมื่อผู้ใช้เห็นกราฟ แสดงว่าจุดสูงสุดออกจากช่วงเชิงเส้น R² เพิ่มขึ้นเป็น 0.999 บทเรียน: R² เพียงอย่างเดียวไม่เพียงพอ ดูที่เหลือ/แปลง

กรณีที่ 3 — ความสับสนของหน่วย ในการวิเคราะห์ครั้งหนึ่ง ไม่ชัดเจนว่าความเข้มข้นเป็น mg/L หรือ g/L; AI สันนิษฐานว่า g/L และผลลัพธ์นั้นผิด 1,000 ครั้ง ได้รับการแก้ไขแล้วเมื่อผู้ใช้ระบุหน่วยคอลัมน์อย่างชัดเจน บทเรียน: ควรเปลี่ยนหน่วยให้สั้นเสมอ โดยสมมติว่า AI มีราคาแพง

ข้อผิดพลาดทั่วไป

  • อาศัยจำนวนวาจา ขอและรันโค้ดเสมอแทนที่จะคำนวณทางจิต
  • ไม่ระบุหน่วย. การผสม mg/L กับ g/L, mL กับ L ทำให้เกิดข้อผิดพลาด 1,000 เท่า
  • ไม่ได้ทดสอบโค้ด นำไปใช้กับ Big Data โดยไม่ต้องทดสอบด้วยตัวอย่างเล็กๆ น้อยๆ ที่รู้คำตอบ
  • พิจารณาR²เป็นเกณฑ์เดียว เชื่อถือจุดที่ไม่เป็นเชิงเส้นโดยไม่ต้องเห็นเป็นภาพกราฟิก
  • ข้ามน้ำยาทดสอบ การคำนวณผลผลิตทางทฤษฎีโดยไม่ต้องกำหนดขีดจำกัดของรีเอเจนต์ในปริมาณสัมพันธ์
  • ก้าวสำคัญหลั่งไหล รายงานผลเป็น 8 หลัก เมื่อการวัดเป็นเลขนัยสำคัญ 3 หลัก
ข้อควรระวัง: แม้แต่โค้ดที่ AI เขียนก็อาจผิดพลาดได้ (ชื่อคอลัมน์ผิด สูตรผิด) การรันโค้ดทำให้ผลลัพธ์ถูกกำหนดไว้ แต่คุณต้องยืนยันด้วยตัวอย่างที่ทราบแล้วว่าโค้ดคำนวณสิ่งที่ถูกต้อง

โดยสรุป

  • ปล่อยให้ผลลัพธ์ที่เป็นตัวเลขอยู่ที่โค้ด Python ที่ดำเนินการ ไม่ใช่การคาดเดาด้วยวาจาของโมเดลภาษา
  • AI เขียนโค้ดอย่างรวดเร็วสำหรับปริมาณสัมพันธ์ การสอบเทียบ การล้างข้อมูล และการแสดงภาพในการวิเคราะห์ข้อมูลทางเคมี
  • ใส่ยูนิตเสมอ ความสับสนของหน่วยเป็นความผิดพลาดที่แพงที่สุด
  • ตรวจสอบสารตกค้างและกราฟนอกเหนือจาก R² ในการสอบเทียบ
  • ทดสอบโค้ดด้วยตัวอย่างง่ายๆ พร้อมคำตอบที่ทราบ มนุษย์ตรวจสอบความถูกต้องของรหัส

งานสมัคร

มีชุดข้อมูลการสอบเทียบหรือปริมาณสัมพันธ์ (หากไม่ใช่ ให้ใช้ข้อมูลเบียร์-แลมเบิร์ตด้านบน) ถาม AI สำหรับโค้ด Python ที่ทำการวิเคราะห์ (โค้ด ไม่ใช่ผลลัพธ์) เรียกใช้โค้ด จากนั้นทดสอบด้วยตัวอย่างคำตอบที่ทราบจำนวนเล็กน้อย ถาม AI ด้วยวาจาเพื่อคำนวณแบบเดียวกันและเปรียบเทียบผลลัพธ์ทั้งสอง: มีความแตกต่างหรือไม่? ตีความพล็อตของ R² และส่วนที่เหลือในการสอบเทียบ ใส่โค้ด เอาต์พุต และความคิดเห็นสั้นๆ ลงในเอกสาร

รายการตรวจสอบ

  • [ ] ฉันได้รับผลลัพธ์ที่เป็นตัวเลขจากโค้ด ไม่ใช่จากการเดาด้วยวาจา
  • [ ] ฉันระบุหน่วยของแต่ละคอลัมน์ข้อมูลอย่างชัดเจน
  • [ ] ฉันทดสอบโค้ดด้วยตัวอย่างเล็กๆ ที่ทราบคำตอบ
  • [ ] ฉันทำการวิเคราะห์สารตกค้าง/กราฟถัดจาก R² ในการสอบเทียบ
  • [ ] ฉันหาค่ารีเอเจนต์จำกัดในปริมาณสัมพันธ์
  • [ ] ฉันรายงานผลลัพธ์ด้วยตัวเลขนัยสำคัญที่เหมาะสม