หน่วย
1. ปัญญาประดิษฐ์เบื้องต้นในวิทยาศาสตร์ข้อมูลและการวิเคราะห์: ขั้นตอนการทำงาน บทบาท ขอบเขต การตรวจสอบความถูกต้อง และจริยธรรม 2. การรวบรวมข้อมูลและความเข้าใจแหล่งที่มา: สคีมา การสุ่มตัวอย่าง การรับรู้คุณภาพและการรั่วไหล 3. การล้างข้อมูลและการประมวลผลล่วงหน้า: ค่าที่หายไป ค่าผิดปกติ และการแปลงประเภท 4. การวิเคราะห์ข้อมูลเชิงสำรวจ (EDA): การแจกแจง ความสัมพันธ์ และข้อมูลเชิงลึกเบื้องต้น 5. วิศวกรรมเชิงคุณลักษณะ: การสร้างตัวแปร การเข้ารหัส การปรับขนาด และการหลีกเลี่ยงการรั่วไหล 6. การสร้างโมเดล: การนิยามปัญหา การเลือกอัลกอริทึม และการแบ่งการฝึกอบรม/การทดสอบ 7. การประเมินแบบจำลอง: การวัด การตรวจสอบข้าม และการเรียนรู้ขั้นสูง 8. การแสดงภาพและการเล่าเรื่อง: กราฟิกที่แม่นยำ กราฟิกที่เที่ยงตรง 9. การสร้างโค้ด: การวิเคราะห์โดยใช้ AI ด้วย Python (pandas) และ SQL 10. การรั่วไหลของข้อมูลและการทำซ้ำ: ภัยพิบัติเงียบและวินัย 11. มูลนิธิ MLOps จริยธรรม ความเป็นส่วนตัว และการวิเคราะห์อย่างมีความรับผิดชอบ
หน่วย 1 / 11

ปัญญาประดิษฐ์เบื้องต้นในวิทยาศาสตร์ข้อมูลและการวิเคราะห์: ขั้นตอนการทำงาน บทบาท ขอบเขต การตรวจสอบความถูกต้อง และจริยธรรม

กำไร:

  • ความสามารถในการแยกแยะขั้นตอนการทำงานหกขั้นตอนของวิทยาศาสตร์ข้อมูล (การนิยามปัญหา การรวบรวม การทำความสะอาด การค้นพบ การสร้างแบบจำลอง การสื่อสาร) และอำนาจหน้าที่ที่ปัญญาประดิษฐ์ทำงานในแต่ละขั้นตอน ตามระดับความเสี่ยงของงาน
  • ความสามารถในการใช้ระเบียบวินัยที่ตรวจสอบเอาต์พุตปัญญาประดิษฐ์แต่ละรายการโดยเชื่อมต่อกับแหล่งที่มา เรียกใช้และเปรียบเทียบ และส่งผ่านการกรองโดยผู้เชี่ยวชาญ
  • ความสามารถในการเปลี่ยนหลักความสามารถในการทำซ้ำและความเป็นส่วนตัว (การเขียนเป็นโค้ด การไม่เปิดเผยชื่อ) ให้เป็นนิสัยในการวิเคราะห์ตั้งแต่วันแรก

ข้อมูลดิบ ยุ่งเหยิง และมัก "โกหก" ตกลงบนโต๊ะนักวิทยาศาสตร์ข้อมูลทุกวัน ในตารางการขาย คอลัมน์วันที่จะเขียนในรูปแบบที่แตกต่างกันสามรูปแบบ หมายเลขลูกค้าเว้นว่างในบางบรรทัด ชื่อของคอลัมน์คือ "รายได้" แต่มีทั้งค่า TL และ USD งานของวิทยาศาสตร์ข้อมูลคือการตัดสินใจที่เชื่อถือได้จากความสับสนวุ่นวายนี้ รวบรวมข้อมูล ทำความสะอาด สำรวจ สร้างแบบจำลอง ตรวจสอบผลลัพธ์ และเปลี่ยนให้เป็นเรื่องราว ปัญญาประดิษฐ์ (AI หรือ AI เรียกสั้นๆ ว่าระบบคอมพิวเตอร์ที่สามารถสร้างข้อความและโค้ด จดจำรูปแบบ สรุป และคาดการณ์) สามารถสัมผัสทุกลิงก์ในห่วงโซ่นี้: การเขียนโค้ดล้างข้อมูลในไม่กี่นาที แนะนำกราฟสำหรับการวิเคราะห์เชิงสำรวจ การตีความหน่วยเมตริกของแบบจำลอง การแก้ไขแบบสอบถาม SQL แต่ AI เดียวกันนี้ยังช่วยให้คุณสร้างความมั่นใจได้ เช่น "สหสัมพันธ์ 0.72" สำหรับข้อมูลที่ไม่เคยเห็นมาก่อน

หน่วยแรกนี้ไม่ใช่การแนะนำห้องสมุด จุดประสงค์คือเพื่อชี้แจงว่าควรใส่ AI ไว้ในขั้นตอนการทำงานด้านวิทยาศาสตร์ข้อมูลตรงไหน และไม่ควรใส่ตรงไหนเลย เรามาวางหลักการพื้นฐานตั้งแต่ต้นกันดีกว่า: AI เป็นตัวช่วย ไม่ใช่นักวิทยาศาสตร์ข้อมูล การตัดสินใจว่าจะรวบรวมข้อมูลใด ตัวชี้วัดใดที่จะตัดสินใจ จะนำแบบจำลองไปใช้จริงหรือไม่ และจะกำหนดขอบเขตทางจริยธรรมที่ใด ขึ้นอยู่กับผู้เชี่ยวชาญที่มีความสามารถ ผลลัพธ์ AI ที่ไม่ได้รับการยืนยันนั้นมีความเสี่ยง เช่นเดียวกับรายงานการวิเคราะห์ที่ไม่ได้ลงนาม

ขั้นตอนการทำงานด้านวิทยาศาสตร์ข้อมูล: แผนที่ตั้งแต่ต้นทางถึงปลายทาง

เพื่อให้เข้าใจถึงโปรเจ็กต์ข้อมูล การแบ่งโปรเจ็กต์ออกเป็นหกระยะจะมีประโยชน์ โมดูลทั้งหมดนี้เป็นไปตามแผนที่นี้

1. คำจำกัดความของปัญหา: เราวัดอะไร ทำไม เพื่อสนับสนุนการตัดสินใจใด ระยะนี้ไม่ได้มอบหมายให้กับ AI เป็นคนกำหนดงาน

2. การรวบรวมข้อมูล: การระบุแหล่งที่มา การดึงข้อมูล การสุ่มตัวอย่าง (หน่วยที่ 2)

3. การล้างข้อมูลและการประมวลผลล่วงหน้า: ค่าที่หายไป ค่าผิดปกติ การแปลงประเภท (หน่วยที่ 3)

4. การวิเคราะห์ข้อมูลเชิงสำรวจ (EDA - การวิเคราะห์ข้อมูลเชิงสำรวจ ขั้นตอนการรับรู้การกระจายตัวและความสัมพันธ์ของข้อมูล "ด้วยตา"): (หน่วยที่ 4)

5. วิศวกรรมคุณลักษณะและการสร้างแบบจำลอง: การสร้างตัวแปร การเลือกอัลกอริทึม การฝึกอบรม และการประเมินผล (หน่วยที่ 5, 6, 7)

6. การสื่อสารและการผลิต: การแสดงภาพ เรื่องราว MLOps (วินัยในการนำโมเดลไปใช้จริงและติดตามดู) (หน่วยที่ 8, 11)

AI ดำเนินการด้วยหน่วยงานที่แตกต่างกันในแต่ละขั้นตอนทั้งหกนี้ ตารางด้านล่างสรุปการกระจายอำนาจนี้ นี่เป็นตารางที่สำคัญที่สุดเพียงตารางเดียวของโมดูล

เวที

บทบาทของเอไอ

ระดับความเสี่ยง

ใครอนุมัติ.

คำจำกัดความของปัญหา

พันธมิตรการระดมความคิด

ต่ำ

นักวิทยาศาสตร์ข้อมูล + ผู้มีส่วนได้ส่วนเสีย

เขียนโค้ดการล้างข้อมูล

เครื่องกำเนิดโค้ดสเก็ตช์

ปานกลาง

นักวิทยาศาสตร์ข้อมูล (อ่านโค้ด)

ความคิดเห็นของ EDA

ผู้แนะนำรูปแบบ

ปานกลาง

นักวิทยาศาสตร์ข้อมูล

การสร้างคุณสมบัติ

เครื่องกำเนิดไอเดียและโค้ด

สูงปานกลาง

การควบคุมการรั่วไหลเป็นสิ่งจำเป็น

การเลือกรุ่น/เมตริก

ที่ปรึกษา

สูง

นักวิทยาศาสตร์ข้อมูล

การตัดสินใจนำเข้าสู่การผลิต

อินพุตเสริม

สูงมาก

ทีมงาน+เจ้าของกิจการ

การอนุมัติด้านจริยธรรม/ความเป็นส่วนตัว

สารกระตุ้น

สูงมาก

มนุษย์อยู่เสมอ

โปรดจำประโยคหนึ่งจากแผนภูมินี้: เมื่อเดิมพันเพิ่มขึ้น บทบาทของ AI ก็จะลดลง และการอนุมัติของมนุษย์ก็เพิ่มมากขึ้น

เหตุใดการยืนยันจึงเป็นหัวใจสำคัญของธุรกิจนี้

โมเดลภาษา AI ดูเหมือนจะแน่ใจ แต่อาจไม่แน่ใจ ในภาษาเทคนิค สิ่งนี้เรียกว่าภาพหลอน ซึ่งเป็นการสร้างแบบจำลองของข้อมูลที่ไม่มีอยู่จริงในประโยคที่คล่องแคล่วราวกับว่ามันเป็นเรื่องจริง ในด้านวิทยาการข้อมูลมีสามรูปแบบ อย่างแรกคือตัวเลขปลอม: หากคุณถามโมเดลว่า "จำนวนการสั่งซื้อเฉลี่ยคือเท่าใด" โดยไม่ให้ข้อมูลใดๆ โมเดลจะบอกตัวเลขให้คุณทราบอย่างมั่นใจ แม้ว่าจะไม่เคยเห็นข้อมูลของคุณก็ตาม ประการที่สองคือฟังก์ชันที่ไม่มีอยู่: โมเดลอาจแนะนำฟังก์ชันที่ไม่มีอยู่เลย เช่น pandas.read_excel_fast() ประการที่สาม การตีความทางสถิติที่ไม่ถูกต้อง: แบบจำลองสามารถทำซ้ำข้อผิดพลาดทางสถิติแบบคลาสสิกได้อย่างราบรื่น เช่น “ค่า p เท่ากับ 0.04 ดังนั้นสมมติฐานจึงถูกต้อง 96%”

ระเบียบวินัยในการตรวจสอบประกอบด้วยสามขั้นตอน:

  1. ลิงก์ไปยังแหล่งที่มา: ทุกตัวเลข อัตรา และแนวโน้มควรมาจากข้อมูลของคุณ ไม่ใช่หน่วยความจำของ AI ใช้ AI สำหรับโค้ดที่ทำงานกับข้อมูล ไม่ใช่เพื่อให้จดจำข้อมูล
  2. เรียกใช้และเปรียบเทียบ: เรียกใช้โค้ดแต่ละชิ้นที่ AI มอบให้ด้วยตัวเอง เปรียบเทียบแต่ละเมตริกที่สร้างกับข้อมูลพื้นฐานที่เป็นอิสระ
  3. ตัวกรองผู้เชี่ยวชาญ: ทดสอบด้วยตัวคุณเองว่าผลลัพธ์ขัดแย้งกับสถิติและความรู้ในโดเมนหรือไม่
ข้อควรระวัง: การนำการวิเคราะห์ที่ AI เขียนมาใส่ในการนำเสนอโดยไม่ได้รันและอ่านก็เหมือนกับการนำเสนอรายงานที่ไม่ได้ลงนาม เพียงเพราะโค้ดใช้งานได้ไม่ได้หมายความว่าถูกต้อง โค้ดที่รวมคอลัมน์ที่ไม่ถูกต้องยังใช้งานได้โดยไม่มีข้อผิดพลาด

ความสามารถในการทำซ้ำ: ความสามารถในการให้ผลลัพธ์เดียวกันสองครั้ง

หลักการที่เงียบแต่สำคัญมากของวิทยาศาสตร์ข้อมูลคือความสามารถในการทำซ้ำได้: เมื่อคุณทำการวิเคราะห์อีกครั้งในอีกหกเดือนต่อมาหรือบนคอมพิวเตอร์เครื่องอื่น คุณจะได้รับผลลัพธ์เดียวกัน ความเสี่ยงนี้จะเพิ่มขึ้นเมื่อทำงานกับ AI เพราะเมื่อคุณบอกให้ AI “สร้างกราฟนี้” และเล่นด้วยตนเอง ขั้นตอนต่างๆ จะหายไป กฎ: ทุกขั้นตอนจะต้องลงทะเบียนในโค้ดและการควบคุมเวอร์ชัน (เช่น Git) ในขั้นตอนที่เกี่ยวข้องกับการสุ่ม ควรแก้ไขเมล็ดสุ่ม (ค่าเริ่มต้นของเครื่องสร้างตัวเลขสุ่ม หากคงที่ ผลลัพธ์จะสามารถทำซ้ำได้) เราจะทำให้หัวข้อนี้ลึกซึ้งยิ่งขึ้นในบทที่ 10 สำหรับตอนนี้ ให้สร้างนิสัยนี้: "อย่าคลิกด้วยมือ แต่เขียนโค้ด"

มินิเคสสามอัน

กรณีที่ 1 — การเร่งความเร็วอย่างปลอดภัย โดยปกตินักวิเคราะห์อีคอมเมิร์ซจะใช้เวลาครึ่งวันในการเคลียร์ตารางคำสั่งซื้อจำนวน 240,000 แถว เขามอบชื่อคอลัมน์และ 5 แถวแรก (โดยไม่มีข้อมูลส่วนบุคคล) ให้กับ AI และขอรหัสทำความสะอาดแพนด้า AI สร้างแบบร่างใน 8 วินาที; นักวิเคราะห์อ่านโค้ดทีละบรรทัด แก้ไขข้อผิดพลาดในการแยกวิเคราะห์วันที่ และดำเนินการ ระยะเวลา: 35 นาที แทนที่จะเป็น 4 ชั่วโมง AI ให้รหัสมา การยืนยันยังคงอยู่กับมนุษย์

กรณีที่ 2 — กับดักเมตริกที่สร้างขึ้น เด็กฝึกงานถาม AI ว่า "ข้อมูลนี้มีฟอเรสต์แบบสุ่มมีความแม่นยำเพียงใด" โดยไม่ต้องฝึกโมเดลเลย “ประมาณ 89%” AI กล่าว นักศึกษาฝึกงานใส่สิ่งนี้ลงในการนำเสนอ เมื่อฝึกโมเดลจริงมีความแม่นยำ 71% ข้อผิดพลาด: กำลังรอหน่วยเมตริกโดยไม่ให้ข้อมูลและแบบจำลองแก่ AI

กรณีที่ 3 — การรั่วไหลแบบเงียบๆ ทีมหนึ่งนำแนวคิดที่ AI แนะนำมาใช้ในการ "เพิ่มค่าเฉลี่ยของตัวแปรเป้าหมายเป็นคุณลักษณะ" โดยไม่ตั้งคำถาม แบบจำลองดำเนินการ 98% ในชุดทดสอบ แต่เกิดข้อขัดข้องในการใช้งานจริงเนื่องจากฟีเจอร์นี้ทำให้ข้อมูลในอนาคตรั่วไหล (ข้อมูลรั่วไหล หน่วยที่ 10) ข้อผิดพลาด: ไม่กรองคำแนะนำ AI ทางสถิติ

พรอมต์อ่อน / พรอมต์แข็งแกร่ง

พรอมต์ที่อ่อนแอ:

วิเคราะห์ข้อมูลการขายนี้และบอกรายได้เฉลี่ยให้ฉันทราบ

การกล่าวอ้างนี้มีข้อบกพร่อง: AI ไม่ได้รับข้อมูล ดังนั้นจึงสามารถประกอบ "รายได้เฉลี่ย" เท่านั้น ทั้งคอลัมน์ ระยะเวลา และสกุลเงินไม่ชัดเจน

พรอมต์อันทรงพลัง:

บทบาทของคุณ: ผู้ช่วยที่ช่วยเหลือนักวิทยาศาสตร์ข้อมูล ฉันมี DataFrame แพนด้า: df คอลัมน์:- order_date (ข้อความ ในรูปแบบ "2024-03-01")- amount_tl (ทศนิยม, NaN ในบางแถว)- customer_id (จำนวนเต็ม)งาน: (1) เขียนโค้ดแพนด้าที่คำนวณจำนวนเฉลี่ย (2) อธิบายวิธีจัดการค่า NaN (3) แสดงรายการสมมติฐานที่โค้ดสร้างขึ้น อย่าสร้างเนื้อหาข้อมูล เพียงสร้างโค้ดแล้วฉันจะเรียกใช้และตรวจสอบผลลัพธ์

ในคำขอนี้ แผนการ ความคาดหวัง และ "ข้อห้ามในการปลอมแปลง" มีความชัดเจน คุณยังคงทำงานและตรวจสอบผลลัพธ์ด้วยตัวเอง

จุดเริ่มต้นของจริยธรรมและความเป็นส่วนตัว

วิทยาศาสตร์ข้อมูลมักจะทำงานกับข้อมูลส่วนบุคคล: บันทึกลูกค้า ผู้ป่วย และพนักงาน KVKK (กฎหมายคุ้มครองข้อมูลส่วนบุคคล) ในตุรกีและ GDPR ในยุโรปปกป้องข้อมูลนี้ การวางชื่อจริง ID อีเมล หรือที่อยู่ของคุณลงในเครื่องมือ AI สาธารณะถือเป็นการละเมิด กฎ: ไม่ระบุชื่อข้อมูลก่อนแชร์ ระบุเฉพาะสคีมา (ชื่อคอลัมน์ ประเภท) และแถวตัวอย่างจำลองหากจำเป็น เราจะทำให้หัวข้อเรื่องจริยธรรมลึกซึ้งยิ่งขึ้นในบทที่ 11 เรามาวางหลักการตั้งแต่ต้น: เพื่อทำความเข้าใจข้อมูล การแบ่งปันโครงสร้าง ไม่ใช่เนื้อหา มักจะเพียงพอแล้ว

ข้อผิดพลาดทั่วไป

  • กำลังรอตัวเลข/เมตริกโดยไม่ให้ข้อมูลกับ AI โมเดลไม่สามารถเข้าถึงข้อมูลได้ เบอร์ที่เขาให้มาคือเบอร์ปลอม มีการคำนวณและดำเนินการผลลัพธ์เสมอ
  • คิดว่ารหัสการทำงานถูกต้อง รหัสที่จัดการคอลัมน์ที่ไม่ถูกต้องจะทำงานโดยไม่มีข้อผิดพลาดเช่นกัน อย่าวางใจโดยไม่อ่านตรรกะ
  • วางข้อมูลส่วนบุคคลจริงลงในเครื่องมือแบบเปิด ชื่อ หมายเลขประจำตัวประชาชน อีเมล จะไม่ถูกแชร์; แผนภาพก็พอแล้ว
  • ทำตามขั้นตอนด้วยตนเองและไม่เขียนลงในโค้ด การวิเคราะห์ที่ไม่สามารถทำซ้ำได้นั้นไม่น่าเชื่อถือ
  • ยอมรับการตีความสถิติของ AI โดยไม่มีคำถาม AI สามารถทำซ้ำข้อผิดพลาดแบบคลาสสิกในแนวคิด เช่น ค่า p และสหสัมพันธ์
เคล็ดลับ: ใส่ "บรรทัดกฎ" สั้นๆ ในแต่ละเซสชัน AI ของคุณ: "อย่าสร้างเนื้อหาข้อมูล เพียงแค่สร้างโค้ด/การวิเคราะห์ แล้วฉันจะเรียกใช้และตรวจสอบผลลัพธ์ ระบุว่า 'ไม่แน่ใจ' ในส่วนที่คุณไม่แน่ใจ" ประโยคเดียวนี้ช่วยลดความเสี่ยงของอาการประสาทหลอนได้อย่างมาก

โดยสรุป

AI เป็นตัวช่วยที่ทรงพลังในด้านวิทยาศาสตร์ข้อมูล โดยจะเร่งความเร็วโค้ดการทำความสะอาด การตีความ EDA การแนะนำโมเดล และการแสดงภาพ แต่คำจำกัดความของปัญหา การเลือกหน่วยเมตริก การตัดสินใจในการผลิต และขอบเขตทางจริยธรรมเป็นของมนุษย์ ขั้นตอนการทำงานมีหกขั้นตอน และบทบาทของ AI จะน้อยลงเมื่อความเสี่ยงเพิ่มขึ้น นิสัยสามประการเป็นรากฐานของทุกสิ่ง: การเชื่อมโยงแหล่งที่มา (การตรวจสอบความถูกต้อง) ความสามารถในการทำซ้ำ (การเขียนโค้ด) และการไม่เปิดเผยตัวตน (การรักษาความลับ) เมื่อคุณรวมทั้งสามสิ่งนี้ไว้ภายในแล้ว ทุกเครื่องมือในส่วนที่เหลือของโมดูลจะกลายเป็นตัวเร่งความเร็วที่ปลอดภัยสำหรับคุณ

งานสมัคร

เพียงสร้างสคีมาของตารางขนาดเล็กที่คุณมี (หรือตารางสมมุติ): ชื่อคอลัมน์ ประเภท และแถวตัวอย่างจำลอง 2-3 แถว (โดยไม่มีข้อมูลส่วนบุคคลจริง) ขอรหัสสถิติสรุปจาก AI โดยใช้เทมเพลต "พร้อมท์อันทรงพลัง" ด้านบน รันโค้ด เปรียบเทียบเอาต์พุตกับค่าที่กำหนดเอง ตรวจสอบสมมติฐานปลอม และจดบันทึกสิ่งที่คุณค้นพบในสัญลักษณ์แสดงหัวข้อย่อย 5 หัวข้อ

รายการตรวจสอบ

  • [ ] ฉันเพิ่งให้สคีมาและตัวอย่างปลอมแก่ AI แทนที่จะเป็นข้อมูลส่วนบุคคลจริงหรือไม่?
  • [ ] ฉันอ่านและรันโค้ดที่สร้างทีละบรรทัดหรือไม่?
  • [ ] ฉันได้ตรวจสอบแต่ละหมายเลขในเอาต์พุตอย่างอิสระหรือไม่
  • [ ] ฉันได้เขียนการวิเคราะห์ทุกขั้นตอนลงในโค้ดและทำให้สามารถทำซ้ำได้หรือไม่?
  • [ ] ฉันได้กำหนดระดับความเสี่ยงของภารกิจและมอบหมายการตัดสินใจขั้นสุดท้ายให้กับมนุษย์แล้วหรือยัง?