หน่วย 6 / 10

ข้อมูลสิ่งแวดล้อมและการวิเคราะห์การติดตาม

กำไร:

  • ความสามารถในการใช้อนุกรมเวลา การข้ามเกณฑ์ และแนวคิดการควบคุมคุณภาพเซ็นเซอร์ (QA/QC)
  • ความสามารถในการสร้างการสแกนความผิดปกติ สรุปแนวโน้ม และกลยุทธ์ข้อมูลที่ขาดหายไปด้วย AI
  • ความสามารถในการตรวจสอบค่าเกินและความผิดปกติที่ AI ชี้ให้เห็นด้วยข้อมูลดิบและการสอบเทียบ

คุณเป็นวิศวกรกะที่โรงงานบำบัดน้ำเสียในเขตอุตสาหกรรมที่จัดตั้งขึ้น สถานีตรวจสอบอย่างต่อเนื่องซึ่งตั้งอยู่ที่ทางออกจะบันทึกออกซิเจนละลายน้ำ (DO) ค่า pH การนำไฟฟ้า และความต้องการออกซิเจนทางเคมี (COD) ทุกๆ 15 นาที เมื่อเวลา 03:40 น. ในตอนเช้า ค่า COD บนหน้าจอ SCADA กระโดดไปที่ 1,240 มก./ลิตร และระบบจะส่งสัญญาณเตือน ขีดจำกัดการปลดปล่อย 250 มก./ลิตร คำถามที่คุณต้องถามก่อนที่จะตื่นตระหนกคือ นี่เป็นเหตุการณ์มลพิษจริงหรือเป็นการบันทึกจากเซ็นเซอร์ ในหน่วยนี้ คุณจะได้เรียนรู้วิธีใช้แบบจำลองภาษา (LLM) เป็น "ผู้ช่วยการอ่านครั้งแรก" สำหรับการสแกนข้อมูลอนุกรมเวลา การทำเครื่องหมายความผิดปกติ และสร้างสรุปแนวโน้ม แต่เรากำลังคุยกันว่าทำไมเขาถึงไม่มีวันทิ้งการตัดสินใจครั้งสุดท้ายไว้กับเธอ

กายวิภาคของข้อมูลการติดตามอย่างต่อเนื่อง

ข้อมูลการตรวจสอบด้านสิ่งแวดล้อมเป็นอนุกรมเวลาที่รวบรวมตามช่วงเวลาปกติ จุดตรวจวัดแต่ละจุดมีการประทับเวลา ค่า และแฟล็กคุณภาพตามหลักการ เพื่อให้เข้าใจถึงข้อมูลดิบ คุณต้องแยกแยะแนวคิดสามประการ:

  • แนวโน้ม: แนวโน้มระยะยาว (เช่น ค่าการนำไฟฟ้าที่เพิ่มขึ้นตามฤดูกาล)
  • ฤดูกาล/วงจร: รูปแบบที่เกิดซ้ำในระหว่างวันหรือปี (เช่น การเพิ่มขึ้นของ DO จากการสังเคราะห์ด้วยแสงในเวลากลางวัน)
  • ความผิดปกติ: ค่าเอกพจน์หรือค่าระยะสั้นที่เบี่ยงเบนไปจากรูปแบบที่คาดไว้ทางสถิติ

พารามิเตอร์

ช่วงการตรวจสอบทั่วไป

ขีดจำกัดตัวอย่าง (จำหน่าย)

ปัญหาเซ็นเซอร์ทั่วไป

ค่า pH

1-5 นาที

6-9 (ไม่มีหน่วย)

การเปลี่ยนอิเล็กโทรดอ้างอิง

ออกซิเจนละลายน้ำ (DO)

5-15 นาที

≥ 5 มก./ลิตร (ตัวกลางสำหรับรับ)

การปนเปื้อนของเมมเบรน (การปนเปื้อนทางชีวภาพ)

การนำไฟฟ้า

5-15 นาที

ขึ้นอยู่กับคลาส µS/ซม

ดริฟท์การสอบเทียบ

COD (เครื่องวิเคราะห์ต่อเนื่อง)

15-60 นาที

250มก./ลิตร

รีเอเจนต์อ่อนล้า, การอุดตัน

PM10 (อากาศ)

1 ชั่วโมง

50 ไมโครกรัม/ลูกบาศก์เมตร (24 ชั่วโมง)

ผลของความชื้น/การควบแน่น

เหตุใดธง QA/QC จึงมีความสำคัญ

QA/QC (การประกันคุณภาพ/การควบคุมคุณภาพ) คือการติดป้ายความน่าเชื่อถือในทุกการวัดผล แม้ว่าค่าดังกล่าวจะปรากฏเป็น "เกินกำหนด" ตามสถิติ แต่จะไม่ถูกต้องหากนำออกไปนอกหน้าต่างการสอบเทียบ หรือหากเซ็นเซอร์อยู่ระหว่างการบำรุงรักษา รหัสธงทั่วไป:

ความหมายของธง ----- ----------------------------- G ดี — ถูกต้อง การวัดที่ยอมรับได้ ผู้ต้องสงสัย — สงสัย จำเป็นต้องตรวจสอบ M หายไป — บันทึกหายไป / บันทึกว่างเปล่า C การสอบเทียบ — หน้าต่างการสอบเทียบ/บำรุงรักษา ข้อมูลไม่ถูกต้อง E โดยประมาณ — ค่าประมาณที่นำเข้า

เคล็ดลับ: เปิดบันทึกการสอบเทียบและการบำรุงรักษาก่อนเริ่มการวิเคราะห์ค่าเกินเสมอ หากการกระโดดของ COD ที่เวลา 03:40 เกิดขึ้นพร้อมกับการสอบเทียบข้ามคืนอัตโนมัติหรือการเปลี่ยนแปลงรีเอเจนต์ นี่คือข้อมูลแฟล็ก "C" ไม่ใช่เรื่องของการเตือนภัย แต่สำหรับการล้างข้อมูล

การสแกนความผิดปกติและสรุปแนวโน้มด้วย AI

คุณสามารถใช้ LLM เพื่อตรวจสอบข้อมูลแบบตาราง ทำเครื่องหมายรูปแบบที่สายตามนุษย์อาจพลาด และจัดเรียงสมมติฐานเริ่มต้นได้อย่างรวดเร็ว จุดวิกฤติ: การให้ข้อมูลดิบ หน่วย และขีดจำกัดแก่โมเดลร่วมกัน และขอข้อสังเกตที่ตรวจสอบได้

ข้อความแจ้งที่อ่อนแอ: "มีปัญหากับข้อมูลคุณภาพน้ำนี้หรือไม่" พร้อมท์ที่รัดกุม: "ด้านล่างนี้เป็นเวลา 15 นาทีสำหรับข้อมูลการตรวจสอบจุดปล่อยน้ำเสีย (คอลัมน์: เวลา, COD [มก./ลิตร], ความนำไฟฟ้า [µS/ซม.], pH, ธง QA) ขีดจำกัด COD ของการปลดปล่อยคือ 250 มก./ลิตร ช่วง pH 6-9 งานของคุณ: 1) แสดงรายการการประทับเวลาที่มีขีดจำกัดเกินขีดจำกัด 2) ประเมินเฉพาะบรรทัดที่มีแฟล็ก 'G' (ดี) แยกบรรทัดที่มีแฟล็ก C/M/S ออกเป็น รายการ 'ต้องมีการตรวจสอบ' แยกกัน 3) ระบุว่าเป็นการกระโดดแบบเดี่ยวๆ (บรรทัดเดียว) หรือเพิ่มขึ้นอย่างต่อเนื่อง (>= 3 บรรทัดติดต่อกัน) 4) โปรดทราบว่าค่าการนำไฟฟ้าและค่า pH เปลี่ยนแปลงไปพร้อมๆ กัน (การเปลี่ยนแปลงพร้อมกันถือเป็นหลักฐานสนับสนุนเหตุการณ์จริง) อย่าเพิ่มความคิดเห็นใดๆ ที่คุณไม่แน่ใจหรือไม่สามารถตรวจสอบได้ด้วยข้อมูล;

พรอมต์ที่มีประสิทธิภาพจะเชื่อมโยงโมเดลเข้ากับขั้นตอนที่เป็นรูปธรรม แยกวิเคราะห์แฟล็ก และมีคำสั่ง "หากคุณไม่แน่ใจ อย่าพูด" อย่างชัดเจนเพื่อจำกัดอาการประสาทหลอน (การตีความที่สร้างขึ้น)

ข้อควรระวัง: LLM อาจทำให้เกิดข้อผิดพลาดในการเปรียบเทียบเกณฑ์ตัวเลข อาจติดฉลาก 248 มก./ลิตรผิดว่า "เกิน" หรือ 252 มก./ลิตร เป็น "ภายในขีดจำกัด" ตรวจสอบทุกๆ รายการโมเดลที่เกินมาอีกครั้ง ไม่ว่าจะมองเห็นจากตารางดิบหรือด้วยสูตร (เช่น ค่า > 250) แบบจำลองจะสแกน คุณเป็นผู้ตัดสินใจเกี่ยวกับขีดจำกัด

กลยุทธ์ข้อมูลที่ขาดหายไป (การใส่ร้าย)

เซ็นเซอร์อุดตัน ไฟดับ การสื่อสารหยุดชะงัก วิธีที่คุณกรอกข้อมูลที่ขาดหายไปส่งผลโดยตรงต่อแนวโน้มและการวิเคราะห์ส่วนเกินของคุณ การใส่ร้ายที่เป็นเท็จสามารถ "สร้าง" โอเวอร์ช็อตที่ไม่มีอยู่จริงหรือซ่อนโอเวอร์ช็อตที่แท้จริงได้

นำเข้าแพนด้าเป็น pdimport numpy เป็นซีรีย์ COD 15 นาที np # -999 รหัสอุปกรณ์ "ไม่มีข้อมูล" "ธง": ["G", "G", "M", "M", "G", "S", "G", "G"],})# 1) แปลงรหัสอุปกรณ์เป็นค่าจริงที่หายไป df.loc[df["koi"] == -999, "koi"] = np.nan# 2) การประมาณค่าเชิงเส้นสำหรับช่องว่าง SHORT (<= 2 ขั้นตอน); flag imputationgap = df["koi"].isna()df["koi_full"] = df["koi"].interpolate(limit=2)df.loc[gap & df["koi_full"].notna(), "flag"] = "E" # ประมาณ # 3) จำกัดการสแกนเกิน — การกำหนดสำหรับการตัดสินใจเกี่ยวกับค่าที่วัดได้ (G) เท่านั้น = df[(df["koi_full"] > 250) & (df["flag"] == "G")]พิมพ์(asyms[["ts", "koi_full", "flag"]])

ในแนวทางนี้ ช่องว่างสั้นๆ จะถูกเติม แต่ค่าที่เติมจะถูกทำเครื่องหมายด้วย E และการตัดสินใจเกินจะทำจากการวัดจริง (G) เท่านั้น เนื่องจากค่า 1240 มก./ลิตร ถูกทำเครื่องหมายเป็น S (น่าสงสัย) จึงไม่รวมไว้ในรายการค่าเกินอัตโนมัติ ได้รับการตรวจสอบก่อน

การตรวจสอบโดยการดริฟท์ของเซ็นเซอร์และการสอบเทียบ

มาตรฐานทองคำในการพิจารณาว่าโอเวอร์ช็อตเกิดขึ้นจริงหรือการเบี่ยงเบนของเซ็นเซอร์หรือไม่นั้นเป็นผลจากห้องปฏิบัติการของการเก็บตัวอย่างแบบจ้วงพร้อมกัน ตัวอย่างเช่น หากเครื่องวิเคราะห์แบบต่อเนื่องแสดงค่า 1240 มก./ลิตร ที่ 03:40 และค่าที่วัดได้ในห้องปฏิบัติการของตัวอย่างที่ถ่ายในขณะนั้นคือ 205 มก./ลิตร ปัญหาอยู่ที่เซ็นเซอร์ ไม่จำหน่าย นี่คือรูปสามเหลี่ยมของเอาท์พุต AI หรือสัญญาณเตือน SCADA กับภาคสนามและห้องปฏิบัติการ

มินิเคส

เซ็นเซอร์วัดความขุ่นในอ่างน้ำดื่มมีแนวโน้มเพิ่มขึ้นเรื่อยๆ เป็นเวลาสามวัน ทีมงานกะให้ข้อมูลรายสัปดาห์แก่ LLM; “ความขุ่นที่เพิ่มขึ้นอย่างแท้จริงเนื่องจากการไหลบ่าหลังฝนตกเป็นไปได้” แบบจำลองกล่าว อย่างไรก็ตาม เมื่อวิศวกรดูบันทึกอุตุนิยมวิทยา เขาพบว่าไม่มีฝนตกในภูมิภาคในสัปดาห์นั้น ในระหว่างการตรวจสอบภาคสนาม เป็นที่เข้าใจว่าเกิดการปนเปื้อนทางชีวภาพบนหน้าต่างแสงของเซ็นเซอร์ หลังจากทำความสะอาดและสอบเทียบแล้วค่าต่างๆ ก็กลับมาเป็นปกติ การตีความ "เหตุการณ์จริงที่เป็นไปได้" ของ LLM ถูกหักล้างโดยข้อมูลภายนอก (บันทึกปริมาณน้ำฝน) และการควบคุมภาคสนาม บทเรียน: ตัวแบบอาจสร้างเรื่องราวที่น่าเชื่อถือแต่เป็นเท็จ ห่วงโซ่การตรวจสอบจับมัน

ข้อผิดพลาดทั่วไป

  • การทำข้อมูลผิดพลาดในหน้าต่างการสอบเทียบ/การบำรุงรักษา (ธง C) สำหรับการเกินจริง
  • กรอกข้อมูลที่ขาดหายไปอย่างเงียบๆ และรายงานค่าที่ใส่เข้าไปเป็นการวัดจริง
  • เข้าใจผิดว่าการกระเด้งครั้งเดียว (เส้นเดียว อาจเป็นสัญญาณรบกวนทางไฟฟ้า) สำหรับเหตุการณ์ที่ต่อเนื่องกัน
  • ไว้วางใจการเปรียบเทียบเบรกพอยต์ของ LLM อย่างสุ่มสี่สุ่มห้า (248 กับ 250)
  • การตัดสินใจโดยใช้พารามิเตอร์ตัวเดียวโดยไม่ต้องตรวจสอบพารามิเตอร์พร้อมกัน (pH + ความนำไฟฟ้า + COD)
  • การประกาศสัญญาณเตือนว่า "จริง" โดยไม่ตัดการเคลื่อนตัวของเซ็นเซอร์ด้วยการเก็บตัวอย่าง/การยืนยันทางห้องปฏิบัติการ
  • ละเว้นการเปลี่ยนแปลงเวลาท้องถิ่น/UTC และเวลาฤดูร้อน และระบุเหตุการณ์เป็นเวลาที่ไม่ถูกต้อง

โดยสรุป

  • ข้อมูลการตรวจสอบด้านสิ่งแวดล้อมเป็นอนุกรมเวลา ไม่สามารถตีความได้หากไม่แยกแยะแนวโน้ม ฤดูกาล และความผิดปกติ
  • ธง QA/QC เป็นแท็กที่เชื่อถือได้ของข้อมูล การตัดสินใจจะทำจากข้อมูลที่ถูกต้อง (G) เท่านั้น
  • LLM เป็นตัวช่วยในการอ่านครั้งแรกอย่างรวดเร็วสำหรับการสแกนความผิดปกติ รายการเกิน และสรุปแนวโน้ม ไม่ใช่ผู้มีอำนาจตัดสินใจ
  • กลยุทธ์ข้อมูลที่ขาดหายไป (การใส่ร้าย) ควรมีความโปร่งใส ค่าที่กรอกจะถูกทำเครื่องหมายและไม่ได้ถือเป็นพื้นฐานสำหรับการตัดสินใจเกิน
  • การเคลื่อนตัวของเซ็นเซอร์ การปนเปื้อนทางชีวภาพ และการเคลื่อนตัวของการสอบเทียบทำให้เกิด “การเคลื่อนตัวเกินจริง”; แยกตัวอย่างแบบจ้วงและการยืนยันทางห้องปฏิบัติการ
  • เอาต์พุต AI เป็นเพียงสมมติฐาน ข้อมูลดิบจะไม่เข้าสู่รายงานอย่างเป็นทางการโดยไม่มีการตรวจสอบโดยบันทึกการสอบเทียบและการควบคุมภาคสนาม

งานสมัคร

ใช้ชุดข้อมูลการตรวจสอบ 24 ชั่วโมง 15 นาทีที่คุณมี (หรือสร้างขึ้นสังเคราะห์) (อย่างน้อยหนึ่งพารามิเตอร์: COD, pH หรือ PM10) และสร้างการดำเนินการที่เพิ่มแฟล็ก QA/QC และแสดงรายการค่าเกินขีดจำกัด ขั้นแรก เขียนข้อความแจ้งที่ชัดเจนและขอให้ LLM ทำการสแกนความผิดปกติและค่าเกิน จากนั้นตรวจสอบค่าเกินเดียวกันอย่างอิสระด้วยค่า > ตัวกรองขีดจำกัดใน Python สร้างตัวอย่างการใส่ร้ายอย่างน้อยหนึ่งตัวอย่างและทำเครื่องหมายค่าที่เติมด้วย E สำหรับ "การเกินพิกัด" แต่ละรายการ คุณจะพบว่า "ฉันจะตรวจสอบสิ่งนี้ด้วยตัวอย่างแบบจ้วง/บันทึกการสอบเทียบได้อย่างไร" ตอบคำถามในหนึ่งประโยค ท้ายที่สุด ให้จัดตารางจำนวนความผิดปกติที่ LLM แจ้งว่าเป็นเหตุการณ์จริง และจำนวนปัญหาของเซ็นเซอร์/ข้อมูลพร้อมเหตุผล