หน่วย
1. ปัญญาประดิษฐ์เบื้องต้นทางเศรษฐศาสตร์: บทบาท ขอบเขต การตรวจสอบ และจริยธรรมข้อมูล 2. การรวบรวมข้อมูลทางเศรษฐกิจและการตรวจสอบแหล่งที่มา: TURKSTAT, EVDS, IMF, World Bank, FRED 3. การล้างข้อมูล การแปลง และการวิเคราะห์เชิงสำรวจ (ด้วยการสนับสนุน Python/pandas) 4. การสนับสนุนการวิเคราะห์อนุกรมเวลาและการพยากรณ์ 5. การตีความตัวบ่งชี้เศรษฐกิจมหภาค: อัตราเงินเฟ้อ การเติบโต การว่างงาน ยอดดุลบัญชีเดินสะพัด 6. การสร้างแบบจำลองสถานการณ์และการวิเคราะห์ความไว 7. การสนับสนุนแบบจำลองทางเศรษฐมิติ: การถดถอย สาเหตุ และการตีความ 8. การทบทวนวรรณกรรมและการสังเคราะห์งานวิจัยทางเศรษฐศาสตร์ 9. หมายเหตุนโยบาย รายงาน และการเขียนบรรยายสรุป 10. การแสดงข้อมูลและแดชบอร์ดทางเศรษฐกิจ 11. ขอบเขต ความเสี่ยงแบบจำลอง จริยธรรม ความเป็นส่วนตัว และการกำกับดูแล
หน่วย 3 / 11

การล้างข้อมูล การแปลง และการวิเคราะห์เชิงสำรวจ (ด้วยการสนับสนุน Python/pandas)

กำไร:

  • ความสามารถในการล้างข้อมูลดิบทางเศรษฐกิจ (การสังเกตที่ขาดหายไป ความสับสนของหน่วย ความถี่ที่ไม่ตรงกัน) และเตรียมให้พร้อมสำหรับการวิเคราะห์ด้วยความช่วยเหลือของปัญญาประดิษฐ์
  • ความสามารถในการพิมพ์การเปลี่ยนแปลงทางเศรษฐกิจมาตรฐาน เช่น การแปลงตามจริง การจัดทำดัชนี อัตราการเติบโต การปรับเปลี่ยนตามฤดูกาลเป็นโค้ดลงในปัญญาประดิษฐ์ และตรวจสอบด้วยตนเอง
  • ความสามารถในการจดจำข้อมูลผ่านการวิเคราะห์ข้อมูลเชิงสำรวจ (สถิติสรุป การกระจาย ค่าผิดปกติ ความสัมพันธ์) และการอ่านสรุปปัญญาประดิษฐ์เชิงวิพากษ์

ข้อมูลเศรษฐกิจไม่ค่อยพร้อมสำหรับการวิเคราะห์ ในตารางที่คุณดาวน์โหลดจาก TURKSTAT พบว่าบางเดือนหายไป คอลัมน์หนึ่งมาเป็นข้อความที่มีวงเล็บหลักพัน อัตราแลกเปลี่ยนอยู่ในรูปแบบภาษาตุรกี เช่น "1.234,56" ชุดหนึ่งเป็นแบบรายเดือน และอีกชุดเป็นแบบรายไตรมาส เวลาของนักเศรษฐศาสตร์ส่วนใหญ่ไม่ได้ใช้เวลาไปกับการวิเคราะห์ แต่ใช้เวลาในการเตรียมข้อมูลให้พร้อมสำหรับการวิเคราะห์ นี่คือจุดที่ AI เป็นตัวเร่งที่แท้จริงและมีความเสี่ยงต่ำ โดยแนะนำขั้นตอนการล้างข้อมูล เขียนแพนด้า (ไลบรารีการประมวลผลข้อมูลของ Python) เข้ารหัสการเปลี่ยนแปลงทางเศรษฐกิจมาตรฐาน แต่หน่วยนี้ก็มีกฎที่ไม่เปลี่ยนรูปเช่นกัน นั่นคือคุณอ่านการเปลี่ยนแปลงทั้งหมดที่เขียนโดยปัญญาประดิษฐ์ และตรวจสอบด้วยตนเองในการสังเกตอย่างน้อยหนึ่งครั้ง หากวงจรที่ระบุจริงอยู่ในทิศทางที่ผิด การวิเคราะห์ทั้งหมดก็จะสลายไปอย่างเงียบๆ

การทำความสะอาด: ปัญหาอะไร วิธีแก้ปัญหา?

ปัญหาที่พบบ่อยที่สุดในข้อมูลเศรษฐกิจและตรรกะ:

  • การสังเกตที่ไม่สมบูรณ์ หนึ่งเดือน/ไตรมาสว่างเปล่า วิธีแก้ไขขึ้นอยู่กับบริบท หากไม่มีอยู่จริง ให้เว้นว่างไว้ หากมีช่องว่างทางเทคนิค จะต้องดำเนินการแก้ไขอย่างระมัดระวัง แต่เส้นแบ่งระหว่างการผลิตยังบางอยู่
  • ความสับสนของหน่วยและรูปแบบ ข้อความ "12.345.6" จะต้องแปลงเป็นตัวเลข ล้าน/พันล้านน่าจะสม่ำเสมอ
  • ความถี่ไม่ตรงกัน หากต้องการรวมอนุกรมรายเดือนและรายไตรมาส จะมีการรวมกัน (รายเดือนถึงรายไตรมาส) — ไม่ว่าจะเป็นค่าเฉลี่ย ยอดรวม หรือสิ้นสุดงวด ขึ้นอยู่กับลักษณะของตัวบ่งชี้ (ความแตกต่างของสต็อก/การไหล)
  • ค่าผิดปกติ (มาก) หากการสังเกตเบี่ยงเบนไปอย่างมาก นั่นเป็นเหตุการณ์จริง (วิกฤต ราคาขึ้น) หรือเป็นข้อผิดพลาดของข้อมูล เป็นที่เข้าใจก่อนที่จะลบ
  • การจัดตำแหน่งวันที่ รูปแบบวันที่และคำจำกัดความช่วงเวลาของซีรี่ส์ต่างๆ ได้รับการซิงโครไนซ์กัน
ข้อควรพิจารณา: การกรอกข้อมูลที่ขาดหายไปอาจดูไร้เดียงสา แต่เป็นการตัดสินใจทางเศรษฐกิจ การกรอกเดือนที่เกิดวิกฤตด้วย "ค่าเฉลี่ยของเดือนใกล้เคียง" หมายถึงการลบวิกฤตนั้นออกจากการวิเคราะห์ ก่อนกรอกให้ถาม "ทำไมถึงมีช่องว่างนี้" ตอบคำถาม.

การเปลี่ยนแปลงทางเศรษฐกิจมาตรฐาน

การเปลี่ยนแปลงและคำจำกัดความในละครประจำวันของนักเศรษฐศาสตร์:

  • ที่กำหนด → จริง การปรับผลกระทบด้านราคา: มูลค่าที่แท้จริง = มูลค่าที่ระบุ / ดัชนีราคา × 100 ปีฐานของ deflator (ดัชนีที่ปรับ) จะกำหนดฐานของผลลัพธ์
  • การจัดทำดัชนี การปรับขนาดซีรี่ส์เพื่อให้ช่วงเวลาที่เลือก = 100; มีประโยชน์สำหรับการเปรียบเทียบชุดสินค้าที่มีขนาดต่างกัน
  • อัตราการเติบโต รายปี: (งวดเดียวกันงวดนี้ / ปีที่แล้ว − 1) × 100 อัตราแบบงวดและแบบรายปีต่างกัน ความสับสนเป็นข้อผิดพลาดทั่วไป
  • การแก้ไขตามฤดูกาล ชำระล้างผลกระทบตามฤดูกาลเป็นประจำ (การท่องเที่ยวช่วงฤดูร้อน วันหยุด) ซีรีส์ดิบและซีรีส์ที่ปรับตามฤดูกาลบอกเล่าเรื่องราวที่แตกต่างกัน
  • ค่าเฉลี่ยเคลื่อนที่ ขจัดเสียงรบกวนและทำให้มองเห็นแนวโน้มได้
  • ลอการิทึมและผลต่าง เพื่อตรวจสอบพลวัตการเติบโตและความคงที่ (จะลึกลงไปในหน่วยอนุกรมเวลา)
เคล็ดลับ: ในการแปลงแต่ละครั้ง คุณจะถูกถามว่า "เกิดอะไรขึ้นกับหน่วยและฐาน" ถาม. ฐานของซีรีส์จริงคือฐานของตัวดันลม ฐานของซีรี่ส์ที่จัดทำดัชนีคือช่วงเวลาที่คุณเลือก การเขียนสิ่งนี้ไว้จะช่วยป้องกันข้อผิดพลาดในอนาคต

การวิเคราะห์ข้อมูลเชิงสำรวจ (EDA)

จำเป็นต้องจดจำข้อมูลก่อนป้อนข้อมูลลงในโมเดล การวิเคราะห์ข้อมูลเชิงสำรวจ (EDA) ประกอบด้วย: สถิติสรุป (ค่าเฉลี่ย มัธยฐาน ส่วนเบี่ยงเบนมาตรฐาน ต่ำสุด-สูงสุด) รูปร่างของการแจกแจง หลักสูตรในช่วงเวลาหนึ่ง ค่าผิดปกติ และความสัมพันธ์ระหว่างอนุกรม AI จะสร้างโค้ดสำหรับขั้นตอนเหล่านี้อย่างรวดเร็ว งานของคุณคืออ่านผลลัพธ์ด้วยสายตาทางเศรษฐกิจ: "ค่าเฉลี่ยนี้สมเหตุสมผลหรือไม่ ความสัมพันธ์นี้เป็นเรื่องบังเอิญหรือเป็นความสัมพันธ์ที่ทราบอยู่แล้ว"

ข้อควรระวัง: สหสัมพันธ์เป็นเพียงวิธีการระบุตัวตนเท่านั้น ไม่ใช่ข้อพิสูจน์ถึงสาเหตุ ความจริงที่ว่าสองซีรีส์เคลื่อนตัวไปด้วยกัน (เช่น ยอดขายไอศกรีมและการจมน้ำ ซึ่งทั้งสองเรื่องเกิดขึ้นในช่วงฤดูร้อน) ไม่จำเป็นต้องบ่งชี้ว่าซีรีส์เรื่องหนึ่งนำไปสู่อีกซีรีส์หนึ่งเสมอไป เราจะทำให้ความแตกต่างนี้ลึกซึ้งยิ่งขึ้นในหน่วยที่ 7

มินิเคสสามอัน

กรณีที่ 1 — ฐาน deflator ไม่ถูกต้อง นักวิเคราะห์มีปัญญาประดิษฐ์เขียนโค้ดเพื่อรับรู้ชุดค่าจ้าง รหัสใช้งานได้ ผลลัพธ์ดูสมเหตุสมผล แต่นักวิเคราะห์คำนวณปี 2020 ด้วยตนเองในขั้นตอน CALCULATE และมันก็ไม่ทำงาน ปัญหา: ปัญญาประดิษฐ์ใช้ deflator โดยมีฐานเป็น 2003=100 และขอชุดค่าจ้างด้วยราคาปี 2015 ฐานมีความขัดแย้ง รหัสได้รับการซ่อมแซมด้วยการแก้ไขบรรทัดเดียว ทั้งซีรีส์ก็เข้าที่

กรณีที่ 2 — ข้อผิดพลาดของระดับเสียงเงียบ สถาบันแห่งหนึ่งได้ลดข้อมูลการส่งออกเป็นพันดอลลาร์และการนำเข้าเป็นล้านดอลลาร์ เมื่อปัญญาประดิษฐ์ลบทั้งสองสิ่งนี้ออกจาก "ดุลการค้าต่างประเทศ" ผลลัพธ์ก็คือการขาดดุลที่ไร้สาระ มุมมองต่ำสุด-สูงสุดใน EDA เผยให้เห็นข้อผิดพลาด: ลำดับความสำคัญของทั้งสองซีรี่ส์แตกต่างกันด้วยปัจจัย 1,000 เมื่อหน่วยถูกทำให้เท่ากัน ความสมดุลก็ถูกต้อง

กรณีที่ 3 — ไม่ลบค่าผิดปกติ หนึ่งเดือนในซีรีส์นั้นต่ำมากเป็นพิเศษ AI แนะนำให้ "ผิดปกติ มาทำความสะอาดกันเถอะ" นักวิเคราะห์สอบสวนว่า จริงๆ แล้วการผลิตหยุดลงเนื่องจากภัยพิบัติทางธรรมชาติในเดือนนั้น คุณค่านั้นเป็นของจริง การลบออกจะบิดเบือนประวัติศาสตร์ แทนที่จะลบ กลับกลายเป็นเชิงอรรถ คำแนะนำ "ชัดเจน" ของ AI ไม่ได้ถูกปฏิบัติตามแบบสุ่มสี่สุ่มห้า

ตารางการตรวจสอบการแปลง

การแปลง

สาระสำคัญของสูตร

จุดตรวจด้วยตนเอง

การตระหนักรู้

ระบุ / ดัชนีราคา × 100

ฐานตัวเบี่ยง = ฐานผลลัพธ์?

การเจริญเติบโตประจำปี

(t / t-12 เดือน - 1)×100

คำนวณระยะเวลาบนกระดาษ

การจัดทำดัชนี

อนุกรม/คาบฐาน × 100

ค่างวดฐานคือ 100 หรือไม่

รายเดือน→รายไตรมาส

Flow : รวบรวม / Stock : สิ้นงวด

วิธีการเก็บเงินที่ถูกต้อง?

ค่าเฉลี่ยเคลื่อนที่

ค่าเฉลี่ยช่วง n สุดท้าย

ความยาวของหน้าต่างถูกต้องหรือไม่?

เทมเพลตที่สามารถคัดลอกได้สี่แบบ

1) แผนการทำความสะอาด:

ฉันมีข้อมูลดิบนี้: [คอลัมน์และแถวตัวอย่าง] จัดทำแผนการทำความสะอาดเพื่อเตรียมพร้อมสำหรับการวิเคราะห์: ค่าที่หายไป ปัญหาหน่วย/รูปแบบ การจัดตำแหน่งวันที่ การจัดตำแหน่งความถี่ ค่าผิดปกติที่เป็นไปได้ อธิบายเป็นประโยคเดียวว่าเหตุใดแต่ละขั้นตอนจึงมีความจำเป็น อย่าเพิ่งเขียนโค้ด ให้ฉันยืนยันแผนก่อน

2) รหัสล้างแพนด้า:

เขียนโค้ดแพนด้าตามแผนที่ฉันอนุมัติ ให้โค้ดระบุว่ามันทำอะไรในแต่ละขั้นตอนพร้อมบรรทัดแสดงความคิดเห็น จะพิมพ์จำนวนแถวและค่าที่หายไปหลังการแปลง อย่าลบข้อสังเกตใดๆ ออกไปอย่างเงียบๆ รายงานทุกบรรทัดที่คุณลบ

3) การรับรู้ (ตรวจสอบได้):

ตระหนักถึงซีรี่ส์ที่ระบุนี้ด้วย [ดัชนีราคา] เขียนปีฐานของ deflator ให้ชัดเจนเมื่อคุณใช้งาน ระบุว่าฐานของอนุกรมผลลัพธ์คืออะไร แสดงบัญชีทีละขั้นตอนในช่วงเวลาเดียว เพื่อให้ฉันสามารถตรวจสอบได้ด้วยตนเอง

4) สรุปการวิเคราะห์เชิงสำรวจ:

เขียนโค้ดการวิเคราะห์เชิงสำรวจสำหรับข้อมูลที่ล้างแล้วต่อไปนี้: สถิติสรุป พล็อตอนุกรมเวลา การสแกนค่าผิดปกติ และเมทริกซ์สหสัมพันธ์ เมื่อตีความผลลัพธ์ ให้ชัดเจนว่าความสัมพันธ์ที่คุณพบไม่ใช่สาเหตุ และระบุ 3 ประเด็นที่โดดเด่นสำหรับฉัน

พรอมต์อ่อน / พรอมต์แรง

พรอมต์ที่อ่อนแอ:

ล้างข้อมูลนี้

AI ดำเนินการด้วยการสันนิษฐานโดยไม่รู้ว่าจะทำความสะอาดอะไร คุณสามารถลบการสังเกต เปลี่ยนหน่วย คุณจะไม่สังเกตเห็น

พรอมต์อันทรงพลัง:

ในข้อมูลการค้าต่างประเทศรายเดือนนี้ การส่งออกมีมูลค่าเป็น "พันเหรียญสหรัฐ" และการนำเข้ามีมูลค่าเป็น "ล้านเหรียญสหรัฐ" ทำให้ทั้งสองมีค่าเท่ากันใน "ล้านเหรียญสหรัฐ" ทำเครื่องหมายเดือนที่หายไป แต่อย่าเติม จัดวันที่ให้ตรงกับสิ้นเดือน พิมพ์จำนวนแถวที่ได้รับผลกระทบในแต่ละขั้นตอน ไม่มีการลบแถวอย่างเงียบ ๆ จากนั้นแสดงยอดคงเหลือของเดือนเดียวในลักษณะที่ฉันสามารถตรวจสอบด้วยตนเองได้

ข้อผิดพลาดทั่วไป

  • เรียกใช้โค้ด Conversion โดยไม่ต้องอ่าน ฐาน/หน่วยที่ไม่ถูกต้องจะทำให้การวิเคราะห์ทั้งหมดเสียหายอย่างเงียบๆ
  • กรอกข้อมูลที่หายไปโดยไม่ต้องคิด การลบล้างช่วงวิกฤต/ภัยพิบัติด้วยค่าเฉลี่ย
  • ละทิ้งค่าผิดปกติโดยอัตโนมัติ เข้าใจผิดเหตุการณ์จริงเนื่องจากข้อผิดพลาดของข้อมูล
  • การเติบโตตามฤดูกาลและรายปีที่น่าสับสน ทั้งสองมีขนาดแตกต่างกัน
  • การรวมความถี่ไม่ถูกต้อง รวบรวมชุดสต็อคและประมวลผลเป็นโฟลว์
  • เข้าใจผิดความสัมพันธ์ใน EDA สำหรับสาเหตุ เข้าใจผิดว่าเครื่องมือการรับรู้เป็นหลักฐาน

โดยสรุป

การทำความสะอาดและการเปลี่ยนแปลงข้อมูลเป็นการวิเคราะห์ทางเศรษฐกิจถึง 80 เปอร์เซ็นต์ที่มองไม่เห็น แต่มีความสำคัญอย่างยิ่ง ปัญญาประดิษฐ์ช่วยเร่งการทำงานของกลไกนี้อย่างรวดเร็ว แต่ขึ้นอยู่กับคุณที่จะอ่านทุกขั้นตอนการล้างข้อมูลและทุกการเปลี่ยนแปลงและตรวจสอบการสังเกตด้วยตนเองอย่างน้อยหนึ่งครั้ง การตัดสินใจฐาน deflator หน่วย ความถี่ และค่าผิดปกติเป็นการตัดสินใจทางเศรษฐกิจ และไม่สามารถปล่อยให้ปัญญาประดิษฐ์สุ่มสี่สุ่มห้าได้ การวิเคราะห์เชิงสำรวจแนะนำข้อมูล แต่ไม่มีความสัมพันธ์กัน

งานสมัคร

ดาวน์โหลดซีรีส์ข้อมูลดิบจริง (เช่น CPI รายเดือนและซีรีส์ค่าจ้าง/รายได้ที่ระบุ) สร้างแผนการทำความสะอาดด้วยเทมเพลตที่ 1 สร้างโค้ดด้วยเทมเพลตที่ 2 และสร้างซีรีส์ด้วยเทมเพลตที่ 3 จากนั้นคำนวณมูลค่าที่แท้จริงของช่วงเวลาหนึ่งบนกระดาษและเปรียบเทียบกับผลลัพธ์ของปัญญาประดิษฐ์ หากคุณพบว่าไม่ตรงกัน ให้วินิจฉัยและแก้ไขแหล่งที่มา (ฐาน/หน่วย) และจดบันทึกความคืบหน้า

รายการตรวจสอบ

  • [ ] ฉันตรวจสอบและอนุมัติแผนการล้างข้อมูลก่อนที่จะเขียนโค้ด
  • [ ] ฉันลบ/เปลี่ยนแปลงทุกบรรทัดโดยปัญญาประดิษฐ์ที่รายงาน ไม่มีการลบอย่างเงียบ ๆ
  • [ ] เมื่อกรอกข้อมูลที่หายไป คุณอาจถามว่า "ทำไมจึงว่างเปล่า" ฉันตอบคำถาม
  • [ ] ฉันตรวจสอบว่าค่าผิดปกติเป็นเหตุการณ์จริงหรือข้อผิดพลาดของข้อมูล
  • [ ] ในการตระหนักรู้ ฉันตรวจสอบแล้วว่าฐาน deflator และฐานผลลัพธ์ตรงกัน
  • [ ] ฉันคำนวณ Conversion ของช่วงเวลาอย่างน้อยหนึ่งช่วงด้วยตนเองอีกครั้ง
  • [ ] ฉันไม่ได้นำเสนอความสัมพันธ์ใน EDA ว่าเป็นสาเหตุ