Lợi nhuận:
- Khả năng tạo số liệu thống kê mô tả và biểu đồ phân phối/mối quan hệ với sự hỗ trợ của trí tuệ nhân tạo và chọn loại biểu đồ phù hợp theo dữ liệu và câu hỏi
- Khả năng nhận biết các lựa chọn sai lệch (trục nét đứt, tỷ lệ không phù hợp, làm mịn quá mức) trong hình ảnh do trí tuệ nhân tạo tạo ra và áp dụng các nguyên tắc trực quan trung thực
- Có thể phân biệt rằng phân tích thăm dò là để tạo ra các giả thuyết và cái bẫy của việc khám phá và xác nhận với cùng một dữ liệu (điều này mở ra cánh cửa cho việc hack p).
Sau khi làm sạch dữ liệu, công việc đầu tiên của nhà nghiên cứu thực nghiệm là tìm hiểu nó. Giai đoạn này được gọi là phân tích dữ liệu thăm dò (EDA - Exploratory Data Analysis): đó là quá trình kiểm tra dữ liệu bằng đồ thị và số liệu thống kê tóm tắt và xem cấu trúc, mô hình cũng như những điều bất ngờ của nó. Mục đích không phải là kiểm tra một giả thuyết mà là để làm quen với dữ liệu, đặt câu hỏi và đặt nền tảng cho mô hình bạn sẽ xây dựng trong tương lai. Trong phần này, chúng ta sẽ xem trí tuệ nhân tạo (AI) tăng tốc EDA và trực quan hóa như thế nào, nhưng tại sao đồ họa mà nó tạo ra phải được kiểm tra cẩn thận.
Trước tiên chúng ta hãy phân biệt hai điều cơ bản. Thứ nhất, thống kê mô tả (các số tóm tắt dữ liệu như giá trị trung bình, trung vị, độ lệch chuẩn, tứ phân vị) và trực quan hóa (hiển thị cùng một thông tin bằng đồ họa) bổ sung cho nhau; Họ cùng nhau mô tả dữ liệu. Thứ hai và quan trọng nhất: việc phát hiện và xác nhận phải được phân biệt. Phân tích thăm dò là để tạo ra các giả thuyết; Khám phá giả thuyết với cùng một dữ liệu và nói "Tôi đã thử nghiệm nó và thấy nó có ý nghĩa" sẽ mở ra cơ hội cho việc hack p, điều mà chúng ta sẽ thấy trong phần tiếp theo. Có thể tự do xem dữ liệu và xem mẫu; Nhưng việc tuyên bố mô hình đó là một "phát hiện đã được chứng minh" trong cùng một dữ liệu là sai lầm.
Phân tích thăm dò từng bước
1. Chế độ xem đơn biến. Kiểm tra từng biến riêng lẻ: phân phối của nó đối xứng hay lệch; có bao nhiêu ngọn đồi; Các ngoại lệ ở đâu? Đối với các biến số, biểu đồ (biểu đồ hiển thị tần số bằng cách chia các giá trị thành các phạm vi) và boxplot (boxplot - biểu đồ hiển thị các giá trị trung bình, tứ phân vị và cực trị); Đối với các biến phân loại, hãy sử dụng bảng tần số và biểu đồ thanh.
2. Chế độ xem hai chiều. Xem mối quan hệ giữa hai biến: biểu đồ phân tán cho hai biến số (hiển thị mỗi quan sát dưới dạng một điểm trên mặt phẳng x-y), biểu đồ hộp được nhóm cho phân loại số, bảng chéo cho hai phân loại. Trước khi xem xét hệ số tương quan, hãy nhớ xem biểu đồ phân tán: cùng một mối tương quan có thể hiển thị các mô hình rất khác nhau (bộ tứ Anscombe nổi tiếng chứng minh điều này; bốn bộ dữ liệu có số liệu thống kê gần như giống hệt nhau, nhưng khi vẽ chúng hóa ra hoàn toàn khác nhau).
3. Chọn loại biểu đồ chính xác. Loại biểu đồ phụ thuộc vào câu hỏi và loại dữ liệu của bạn. Biểu đồ phân phối; tán xạ cho mối quan hệ; biểu đồ đường thay đổi theo thời gian; biểu đồ thanh để so sánh danh mục; (cẩn thận) thanh xếp chồng lên nhau để cân đối tỷ lệ giữa các bộ phận với tổng thể. AI nhanh chóng tạo mã cho bạn nhưng quyền quyết định "biểu đồ nào cho câu hỏi nào" là của bạn.
4. Lưu ý mẫu, không khai báo kết quả. Ghi lại bất kỳ hình mẫu thú vị nào mà bạn thấy làm "ghi chú khám phá", nhưng đừng coi đó là một phát hiện đã được xác nhận. Việc xác nhận được thực hiện theo một bước riêng biệt, tốt nhất là với dữ liệu riêng biệt hoặc theo lịch trình định trước.
Nguyên tắc trực quan trung thực
Đồ họa thuyết phục; Vì vậy, sức mạnh gây hiểu lầm của nó cũng rất cao. AI có thể đưa ra những lựa chọn mang tính thẩm mỹ nhưng đôi khi gây hiểu lầm. Kiểm tra các chính sách sau:
- Trong biểu đồ thanh, trục y phải bắt đầu từ 0. Trục nét đứt thể hiện sự khác biệt nhỏ cũng như lớn.
- Quy mô phải nhất quán. Nếu hai biểu đồ đang được so sánh, hãy sử dụng cùng một phạm vi trục.
- Làm mịn quá mức có thể che giấu mô hình thực sự. Đường xu hướng trông đẹp mắt nhưng nếu nó "làm phẳng" dữ liệu quá nhiều thì có thể gây hiểu nhầm.
- Màu sắc và trang trí 3D làm sai lệch sự chú ý chứ không phải dữ liệu. Hãy chọn sự đơn giản.
- Dữ liệu bị thiếu và kích thước mẫu sẽ được hiển thị. "n=12" và "n=12.000" không được giống nhau.
Lưu ý: Chỉ vì đồ họa do AI tạo ra đẹp thì không đúng sự thật. Sai lầm phổ biến nhất mà anh ấy mắc phải là không bắt đầu trục từ số 0 trong biểu đồ thanh và phóng đại sự khác biệt giữa hai nhóm. Luôn kiểm tra trục.
Biểu đồ so sánh: câu hỏi → biểu đồ
Hỏi
biểu đồ chính xác
Lỗi thường gặp
Biến này được phân phối như thế nào?
Biểu đồ/biểu đồ hộp
sử dụng biểu đồ hình tròn
Hai biến số có liên quan với nhau không?
Biểu đồ phân tán
Chỉ cần nhìn vào số lượng mối tương quan
Nó đã thay đổi như thế nào theo thời gian?
biểu đồ đường
Kể một xu hướng bằng biểu đồ thanh
Sự khác biệt giữa các nhóm là gì?
Hộp/thanh được nhóm lại (từ đầu)
Thanh trục cắt ngắn
Tỷ lệ một phần so với toàn bộ?
Thanh xếp chồng lên nhau (thận trọng)
Biểu đồ hình tròn nhiều lát
Bốn lời nhắc có thể sao chép
1. Mã khám phá tự động:
Vai trò của bạn: Trợ lý EDA. Tôi không chia sẻ dữ liệu, tôi muốn mã R (ggplot2). Có các biến số (thu nhập, độ tuổi, chi tiêu) và phân loại (khu vực, giáo dục) trong data.frame 'data'. Nhiệm vụ: viết mã tạo biểu đồ cho từng số, biểu đồ thanh cho từng danh mục và biểu đồ phân tán cho thu nhập ~ độ tuổi. Trong biểu đồ thanh, hãy để trục y bắt đầu từ ZERO. Thêm dòng bình luận.
2. Xét tương quan (tương quan + trực quan với nhau):
Viết mã vừa tính toán mối tương quan Pearson cho thu nhập và chi tiêu vừa vẽ đồ thị phân tán + xu hướng tuyến tính. Thêm một dòng nhận xét nhắc nhở tôi kiểm tra biểu đồ trước khi TIN TƯỞNG vào số lượng tương quan (Cảnh báo Anscombe). Đừng làm phẳng đường xu hướng quá mức.
3. Kiểm toán tính liêm chính:
Kiểm tra mã ggplot sau để có hình ảnh trung thực:[code]. Kiểm tra và sửa các thông tin sau: trục y có bắt đầu từ 0 không, thang đo có nhất quán không, kích thước mẫu có hiển thị không, có làm mịn quá mức không? Giải thích lý do cho mỗi lần sửa chữa bạn đã thực hiện.
4. Lập biên bản phát hiện (không phải phát hiện):
Dựa trên các biểu đồ tôi tạo ra, hãy liệt kê CÁC QUAN SÁT dưới dạng 'ghi chú khám phá'; viết từng mục bằng ngôn ngữ 'giả thuyết cần kiểm tra', chứ không phải 'kết luận'. Ví dụ: 'Thu nhập từ giáo dục đại học dường như được dàn trải nhiều hơn; nên được kiểm tra bằng dữ liệu riêng biệt.' Tránh những tuyên bố nhân quả và dứt khoát.
Dấu nhắc yếu / Dấu nhắc mạnh
Dấu nhắc yếu:
Tạo những biểu đồ đẹp về lợi nhuận và cho tôi biết ý nghĩa của chúng.
Lời nhắc này dẫn đến kết quả sai lệch: “đẹp” tập trung vào tính thẩm mỹ, trong khi “ý nghĩa của nó” thúc đẩy AI chuyển từ khám phá sang kết luận dứt khoát. Những bình luận phóng đại, nhân quả theo sau.
Lời nhắc mạnh mẽ:
Vai trò của bạn: trợ lý EDA trung thực. Nhiệm vụ: (1) chọn loại biểu đồ phù hợp với câu hỏi của tôi và viết phần giải thích, (2) bắt đầu trục từ 0 trong biểu đồ thanh, (3) diễn giải kết quả đầu ra bằng ngôn ngữ LƯU Ý KHÁM PHÁ: không có giả thuyết xác nhận dứt khoát/nhân quả nào đề xuất giả thuyết bằng ngôn ngữ "phải được kiểm tra", (4) cảnh báo tôi nếu mẫu nhỏ (n <30). Tôi sẽ chạy biểu đồ trong môi trường của riêng mình và xác minh nó.
Sự khác biệt: ý chí mạnh mẽ biện minh cho loại biểu đồ, áp đặt các quy tắc trung thực và không nhầm lẫn giữa khám phá với xác nhận.
ba trường hợp nhỏ
Trường hợp 1 - Phóng đại trục rời rạc. Một nhà phân tích cho thấy điểm hài lòng của hai nhánh (7,8 và 8,0; trên 10) trong biểu đồ thanh. Khi bắt đầu trục YZ từ 7,5, nhánh thứ hai có vẻ cao gần gấp đôi nhánh thứ nhất; trong khi sự khác biệt chỉ là 2,5%. Ban quản lý sắp khen thưởng một chi nhánh có ấn tượng sai lầm. Khi tôi khởi động trục từ đầu, sự khác biệt gần như không thể nhận thấy được. Bài học: chỉ riêng việc lựa chọn trục đã thay đổi nhận thức.
Trường hợp 2 - Tin tưởng vào mối tương quan và bỏ qua biểu đồ. Một nhà nghiên cứu nhận thấy r = 0,81 giữa hai biến và viết "mối quan hệ tuyến tính mạnh mẽ". Khi nhà tư vấn của ông yêu cầu biểu đồ phân tán, người ta thấy rằng mối quan hệ thực sự là do một quan sát cực đoan duy nhất và khi điểm đó bị loại bỏ, mối tương quan giảm xuống còn 0,12. Bài học: số lượng tương quan không thể thay thế cho biểu đồ; luôn luôn nhìn vào sự phân tán.
Trường hợp 3 - Khám phá nhầm lẫn với xác nhận. Một sinh viên đã xem xét tất cả các mối tương quan theo cặp trong tập dữ liệu 40 biến, chọn giá trị cao nhất (r=0,52) và viết: "chúng tôi đã tìm thấy mối quan hệ đáng kể giữa giáo dục và tiết kiệm (p=0,004)." Tuy nhiên, có hàng trăm cặp trong 40 biến; việc chọn mức cao nhất là một phát hiện sai lầm do tình cờ. Bài học: mẫu được phát hiện không thể được “kiểm tra và tuyên bố là có ý nghĩa” trong cùng một dữ liệu; Cần có xác nhận riêng.
Những lỗi thường gặp
- Không bắt đầu trục từ số 0 trong biểu đồ thanh. Nó phóng đại sự khác biệt nhỏ; Lời nói dối trực quan phổ biến nhất. Luôn kiểm tra.
- Nhìn vào mối tương quan và bỏ qua biểu đồ. Mối tương quan tương tự đến từ các mô hình rất khác nhau; có thể phù hợp với một mối quan hệ ngoại lệ. Đầu tiên, phân tán.
- Coi mẫu được tìm thấy trong phát hiện này là "bằng chứng" trong cùng một dữ liệu. Đây là cửa ngõ dẫn đến p-hacking; Việc xác nhận được thực hiện riêng biệt.
- Loại biểu đồ sai. Các kết quả trùng khớp như thanh biểu thị xu hướng và hình tròn biểu thị mức phân phối đều sai lệch. Chọn một thể loại dựa trên câu hỏi.
- Ẩn kích thước mẫu. n=8 và n=8.000 không được trông giống nhau trên cùng một biểu đồ; sự không chắc chắn phải được thể hiện.
Mẹo: Trước khi xuất bản biểu đồ, hãy tự hỏi: "Liệu câu chuyện có thay đổi nếu tôi thay đổi trục không?" Nếu câu trả lời là có thì có lẽ bạn đã bắt đầu chuyển hướng từ một nơi không trung thực.
Tóm lại
Phân tích dữ liệu thăm dò là giai đoạn thu thập dữ liệu, xem các mẫu và đưa ra các giả thuyết; Nó không phải là một sự xác nhận. AI nhanh chóng tạo số liệu thống kê mô tả và mã biểu đồ, nhưng bạn chọn loại biểu đồ dựa trên câu hỏi của mình và kiểm soát các nguyên tắc công bằng (trục 0, tỷ lệ nhất quán, độ không chắc chắn rõ ràng). Nhìn vào sự phân tán trước khi tin vào con số tương quan; Đừng khai báo mẫu bạn tìm thấy trong khám phá là "bằng chứng" trong cùng một dữ liệu. Một đồ thị đẹp của AI không có nghĩa là một đồ thị đúng.
Nhiệm vụ ứng dụng
Chọn ít nhất ba biến trong một tập dữ liệu. Yêu cầu AI cung cấp và chạy mã tạo ra các biểu đồ khám phá (biểu đồ, phân tán, đóng hộp) kèm theo lời nhắc thực thi các quy tắc về tính trung thực. Đối với mỗi biểu đồ: kiểm tra (1) tính phù hợp của loại biểu đồ với câu hỏi, (2) tính trung thực của trục, (3) tính minh bạch của cỡ mẫu. Viết ít nhất một “ghi chú khám phá” bằng ngôn ngữ giả thuyết (“…dường như đã được kiểm tra riêng”). Kiểm tra mối tương quan với cả số lượng và phân tán và báo cáo nếu có sự khác biệt giữa chúng.
danh sách kiểm tra
- [ ] Tôi đã chọn loại biểu đồ dựa trên câu hỏi và loại dữ liệu của mình.
- [ ] Trong biểu đồ thanh, tôi bắt đầu trục y từ 0; Tôi đã kiểm tra tính trung thực của trục.
- [ ] Tôi đã xem biểu đồ phân tán trước khi tin tưởng vào mối tương quan.
- [ ] Tôi đã phản ánh cỡ mẫu và độ không chắc chắn trên biểu đồ.
- [ ] Tôi đã viết những mô hình mà tôi tìm thấy trong quá trình khám phá là "giả thuyết cần được kiểm tra" chứ không phải là "bằng chứng".
- [ ] Tôi đã lưu ý rằng tôi sẽ không sử dụng cùng một dữ liệu để xác nhận và cần phải thực hiện một bước riêng.