Lợi nhuận:
- Hiểu rằng việc hack p, HARKing, báo cáo có chọn lọc và khu vườn phân nhánh tạo ra những phát hiện sai lệch và xem trí tuệ nhân tạo có thể đẩy nhanh những cái bẫy này như thế nào
- Khả năng thiết lập các biện pháp phòng vệ như đăng ký trước, kế hoạch phân tích, kỷ luật so sánh nhiều lần và phân tích độ nhạy với sự hỗ trợ của trí tuệ nhân tạo
- Có thể tiếp thu thiết kế yêu cầu trung thực sẽ cho phép trí tuệ nhân tạo từ chối các yêu cầu loại 'tìm kết quả có ý nghĩa' và trách nhiệm cuối cùng thuộc về nhà nghiên cứu.
Trong bài học trước, chúng ta đã biết giá trị p là gì và giá trị p là gì. Trong phần này chúng ta sẽ xem xét một chủ đề đen tối hơn, những cái bẫy mang tính hệ thống đe dọa tính toàn vẹn thống kê. Hầu hết những điều này không phải là gian lận có chủ ý; Đây là những cơ chế ngấm ngầm mà ngay cả những nhà nghiên cứu có thiện chí cũng rơi vào mà không nhận ra. Và trí tuệ nhân tạo (AI) khiến những cạm bẫy này trở nên dễ dàng hơn và nhanh hơn vì nó có thể thực hiện hàng chục phân tích trong vài giây. Mục đích của đơn vị này là thiết lập kỷ luật sẽ biến AI từ một "cỗ máy tìm kiếm kết quả có ý nghĩa" thành một trợ lý trung thực.
Những cạm bẫy cơ bản
p-hacking (săn giá trị p): Nó đang thử phân tích lại theo nhiều cách khác nhau cho đến khi thu được kết quả đáng kể (p<0,05). Thêm và xóa các biến, chọn mẫu con, thay đổi định nghĩa của các ngoại lệ, thử các phép biến đổi khác nhau, sử dụng các biến kết quả khác nhau, dừng thu thập dữ liệu khi nó có ý nghĩa... Mỗi lần thử mang lại một "cơ hội" mới; Nếu bạn cố gắng đủ nhiều, một trong số chúng sẽ trở nên có ý nghĩa, ngay cả khi nó thực sự không có tác dụng gì. Kết quả: những phát hiện giả mạo đã được công bố nhưng không thể tái tạo được.
HARKing (Giả thuyết sau khi biết kết quả): Đưa ra giả thuyết sau khi xem kết quả và trình bày nó là "Tôi đã dự đoán như thế này ngay từ đầu". Bạn nhìn vào dữ liệu và tìm ra mối quan hệ nổi bật nhất, sau đó viết bài báo như thể nó được thiết kế để kiểm tra giả thuyết đó. Điều này đánh lừa người đọc bằng cách làm cho phát hiện này giống như một sự xác nhận.
Báo cáo có chọn lọc (hái quả anh đào): Chỉ báo cáo những cái "tốt" từ hàng tá phân tích và âm thầm chôn vùi phần còn lại. Điều này còn được gọi là “vấn đề ngăn kéo hồ sơ”: những kết quả vô nghĩa vẫn nằm trong ngăn kéo, khiến tài liệu bị thiên lệch một cách có hệ thống.
Khu vườn của những con đường rẽ nhánh: Thuật ngữ của Andrew Gelman. Ngay cả khi không có một lần hack p có chủ ý nào, nhà nghiên cứu vẫn đưa ra nhiều lựa chọn hợp lý dựa trên dữ liệu (biến nào, ngưỡng nào, nhóm con nào, phép biến đổi nào). Những mức độ tự do điều tra này nhiều đến mức bạn đang lựa chọn một cách hiệu quả mức độ có ý nghĩa từ vô số phân tích — ngay cả khi không có bất kỳ mục đích xấu nào. Kết quả một lần nữa là tỷ lệ dương tính giả ngày càng tăng.
Thận trọng: Hầu hết các bẫy này không phải là thủ đoạn có chủ ý. Tổng các bước dường như vô hại như "Tôi vừa thử thêm một vài mô hình", "nó sạch hơn khi tôi loại bỏ ngoại lệ", "hiệu ứng rõ ràng hơn trong nhóm con này" có thể tạo ra một phát hiện giả. Sự trung thực là vấn đề của phương pháp, không phải là ý định.
Tại sao AI lại phóng to những cái bẫy này?
Việc thử 3 mẫu bằng tay sẽ mất thời gian; YZ sản xuất 50 biến thể mô hình, 10 chuyển đổi khác nhau, 8 nhóm phụ trong vài phút. Sức mạnh này sẽ là thảm họa nếu không có một kế hoạch trung thực: một yêu cầu như “tìm mối quan hệ có ý nghĩa trong dữ liệu này” hoặc “xây dựng mô hình hỗ trợ giả thuyết này” sẽ biến AI trực tiếp thành một công cụ hack p. AI cũng muốn trở nên hữu ích; có xu hướng tìm kiếm một kết quả "có ý nghĩa" làm bạn hài lòng. Đó là lý do tại sao thiết kế nhanh chóng của bạn là tuyến phòng thủ đầu tiên của sự trung thực.
Phòng thủ: tiến trình kinh doanh công bằng
1. Đăng ký trước: Có nghĩa là ghi lại giả thuyết, biến số, mô hình và thử nghiệm của bạn bằng văn bản (có thể trên nền tảng có dấu thời gian) trước khi thực hiện phân tích. Vì vậy, sự khám phá được tách rời khỏi sự xác nhận; bất cứ điều gì bạn thay đổi sau đó đều được gắn thẻ là "explorer".
2. Kế hoạch phân tích: Ngay cả khi bạn không thể ghi trước, hãy viết kế hoạch phân tích trước khi đi sâu vào dữ liệu: giả thuyết chính, biến kết quả chính, mô hình chính. Thiết lập sự khác biệt giữa “phân tích chính” và “phân tích bổ sung/thăm dò” ngay từ đầu và duy trì nó trong báo cáo.
3. Báo cáo mọi thứ: Đừng giấu những mẫu bạn đã thử. Trong phần “phân tích độ nhạy” (kiểm tra độ tin cậy), hãy chỉ ra các thông số kỹ thuật khác nhau thay đổi kết quả như thế nào. Phát hiện này chỉ có giá trị nếu nó phù hợp với nhiều lựa chọn hợp lý.
4. Môn so sánh trắc nghiệm: Nếu làm quá nhiều bài kiểm tra, hãy sửa lại (đơn vị 6). Trả lời câu hỏi "Tôi đã làm bao nhiêu bài kiểm tra?" Thành thật.
5. Phân tích độ nhạy: Lặp lại phát hiện chính của bạn với một mẫu khác, bộ điều khiển khác và phép biến đổi khác. Nếu kết quả thay đổi thì đừng giấu mà hãy báo cáo.
Biểu đồ so sánh: trung thực và bẫy
ứng dụng
hình bẫy
Trung thực tương đương
Lựa chọn mô hình
Cố gắng cho đến khi có ý nghĩa (p-hacking)
Mô hình tổng thể được lập kế hoạch trước
giả thuyết
Phù hợp sau thực tế (HARKing)
Ghi trước, trước dữ liệu
Báo cáo
Đừng chỉ trưng ra những cái đẹp
Tất cả thông số kỹ thuật + độ nhạy
nhóm con
Lựa chọn điều nổi bật nhất
Được xác định trước, có thể sửa được
thu thập dữ liệu
Dừng lại khi nó có ý nghĩa
mẫu xác định trước
Bốn lời nhắc có thể sao chép
1. Khung yêu cầu trung thực:
Vai trò của bạn: trợ lý thống kê trung thực. Mục tiêu của tôi KHÔNG phải là tìm ra một kết quả có ý nghĩa mà là tìm ra kết quả đúng. QUY TẮC:- KHÔNG đưa cho tôi các đề xuất loại "thử mô hình cho đến khi thấy hợp lý", - hãy cho tôi biết nếu bạn đề xuất nhiều thông số kỹ thuật thì tất cả chúng đều cần được báo cáo, - cảnh báo tôi về bất kỳ bước nào có thể dẫn đến hack p. Trước tiên hãy giúp tôi làm rõ mô hình chính của mình, tách biệt khám phá khỏi xác nhận.
2. Dự thảo phương án phân tích:
Giúp tôi soạn thảo kế hoạch phân tích sơ bộ cho một nghiên cứu: giả thuyết chính, biến kết quả chính, đặc tả mô hình chính, các nhóm con được xác định trước, nhiều chiến lược so sánh. Đặt các phân tích "thăm dò" và "xác nhận" vào các tiêu đề riêng biệt. Nhắc tôi điền thông tin này MÀ KHÔNG XEM dữ liệu.
3. Phân tích độ nhạy:
Phát hiện chính của tôi là viết mã phân tích độ nhạy (R) cho Mục tiêu của tôi là XEM kết quả chắc chắn như thế nào, KHÔNG chọn kết quả tốt nhất; hiển thị tất cả các kết quả.
4. Tự giám sát:
Tôi sẽ giải thích quá trình phân tích của mình; Đưa cho tôi một danh sách kiểm tra về p-hacking / HARKing / báo cáo có chọn lọc và đánh dấu những bước nào của tôi có rủi ro. Hỏi lại tôi xem tôi đã thử bao nhiêu mô hình/kiểm tra và những mô hình/kiểm tra nào tôi định báo cáo.
Dấu nhắc yếu / Dấu nhắc mạnh
Dấu nhắc yếu:
Những biến nào thể hiện mối quan hệ quan trọng trong dữ liệu này, hãy tìm mô hình tốt nhất.
Lời nhắc này là hướng dẫn hack p trực tiếp: AI thử hàng tá kết hợp và đưa ra kết hợp "có ý nghĩa nhất". Kết quả gần như chắc chắn là một phát hiện giả mạo không thể lặp lại được.
Lời nhắc mạnh mẽ:
Vai trò của bạn: trợ lý trung thực. Mô hình MAIN tôi đã xác định trước là: Y ~ X + điều khiển. Viết mã dự đoán mô hình này. ĐỪNG tìm kiếm một mô hình khác "có ý nghĩa hơn". Đồng thời đề xuất phân tích độ nhạy để tôi có thể thấy độ tin cậy của kết quả, nhưng biết rằng tôi sẽ báo cáo TẤT CẢ kết quả chứ không chọn kết quả tốt nhất. Đừng để tôi viết ra bất kỳ phát hiện thăm dò nào là 'đã được xác nhận'.
Sự khác biệt: mạnh mẽ sẽ sửa mô hình chính, cấm tìm kiếm và yêu cầu tất cả các kết quả phải được báo cáo.
ba trường hợp nhỏ
Trường hợp 1 - Săn tìm nhóm con. Một nhà nghiên cứu không tìm thấy tác dụng nào trong toàn bộ mẫu; Anh ấy hỏi AI "nó có ý nghĩa ở phân nhóm nào?" YZ đã quét các kết hợp độ tuổi, giới tính và khu vực và tìm thấy "p = 0,03 ở phụ nữ thành thị trong độ tuổi 35-44". Bài viết được dựa trên phân nhóm này. Sự sao chép của ông không có tác dụng: đây là kết quả ngẫu nhiên của hàng chục nhóm nhỏ. Bài học: chọn nhóm con sau dữ liệu là HARKing, không xác nhận.
Trường hợp 2 - Săn tìm chuyển đổi. Mối quan hệ hóa ra vô nghĩa ở dạng cấp độ học sinh; đã thử nó ở dạng log, căn bậc hai, bình phương và độ trễ; Anh ta tìm thấy p=0,048 ở dạng log-log và chỉ báo cáo điều đó. May mắn thay, một trong 5 hình thức đã cố gắng vượt qua ngưỡng. Cách đúng là: chọn trước biểu mẫu bằng lý thuyết và hiển thị kết quả của tất cả các biểu mẫu trong bảng độ nhạy. Bài học: báo cáo có chọn lọc tạo ra ý nghĩa sai lầm.
Trường hợp 3 - Việc đóng khung trung thực hoạt động như thế nào. Một nhóm đã đăng ký trước khi phân tích: một giả thuyết chính, một mô hình chính, hai nhóm con được xác định trước, hiệu chỉnh Bonferroni. Tác dụng chính không đáng kể nhưng nhóm đã báo cáo một cách trung thực; Cá nhân khám phá đã gắn cờ một phát hiện là "cần được kiểm tra trong tương lai". Nghiên cứu này có thể tái sản xuất và đáng tin cậy. Bài học: lập kế hoạch trung thực khiến ngay cả kết quả “thất bại” cũng trở nên đáng giá.
Những lỗi thường gặp
- Yêu cầu AI "tìm kết quả có ý nghĩa". Đây rõ ràng là hack p; Đặt AI vào khung trung thực, yêu cầu độ chính xác chứ không phải kết quả.
- Trình bày phát hiện này dưới dạng xác nhận (HARKing). Sẽ là sai lầm khi viết giả thuyết được thiết lập sau dữ liệu là “Tôi đã dự đoán ngay từ đầu”; Dán nhãn cho phát hiện thăm dò.
- Chỉ cần báo cáo kết quả tốt. Hiển thị tất cả các thông số kỹ thuật đã được kiểm tra; Việc che giấu phân tích tình cảm sẽ làm ảnh hưởng đến tính toàn vẹn.
- Sàng lọc phân nhóm/chuyển đổi. Việc chọn nhóm quan trọng nhất trong hàng chục nhóm con hoặc các phép biến đổi sẽ tạo ra những kết quả sai lệch; xác định và khắc phục trước.
- Quên bao nhiêu bài kiểm tra bạn đã thực hiện. Theo dõi tổng số lần thử; Không có giá trị p nào có thể được giải thích một cách trung thực nếu không biết con số này.
Mẹo: Trước khi viết ra một phát hiện, hãy tự hỏi bản thân: "Tôi đã âm thầm thử bao nhiêu cách cho đến khi tìm thấy kết quả này và tôi có báo cáo tất cả không?" Nếu một số bài luận vẫn ở trong ngăn kéo, báo cáo của bạn trông có vẻ chắc chắn hơn thực tế.
Tóm lại
p-hacking, HARKing, báo cáo có chọn lọc và khu vườn của những con đường rẽ nhánh; Nhiều cái bẫy hoạt động không chủ ý nhưng tạo ra những phát hiện giả mạo, không thể tái tạo được. AI đẩy nhanh những cạm bẫy này vì nó có thể thử hàng tá phân tích ngay lập tức; Yêu cầu loại “tìm kết quả có ý nghĩa” biến AI thành một công cụ hack. Phòng thủ; tách biệt việc phát hiện khỏi xác nhận bằng kế hoạch phân tích và đăng ký trước, báo cáo tất cả các thông số kỹ thuật và phân tích độ nhạy, sửa nhiều so sánh và đưa AI vào một khuôn khổ trung thực đòi hỏi "kết quả chính xác". Trách nhiệm cuối cùng luôn thuộc về nhà nghiên cứu.
Nhiệm vụ ứng dụng
Chọn một câu hỏi nghiên cứu và viết kế hoạch phân tích ngắn gọn trước khi xem dữ liệu: giả thuyết chính, mô hình chính, biến kết quả chính, các nhóm con được xác định trước, nhiều chiến lược so sánh. Sau đó ước tính mô hình chính. Sau đó thực hiện phân tích độ nhạy (các điều khiển khác nhau, bao gồm/loại trừ ngoại lệ, dạng hàm khác nhau) và hiển thị tất cả các kết quả trong một bảng. Trong một đoạn văn, hãy đánh giá những bước nào có nguy cơ bị hack p và cách khuôn khổ trung thực của bạn hạn chế chúng.
danh sách kiểm tra
- [ ] Tôi đã viết kế hoạch phân tích/mô hình tổng thể trước khi đi sâu vào dữ liệu.
- [ ] Tôi đã dán nhãn phân tích thăm dò và phân tích xác nhận riêng biệt; Tôi không hề nghe lén.
- [ ] Tôi đã báo cáo tất cả các thông số kỹ thuật mà tôi đã thử; Tôi không chỉ chọn cái đẹp.
- [ ] Tôi đã xác định trước các nhóm con và các phép biến đổi, tôi không quét chúng sau dữ liệu.
- [ ] Tôi theo dõi xem mình đã chạy bao nhiêu bài kiểm tra và áp dụng những chỉnh sửa cần thiết.
- [ ] Tôi sử dụng AI với mục đích “tìm ra sự thật” hơn là “thấy nó có ý nghĩa”; Tôi đã nhận trách nhiệm.