Ganancias:
- Comprenda que el p-hacking, el HARKing, los informes selectivos y el jardín de caminos que se bifurcan producen resultados falsos y vea cómo la inteligencia artificial puede acelerar estas trampas.
- Capacidad para establecer defensas como prerregistro, plan de análisis, disciplina de comparación múltiple y análisis de sensibilidad con soporte de inteligencia artificial.
- Ser capaz de internalizar el diseño de solicitud honesta que permitirá a la inteligencia artificial rechazar solicitudes del tipo 'encontrar el resultado significativo' y que la responsabilidad final recaiga en el investigador.
En la unidad anterior vimos qué es y qué no es el valor p. En esta unidad veremos un tema más oscuro: las trampas sistemáticas que amenazan la integridad estadística. La mayoría de estos no son trampas intencionales; Se trata de mecanismos insidiosos en los que incluso los investigadores bien intencionados caen sin darse cuenta. Y la inteligencia artificial (IA) hace que estos problemas sean más fáciles y rápidos, ya que permite ejecutar docenas de análisis en segundos. El objetivo de esta unidad es establecer la disciplina que transformará la IA de una "máquina de búsqueda de resultados significativos" a un asistente honesto.
Errores básicos
p-hacking (p-valuehunting): Es intentar nuevamente el análisis de diferentes maneras hasta obtener un resultado significativo (p<0,05). Agregar y eliminar variables, seleccionar submuestras, cambiar la definición de valores atípicos, probar diferentes transformaciones, usar diferentes variables de resultado, detener la recopilación de datos cuando sea significativa... Cada intento brinda una nueva "oportunidad"; Si te esfuerzas lo suficiente, uno de ellos resultará significativo, incluso si en realidad no tiene ningún efecto. El resultado: hallazgos espurios que fueron publicados pero no reproducibles.
HARKing (Hipothesizing After the Results are Known): Hacer una hipótesis después de ver los resultados y presentarla como "Lo predije así desde el principio". Observa los datos y encuentra la relación más sorprendente, luego escribe el artículo como si estuviera diseñado para probar esa hipótesis. Esto engaña al lector al hacer que el descubrimiento parezca una confirmación.
Informes selectivos (selección selectiva): informar sólo los "buenos" de docenas de análisis y enterrar silenciosamente el resto. Esto también se conoce como el "problema del cajón de archivos": los resultados sin sentido permanecen en el cajón, lo que hace que la literatura esté sistemáticamente sesgada.
Jardín de caminos que se bifurcan: término de Andrew Gelman. Incluso sin un solo p-hacking intencional, el investigador toma muchas decisiones razonables basadas en los datos (qué variable, qué umbral, qué subgrupo, qué transformación). Estos grados de libertad de investigación son tan numerosos que efectivamente se está eligiendo el significativo entre una multitud de análisis, incluso sin ninguna mala intención. El resultado es nuevamente una tasa creciente de falsos positivos.
Precaución: la mayoría de estas trampas no son trucos deliberados. La suma de pasos aparentemente inocentes como "Sólo probé algunos modelos más", "quedó más limpio cuando eliminé el valor atípico", "el efecto es más claro en este subgrupo" puede producir un hallazgo espurio. La honestidad es una cuestión de método, no de intención.
¿Por qué la IA amplía estas trampas?
Probar 3 modelos a mano lleva tiempo; YZ produce 50 variantes de modelos, 10 conversiones diferentes y 8 subgrupos en minutos. Este poder es desastroso sin un plan honesto: una solicitud como “encontrar una relación significativa en estos datos” o “construir un modelo que respalde esta hipótesis” convierte a la IA directamente en un motor de piratería p. La IA también quiere ser útil; tiende a encontrar un resultado "significativo" que le satisfaga. Es por eso que su diseño rápido es la primera línea de defensa de la honestidad.
Defensas: curso justo de negocios
1. Preinscripción: Significa registrar su hipótesis, variables, modelo y pruebas por escrito (posiblemente en una plataforma con fecha y hora) antes de realizar el análisis. Así, el descubrimiento se separa de la confirmación; Todo lo que cambies después se etiquetará como "explorador".
2. Plan de análisis: incluso si no puede realizar un registro previo, escriba un plan de análisis antes de sumergirse en los datos: hipótesis principal, variable de resultado principal, modelo principal. Establecer la distinción entre “análisis principal” y “análisis adicional/exploratorio” desde el principio y mantenerla en el informe.
3. Informa de todo: No ocultes los modelos que has probado. En la sección “análisis de sensibilidad” (verificación de robustez), muestre cómo diferentes especificaciones cambian el resultado. El hallazgo es sólido sólo si se sostiene bajo muchas opciones plausibles.
4. Disciplina de comparación múltiple: Si has hecho demasiados tests, corrígelos (unidad 6). Responda la pregunta "¿Cuántas pruebas me he hecho?" honestamente.
5. Análisis de sensibilidad: repita su hallazgo principal con una muestra diferente, un conjunto de control diferente y una transformación diferente. Si el resultado cambia, no lo ocultes, repórtalo.
Cuadro comparativo: honesto versus trampa
Solicitud
forma de trampa
equivalente honesto
Selección de modelo
Intentando hasta que tenga sentido (p-hacking)
Modelo maestro planificado previamente
hipótesis
Adaptarse después del hecho (HARKing)
Pregrabado, antes de los datos.
Informes
No muestres solo a los hermosos
Todas las especificaciones + sensibilidad
subgrupo
Eligiendo lo más llamativo
Predefinido, corregible
recopilación de datos
Detente cuando tenga sentido
muestra predeterminada
Cuatro indicaciones copiables
1. Marco de reclamación honesta:
Su función: asistente de estadística honesto. Mi objetivo NO es encontrar un resultado significativo, sino encontrar el resultado correcto. REGLAS: - NO me des sugerencias del tipo "probar modelos hasta que tenga sentido", - dime si sugieres múltiples especificaciones, todas deben ser reportadas, - avísame sobre cualquier paso que pueda llevar a p-hacking. Ayúdame a aclarar mi modelo principal primero, separar el descubrimiento de la confirmación.
2. Borrador del plan de análisis:
Ayúdenme a redactar un plan de análisis preliminar para un estudio: hipótesis primaria, variable de resultado primaria, especificación del modelo principal, subgrupos predefinidos, estrategia de comparación múltiple. Coloque los análisis "exploratorios" y "confirmatorios" en títulos separados. Recuérdame completar esto SIN MIRAR los datos.
3. Análisis de sensibilidad:
Mi principal hallazgo es escribir el código de análisis de sensibilidad (R) para Mi objetivo es VER qué tan sólido es el resultado, NO elegir el mejor; mostrar todos los resultados.
4. Autocontrol:
Explicaré mi proceso de análisis; Dame una lista de verificación para p-hacking / HARKing / informes selectivos y marca cuáles de mis pasos son riesgosos. Pregúnteme cuántos modelos/pruebas he probado y cuáles planeo informar.
Aviso débil / Aviso fuerte
Aviso débil:
Qué variables muestran relaciones significativas en estos datos, encuentre el mejor modelo.
Este mensaje es una instrucción directa de p-hacking: la IA prueba docenas de combinaciones y presenta la que "tiene más sentido". Es casi seguro que el resultado sea un hallazgo espurio que no se puede replicar.
Potente mensaje:
Tu papel: asistente honesto. El modelo PRINCIPAL que he predeterminado es: Y ~ X + controles. Escriba código que prediga este modelo. NO busque otro modelo "más significativo". Sugiera también un análisis de sensibilidad para poder ver la solidez del resultado, pero sepa que informaré TODOS los resultados, no elegiré el mejor. No me dejen descartar ningún hallazgo exploratorio como "confirmado".
Diferencia: una fuerte voluntad corrige el modelo principal, prohíbe la búsqueda y requiere que se informen todos los resultados.
tres mini casos
Caso 1: caza de subgrupos. Un investigador no encontró ningún efecto en la muestra general; Le preguntó a la IA "¿en qué subgrupo es significativo?" YZ escaneó las combinaciones de edad, género y región y encontró "p = 0,03 en mujeres urbanas de 35 a 44 años". El artículo se basó en este subgrupo. Su replicación no encontró ningún efecto: esto fue el resultado del azar en docenas de subgrupos. Lección: el subgrupo seleccionado después de los datos HARKing, no confirmando.
Caso 2: Búsqueda de conversiones. La relación que resulta no tener sentido a nivel de estudiante; lo probé en forma logarítmica, raíz cuadrada, cuadrada y rezagada; Encontró p=0,048 en forma log-log y solo informó eso. Por suerte, una de las cinco formas probadas cruzó el umbral. La forma correcta fue: preseleccionar la forma con teoría y mostrar el resultado de todas las formas en la tabla de sensibilidad. Lección: los informes selectivos producen una significación falsa.
Caso 3: Cómo funciona el encuadre honesto. Un equipo prerregistrado antes del análisis: hipótesis primaria única, modelo principal único, dos subgrupos predefinidos, corrección de Bonferroni. El efecto principal no fue significativo, pero el equipo lo informó honestamente; El individuo exploratorio señaló un hallazgo como "que necesita ser probado en el futuro". El estudio fue reproducible y confiable. Lección: una planificación honesta hace que incluso el resultado “fallido” valga la pena.
Errores comunes
- Decirle a la IA que "encuentre resultados significativos". Esto es pura piratería; Coloque la IA en un marco honesto, pidiendo precisión, no resultados.
- Presentar el descubrimiento como confirmación (HARKing). Es engañoso escribir la hipótesis establecida después de los datos como "lo predije desde el principio"; Etiquete el hallazgo exploratorio.
- Simplemente reportando buenos resultados. Mostrar todas las especificaciones probadas; Ocultar el análisis de sentimientos compromete la integridad.
- Selección de subgrupos/conversión. Elegir el más significativo entre docenas de subgrupos o transformaciones produce hallazgos espurios; identificar y solucionar con antelación.
- Olvidar cuántas pruebas has hecho. Lleve un registro del número total de intentos; Ningún valor p puede interpretarse honestamente sin conocer este número.
Consejo: antes de escribir un hallazgo, pregúntese: "¿De cuántas maneras lo he intentado en silencio hasta encontrar este resultado? ¿Estoy informándolos todos?" Si algunos de los ensayos permanecen en el cajón, su informe parece más sólido de lo que es.
En resumen
p-hacking, HARKing, informes selectivos y el jardín de caminos que se bifurcan; Muchas son trampas que funcionan sin querer pero que producen resultados espurios e irreproducibles. La IA acelera estos problemas porque puede realizar decenas de análisis al instante; Las solicitudes del tipo "encontrar resultados significativos" convierten la IA en un motor de piratería informática. Defensa; separar el descubrimiento de la confirmación con un plan de análisis y prerregistro, informar todas las especificaciones y análisis de sensibilidad, corregir múltiples comparaciones y colocar la IA en un marco honesto que exige el "resultado correcto". La responsabilidad final siempre recae en el investigador.
Tarea de aplicación
Elija una pregunta de investigación y escriba un breve plan de análisis antes de observar los datos: hipótesis primaria, modelo principal, variable de resultado primaria, subgrupos predefinidos, estrategia de comparación múltiple. Luego estime el modelo principal. Luego haga un análisis de sensibilidad (diferentes controles, valores atípicos incluidos/excluidos, diferente forma de función) y muestre todos los resultados en una sola tabla. En un párrafo, evalúe qué pasos plantean un riesgo de p-hacking y cómo su marco honesto los limita.
lista de verificación
- [] Escribí el plan de análisis/modelo maestro antes de sumergirme en los datos.
- [] Etiqueté los análisis exploratorios y confirmatorios por separado; No estaba HARKing.
- [] He informado de todas las especificaciones que he probado; No elegí sólo la hermosa.
- [] Definí los subgrupos y las transformaciones de antemano, no los escaneé después de los datos.
- [] Llevé un registro de cuántas pruebas había realizado y apliqué la corrección necesaria.
- [] Utilicé la IA en el contexto de “encontrar la verdad” en lugar de “encontrarla significativa”; Asumí la responsabilidad.