Unidad 6 / 11

Prueba de hipótesis y valor p: significancia, potencia y comparaciones múltiples

Ganancias:

  • Capacidad para definir correctamente la hipótesis nula, el valor p, el intervalo de confianza y el poder estadístico y utilizar la inteligencia artificial en la selección e interpretación de pruebas.
  • Capacidad para distinguir lo que es y lo que no es un valor p (ni el tamaño del efecto, ni la probabilidad de precisión) y comprender por qué es necesaria la corrección de comparación múltiple
  • Capacidad para reconocer comentarios realizados por inteligencia artificial que confunden significado con materialidad y reportarlos con tamaño de efecto e incertidumbre.

La herramienta estadística más utilizada y más incomprendida es la prueba de hipótesis. La idea básica es simple: tenemos una afirmación (por ejemplo, “la media de estos dos grupos es diferente”) y su opuesta, una hipótesis nula (H0 – “en realidad no hay diferencia”). La prueba mide qué tan bien concuerdan los datos con la hipótesis nula. En esta unidad veremos cómo la inteligencia artificial (IA) facilita la selección e interpretación de las pruebas, pero por qué los errores en torno al valor p son tan comunes y peligrosos. Empecemos desde el principio: la IA sabe qué sintaxis de prueba escribir; pero es su trabajo interpretar si se cumple el supuesto de la prueba y qué significa realmente el resultado.

¿Qué es realmente el valor p?

El valor p es la probabilidad de que el resultado observado, o un resultado más extremo, ocurra por casualidad cuando la hipótesis nula es verdadera (es decir, en realidad no hay ningún efecto). Un valor p pequeño (0,05 es el umbral tradicional) significa que "sería sorprendente ver esos datos si realmente no hubiera ningún efecto"; Esto se considera evidencia contra la hipótesis nula.

Ahora aclaremos qué no es el valor p, que la IA a menudo confunde:

  • El valor p no es la probabilidad de que la hipótesis nula sea cierta. p=0,03 no significa "hay un 3% de probabilidad de que no haya efecto".
  • El valor p no indica el tamaño del efecto. Un efecto muy pequeño puede producir un valor p pequeño en una muestra grande.
  • El valor p no prueba que el hallazgo sea significativo o real. "Significativo" es un término estadístico, "significativo" es un juicio.
  • p>0,05 no significa "sin efecto"; Significa "no pudimos mostrar el efecto con estos datos". La ausencia de evidencia no es evidencia de ausencia.
Precaución: El error de interpretación más común de la IA es presentar la palabra "significativo" como "impacto significativo/fuerte/importante". La importancia estadística y la importancia práctica son dos cosas diferentes; Informe siempre los dos por separado.

Intervalo de confianza y tamaño del efecto: información más rica

En lugar de un único valor p, un intervalo de confianza es mucho más informativo: proporciona el rango plausible de valores para su estimación. La frase "Efecto 1200, intervalo de confianza del 95% [300, 2100]" muestra tanto la dirección, la magnitud como la incertidumbre; "p<0,05" simplemente dice "lejos de cero". La práctica estadística moderna utiliza el valor p no solo; recomienda informar con el trío de tamaño del efecto + intervalo de confianza + valor p.

Poder estadístico y muestra.

El poder estadístico es la probabilidad de detectar un efecto que realmente existe (1 menos la probabilidad de error de tipo II, es decir, "pasar por alto el efecto real"). Un estudio con poco poder estadístico es susceptible a dos riesgos: (1) pasa por alto los efectos verdaderos (falso negativo); (2) los pocos resultados que resultan significativos conllevan magnitudes infladas: la llamada maldición del ganador porque sólo las predicciones infladas pueden cruzar el umbral. Por lo tanto, es una buena práctica calcular la potencia/muestra antes del análisis. AI genera el código para esta cuenta; El tamaño del efecto objetivo se determina con la teoría.

Problema de comparación múltiple

Al realizar una prueba, un umbral de 0,05 significa "5% de riesgo de falsos positivos". Pero si se hacen 20 pruebas, en promedio se esperaría que una arrojara p<0,05 por casualidad, incluso cuando todas ellas fueran realmente ineficaces. A esto se le llama problema de comparación múltiple. La probabilidad de falsos positivos aumenta rápidamente cuando se prueban grandes cantidades de variables, subgrupos o variables de resultado. La solución es corregir el umbral: métodos de Bonferroni (dividir el umbral por el número de pruebas: estricto), Holm o Benjamini-Hochberg que controlan la tasa de descubrimiento falso (FDR). Este riesgo se vuelve aún mayor en la era de la IA, ya que la IA puede producir docenas de pruebas en segundos; este es el tema directo de la siguiente unidad (p-hacking).

Tabla comparativa: lo que dice el valor p y lo que no dice

expresión

¿Es verdad?

Descripción

"p=0,02, la probabilidad de que no haya efecto es del 2%"

mal

p no es la probabilidad de H0

"p<0,05, el efecto es grande"

mal

p no indica tamaño

"p=0,20, sin efecto"

mal

No poder presentarse no es ausencia

"p<0.05, hay evidencia en contra de H0"

Verdadero

Cauteloso y puntual

"Efecto 1.200 [300;2.100], p=0.01"

mejor

Tamaño + incertidumbre + evidencia

Cuatro indicaciones copiables

1. Elegir la prueba adecuada:

Su función: asistente de pruebas estadísticas. Quiero comparar la media de dos grupos independientes (variable continua). Dame: qué prueba es apropiada (con sus supuestos: normalidad, igualdad de varianza), la alternativa si no se cumple el supuesto (por ejemplo, Welch, Mann-Whitney) y el código R. Ejecutaré el resultado y comprobaré las suposiciones.

2. Informar el valor p correctamente:

Informe el resultado de la prueba a continuación, pero REGLAS: - NO presente el valor p como "probabilidad de H0" o "tamaño del efecto", - asegúrese de incluir el tamaño del efecto y el intervalo de confianza del 95%, - escriba "significativo" y "significativo" por separado, - si p>0,05, NO diga "sin efecto", diga "no pudimos mostrar". Salida: [pegar]

3. Cálculo de potencia/muestra:

Estoy planeando un experimento: dos grupos, tamaño del efecto esperado (d de Cohen) ~0,4, potencia 0,80, alfa 0,05. Escriba código R que calcule el tamaño de muestra requerido (paquete pwr) y explique los riesgos de un estudio de baja potencia (maldición del ganador).

4. Corrección de comparación múltiple:

He realizado 15 pruebas de hipótesis distintas y tengo valores p. Escriba un código R que aplique las correcciones de Bonferroni y Benjamin-Hochberg (FDR), explique la diferencia entre los dos métodos y resuma en una oración por qué no debería confiar en p<0,05.

Aviso débil / Aviso fuerte

Aviso débil:

¿Es significativo el resultado de esta prueba? Comenta el resultado.

Esta afirmación atrapa a la IA en el binario “significativo/no significativo”; Lo más probable es que produzca una frase que confunda magnitud con significado, como "sí, es significativo, el efecto es fuerte".

Potente mensaje:

Su función: atento asistente estadístico. Interprete el resultado pero: (1) proporcione el tamaño del efecto + intervalo de confianza del 95% + valor p juntos, (2) separe la significancia de la significancia, (3) p>0.05 en "no se pudo mostrar", (4) pregunte cuántas pruebas hice; Si hay más de uno, sugerir corrección de comparación múltiple, (5) recordar que se deben verificar los supuestos de la prueba.

Diferencia: un mensaje fuerte impone informes enriquecidos y protege contra trampas de valor p.

tres mini casos

Caso 1: “Importancia” no significativa en una muestra grande. Un analista encontró que la diferencia media entre los dos grupos era "altamente significativa" en p<0,001 en datos con 500.000 observaciones. Pero la diferencia fue de sólo 0,3 puntos (sobre 100) y prácticamente no tuvo sentido. La enorme muestra hizo que incluso la pequeña diferencia fuera "significativa". Cuando se informó el tamaño del efecto, se encontró que el hallazgo era insignificante. Lección: la importancia no es magnitud; Si n es grande, toda diferencia es significativa.

Caso 2: Ilusión de pruebas múltiples. Un equipo probó 22 variables de resultado; Uno de ellos mostró p=0,04 y se anunció como "encontramos el efecto". Con la corrección de Bonferroni, el umbral disminuyó a 0,05/22 = 0,0023; 0,04 no superó este umbral. El único resultado "significativo" habría sido por casualidad entre 22 ensayos. Lección: cuando se prueba mucho, es necesaria la corrección.

Caso 3: La falta de poder y la maldición del ganador. Un pequeño estudio piloto (n=15 por grupo) encontró un efecto muy grande (d=0,9) y significativo. Un gran estudio de replicación redujo el efecto a d = 0,2. La pequeña muestra sólo había permitido que una sobreestimación cruzara el umbral. Lección: No se puede confiar en tamaños de efecto significativos a baja potencia.

Errores comunes

  • Confundir significado con importancia/magnitud. El efecto no es grande sólo porque p sea pequeño; Informe el tamaño del efecto por separado.
  • Confundir el valor p con la probabilidad de H0. p no es la "probabilidad de que no haya efecto"; es conceptualmente diferente.
  • Leyendo p>0,05 como "sin efecto". La falta de presentación no es evidencia de ausencia; Indique la incertidumbre.
  • No corregir por pruebas múltiples. Demasiadas pruebas producen falsos positivos; Aplicar Bonferroni/FDR.
  • Ignorando el poder. El efecto significativo en la muestra pequeña es exagerado; Calcule la potencia antes del análisis.
Consejo: antes de descartar un resultado como “significativo”, haga dos preguntas: “¿Es el efecto prácticamente significativo (magnitud)?” y "¿Cuántas pruebas me hice antes de encontrar este resultado?" La segunda pregunta es la prueba de fuego de la honestidad.

En resumen

Las pruebas de hipótesis y el valor p son herramientas poderosas pero incomprendidas. El valor p es la probabilidad de ver los datos cuando la hipótesis nula es verdadera; La probabilidad de H0 no es la magnitud del efecto ni la importancia del hallazgo. Informe siempre la importancia junto con el tamaño del efecto y el intervalo de confianza; No lea p>0,05 como "sin efecto"; aplique corrección de comparación múltiple si ha realizado muchas pruebas; Tenga en cuenta el riesgo de efectos exagerados de estudios de bajo poder estadístico. La IA produce códigos y planos de prueba; Es su responsabilidad distinguir entre significado y materialidad y verificar las suposiciones.

Tarea de aplicación

Haga una comparación de medias entre dos grupos en un conjunto de datos. Pídale a la IA la prueba adecuada (con sus suposiciones) y el código, ejecútelo y verifique las suposiciones. Informe el resultado con tres componentes: tamaño del efecto, intervalo de confianza del 95%, valor p. Luego piense en cuántas comparaciones diferentes puede hacer con los mismos datos; Si ha realizado varias pruebas, aplique la corrección de Bonferroni o FDR e informe si el resultado aún se mantiene. Finalmente, escriba una evaluación aproximada del poder para su análisis.

lista de verificación

  • [ ] Seleccioné la prueba con sus supuestos y verifiqué los supuestos.
  • [] Informé el resultado como tamaño del efecto + intervalo de confianza + valor p.
  • [ ] Mantuve separados “significativo” e “importante”; No pensé que p fuera la probabilidad de H0.
  • [] Escribí p>0.05 como "no pudimos mostrarlo" en lugar de "sin efecto".
  • [] Apliqué corrección de comparación múltiple si realicé varias pruebas.
  • [ ] Evalué el poder de muestreo; Fui cauteloso con el tamaño del efecto a baja potencia.