Ganancias:
- Capacidad para elegir la prueba adecuada al tipo y distribución de los datos y comprobar los supuestos (normalidad, varianza)
- Capacidad para comprender el verdadero significado del valor p e informar los resultados con el tamaño del efecto y el intervalo de confianza.
- Protección contra p-hacking con separación de descubrimiento y verificación, corrección de comparación múltiple e informes completos
El experimento ha terminado, los datos están disponibles. Ahora estamos en la etapa más crítica y más equivocada: analizar los datos correctamente e interpretar los resultados con honestidad. Los datos biológicos suelen ser ruidosos, inestables y multivariados. La selección incorrecta de pruebas, las violaciones de suposiciones implícitas y el p-hacking inconsciente (probar un análisis hasta que dé el resultado deseado) son las causas principales de la crisis de reproducibilidad en la literatura biológica publicada. La IA le ayuda a elegir la prueba adecuada, comprobar suposiciones y escribir código de análisis; pero la integridad estadística es su responsabilidad.
En esta unidad, cubriremos pruebas estadísticas comunes, comprobaciones de suposiciones y formas de protegerse del p-hacking.
Elegir la prueba adecuada
La elección de la prueba depende del tipo y distribución de los datos. La inteligencia artificial te ayudará a tomar esta decisión, pero no debes aplicarla a ciegas:
- Dos grupos, datos continuos, distribución normal: prueba t independiente.
- Dos grupos, no normales: U de Mann-Whitney (no paramétrico: no requiere supuesto de distribución).
- Más de dos grupos: ANOVA (análisis de varianza) + prueba post-hoc.
- Datos categóricos (recuentos): Chi-cuadrado o prueba exacta de Fisher.
- Relación: Correlación (Pearson/Spearman) o regresión.
Consejo: Visualice los datos antes de seleccionar la prueba. Un histograma o diagrama de caja muestra instantáneamente la normalidad y los valores atípicos que requiere una prueba t. "Primero graficar, probar después" es un buen hábito.
Comprobando suposiciones
Cada prueba tiene suposiciones ocultas. La prueba t supone una distribución normal e igualdad de varianza; Si se violan, el resultado será engañoso. La IA escribe código que verifica estas suposiciones:
Rol: Eres asistente de bioestadística. Tarea: escribir código que verifique los supuestos de una prueba t antes de comparar dos grupos de datos: normalidad (Shapiro-Wilk), igualdad de varianza (Levene). Si se viola el supuesto, dígame qué prueba alternativa debo seguir adelante. Proporcione código Python con comentarios.
El código le redirige a Mann-Whitney si se rompe la normalidad. Este flujo de “verificar primero, decidir después” le impide realizar la prueba incorrecta.
p-hacking y cómo protegerse
p-hacking consiste en analizar datos de diferentes maneras hasta p<0,05: probar diferentes pruebas, descartar selectivamente valores atípicos, agregar/eliminar grupos, informar qué es "significativo" entre una gran cantidad de variables. Esta es la principal fuente de descubrimientos falsos. Formas de protección:
- Fijar el plan de análisis con antelación (Unidad 7).
- Informe todas las pruebas, no sólo las que muestren importancia.
- Corregir comparación múltiple (FDR/Bonferroni).
- Indique el tamaño del efecto y el intervalo de confianza junto al valor p.
- Descubrimiento y validación separados: pruebe lo que encuentre en el conjunto de descubrimiento en un conjunto independiente.
Paso a paso: un análisis honesto
- Visualice los datos (dispersos, valores atípicos).
- Verifique los supuestos.
- Realiza la prueba que hayas predeterminado.
- Corregir comparación múltiple.
- Informe el tamaño del efecto + intervalo de confianza.
- Escriba las limitaciones claramente.
Plantillas de avisos copiables
Visualice el rendimiento: trace histogramas y diagramas de caja para cada grupo, marque valores atípicos. Luego interprete la normalidad. Columnas de datos: [nombre]. Proporcione código Python con comentarios.
Quiero comparar mis dos grupos. Características de los datos: [tipo, N, distribución]. ¿Qué prueba es apropiada? Verifique los supuestos, realice la prueba, informe el tamaño del efecto Y el intervalo de confianza del 95% CON valor p.
Probé 15 genes diferentes en mi análisis. Proporcione el código que aplica la corrección de Bonferroni y Benjamini-Hochberg y explique la diferencia entre los dos métodos.
Aviso débil / Aviso fuerte
Débil: "¿Son estos dos grupos diferentes? Realice una prueba t".
Fuerte: "Tengo dos grupos (control n=18, tratamiento n=20), la variable dependiente es la actividad enzimática (continua). Primero visualice la distribución y pruebe la normalidad con Shapiro-Wilk. Si es normal, aplique la prueba t, si no, Mann-Whitney. Informe el resultado con el valor p, el tamaño del efecto (d de Cohen o rango biserial) y el intervalo de confianza del 95%. Explique qué prueba eligió y por qué".
Diferencia: el poderoso mensaje tiene tipo de datos, números de muestra, verificación de suposiciones y solicitud de informes completos. El modelo sigue el camino correcto en lugar de aplicar ciegamente la prueba t.
tres mini casos
Caso 1: Prueba incorrecta: un estudiante aplicó una prueba t a datos significativamente asimétricos (no normales) y encontró p=0,048. Cuando la inteligencia artificial añadió la comprobación de normalidad, los datos no salieron normales; Con Mann-Whitney, p=0,11. El resultado real no tuvo sentido. Lección: probar sin verificar la suposición es engañoso.
Caso 2: Descarte selectivo de valores atípicos: un investigador eliminó dos puntos "atípicos" para que el resultado fuera significativo. El modelo enfatizó que el descarte de valores atípicos debe basarse en una regla predefinida (por ejemplo, el método IQR) y reportarse; la eliminación arbitraria es p-hacking. Lección: establezca la regla de los valores atípicos de antemano.
Caso 3: Recuperación del tamaño del efecto: un estudio tuvo p=0,001 pero el tamaño del efecto (d=0,1) fue casi cero; la muestra grande mostró que la diferencia insignificante era significativa. Cuando la inteligencia artificial informó el tamaño del efecto, se descubrió que el hallazgo no tenía valor práctico. Lección: El hecho de que p sea pequeño no importa.
cuadro comparativo
Estado
enfoque correcto
Para ser evitado
datos anormales
Prueba no paramétrica
Prueba t forzada
prueba múltiple
Aplicar corrección
Crudo p<0,05
valor atípico
Regla predefinida
eliminación arbitraria
resultado significativo
Tamaño del efecto + IC
solo p
descubrimiento hallazgo
Validar en conjunto independiente
Finalizar en un set
Errores comunes
- Pruebas de hipótesis no controladas: significancia espuria con pruebas falsas.
- p-hacking: Probar el análisis hasta que dé el resultado deseado.
- Informar solo el valor p: omitiendo el tamaño del efecto y el intervalo de confianza.
- No corregir comparaciones múltiples: falsos positivos.
- Salto de causalidad: inferir causalidad a partir de la correlación.
Precaución: La IA no "producirá" el resultado que desea, pero escribirá felizmente el código para la prueba incorrecta si se le engaña. Tiene integridad estadística: informe todos los ensayos, planifique el análisis con antelación, nunca pierda el tamaño del efecto. Trabaje con un bioestadístico para los análisis que conduzcan a la publicación.
significado real del valor p
El concepto más mal entendido en biología es el valor p. El valor p no es la "probabilidad de que la hipótesis sea cierta"; Es "la probabilidad de ver una diferencia tan grande o más extrema que la que observas, cuando en realidad no hay diferencia". Esta distinción sutil pero crítica es clave para no exagerar los resultados. p=0,03 no significa "el efecto es 97% real". Al hacer que la IA interprete un resultado, comprobar que utiliza esta definición correctamente; En ocasiones, el modelo puede repetir interpretaciones erróneas comunes.
El intervalo de confianza (IC) suele ser más informativo que el valor p porque muestra la magnitud y la incertidumbre del efecto juntas. “Diferencia de 2,4 veces (IC del 95%: 1,8-3,1)” dice mucho más que “p<0,05”: tanto la dirección del efecto, su magnitud y la precisión con la que se midió. Resalte GA en sus informes.
Utilice la definición correcta del valor p al interpretar mi resultado. Evite declaraciones incorrectas como "probabilidad de que el efecto sea verdadero". En su lugar, explique el significado práctico en términos del tamaño del efecto y el intervalo de confianza del 95%. Resultado: [datos]
Correlación, causalidad y datos observacionales.
La mayoría de los datos biológicos son observacionales: ves que algo cambia con otra cosa, pero no puedes ver qué causa qué. La frase “la expresión del gen X se correlaciona con la enfermedad” no indica que X cause la enfermedad; La enfermedad puede estar aumentando X, o un tercer factor puede estar afectando a ambos. La causalidad sólo puede establecerse mediante experimentación intervencionista (cambiando X y midiendo el resultado). La IA puede, sin saberlo, utilizar lenguaje causal (“causas”, “conduce a”) en sus textos; revise cada oración de conclusión desde esta perspectiva, expresando los hallazgos observacionales en lenguaje correlacional (“correlacionados”, “variando juntos”).
Separar datos emparejados e independientes
La distinción que con mayor frecuencia se pasa por alto en la selección de pruebas es si las muestras son independientes o apareadas. Si está tomando mediciones antes y después del mismo individuo (por ejemplo, valores sanguíneos de los mismos pacientes antes y después del tratamiento), estas mediciones no son independientes; Se requiere una prueba emparejada. El uso de la prueba t independiente de dos muestras aquí descarta la información de coincidencia en los datos y reduce la potencia; Incluso puede revertir el resultado. La regla es simple: "¿Estas dos mediciones provienen de la misma unidad biológica?" Si la respuesta es sí, se utiliza la prueba pareada (prueba t pareada o prueba de rangos con signos de Wilcoxon); en caso negativo, se utiliza la prueba independiente. Cuando solicite pruebas de inteligencia artificial, asegúrese de especificar la estructura de coincidencia de sus datos; Si no lo especifica, el modelo a menudo asume independencia y recomienda la prueba incorrecta.
Tengo dos juegos de medidas. Importante: estas medidas se tomaron antes/después de los MISMOS individuos (emparejados). Elija la prueba adecuada que tenga en cuenta esta coincidencia (prueba t pareada o Wilcoxon), verifique sus suposiciones e informe con el tamaño del efecto. No asumas la independencia.
En resumen
Análisis de datos preciso; elegir la prueba adecuada para el tipo de datos, verificar suposiciones, corregir comparaciones múltiples e informar el tamaño del efecto y el intervalo de confianza además del valor p. El mayor peligro es el p-hacking; El antídoto es un plan de análisis avanzado, informes completos y separación entre descubrimiento y verificación. La inteligencia artificial es una ayuda poderosa en la selección de pruebas y la verificación de suposiciones, pero la integridad estadística recae en el ser humano.
Tarea de aplicación
Tome un conjunto de datos (sus propios datos o una muestra) con dos grupos. Primero, haga que la IA escriba el código que visualiza los datos y prueba la normalidad. Dependiendo del resultado, aplique la prueba adecuada (prueba t o Mann-Whitney) e informe el tamaño del efecto y el intervalo de confianza junto con el valor p. Luego compare el efecto de comparaciones múltiples sin corrección y con corrección en el resultado.
lista de verificación
- [] Visualicé los datos antes de realizar la prueba.
- [] Verifiqué los supuestos de la prueba (normalidad, varianza).
- [ ] Elegí la prueba adecuada, no apliqué ciegamente la prueba t.
- [] Arreglé la comparación múltiple.
- Informé el valor p [], así como el tamaño del efecto y el intervalo de confianza.
- [] Arreglé el plan de análisis con anticipación y evité el p-hacking.