Analítica y dashboards

Prueba de hipótesis y valor p: qué significan de verdad

7 min de lectura
Prueba de hipótesis y valor p explicados

Una prueba de hipótesis es un procedimiento para decidir si un resultado observado en una muestra es lo bastante fuerte como para concluir algo sobre toda la población, o si podría deberse al azar. Se plantea una hipótesis nula (no hay diferencia) y una alternativa (sí la hay), y se calcula el valor p: la probabilidad de haber obtenido un resultado así de extremo si la hipótesis nula fuera cierta. Si el valor p es menor al nivel de significancia elegido, normalmente 0.05, se rechaza la hipótesis nula. El valor p no es la probabilidad de que la hipótesis sea verdadera, y esa confusión es la más común y la más costosa.

Tabla de contenidos

Respuesta rápida: Una prueba de hipótesis es un procedimiento para decidir si un resultado observado en una muestra es lo bastante fuerte como para concluir algo sobre toda la población, o si podría deberse al azar. Se plantea una hipótesis nula (no hay diferencia) y una alternativa (sí la hay), y se calcula el valor p: la probabilidad de haber obtenido un resultado así de extremo si la hipótesis nula fuera cierta. Si el valor p es menor al nivel de significancia elegido, normalmente 0.05, se rechaza la hipótesis nula. El valor p no es la probabilidad de que la hipótesis sea verdadera, y esa confusión es la más común y la más costosa.

El problema que resuelve

Cambias el diseño de tu página y la conversión sube de 2.1% a 2.4%. ¿Funcionó el cambio, o simplemente esa semana entró gente distinta?

Esa pregunta no se responde mirando el número. Se responde preguntando: si el cambio no hubiera servido de nada, ¿qué tan raro sería ver una diferencia así de grande solo por azar? Si es rarísimo, algo pasó. Si es común, no puedes concluir nada.

Eso es una prueba de hipótesis. No demuestra nada: cuantifica qué tan sorprendente sería tu resultado en un mundo donde no hubo efecto.

Hipótesis nula y alternativa

  • Hipótesis nula (H0): no pasa nada. No hay diferencia, no hay relación, el cambio no sirvió.
  • Hipótesis alternativa (H1): sí pasa algo. Es lo que tú sospechas.

El detalle que confunde: siempre se pone a prueba la nula, no la alternativa. Es como en un juicio: se asume inocencia y se busca evidencia suficiente para rechazarla. Nunca se demuestra la inocencia.

Por eso el resultado de una prueba nunca es "queda demostrado que funciona". Es "hay evidencia suficiente para rechazar que no funciona" o "no hay evidencia suficiente". Y no encontrar evidencia no es lo mismo que probar que no hay efecto: puede que el efecto exista y tu muestra sea muy chica para detectarlo.

El valor p, y el error que comete casi todo el mundo

El valor p es la probabilidad de obtener un resultado al menos tan extremo como el tuyo, suponiendo que la hipótesis nula sea cierta.

Léelo despacio, porque la suposición está adentro. El valor p vive en un mundo hipotético donde no hay efecto, y te dice qué tan raro sería tu dato en ese mundo.

Un valor p de 0.03 significa: si el cambio no hubiera servido, habría un 3 por ciento de probabilidad de ver una diferencia así de grande solo por azar. Como es poco probable, se rechaza la hipótesis nula.

Lo que el valor p NO es:

  • No es la probabilidad de que la hipótesis nula sea verdadera.
  • No es la probabilidad de que te hayas equivocado.
  • No mide qué tan grande es el efecto. Con una muestra enorme, una diferencia irrelevante puede dar un valor p pequeñísimo.

Un cierre práctico: cuando pases de describir a predecir, los primeros modelos que vas a probar son los clasificadores base, y ahí el valor p deja lugar a las métricas de modelo.

Ese último punto es el que más daño hace en el trabajo real. Con 500 mil usuarios, una mejora de 0.01% en conversión puede salir estadísticamente significativa y no valer absolutamente nada para el negocio. Significativo no quiere decir importante. Siempre hay que mirar también el tamaño del efecto.

Nivel de significancia y los dos errores posibles

El nivel de significancia, que se escribe alfa, es el umbral que decides antes de mirar los datos. Lo habitual es 0.05, y no hay nada sagrado en ese número: es una convención.

Al decidir siempre puedes equivocarte de dos formas:

En realidad no hay efectoEn realidad sí hay efecto
Rechazas la nulaError tipo I (falso positivo)Correcto
No la rechazasCorrectoError tipo II (falso negativo)

El nivel de significancia es tu tolerancia al error tipo I. Con alfa 0.05 aceptas equivocarte una de cada veinte veces cuando no hay efecto.

Y bajar alfa no es gratis: cuanto más exigente eres para no dar falsos positivos, más falsos negativos se te escapan. La decisión depende de qué error cuesta más en tu caso. En un test de A/B de marketing, un falso positivo cuesta poco. En un diagnóstico médico, cuesta muchísimo.

El intervalo de confianza dice más que el valor p

El valor p te da un sí o un no. El intervalo de confianza te da un rango de valores plausibles, y por eso comunica mucho mejor.

Si la mejora de conversión fue de 0.3 puntos con un intervalo de confianza al 95% de 0.1 a 0.5, sabes dos cosas: que el efecto probablemente es real (el rango no incluye el cero) y que su tamaño está entre 0.1 y 0.5. El valor p solo te habría dicho lo primero.

El margen de error es la mitad del ancho de ese intervalo, y es lo que se reporta en encuestas como "más o menos 3 puntos". Depende sobre todo del tamaño de la muestra: para reducirlo a la mitad necesitas cuadruplicar la muestra, no duplicarla. Por eso las encuestas grandes cuestan tanto.

Qué prueba usar en cada caso

Qué comparasPruebaEjemplo
Dos grupos, variable numéricaPrueba t de Student¿El grupo A gasta más que el B?
Tres o más grupos, variable numéricaANOVA¿Las ventas difieren entre cuatro sucursales?
Dos variables categóricasChi cuadrado¿La ciudad se relaciona con el tipo de plan contratado?
Dos proporcionesPrueba z de proporciones¿La conversión de A supera a la de B?
Grupos sin distribución normalPruebas no paramétricasMuestras chicas o muy sesgadas

ANOVA existe justamente para no hacer muchas pruebas t. Si comparas cuatro grupos de a pares serían seis pruebas, y cada una con 5% de riesgo de falso positivo acumula hasta más de un 25% de probabilidad de encontrar algo que no existe. ANOVA compara los cuatro de una vez y controla eso.

Chi cuadrado es la que se usa con tablas de frecuencias: compara los conteos que observaste contra los que esperarías si las dos variables fueran independientes.

La condición que casi todas comparten es que los datos sigan aproximadamente una distribución normal. Cuando no la siguen, hay versiones no paramétricas que no la exigen.

Preguntas frecuentes

¿Qué es una prueba de hipótesis?

Es un procedimiento para decidir si un resultado observado en una muestra es lo bastante fuerte como para concluir algo sobre toda la población, o si podría deberse al azar. Se plantea una hipótesis nula que dice que no hay efecto y se busca evidencia suficiente para rechazarla.

¿Qué significa el valor p?

Es la probabilidad de obtener un resultado al menos tan extremo como el tuyo suponiendo que la hipótesis nula sea cierta. Un valor p de 0.03 significa que, si no hubiera efecto, habría un 3 por ciento de probabilidad de ver una diferencia así de grande solo por azar.

¿El valor p mide la probabilidad de que mi hipótesis sea correcta?

No, y es la confusión más común. El valor p se calcula suponiendo que la hipótesis nula es cierta, así que no puede decirte la probabilidad de que lo sea. Tampoco mide el tamaño del efecto: con muestras muy grandes, diferencias irrelevantes dan valores p muy pequeños.

¿Qué es el nivel de significancia?

Es el umbral que eliges antes de mirar los datos, normalmente 0.05, para decidir cuándo rechazar la hipótesis nula. Representa tu tolerancia a los falsos positivos: con 0.05 aceptas equivocarte una de cada veinte veces cuando en realidad no hay efecto.

¿Cuándo uso chi cuadrado, prueba t o ANOVA?

Prueba t para comparar dos grupos en una variable numérica. ANOVA para tres o más grupos, porque hacer muchas pruebas t por pares infla el riesgo de falsos positivos. Chi cuadrado para relacionar dos variables categóricas usando tablas de frecuencias.

¿Qué es el intervalo de confianza?

Es un rango de valores plausibles para el resultado real. Comunica mejor que el valor p porque te dice no solo si el efecto probablemente existe, sino también qué tan grande es. El margen de error es la mitad del ancho de ese intervalo.

Machine learning no se aprende memorizando fórmulas

La IA ya escribe el código del modelo. Lo que decide es saber qué técnica corresponde, si el resultado tiene sentido y cómo se lee. Eso es lo que enseño en el curso de SQL + Python, que incluye siete módulos de machine learning con proyectos y datasets reales. En vivo.

Formate con Gera

¿Quieres aprender datos?

Cursos en vivo de SQL, Python y Power BI con Gera. Clases por Zoom, datos reales y feedback directo. Tambien hacemos capacitacion in-company.

Ver cursos de datos
prueba de hipotesis

Comparte este artículo:

Sigue a Miss Yera:
WhatsApp directo
¿Tienes alguna duda o consulta?