Hola! Este es el libro de estadística 🌸
Empieza con una reunión que he visto muchísimas veces: alguien proyecta "las ventas subieron 3% este mes" y se va una hora entera en explicar por qué. Nadie pregunta cuánto se mueven las ventas normalmente.
En el capítulo 1 lo medimos sobre ventas de verdad y sale 14,41%. O sea que ese 3% es de los meses más planos que existen, y la reunión entera sobraba.
Ese es el libro: ¿esto que estoy viendo es real, o es lo que varía normalmente? Todo lo demás son herramientas para contestarla.
Cómo está hecho
Todo el código de este libro se ejecuta. Cada bloque corre sobre el mismo archivo de ventas y su salida se compara con la publicada, en una prueba automática. Los números que vas a leer no son estimaciones: si el valor p es 0,0155 es porque salió 0,0155 🔍
Y eso trae una consecuencia bonita: hay hallazgos que contradicen lo que yo esperaba y se quedaron publicados, con la explicación al lado.
Qué vas a encontrar
- 📏 Que la media del monto es 803,76 soles y el 65,93% de las ventas está por debajo de ese "promedio".
- 🎭 Que los 32 atípicos que encuentra el método clásico son, los 32, clientes de un mismo segmento.
- 🚨 Que un detector con 99% de acierto sobre algo que pasa el 0,70% de las veces se equivoca el 59% de las veces que suena.
- 💥 Que copiando los mismos datos diez veces el valor p se derrumba de 0,0118 a 0,0000000000000016 y el tamaño del efecto no se mueve.
- 📉 Que vender más unidades no da más dinero: la correlación es 0,0178.
Los dieciséis capítulos
Los seis primeros describen lo que tienes. Del 7 al 13, la inferencia, que es afirmar cosas sobre lo que no mediste. El 14 son los errores que invalidan un análisis entero, y el 15 un proyecto de punta a punta.
Cada capítulo trae seis ejercicios resueltos y al menos un error de verdad, ejecutado, con su mensaje tal como sale en pantalla. Los errores que no dan error son los que hacen daño, y de esos hay varios 🕳️
Antes de empezar
Hace falta Python básico: leer un CSV, filtrar y agrupar. Si eso te suena lejos, el libro de Python va antes y usa este mismo archivo.
Y si lo que te falta es sacar los datos de una base antes de analizarlos, eso es SQL desde cero.
El mapa de los dieciséis capítulos
Cada capítulo enlaza al post que desarrolla su idea suelta, por si quieres la versión corta antes de meterte en el libro 🗺️
- ¿Es real o es ruido? Para qué sirve todo esto: qué es la estadística.
- Cada columna es de un tipo. Nominal, ordinal, discreta y continua, y qué se puede calcular con cada una.
- Media, mediana y moda. Cuál reportar: media, mediana y moda.
- La dispersión. Desviación, IQR y coeficiente de variación: estadística descriptiva.
- La campana. Y cuándo no aplica: la distribución normal.
- Los atípicos. Tres métodos que no se ponen de acuerdo.
- Probabilidad. Condicional, independencia y Bayes: probabilidad y estadística.
- Tres distribuciones. Binomial, Poisson y el teorema central del límite.
- El margen de error. Intervalos de confianza y bootstrap: estadística inferencial.
- La prueba de hipótesis. El valor p calculado a mano: prueba de hipótesis y valor p.
- ¿Qué prueba uso? t, ji cuadrado, ANOVA y las no paramétricas.
- Significativo no es importante. Tamaño del efecto y potencia.
- Correlación. Pearson, Spearman y la frase en voz alta: correlación.
- Los errores que invalidan un análisis. Simpson, regresión a la media y p-hacking.
- Proyecto final. De la pregunta al informe.
- Referencias. Qué leer después.
La trampa, antes de empezar
Esta sale entera en el capítulo 14, y quiero que la veas ahora para que la reconozcas cuando llegues 🪤
La trampa
Un equipo probó veinte variables contra las ventas para ver cuál las explicaba. Salió una con p = 0,03 y la presentaron.
for variable in las_veinte_variables:
p = prueba_de_hipotesis(variable, ventas)
if p < 0.05:
print('¡Encontramos algo!', variable)
Qué está mal
Con veinte pruebas al 5%, se espera UNA significativa por puro azar aunque no haya ninguna relación real. Encontrar una no prueba nada: es lo que tenía que pasar. Si vas a probar veinte cosas, hay que ajustar el umbral o decir cuántas probaste. Lo segundo es lo que casi nunca aparece en la presentación.
Una pregunta para calentar
Comprueba que lo tienes
Los sueldos de un área son: 2.000, 2.100, 2.200, 2.300 y 18.000 soles. ¿Qué reportas si te piden el sueldo típico?
- La mediana, 2.200
- La media, 5.320
- La moda
- La media, pero avisando que hay un valor alto
Qué medida usar, en una tabla
| Lo que quieres saber | Qué se usa | Cuándo engaña |
|---|---|---|
| El valor típico | Media | Con valores extremos |
| El valor típico con extremos | Mediana | Casi nunca, por eso se prefiere |
| El más frecuente | Moda | Con datos continuos |
| Cuánto varían | Desviación estándar | Si la distribución no es simétrica |
| Si dos cosas se mueven juntas | Correlación | Siempre que se lea como causa |
| Si la diferencia es real | Prueba de hipótesis | Si probaste veinte cosas antes |
| Cuánta confianza merece | Intervalo de confianza | Con muestras sesgadas |
Preguntas frecuentes sobre estadística para datos
¿Cuánta estadística hace falta para analizar datos?
Menos de la que se cree y distinta de la que se enseña. Necesitas descriptiva (media, mediana, dispersión), entender qué es una distribución, y saber leer una correlación y un intervalo de confianza. Con eso resuelves la enorme mayoría del trabajo real. Lo demás se consulta cuando aparece.
¿Cuándo uso la media y cuándo la mediana?
Si hay valores extremos, mediana. Sueldos, tiempos de respuesta, montos de compra y casi todo lo que tiene una cola larga se describen mal con el promedio. La media sirve cuando los datos son simétricos y no hay valores disparados.
¿Qué significa exactamente el valor p?
Qué tan raro sería ver estos datos si no hubiera ningún efecto. No es la probabilidad de que tu hipótesis sea cierta, aunque se lea así en todas partes. Un valor p bajo dice que los datos son poco compatibles con la ausencia de efecto, nada más.
¿Por qué correlación no implica causalidad?
Porque dos cosas pueden moverse juntas por una tercera que las mueve a ambas, o por pura coincidencia si buscas suficientes pares. La correlación es una observación; la causalidad requiere un experimento o un diseño que descarte las explicaciones alternativas.
¿Qué tamaño de muestra necesito?
Depende de cuán pequeña sea la diferencia que quieras detectar y de cuánto varíen tus datos, no del tamaño de la población. Detectar una diferencia grande necesita poca muestra; detectar una de un punto porcentual necesita mucha. Y una muestra grande pero sesgada es peor que una pequeña bien tomada.
¿Necesito estadística si voy a usar machine learning?
Sí, y bastante. Entrenar un modelo lo hace cualquiera; saber si el resultado vale algo, no. Sin dispersión no interpretas la variabilidad del modelo, sin distribuciones no detectas datos raros y sin entender el muestreo no sabes por qué tu validación miente.
El cuaderno: ¿es real o es ruido?
Nueve bloques que responden la única pregunta que importa al mirar datos. Todo con el mismo archivo, así que los números que te salen son los que se comentan aquí.
Practica con datos de verdad
El cuaderno corre de arriba abajo y no necesitas instalar nada: ábrelo en Google Colab y ejecuta. Los datos son ventas de una distribuidora peruana con los defectos que traen los datos reales.
Lo que vas a hacer:
- Ver la media (S/812) contra la mediana (S/536) en una variable con cola larga.
- Comparar la dispersión entre segmentos con el coeficiente de variación.
- Comprobar la regla del 68 y el 95 sobre tus datos, y descubrir que no se cumple.
- Contrastar dos canales de venta con una prueba t y leer el valor p correctamente.
- Calcular el intervalo de confianza de la diferencia y ver que cruza el cero.
- Correr veinte pruebas sobre datos sin ninguna relación y ver cuántas salen "significativas".
Para abrirlo: descarga el cuaderno, entra a Google Colab, elige Subir y arrástralo. El CSV lo lee solo desde internet, así que no hace falta descargarlo salvo que quieras mirarlo en Excel.
Qué sigue después de estadística
El paso natural es machine learning, que es estadística puesta a predecir. Todo lo de aquí reaparece allá: la dispersión se vuelve varianza del modelo, la inferencia se vuelve validación y la correlación se vuelve el riesgo de aprender una relación que no existe.
Y en una empresa, esto mismo aplicado a decidir con evidencia en vez de con la sensación del que habla más fuerte es consultoría de negocios con datos.
Los 16 capítulos
Se leen en orden. Cada uno supone el anterior.
- 1 ¿Es real o es ruido? La pregunta que decide si una reunión de una hora tenía sentido, medida sobre las ventas de verdad.
- 2 Cada columna es de un tipo, y eso decide qué puedes calcular Nominal, ordinal, discreta y continua. Y las cuentas que salen sin dar error y no significan nada.
- 3 Media, mediana y moda: cuál reportar El ticket promedio es 803 soles y el 65,93% de las ventas está por debajo. Quién tiene razón, y por qué.
- 4 La dispersión: dos negocios con el mismo promedio Desviación estándar, rango intercuartílico y coeficiente de variación. Y el ddof que cambia el número sin que lo pidas.
- 5 La campana, y cuándo no aplica La distribución normal, cómo se comprueba de verdad, y por qué el test de normalidad dice que no en cuanto tienes datos.
- 6 Atípicos: los tres métodos no se ponen de acuerdo 32, 203 o 222 filas raras según a quién le preguntes. Y las 21 ventas negativas que resultaron tener una cosa en común.
- 7 Probabilidad, lo justo y necesario Condicional, independencia y Bayes. Con el error de dar la vuelta a una probabilidad, que cuesta campañas enteras.
- 8 Tres distribuciones y el teorema que lo explica todo Binomial, Poisson y normal, con datos de verdad. Y por qué la campana aparece aunque tus datos no la tengan.
- 9 De la muestra a la población: el margen de error Intervalos de confianza, lo que de verdad significan, y por qué dos intervalos que se solapan pueden ser una diferencia real.
- 10 La prueba de hipótesis y el valor p Calculado a mano barajando etiquetas, para que veas exactamente qué es antes de que ninguna fórmula te lo esconda.
- 11 ¿Qué prueba uso? Las cuatro que cubren casi todo t, ji cuadrado, ANOVA y las no paramétricas, elegidas por el tipo de variable y comprobadas sobre las mismas ventas.
- 12 Significativo no es importante El tamaño del efecto, la potencia, y la demostración de que copiando los datos diez veces el valor p se derrumba y el efecto no se mueve.
- 13 Correlación: la que salió cero y la que se infló sola Pearson, Spearman, y la frase que hay que decir en voz alta cada vez que aparece un coeficiente.
- 14 Los errores que invalidan un análisis entero Simpson fabricado con ventas de verdad, regresión a la media, p-hacking y las filas que no son independientes.
- 15 Proyecto final: ¿movemos clientes a WhatsApp? Una pregunta de negocio de principio a fin, con el informe de una página que se puede defender en una reunión.
- 16 Referencias y dónde seguir Las herramientas, los números que se repiten en el libro, y lo que este libro no cubre.
¿Quieres llevarlo más lejos?
Esta guía te deja operando. El curso te deja diseñando, midiendo y gobernando sistemas de IA que trabajan solos.
Ver los cursos