Quince capítulos 🎉 Este último es el mapa para cuando ya no estemos mirando juntas el mismo archivo.
Las herramientas, y qué mirar de cada una
| Herramienta | Dónde | Para qué en este libro |
|---|---|---|
| scipy.stats | docs.scipy.org | Todas las pruebas: t, ji cuadrado, ANOVA, Mann-Whitney, Shapiro |
| pandas | pandas.pydata.org/docs | Cargar, limpiar, agrupar y describir |
| numpy | numpy.org/doc | Las simulaciones, el bootstrap y las permutaciones |
| statsmodels | statsmodels.org | Lo que sigue: regresión con sus intervalos y sus diagnósticos |
Una nota sobre la última: statsmodels no se usa en este libro y es la que yo abriría después. scipy te da el valor p; statsmodels te da la tabla completa de un modelo, con coeficientes, intervalos y comprobaciones.
Los números del libro, en una tabla
Todo lo que se afirma aquí salió de ejecutar el código sobre las mismas 3.000 ventas. Este es el resumen, por si quieres comprobar alguno 🔍
| Capítulo | Lo que salió |
|---|---|
| 1 | El mes promedio se mueve 14,41%. El atajo dayfirst=True cambió 847 fechas |
| 2 | Lima escrita de 4 formas. La media de id_venta es 11.499,50 y no significa nada |
| 3 | Media 803,76 y mediana 533,63, con el 65,93% de las ventas por debajo del promedio |
| 4 | Los 4 segmentos tienen desviaciones de 69,59 a 719,55 y el mismo CV de 0,37 |
| 5 | Shapiro da p = 0,4422 con 20 filas y 0,000000 con 1.000, sobre los mismos datos |
| 6 | Los tres métodos de atípicos dan 32, 203 y 222. Las 32 de la z son 32 mayoristas |
| 7 | El 72,40% de los mayoristas compra; el 31,33% de las compras son de mayoristas |
| 8 | Ventas diarias: media 5,5866 y varianza 5,4146, la firma de una Poisson |
| 9 | El intervalo del 95% con muestras chicas cubre el 93% |
| 10 | De 10.000 mundos sin efecto, 155 dieron una diferencia así de grande |
| 11 | Ciudad p = 0,9813; segmento p = 7,2e-42. Bodega tiene un residuo de +8,299 |
| 12 | Copiando los datos 10 veces, el p baja a 1,6e-15 y la d se queda en 0,1284 |
| 13 | Unidades y monto: r = 0,0178. Agregando por segmento: 0,5433 |
| 14 | Probando 20 subgrupos vacíos, el 64,0% de las veces sale algo significativo |
| 15 | WhatsApp cierra 19,37 puntos más, y aguanta en los 4 segmentos |
Los tres caminos que siguen
Este libro cubre comparar grupos. Lo que viene después son tres cosas distintas, y cuál te toca depende de qué necesites 🛤️
1. Regresión. Todo el libro compara un factor cada vez. La regresión mira varios a la vez y te dice cuánto aporta cada uno con los demás fijos. Es lo que hacía falta en el capítulo 15 para separar el canal del segmento en un solo modelo. Está en statsmodels, y la versión que predice está en el libro de machine learning.
2. Inferencia causal. El capítulo 15 termina diciendo "esto es observacional". Hay un campo entero dedicado a cuándo sí se puede afirmar causalidad sin experimento, con herramientas como los grafos causales o las variables instrumentales. El libro moderno de referencia es Causal Inference: The Mixtape, de Scott Cunningham, que además es gratis en la web.
3. Estadística bayesiana. Todo lo que hicimos es "frecuentista": suponer que no pasa nada y ver qué tan raro es lo que viste. El enfoque bayesiano hace la pregunta al revés, que es la que uno quería hacer desde el principio: dada la evidencia, ¿qué probabilidad tiene cada valor?. El libro de referencia es Statistical Rethinking, de Richard McElreath.
Lo que este libro no cubre, y a propósito
- 📈 Series de tiempo. Miramos meses, pero nunca tratamos el tiempo como tiempo: nada de estacionalidad, tendencia ni autocorrelación.
- 🧪 Diseño de experimentos. El capítulo 12 calcula tamaños de muestra, pero un experimento de verdad tiene aleatorización, bloques y estratos.
- 🧩 Modelos multinivel. Es la respuesta buena al problema del capítulo 14 de las filas que no son independientes.
- 🔢 Análisis multivariante. Componentes principales, conglomerados y compañía.
Cómo se hizo este libro
Por si te sirve para los tuyos 🐣
Todo el código de este libro se ejecuta. Cada bloque corre sobre el mismo CSV y su salida se compara con la publicada, en una prueba automática que corre con el resto del sitio. Si una versión de pandas cambia un formato, la prueba falla y me entero yo antes que tú.
Eso explica varias cosas del libro que igual te llamaron la atención. Los números tienen cuatro decimales porque son los que salieron. Hay hallazgos que contradicen lo que yo esperaba y se quedaron publicados, como el del capítulo 14 donde contar clientes en vez de ventas mejoró el valor p en lugar de empeorarlo 😅
Y los errores de cada capítulo son errores de verdad: se ejecutan, revientan, y la prueba comprueba que revientan con el mensaje que dice el libro.
Los otros libros
- 🐍 Python para análisis de datos. Si el código de aquí te costó, este va antes.
- 🗄️ SQL desde cero. Para sacar los datos antes de analizarlos.
- 🤖 Machine learning desde cero. El siguiente paso natural: en vez de comparar grupos, predecir.
- 🧠 Deep learning desde cero. Redes neuronales escritas a mano con numpy.
- 📊 Todas las guías.
Y ya está
Si te llevas una sola cosa de todo el libro, que sea la pregunta del capítulo 1, porque es la que hay detrás de los otros quince:
¿Esto que estoy viendo es real, o es lo que varía normalmente?
Ahora ya sabes contestarla con números. Gracias por llegar hasta aquí 💛
Si estás aplicando esto en tu empresa y quieres que lo veamos juntas, agenda una reunión o escríbeme por el formulario 🐣