Capítulo 16 de 16 7 secciones 5 min

Referencias y dónde seguir

Las herramientas, los números que se repiten en el libro, y lo que este libro no cubre.

Para seguir después de este libro: la documentación de scipy.stats para las pruebas, la de pandas para el manejo de datos, y tres caminos según lo que necesites, que son regresión, inferencia causal y estadística bayesiana. Ninguno de los tres sale en este libro.

Quince capítulos 🎉 Este último es el mapa para cuando ya no estemos mirando juntas el mismo archivo.

Las herramientas, y qué mirar de cada una

HerramientaDóndePara qué en este libro
scipy.stats docs.scipy.org Todas las pruebas: t, ji cuadrado, ANOVA, Mann-Whitney, Shapiro
pandas pandas.pydata.org/docs Cargar, limpiar, agrupar y describir
numpy numpy.org/doc Las simulaciones, el bootstrap y las permutaciones
statsmodels statsmodels.org Lo que sigue: regresión con sus intervalos y sus diagnósticos

Una nota sobre la última: statsmodels no se usa en este libro y es la que yo abriría después. scipy te da el valor p; statsmodels te da la tabla completa de un modelo, con coeficientes, intervalos y comprobaciones.

Los números del libro, en una tabla

Todo lo que se afirma aquí salió de ejecutar el código sobre las mismas 3.000 ventas. Este es el resumen, por si quieres comprobar alguno 🔍

CapítuloLo que salió
1El mes promedio se mueve 14,41%. El atajo dayfirst=True cambió 847 fechas
2Lima escrita de 4 formas. La media de id_venta es 11.499,50 y no significa nada
3Media 803,76 y mediana 533,63, con el 65,93% de las ventas por debajo del promedio
4Los 4 segmentos tienen desviaciones de 69,59 a 719,55 y el mismo CV de 0,37
5Shapiro da p = 0,4422 con 20 filas y 0,000000 con 1.000, sobre los mismos datos
6Los tres métodos de atípicos dan 32, 203 y 222. Las 32 de la z son 32 mayoristas
7El 72,40% de los mayoristas compra; el 31,33% de las compras son de mayoristas
8Ventas diarias: media 5,5866 y varianza 5,4146, la firma de una Poisson
9El intervalo del 95% con muestras chicas cubre el 93%
10De 10.000 mundos sin efecto, 155 dieron una diferencia así de grande
11Ciudad p = 0,9813; segmento p = 7,2e-42. Bodega tiene un residuo de +8,299
12Copiando los datos 10 veces, el p baja a 1,6e-15 y la d se queda en 0,1284
13Unidades y monto: r = 0,0178. Agregando por segmento: 0,5433
14Probando 20 subgrupos vacíos, el 64,0% de las veces sale algo significativo
15WhatsApp cierra 19,37 puntos más, y aguanta en los 4 segmentos

Los tres caminos que siguen

Este libro cubre comparar grupos. Lo que viene después son tres cosas distintas, y cuál te toca depende de qué necesites 🛤️

1. Regresión. Todo el libro compara un factor cada vez. La regresión mira varios a la vez y te dice cuánto aporta cada uno con los demás fijos. Es lo que hacía falta en el capítulo 15 para separar el canal del segmento en un solo modelo. Está en statsmodels, y la versión que predice está en el libro de machine learning.

2. Inferencia causal. El capítulo 15 termina diciendo "esto es observacional". Hay un campo entero dedicado a cuándo se puede afirmar causalidad sin experimento, con herramientas como los grafos causales o las variables instrumentales. El libro moderno de referencia es Causal Inference: The Mixtape, de Scott Cunningham, que además es gratis en la web.

3. Estadística bayesiana. Todo lo que hicimos es "frecuentista": suponer que no pasa nada y ver qué tan raro es lo que viste. El enfoque bayesiano hace la pregunta al revés, que es la que uno quería hacer desde el principio: dada la evidencia, ¿qué probabilidad tiene cada valor?. El libro de referencia es Statistical Rethinking, de Richard McElreath.

Lo que este libro no cubre, y a propósito

  • 📈 Series de tiempo. Miramos meses, pero nunca tratamos el tiempo como tiempo: nada de estacionalidad, tendencia ni autocorrelación.
  • 🧪 Diseño de experimentos. El capítulo 12 calcula tamaños de muestra, pero un experimento de verdad tiene aleatorización, bloques y estratos.
  • 🧩 Modelos multinivel. Es la respuesta buena al problema del capítulo 14 de las filas que no son independientes.
  • 🔢 Análisis multivariante. Componentes principales, conglomerados y compañía.

Cómo se hizo este libro

Por si te sirve para los tuyos 🐣

Todo el código de este libro se ejecuta. Cada bloque corre sobre el mismo CSV y su salida se compara con la publicada, en una prueba automática que corre con el resto del sitio. Si una versión de pandas cambia un formato, la prueba falla y me entero yo antes que tú.

Eso explica varias cosas del libro que igual te llamaron la atención. Los números tienen cuatro decimales porque son los que salieron. Hay hallazgos que contradicen lo que yo esperaba y se quedaron publicados, como el del capítulo 14 donde contar clientes en vez de ventas mejoró el valor p en lugar de empeorarlo 😅

Y los errores de cada capítulo son errores de verdad: se ejecutan, revientan, y la prueba comprueba que revientan con el mensaje que dice el libro.

Los otros libros

Y ya está

Si te llevas una sola cosa de todo el libro, que sea la pregunta del capítulo 1, porque es la que hay detrás de los otros quince:

¿Esto que estoy viendo es real, o es lo que varía normalmente?

Ahora ya sabes contestarla con números. Gracias por llegar hasta aquí 💛

Si estás aplicando esto en tu empresa y quieres que lo veamos juntas, agenda una reunión o escríbeme por el formulario 🐣

¿Tienes alguna duda o consulta?