Gratis Guía escrita 25 capítulos 385 min de lectura

Machine learning desde cero

Dieciséis capítulos con el código ejecutado, sobre un archivo de ventas peruanas sucio a propósito, que terminan en una lista de clientes a quién llamar.

Gera Flores, Miss Yera Gera Flores · Miss Yera

El machine learning es la parte de la IA donde la máquina aprende de ejemplos en vez de seguir reglas escritas a mano. Y lo que separa un modelo útil de uno inservible no es el algoritmo: es que no haya fuga de información, que la partición responda a tu pregunta y que la métrica sea la correcta. Este libro son dieciséis capítulos sobre un solo archivo de ventas, con todo el código ejecutado, que terminan en una lista de 200 clientes con su probabilidad y su valor al lado.

Hola! Bienvenida a este libro 🌸

Esto no es un artículo largo:

  • Son dieciséis capítulos que se leen en orden
  • Con ejercicios resueltos en cada uno
  • Con todo el código ejecutado de verdad

Y cuando digo ejecutado lo digo en serio. Cada bloque corre sobre el mismo archivo de ventas que te vas a descargar, y su salida se compara con lo que está publicado. Si algún día un número deja de coincidir, aquí se entera antes que tú 💜

Eso tiene una consecuencia que a mí me cambió la forma de escribir: varias veces el resultado me desmintió lo que iba a decir, y esas veces se quedaron en el libro tal cual salieron 🫣

Lo que este libro hace y casi ningún otro

Casi todo el material de machine learning termina donde empieza lo difícil. Te enseñan a entrenar ocho modelos, a comparar la exactitud y ahí paran.

Pero el fit y el predict son tres líneas y son la parte fácil. Lo que decide si un modelo sirve o hace daño es otra cosa:

  • 🕳️ Si hay una columna que no va a existir el día que predices. En el capítulo 6 hay un modelo con 0,9994 de AUC que en producción acierta cero de 750.
  • ✂️ Cómo partiste los datos. La misma pregunta da 0,7227 o 0,6843 según si el cliente puede aparecer a los dos lados.
  • 🎚️ Dónde pusiste el corte. En el capítulo 9, mover el umbral de 0,5 al número correcto ahorra S/65.750 sin tocar el modelo.
  • 👥 Para quién funciona peor. En el capítulo 13, el mismo umbral encuentra al 92,52% de los mayoristas que compran y al 40,68% de las bodegas.

De eso va este libro. Los algoritmos ocupan un capítulo de dieciséis, que es más o menos lo que ocupan en el trabajo real 🙂

Con qué vas a practicar

Con ventas-miss-yera.csv, un archivo de ventas de una distribuidora peruana: 3.037 filas, 617 clientes y dieciocho meses.

Y viene sucio a propósito, porque es lo que te vas a encontrar:

Lo que traeCuántoQué pasa si no lo ves
Filas duplicadas37Cuentas de más y el mismo cliente pesa doble
Montos con coma decimal606to_numeric a secas te borra S/471.534
Fechas en dd/mm/aaaa759Se convierten en nulos sin avisar
Lima escrita de cuatro formas4 variantesUna ciudad se te parte en cuatro categorías
Montos negativos21Parecen atípicos y son otra cosa, capítulo 3
Nulos que significan algo3 columnasRellenarlos borra veinte puntos de señal

Ese desorden está puesto a mano y da para cuatro capítulos. Un dataset limpio no te enseña a trabajar 🧽

Para quién es

Para ti si:

  • 🐍 Ya te defiendes con pandas y quieres dar el paso siguiente.
  • 📊 Haces reportes y te piden "algo predictivo" y no sabes por dónde empezar.
  • 🎓 Hiciste un curso de machine learning y sientes que sabes entrenar modelos y no sabes entregarlos.
  • 🧐 Te toca revisar el trabajo de otra persona y quieres saber qué preguntar.

Si pandas todavía te cuesta, el paso previo es Python desde cero. Y si lo que te falta es traer los datos, es SQL desde cero 🐣

Pipeline de un proyecto de machine learning supervisado: contrato de datos, EDA, partir en train y test antes de tocar nada, preprocesar dentro del pipeline, baseline, modelos con validación cruzada, umbral por costos y auditoría con SHAP y sesgo.
El orden importa más que el algoritmo. Escalar o imputar antes de partir en train y test contamina la prueba con información del conjunto entero, y el modelo sale con una nota que no es suya.

Qué vas a poder hacer al terminar

  • 🔍 Mirar un archivo nuevo y encontrar la suciedad antes de modelar nada.
  • 🚩 Oler una fuga de información por el síntoma, que es una métrica demasiado buena.
  • 🧱 Montar un pipeline donde el preprocesamiento va dentro y no se escapa.
  • 📏 Elegir la métrica que corresponde y defenderla contra el "pero el 95%".
  • 💰 Calcular el umbral con los costos del negocio en vez de aceptar el 0,5.
  • ⚖️ Auditar el modelo por grupos y ponerle precio a emparejarlos.
  • 🤫 Hacer que el modelo diga cuándo no sabe.
  • 📤 Entregar una lista que alguien pueda usar el lunes, que es de lo que va el capítulo 15.

Comprueba que lo tienes

Tu modelo de fuga de clientes saca 0,94 de exactitud. El 6% de los clientes se fue el año pasado. ¿Qué haces?

  • Miro el recall antes de celebrar nada
  • Lo llevo a producción, 0,94 está muy bien
  • Pruebo un modelo más potente para llegar a 0,97
  • Añado más variables

La trampa

Un modelo de morosidad con AUC de 0,95. El equipo estaba feliz. Duró hasta que alguien preguntó de dónde salía una de las columnas.

X = df[['edad', 'ingreso', 'deuda_actual', 'antiguedad',
        'monto_recuperado_por_cobranza']]
y = df['moroso']
Qué está mal

La última columna. Lo que recuperó cobranza solo existe DESPUÉS de que el cliente cayó en mora, así que el modelo está leyendo el futuro. En producción esa columna llega vacía y el AUC se desploma al 0,6 real. Es fuga de información, y el síntoma siempre es el mismo: una métrica demasiado buena para el problema.

El 95% de exactitud que no sirve para nada

Si el 95% de tus transacciones son legítimas, un modelo que diga que todo es legítimo acierta el 95% de las veces y no detecta un solo fraude.

Esto no es un ejemplo de manual: en el capítulo 8 lo medimos sobre estos datos. Con un objetivo raro, el modelo saca 92,27% de exactitud, el "digo que no a todo" saca 92,40%, y el modelo encuentra 0 de 57 casos. Y su AUC es 0,92, que suena de maravilla.

La exactitud sola es una métrica peligrosa y es justo la que se reporta. Lo que hay que mirar es la matriz de confusión y lo que sale de ella: precisión, recall y el equilibrio entre las dos 🎯

El libro, capítulo por capítulo

Se leen en orden la primera vez. Después se vuelve al que te haga falta.

  • 1️⃣ Qué es y qué no es, con la primera medición sobre los datos.
  • 2️⃣ El contrato: qué predices, con qué columnas y qué existe el día D.
  • 3️⃣ Explorar y limpiar, que es donde está la mitad del trabajo.
  • 4️⃣ Construir columnas, y las banderas de nulo que valían veinte puntos.
  • 5️⃣ El pipeline, para que el preprocesamiento no se escape.
  • 6️⃣ Fuga de información, el capítulo que más dinero ahorra.
  • 7️⃣ Los modelos: ocho comparados, y gana el más simple.
  • 8️⃣ Métricas, y por qué la exactitud miente.
  • 9️⃣ El umbral y los soles que vale mover un número.
  • 🔟 Validación cruzada y cuánto de tu resultado es la semilla.
  • 1️⃣1️⃣ Cuando lo que importa pasa el 7% de las veces.
  • 1️⃣2️⃣ Abrir la caja: qué mira el modelo y por qué.
  • 1️⃣3️⃣ Sesgo y confianza: para quién funciona peor y cómo decir "no sé".
  • 1️⃣4️⃣ Producción y deriva, y cómo no asustarse en vano.
  • 1️⃣5️⃣ El proyecto entero, del CSV a la lista de 200 clientes.
  • 1️⃣6️⃣ Referencias y dónde seguir.

El cuaderno, si prefieres tocarlo

Hay un cuaderno con el recorrido principal, en el mismo orden y sobre el mismo archivo. Sirve para lo que la página no puede: cambiar un número, volver a ejecutar y ver qué se movió.

Practica con datos de verdad

El cuaderno corre de arriba abajo y no necesitas instalar nada: ábrelo en Google Colab y ejecuta. Los datos son ventas de una distribuidora peruana con los defectos que traen los datos reales.

Para abrirlo: descarga el cuaderno, entra a Google Colab, elige Subir y arrástralo. El CSV lo lee solo desde internet, así que no hace falta descargarlo salvo que quieras mirarlo en Excel.

Lo que hay que saber antes de meterse aquí

El orden importa. Antes de un modelo hace falta poder traer los datos, entenderlos con estadística descriptiva y saber qué significa que dos variables se muevan juntas, incluida la razón por la que correlación no es causalidad.

Si te falta la parte de traer los datos, empieza por la guía de SQL desde cero. Si lo que quieres es la ruta completa hasta el rol, está en la guía de cómo ser analista de datos. Y si prefieres hacerlo acompañada y aplicando IA sobre tus propios datos, el Full Day IA es la sesión donde se arma.

Hacia adelante, el paso siguiente es la guía de deep learning: de la neurona al transformer, y qué hacer con un LLM en una empresa. Pero ojo con el orden también aquí, porque en la otra dirección se pierde mucha gente: todo lo de este libro sigue valiendo cuando el modelo es una red. La fuga de información, el baseline, el umbral por costo y la trampa de elegir hiperparámetros contra la prueba no desaparecen porque el modelo sea más sofisticado. Se vuelven más fáciles de cometer, porque el entrenamiento tarda horas y nadie quiere repetirlo.

Preguntas que me hacen siempre

¿Necesito saber matemáticas?

No para este libro. Hay una exponencial en el capítulo 12 y un percentil en el 13, y las dos van explicadas. Lo que sí necesitas es pandas.

¿Cuánto tiempo toma?

Si haces los ejercicios, unas dos semanas a ritmo de un capítulo por día. Si solo lees, una tarde larga y no vas a aprender ni la mitad 🙃

¿Sirve para una entrevista de trabajo?

Sirve sobre todo para la parte donde te preguntan por qué tomaste una decisión. Los capítulos 6, 9 y 13 son respuestas que casi nadie tiene.

¿Por qué scikit-learn y no otra cosa?

Porque se instala sin pelear, está en todas partes y hace todo lo del libro. Las otras librerías, y para qué sirve cada una, están en el capítulo 16.

¿Puedo usar mis propios datos?

Sí, y es lo que te recomiendo desde el capítulo 3. Solo cambia el nombre de las columnas en cada bloque. Los números te van a salir distintos y ahí es donde de verdad se aprende.

¿Esto es lo mismo que la IA generativa?

No. Aquí se predice una columna a partir de otras. Los modelos que escriben texto son otra familia y están en la guía de deep learning.

Los 25 capítulos

Se leen en orden. Cada uno supone el anterior.

  1. 1 Qué es machine learning, y cuándo no usarlo La idea que le da la vuelta a la programación, y tu primer modelo en seis líneas con la ducha fría incluida.
  2. 2 El contrato de datos, o qué se acuerda antes de modelar Las cuatro preguntas que deciden si el proyecto sirve, y las cuatro tienen respuesta medible en el archivo.
  3. 3 Gobernanza: calidad, sesgos y el umbral de aceptación Lo que una senior escribe antes de tocar un modelo, y que casi nunca aparece: el perfil de calidad, los sesgos declarados y el número que decide si el proyecto sirve.
  4. 4 Abrir el archivo y pelearse con la suciedad 37 filas repetidas, Lima escrita de cuatro formas, medio millón de soles que se evaporan sin dar error, y unos huecos que predicen.
  5. 5 Auditoría de tipos: pandas te miente Las ocho categorías en que cae cualquier columna, con el detector que las clasifica solo y las dos que este archivo tenía disfrazadas.
  6. 6 Cada columna, mirada de una en una La ficha de cuatro números que decide qué escalar y qué transformar, y los tres métodos que cuentan 203, 32 o 222 atípicos en la misma columna.
  7. 7 Cada columna contra el objetivo, con una prueba de por medio Qué prueba toca según el tipo, por qué el valor p solo no sirve, y las cuatro columnas de ruido puro que salieron significativas.
  8. 8 Las columnas entre ellas, que es donde estaba la trampa La matriz que delata una fuga sin entrenar nada, y la correlación de 0,2351 que se evapora al partir por segmento.
  9. 9 Construir columnas, que es donde se gana Cinco columnas nuevas: tres que valen puntos enteros, una que no sirve y una que es una trampa con el 30% de los datos.
  10. 10 Escalar, imputar y codificar: qué decide de verdad Seis escaladores que dan el mismo AUC, uno que vale siete centésimas, y la tabla de decisiones que sale de medirlo todo.
  11. 11 El pipeline, y el primer modelo de verdad ColumnTransformer, imputar, codificar, y diez puntos por encima del listón que casi no vienen del modelo.
  12. 12 La fuga de información, provocada tres veces El fallo que en vez de un error te da una felicitación, con los tres sabores medidos sobre el mismo archivo.
  13. 13 Ocho modelos, y gana el más simple Logística, árbol, bosque, boosting, vecinos, Bayes y SVM sobre las mismas columnas, y por qué la de 1958 queda primera.
  14. 14 Las métricas, y el 92% que es peor que no hacer nada Matriz de confusión, precisión, recall y AUC, con un modelo que gana al de antes en el número y pierde contra el listón.
  15. 15 El umbral, o los S/65.750 que valía mover un número El 0,5 que viene de fábrica, cuánto cuesta cada error, y por qué un modelo casi nunca decide: ordena.
  16. 16 Validación cruzada, o por qué 0,7214 no era un resultado Diez semillas dan cinco puntos y medio de diferencia, y ajustar hiperparámetros movió once diezmilésimas.
  17. 17 XGBoost, LightGBM y Optuna: cuándo ganan y cuándo no Los tres boosting contra la regresión logística sobre las mismas 3.000 ventas, y sesenta pruebas de Optuna para ver si alcanzan.
  18. 18 Cuando lo que importa pasa el 7% de las veces Pesos, umbral y remuestreo dan el mismo resultado, y ninguno crea información.
  19. 19 Abrir la caja: qué mira el modelo y por qué Coeficientes, odds e importancia por permutación, y la columna que valía doce puntos y no aporta nada.
  20. 20 SHAP: por qué ESTE cliente y no el otro El reparto que suma exacto, dos clientes con la misma probabilidad por razones opuestas, y el PDP que sale plano sin avisar.
  21. 21 Cuando la pregunta no es predecir Coeficientes con su valor p y su intervalo, odds que se dicen en voz alta, y la columna que el boosting adora y la regresión no distingue del ruido.
  22. 22 Para quién funciona peor y cuánto puedes fiarte El modelo tiene 0,72 de AUC en general y menos de 0,69 dentro de cada segmento. Cómo se mide eso y cómo se dice "no sé".
  23. 23 Sacarlo del cuaderno y vigilar que siga sirviendo Guardar el modelo, partir por fecha, medir deriva con PSI y romperlo a propósito para ver qué alarma suena y cuál no.
  24. 24 El proyecto entero, del CSV crudo a la lista de clientes Todo el libro en un solo archivo, y la pregunta con la que se termina de verdad: a quién llamo el lunes.
  25. 25 Referencias y dónde seguir La documentación de scikit-learn, las fuentes de lo que este libro afirma, las librerías que no pudimos instalar y qué queda fuera.

¿Quieres llevarlo más lejos?

Esta guía te deja operando. El curso te deja diseñando, midiendo y gobernando sistemas de IA que trabajan solos.

Ver los cursos
¿Tienes alguna duda o consulta?