Hola! Bienvenida a este libro 🌸
Esto no es un artículo largo: son quince capítulos que se leen en orden, con ejercicios en cada uno y con todo el código ejecutado de verdad.
Cada bloque corre y su salida se compara con la publicada. Si algún día un número deja de coincidir, aquí se entera antes que tú 💜
Lo que este libro hace y casi ningún otro
Aquí las redes están escritas a mano con numpy. La neurona, el gradiente, la retropropagación, la convolución y la atención: todas en veinte líneas cada una y con sus números impresos.
No porque en el trabajo se haga así, sino porque es la única forma de que
después, cuando uses PyTorch, sepas qué está pasando. Cuando leas
loss.backward() vas a saber qué calcula, y el día que algo no
entrene vas a tener dónde mirar 🔧
Y hay una segunda cosa rara: este libro empieza diciéndote cuándo no usar una red neuronal. El capítulo 1 mide, sobre datos de una distribuidora peruana, que la red pierde contra tres líneas de regresión logística. Un libro de deep learning que no diga cuándo NO usarlo es publicidad, no docencia.
Los números que vas a encontrar
| Dónde | La red | Una regresión logística |
|---|---|---|
| 3.000 ventas en tabla (capítulo 1) | 0,5834 | 0,7214 |
| Las mismas, con freno (capítulo 8) | 0,7207 | 0,7214 |
| 1.797 dígitos escritos a mano (capítulo 14) | 0,9756 | 0,9622 |
Esa tabla es el libro entero. La red no es mejor ni peor: es distinta, y gana donde el dato tiene forma 🖼️
Para quién es
- 🤖 Para ti si quieres entender qué hay dentro de ChatGPT y no te conformas con la analogía del cerebro.
- 🧐 Si te van a vender una solución con redes y quieres poder pedir la comparación contra el modelo simple.
- 📸 Si en tu trabajo hay fotos, documentos escaneados o comentarios de clientes, que es donde esto sí paga.
- 🔧 Si ya usaste una librería de deep learning y te quedaste con la sensación de estar apretando botones.
Hace falta saber Python y manejarte con numpy. Si eso te falta, el paso previo es Python para análisis de datos, y si quieres el orden completo, antes va Machine learning desde cero 🐣
Qué vas a poder hacer al terminar
- ✍️ Escribir una red neuronal completa sin importar ninguna librería.
- 🔍 Comprobar tú misma que un gradiente está bien calculado.
- 📉 Reconocer un sobreajuste mirando dos números, y saber qué freno poner.
- 🖼️ Entender por qué la convolución existe y cuándo no sirve.
- 🔺 Explicar la atención de un transformer con la matriz delante.
- 💬 Decidir entre prompt, RAG y ajuste fino con criterio y no por moda.
- 🏆 Y montar un clasificador de imágenes al 97,56%, que es el capítulo 14.
Comprueba que lo tienes
Un estudio de abogados quiere un asistente que responda sobre sus 4.000 contratos, y que los contratos nuevos entren cada semana. ¿Qué le propones?
- RAG sobre los contratos
- Ajuste fino con los 4.000 contratos
- Ajuste fino y luego RAG encima
- Pegar los contratos en el prompt
La trampa
Una empresa pagó tres meses de ajuste fino para que el modelo "supiera" de su catálogo. Esto es lo que le pasaron como datos de entrenamiento.
{"prompt": "¿Cuánto cuesta el producto A?", "completion": "S/ 250"}
{"prompt": "¿Cuánto cuesta el producto B?", "completion": "S/ 890"}
{"prompt": "¿Stock del producto A?", "completion": "120 unidades"}
Qué está mal
Están enseñando hechos, y el ajuste fino enseña comportamiento. El modelo aprende el estilo de la respuesta (cifra corta con S/ delante) y luego se inventa los precios con toda la seguridad del mundo. Peor todavía: el día que sube el precio del producto A, hay que reentrenar. Eso era una tabla y un RAG.
El libro, capítulo por capítulo
- 1️⃣ Cuándo una red ayuda y cuándo es un error caro.
- 2️⃣ La neurona, y la prueba de que una regresión logística es una.
- 3️⃣ Las activaciones, y por qué sin ellas diez capas son una.
- 4️⃣ Apilar capas: el XOR que paró el campo veinte años.
- 5️⃣ Descenso de gradiente, y por qué sin escalar no hay paso que sirva.
- 6️⃣ Retropropagación, comprobada peso a peso.
- 7️⃣ Entrenar de verdad, y los tres botones que al subirlos empeoran.
- 8️⃣ Los tres frenos del sobreajuste, escritos a mano.
- 9️⃣ La convolución, con imágenes de dígitos.
- 🔟 Texto y embeddings, y por qué no distinguen antónimos.
- 1️⃣1️⃣ La atención, en seis líneas de numpy.
- 1️⃣2️⃣ Del transformer al LLM: tokens, temperatura y el bucle que escribe.
- 1️⃣3️⃣ Prompt, RAG o ajuste fino, con un buscador escrito a mano.
- 1️⃣4️⃣ El proyecto final: dígitos al 97,56%.
- 1️⃣5️⃣ Referencias y dónde seguir.
Con qué vas a practicar
Con tres cosas, y ninguna hay que descargarla a mano:
- 📊 El CSV de ventas de los otros libros, para los capítulos donde el dato va en tabla.
- 🔢 Los 1.797 dígitos escritos a mano que vienen dentro de scikit-learn, para la convolución y el proyecto final.
- 💬 Unos comentarios de clientes que escribí yo, con la forma de los que le llegan a una distribuidora, para los capítulos de texto.
Y no hace falta ni TensorFlow ni PyTorch: el libro entero corre con numpy y scikit-learn 🧰
Si lo tuyo es la empresa y no el aprendizaje
El capítulo 13 es el que más se usa en proyectos reales: cuándo conviene un prompt, cuándo RAG y cuándo ajustar un modelo, con un buscador escrito a mano y sus dos formas de fallar medidas.
Si prefieres trabajarlo conmigo y sobre los datos de tu empresa, eso es la consultoría, y si es para un equipo, el Full Day IA 💜
Preguntas frecuentes sobre este libro
¿Necesito saber matemáticas?
Derivadas ayuda, y no hace falta. El capítulo 5 explica el gradiente con una tabla de números en vez de con fórmulas, y el 6 comprueba cada derivada moviendo los pesos a mano en lugar de pedirte que te la creas.
¿Por qué numpy y no PyTorch?
Porque PyTorch esconde justo lo que hay que entender. Con numpy, la retropropagación son seis líneas que puedes leer. Cuando termines el libro, PyTorch se aprende en dos tardes y está todo en el capítulo 15.
¿Sirve para trabajar con LLM?
Sí, y es de lo más útil que tiene. Los capítulos 10 al 13 van de embeddings, atención, tokens, temperatura y RAG, todo escrito a mano. Después de eso, las decisiones de un proyecto con LLM dejan de ser adivinanza.
¿Cuánto tiempo toma?
Con los ejercicios, unas dos semanas a un capítulo por día. Los capítulos 5, 6 y 7 son los más densos y los que más rinde hacer despacio.
¿Este libro entrena modelos grandes?
No, y el capítulo 15 dice exactamente qué deja fuera: el entrenamiento a escala, las GPU, visión moderna, audio y los modelos que generan imágenes. Lo que sí te deja es entender la maquinaria de todos ellos.
¿El código de verdad funciona?
Sí, y no es una promesa: cada bloque se ejecuta automáticamente y su salida se compara con lo publicado. Los errores también: cuando el libro dice que algo va a fallar, se comprueba que falle y con ese mensaje.
Después de este libro
- 🤖 Machine learning desde cero, que es el que responde la mayoría de las preguntas de empresa.
- 📊 Estadística para analizar datos, para saber si una diferencia es real o es ruido.
- 🗄️ SQL desde cero, porque los datos casi nunca llegan en CSV.
Nos vemos en el capítulo 1. Que tengas un hermoso día! 🌟
Los 15 capítulos
Se leen en orden. Cada uno supone el anterior.
- 1 Cuándo una red neuronal ayuda y cuándo es un error caro Empezamos midiendo: sobre los datos de este libro la red pierde contra una regresión logística, y pierde más cuanto más grande es.
- 2 La neurona, escrita a mano en cuatro cuentas Multiplicar, sumar, aplastar. Y comprobar que la regresión logística que ya conoces es exactamente esto.
- 3 Por qué hace falta doblar, y con qué se dobla Sin función de activación, diez capas son una. Lo comprobamos, y de paso vemos por qué casi nadie usa ya la sigmoide en el medio.
- 4 El problema que una neurona no puede, y la red que sí El XOR, que paró el campo veinte años. Y la diferencia entre poder representar algo y llegar a encontrarlo.
- 5 Cómo sabe la red hacia dónde corregir La pérdida, la pendiente y el paso. Y por qué sin escalar no existe ningún paso que funcione, que era lo que quedó pendiente.
- 6 Repartir la culpa hacia atrás La regla de la cadena con capas, comprobada peso a peso. Y el gradiente desvanecido, por fin medido.
- 7 La red completa sobre las ventas, y todo lo que la empeora Más neuronas, más vueltas y más paso: los tres botones que todo el mundo sube, medidos uno por uno. Los tres la empeoran.
- 8 Los tres frenos, escritos a mano y medidos Penalizar los pesos, apagar neuronas al azar y ensuciar las entradas. Uno funciona, uno ayuda a medias y uno casi no.
- 9 Cuando el dato tiene forma: la convolución Un filtro de nueve números que recorre la imagen. Escrito a mano y medido contra los píxeles sueltos, moviendo los dígitos.
- 10 Convertir palabras en números que signifiquen algo One-hot dice que bodega y minimarket no se parecen en nada. Los embeddings arreglan eso, y traen su propio problema.
- 11 La atención, que es la idea que cambió todo Cada palabra mira a las demás y se queda con lo que le sirve. Escrita en seis líneas de numpy.
- 12 Qué está pasando cuando le escribes a un modelo de lenguaje Tokens, el bloque completo, el bucle que escribe palabra a palabra y qué hace de verdad la temperatura.
- 13 Prompt, RAG o ajustar el modelo: cuál toca La pregunta que llega a las empresas, con un buscador de RAG escrito a mano y sus dos formas de fallar medidas.
- 14 Una red que reconoce dígitos, escrita entera por nosotras Todo el libro en un archivo, sin importar ninguna librería de deep learning. Y por fin la red gana.
- 15 Referencias y dónde seguir Las librerías que ahora sí tocan, los papers que hay detrás de cada capítulo y lo que este libro no cubre.
¿Quieres llevarlo más lejos?
Esta guía te deja operando. El curso te deja diseñando, midiendo y gobernando sistemas de IA que trabajan solos.
Ver los cursos