Árbol de decisión, KNN y Naive Bayes: los clasificadores base
El árbol de decisión clasifica haciendo preguntas encadenadas sobre las variables hasta llegar a una respuesta, y su gran ventaja es que se puede leer y explicar. KNN clasifica cada caso nuevo mirando a sus vecinos más cercanos y dándole la categoría mayoritaria entre ellos. Naive Bayes calcula la probabilidad de cada categoría usando el teorema de Bayes y asumiendo que las variables son independientes entre sí, un supuesto poco realista que aun así funciona sorprendentemente bien en clasificación de texto. El perceptrón es el modelo más simple inspirado en una neurona y es el ladrillo con el que se construyen las redes neuronales.
Tabla de contenidos
Respuesta rápida: El árbol de decisión clasifica haciendo preguntas encadenadas sobre las variables hasta llegar a una respuesta, y su gran ventaja es que se puede leer y explicar. KNN clasifica cada caso nuevo mirando a sus vecinos más cercanos y dándole la categoría mayoritaria entre ellos. Naive Bayes calcula la probabilidad de cada categoría usando el teorema de Bayes y asumiendo que las variables son independientes entre sí, un supuesto poco realista que aun así funciona sorprendentemente bien en clasificación de texto. El perceptrón es el modelo más simple inspirado en una neurona y es el ladrillo con el que se construyen las redes neuronales.
Cuatro lógicas distintas para el mismo problema
Todos estos algoritmos hacen lo mismo: reciben un caso y dicen a qué categoría pertenece. Lo interesante es que llegan por caminos completamente distintos, y entender esos caminos es lo que te permite elegir con criterio en vez de probar al azar.
Son la base del aprendizaje supervisado, y conviene dominarlos antes de saltar a random forest o a redes neuronales, que en el fondo son combinaciones o extensiones de estas ideas.
Árbol de decisión: preguntas encadenadas
Funciona como un cuestionario. En cada nodo hace una pregunta sobre una variable, y según la respuesta baja por una rama u otra hasta llegar a una hoja con la categoría final.
Un árbol para predecir si un cliente se va podría preguntar: ¿lleva más de dos años? Si no, ¿usó el producto el último mes? Si no, se va a ir.
El algoritmo elige en cada paso la pregunta que mejor separa los datos, usando medidas como la entropía o el índice Gini. No es magia: prueba todas las divisiones posibles y se queda con la que deja los grupos más puros.
- Ventaja principal: se puede leer. Puedes imprimir el árbol y mostrárselo a alguien de negocio, que va a entender las reglas. Es el modelo más explicable que existe.
- Ventaja práctica: no le molestan las escalas ni las variables categóricas, así que necesita mucho menos preprocesamiento.
- Su debilidad: sobreajusta con facilidad. Un árbol sin límite de profundidad puede crear una rama por cada caso y memorizar todo.
Esa debilidad se controla limitando la profundidad o exigiendo un mínimo de casos por hoja. Y es también la razón por la que existe random forest: en vez de un árbol, cientos de árboles distintos que votan, lo que reduce el sobreajuste de forma dramática.
KNN: dime con quién andas
KNN, o k vecinos más cercanos, es el más intuitivo de todos. Para clasificar un caso nuevo mira los k casos más parecidos que ya conoce y le asigna la categoría que sea mayoritaria entre ellos.
Si k es 5 y de los 5 clientes más parecidos 4 se fueron, predice que este también se va.
Tiene una particularidad: no entrena nada. Guarda todos los datos y hace el cálculo en el momento de predecir. Por eso es instantáneo de "entrenar" y lento de usar, al revés que casi todos los demás.
Los tres cuidados:
- Estandariza siempre. KNN se basa en distancias, así que una variable en soles aplasta a una en años. Sin estandarizar, el resultado no significa nada.
- Elige k con cuidado. Un k muy chico hace el modelo sensible al ruido; uno muy grande borra las fronteras entre categorías. Se busca probando.
- No sirve con muchas variables. En espacios de muchas dimensiones todos los puntos terminan igual de lejos entre sí y la noción de vecino cercano pierde sentido. Ahí conviene reducir dimensiones con PCA antes.
Naive Bayes: probabilidades que funcionan pese al supuesto
Calcula la probabilidad de cada categoría usando el teorema de Bayes: combina qué tan frecuente es cada categoría en general con qué tan probable es observar estas características dentro de ella.
El "naive", que significa ingenuo, viene de su supuesto: asume que todas las variables son independientes entre sí. En un correo, asume que la palabra "gratis" y la palabra "oferta" aparecen de forma independiente, lo cual es evidentemente falso.
Y sin embargo funciona notablemente bien, sobre todo en clasificación de texto: filtros de spam, análisis de sentimiento, categorización de documentos. Es rápido, necesita pocos datos para empezar a rendir y maneja miles de variables sin problema.
Cuándo no usarlo: cuando las variables están claramente relacionadas entre sí y esa relación es justamente la señal importante. Ahí el supuesto ingenuo deja de ser inofensivo.
El perceptrón: el ladrillo de las redes neuronales
Es el modelo más simple inspirado en una neurona. Recibe varias entradas, le da un peso a cada una, las suma y si el resultado supera un umbral, se activa.
Suena elemental porque lo es, y tiene una limitación famosa: solo puede separar categorías con una línea recta. Hay problemas simples que no puede resolver, y ese descubrimiento en los años sesenta frenó la investigación en redes neuronales durante más de una década.
Lo que cambió todo fue apilarlos: varias capas de perceptrones conectados sí pueden aprender fronteras curvas y complejas. Eso es una red neuronal, y de ahí en adelante todo lo que ves hoy en IA generativa es esa idea llevada a una escala enorme.
Por eso vale la pena entenderlo aunque no lo uses: es el ladrillo con el que está construido el resto.
Cuál elegir
| Algoritmo | Su fuerza | Cuándo evitarlo |
|---|---|---|
| Árbol de decisión | Se puede explicar a cualquiera | Si necesitas máxima precisión sin importar la explicación |
| KNN | Simple y sin supuestos sobre los datos | Con muchas variables o muchos datos |
| Naive Bayes | Rapidísimo y bueno con texto | Si las variables están muy relacionadas entre sí |
| Perceptrón | Base conceptual de las redes | Para problemas reales: usa una red completa |
Mi orden de trabajo con un problema nuevo: primero una regresión logística como línea base, después un árbol para ver qué variables importan y poder explicarlo, y solo si hace falta más precisión, modelos de conjunto como random forest. Empezar por lo complejo es la forma más rápida de tener un modelo que nadie entiende y que no rinde mejor.
Preguntas frecuentes
¿Qué es un árbol de decisión?
Es un modelo que clasifica haciendo preguntas encadenadas sobre las variables hasta llegar a una respuesta. En cada nodo elige la pregunta que mejor separa los datos. Su gran ventaja es que se puede leer y explicar a alguien que no sabe de modelos.
¿Cómo funciona el algoritmo KNN?
Para clasificar un caso nuevo mira los k casos más parecidos que ya conoce y le asigna la categoría mayoritaria entre ellos. No entrena nada: guarda los datos y calcula en el momento de predecir. Exige estandarizar las variables porque se basa en distancias.
¿Qué es Naive Bayes y por qué se llama ingenuo?
Es un clasificador que calcula la probabilidad de cada categoría con el teorema de Bayes. Se llama ingenuo porque asume que todas las variables son independientes entre sí, un supuesto poco realista. Aun así funciona muy bien en clasificación de texto, como filtros de spam.
¿Qué es un perceptrón?
Es el modelo más simple inspirado en una neurona: recibe entradas, les da un peso, las suma y se activa si supera un umbral. Solo puede separar categorías con una línea recta, pero apilando varias capas de perceptrones se obtiene una red neuronal capaz de aprender patrones complejos.
¿Cuál es el mejor algoritmo de clasificación?
No hay uno mejor en abstracto: depende de los datos y de si necesitas explicar el modelo. Un buen orden es empezar con regresión logística como línea base, seguir con un árbol de decisión para ver qué variables importan, y recurrir a modelos de conjunto solo si hace falta más precisión.
¿Por qué el árbol de decisión sobreajusta?
Porque si no se le pone límite puede crear una rama por cada caso del entrenamiento y memorizarlos todos. Se controla limitando la profundidad del árbol o exigiendo un mínimo de casos por hoja. Random forest resuelve el problema combinando cientos de árboles que votan.
Machine learning no se aprende memorizando fórmulas
La IA ya escribe el código del modelo. Lo que decide es saber qué técnica corresponde, si el resultado tiene sentido y cómo se lee. Eso es lo que enseño en el curso de SQL + Python, que incluye siete módulos de machine learning con proyectos y datasets reales. En vivo.
Formate con Gera
¿Quieres aprender datos?
Cursos en vivo de SQL, Python y Power BI con Gera. Clases por Zoom, datos reales y feedback directo. Tambien hacemos capacitacion in-company.
Ver cursos de datos