Analítica y dashboards

Matriz de confusión y métricas: cómo saber si un modelo sirve

7 min de lectura
Matriz de confusión y métricas de evaluación de modelos

La matriz de confusión es una tabla que cruza lo que el modelo predijo contra lo que realmente pasó, y de ella salen las métricas de clasificación: la exactitud es el porcentaje de aciertos totales, la precisión mide cuántos de los positivos predichos eran correctos, el recall mide cuántos de los positivos reales logró detectar, y el F1 combina precisión y recall en un solo número. La exactitud engaña cuando las clases están desbalanceadas: si solo el 2 por ciento de las transacciones son fraude, un modelo que diga siempre que no hay fraude acierta el 98 por ciento y no sirve para nada. En regresión las métricas son otras: R cuadrado mide qué proporción de la variación explica el modelo, y RMSE mide el error promedio en las unidades originales.

Tabla de contenidos

Respuesta rápida: La matriz de confusión es una tabla que cruza lo que el modelo predijo contra lo que realmente pasó, y de ella salen las métricas de clasificación: la exactitud es el porcentaje de aciertos totales, la precisión mide cuántos de los positivos predichos eran correctos, el recall mide cuántos de los positivos reales logró detectar, y el F1 combina precisión y recall en un solo número. La exactitud engaña cuando las clases están desbalanceadas: si solo el 2 por ciento de las transacciones son fraude, un modelo que diga siempre que no hay fraude acierta el 98 por ciento y no sirve para nada. En regresión las métricas son otras: R cuadrado mide qué proporción de la variación explica el modelo, y RMSE mide el error promedio en las unidades originales.

El modelo con 95% de exactitud que no sirve para nada

Un modelo detecta fraude en transacciones con 98 por ciento de exactitud. Suena excelente hasta que miras la data: solo el 2 por ciento de las transacciones son fraudulentas.

Un modelo que dijera siempre "no hay fraude", sin mirar nada, también acertaría el 98 por ciento. Y sería completamente inútil, porque nunca detectaría un fraude.

Ese es el motivo por el que existe todo este artículo. La exactitud sola miente cuando las clases están desbalanceadas, y en el mundo real casi siempre lo están: el fraude es raro, la enfermedad es rara, el cliente que se va es minoría.

Cómo se lee la matriz de confusión

Es una tabla que cruza lo que el modelo dijo contra lo que realmente pasó:

En realidad SÍEn realidad NO
El modelo dijo SÍVerdadero positivo (acierto)Falso positivo (falsa alarma)
El modelo dijo NOFalso negativo (se le escapó)Verdadero negativo (acierto)

La diagonal son los aciertos. Las otras dos casillas son los dos tipos de error, y casi nunca cuestan lo mismo:

  • Falso positivo: el modelo marcó fraude donde no lo había. Costo: molestar a un cliente legítimo.
  • Falso negativo: el modelo dejó pasar un fraude real. Costo: la plata perdida.

Toda la elección de métrica sale de esa comparación. Antes de elegir cualquier número, la pregunta correcta es: ¿cuál de los dos errores me cuesta más caro?

Precisión, recall y F1

MétricaQué respondeCuándo importa más
Exactitud¿Qué porcentaje del total acerté?Solo si las clases están balanceadas
PrecisiónDe los que marqué positivos, ¿cuántos lo eran?Cuando la falsa alarma es cara
RecallDe los positivos reales, ¿cuántos detecté?Cuando dejar pasar uno es caro
F1El equilibrio entre las dos anterioresCuando ambos errores importan

Dos ejemplos que dejan clara la diferencia:

  • Filtro de spam: prioriza precisión. Que se cuele un spam molesta un poco. Que un correo importante termine en spam es un problema serio. Prefieres marcar menos y estar más seguro.
  • Detección de una enfermedad: prioriza recall. Un falso positivo genera un examen adicional. Un falso negativo es un enfermo que se va a casa sin tratamiento. Prefieres marcar de más.

Precisión y recall están en tensión: subir una baja la otra. Si el modelo marca a todos como positivos, el recall es 100 por ciento y la precisión es pésima. Por eso existe el F1, que los combina, y por eso se usa la media armónica en vez del promedio simple: la armónica castiga los desequilibrios. Con precisión 0.9 y recall 0.1, el promedio simple daría 0.5 y el F1 da 0.18, que refleja mucho mejor que el modelo no sirve.

La curva ROC y el AUC

Un modelo de clasificación no devuelve un sí o un no: devuelve una probabilidad. Eres tú quien decide el umbral a partir del cual eso se considera positivo, y normalmente arranca en 0.5.

Ese umbral es una perilla. Bajarlo detecta más positivos reales pero también genera más falsas alarmas. Subirlo hace lo contrario.

La curva ROC grafica ese intercambio para todos los umbrales posibles. El AUC es el área bajo esa curva y resume el modelo en un número:

  • AUC de 0.5: el modelo no distingue nada, equivale a lanzar una moneda.
  • AUC entre 0.7 y 0.8: aceptable.
  • AUC por encima de 0.9: muy bueno, y también motivo para sospechar de una fuga de información en los datos.

La ventaja del AUC es que no depende del umbral elegido, así que sirve para comparar dos modelos de forma limpia. Su límite es que con clases muy desbalanceadas puede verse optimista, y ahí conviene mirar además la curva de precisión y recall.

Cuando el modelo predice números: R cuadrado y RMSE

Si el modelo predice un valor numérico en vez de una categoría, como el precio de una casa o la demanda del mes, las métricas son otras.

R cuadrado, o coeficiente de determinación, mide qué proporción de la variación de la variable objetivo explica el modelo. Va de 0 a 1: un R cuadrado de 0.75 significa que el modelo explica el 75 por ciento de la variación y el resto queda sin explicar.

Su trampa: siempre sube al agregar variables, aunque sean basura. Por eso existe el R cuadrado ajustado, que penaliza el número de variables y es el que hay que mirar cuando comparas modelos con distinta cantidad de predictores.

RMSE, o raíz del error cuadrático medio, mide el error promedio en las unidades originales. Si predices precios en soles, un RMSE de 15.000 significa que en promedio te equivocas por unos 15 mil soles. Es la métrica que se entiende sin explicar.

La diferencia con el MAE, el error absoluto medio: RMSE eleva los errores al cuadrado antes de promediar, así que castiga mucho más los errores grandes. Si equivocarte por mucho es desproporcionadamente malo, usa RMSE. Si todos los errores pesan igual, MAE es más honesto.

Una regla que aplico siempre: reporta R cuadrado y RMSE juntos. El primero dice qué tan bien explica y el segundo cuánto se equivoca en unidades reales. Solos, cada uno cuenta media historia.

El error de evaluar sobre los datos de entrenamiento

Todas estas métricas hay que calcularlas sobre datos que el modelo no vio durante el entrenamiento. Evaluarlo sobre los mismos datos con los que aprendió es como tomarle un examen con las preguntas que ya tenía resueltas.

Un modelo puede memorizar el conjunto de entrenamiento y sacar métricas perfectas ahí, para después fallar por completo con datos nuevos. Eso es sobreajuste, y cómo detectarlo y evitarlo lo explico en overfitting y validación cruzada.

Preguntas frecuentes

¿Qué es una matriz de confusión?

Es una tabla que cruza lo que el modelo predijo contra lo que realmente ocurrió. La diagonal son los aciertos y las otras dos casillas son los dos tipos de error: falsos positivos, o falsas alarmas, y falsos negativos, que son los casos que se le escaparon.

¿Cómo se interpreta una matriz de confusión?

Se mira qué tipo de error comete más el modelo y cuánto cuesta cada uno. Un falso positivo marca algo que no era; un falso negativo deja pasar algo que sí era. La elección de métrica sale de responder cuál de los dos errores es más caro en tu caso.

¿Cuál es la diferencia entre precisión y recall?

La precisión responde cuántos de los que marcaste como positivos lo eran de verdad, y importa cuando la falsa alarma es cara. El recall responde cuántos de los positivos reales lograste detectar, y importa cuando dejar pasar uno es caro. Subir una suele bajar la otra.

¿Por qué la exactitud no es suficiente?

Porque engaña cuando las clases están desbalanceadas. Si solo el 2 por ciento de las transacciones son fraude, un modelo que diga siempre que no hay fraude acierta el 98 por ciento sin detectar ni un caso. En esos escenarios hay que mirar precisión, recall y F1.

¿Qué es el R cuadrado?

Es el coeficiente de determinación y mide qué proporción de la variación de la variable objetivo explica el modelo. Va de 0 a 1. Su trampa es que siempre sube al agregar variables aunque no aporten, por eso al comparar modelos conviene mirar el R cuadrado ajustado.

¿Cuál es la diferencia entre RMSE y MAE?

Los dos miden el error promedio en las unidades originales, pero RMSE eleva los errores al cuadrado antes de promediar, así que castiga mucho más los errores grandes. Usa RMSE si equivocarte por mucho es desproporcionadamente malo y MAE si todos los errores pesan igual.

¿Qué es la curva ROC y el AUC?

La curva ROC grafica el intercambio entre detectar positivos y generar falsas alarmas para todos los umbrales posibles. El AUC es el área bajo esa curva: 0.5 equivale a lanzar una moneda y por encima de 0.9 es muy bueno. Su ventaja es que no depende del umbral elegido.

Machine learning no se aprende memorizando fórmulas

La IA ya escribe el código del modelo. Lo que decide es saber qué técnica corresponde, si el resultado tiene sentido y cómo se lee. Eso es lo que enseño en el curso de SQL + Python, que incluye siete módulos de machine learning con proyectos y datasets reales. En vivo.

Formate con Gera

¿Quieres aprender datos?

Cursos en vivo de SQL, Python y Power BI con Gera. Clases por Zoom, datos reales y feedback directo. Tambien hacemos capacitacion in-company.

Ver cursos de datos
matriz de confusion

Comparte este artículo:

Sigue a Miss Yera:
WhatsApp directo
¿Tienes alguna duda o consulta?