Analítica y dashboards

Regresión lineal y logística: cuándo usar cada una

6 min de lectura
Regresión lineal y regresión logística explicadas

La regresión lineal predice un valor numérico ajustando una recta a los datos: se usa para estimar ventas, precios o demanda. La regresión lineal simple usa una sola variable predictora y la múltiple usa varias. La regresión logística, a pesar del nombre, no predice números sino la probabilidad de que ocurra algo, y se usa para clasificar: si un cliente se va a ir, si una transacción es fraude, si un correo es spam. La diferencia clave está en qué predicen: la lineal devuelve un número que puede ser cualquiera, la logística devuelve una probabilidad entre 0 y 1.

Tabla de contenidos

Respuesta rápida: La regresión lineal predice un valor numérico ajustando una recta a los datos: se usa para estimar ventas, precios o demanda. La regresión lineal simple usa una sola variable predictora y la múltiple usa varias. La regresión logística, a pesar del nombre, no predice números sino la probabilidad de que ocurra algo, y se usa para clasificar: si un cliente se va a ir, si una transacción es fraude, si un correo es spam. La diferencia clave está en qué predicen: la lineal devuelve un número que puede ser cualquiera, la logística devuelve una probabilidad entre 0 y 1.

Los dos modelos que están debajo de casi todo

Antes de random forest, de redes neuronales y de todo lo que suena moderno, están estos dos. Y siguen siendo los primeros que se prueban en cualquier proyecto serio, por una razón: se pueden explicar.

Un modelo complejo puede acertar más y no poder justificar ninguna de sus decisiones. Una regresión te dice exactamente cuánto pesa cada variable y en qué dirección. En un banco, en una aseguradora o frente a un directorio, eso no es un detalle: muchas veces es un requisito.

Mi recomendación de siempre: empieza con una regresión. Si un modelo complejo no le gana por un margen que justifique perder la explicabilidad, quédate con la regresión.

Regresión lineal simple

Ajusta una recta que pase lo más cerca posible de todos los puntos. Su forma es:

y = a + b · x

  • y es lo que quieres predecir. Las ventas, por ejemplo.
  • x es la variable que usas para predecir. La inversión en publicidad.
  • b es la pendiente: cuánto cambia y cuando x sube en una unidad.
  • a es la intersección: el valor de y cuando x vale cero.

Si el resultado fuera ventas = 5000 + 3.2 × publicidad, se lee así: sin publicidad vendes 5.000, y por cada sol adicional de publicidad las ventas suben 3.2 soles. Ese 3.2 es lo que importa y es directamente accionable.

El ajuste se hace minimizando la suma de los errores al cuadrado, que es de donde vienen el RMSE y el R cuadrado con los que después se evalúa.

Regresión lineal múltiple

En la vida real nada depende de una sola cosa. Las ventas dependen de la publicidad, del precio, de la temporada, de la competencia y de la fuerza de ventas. La regresión múltiple incorpora todas:

ventas = a + b1·publicidad + b2·precio + b3·temporada

Y aquí aparece lo más valioso de la técnica. Cada coeficiente mide el efecto de esa variable manteniendo las demás constantes. Eso te permite separar efectos que en los datos crudos están mezclados: cuánto de la subida de ventas fue la publicidad y cuánto fue simplemente que era diciembre.

El cuidado es la multicolinealidad: si dos variables predictoras están muy correlacionadas entre sí, el modelo no puede repartir el crédito y los coeficientes se vuelven inestables. Puedes ver un coeficiente negativo en una variable que claramente ayuda. Se detecta mirando la correlación entre las variables predictoras antes de modelar, y se resuelve quitando una de las dos.

Regresión logística: el nombre confunde

A pesar de llamarse regresión, la logística se usa para clasificar. No predice un número: predice la probabilidad de que algo ocurra.

El motivo de que exista es simple. Si intentas usar regresión lineal para predecir algo que solo puede ser 0 o 1, la recta se va a ir por debajo de cero y por encima de uno, y una probabilidad negativa no significa nada.

La logística resuelve eso aplicando una función que aplasta cualquier resultado dentro del rango de 0 a 1. La curva que produce tiene forma de S: cambia poco en los extremos y mucho en el medio.

Sus usos son los que más aparecen en empresas: predecir qué clientes se van a ir, si una transacción es fraudulenta, si un lead va a convertir, si un crédito se va a pagar.

Cómo se lee el resultado: el modelo devuelve una probabilidad, por ejemplo 0.73, y tú eliges el umbral para convertirla en decisión. Ese umbral es la perilla de la que hablo en el post de métricas, y moverlo cambia por completo el balance entre falsas alarmas y casos que se escapan.

Los supuestos que casi nadie revisa

La regresión lineal asume cuatro cosas, y aunque revisarlas parezca burocracia, ignorarlas produce conclusiones falsas con mucha seguridad:

  1. Linealidad: la relación entre x e y es aproximadamente una recta. Si es curva, la regresión lineal la va a modelar mal.
  2. Independencia: las observaciones no dependen unas de otras. Con series de tiempo esto se rompe casi siempre.
  3. Varianza constante: el error es parecido en todo el rango. Si predices mucho mejor los valores chicos que los grandes, este supuesto falla.
  4. Errores distribuidos normalmente: los residuos siguen una distribución normal.

La forma práctica de revisarlos es una sola: graficar los residuos, o sea la diferencia entre lo predicho y lo real. Si al graficarlos contra los valores predichos ves una nube sin forma, todo bien. Si ves una curva, un embudo o un patrón, algo de lo anterior está fallando.

Y un cuidado que aplica a las dos regresiones: son muy sensibles a valores extremos. Un solo dato atípico puede inclinar la recta entera. Antes de confiar en un coeficiente, mira si hay outliers y decide si son errores de captura o casos reales.

Preguntas frecuentes

¿Qué es la regresión lineal?

Es un modelo que predice un valor numérico ajustando una recta a los datos. Su forma es y = a + b·x, donde b indica cuánto cambia lo que predices cuando la variable predictora sube en una unidad, y a es el valor cuando esa variable vale cero.

¿Cuál es la diferencia entre regresión lineal simple y múltiple?

La simple usa una sola variable predictora y la múltiple usa varias. La ventaja de la múltiple es que cada coeficiente mide el efecto de esa variable manteniendo las demás constantes, lo que permite separar efectos que en los datos crudos están mezclados.

¿Qué es la regresión logística?

Es un modelo de clasificación que, a pesar de su nombre, no predice números sino la probabilidad de que ocurra algo. Se usa para predecir si un cliente se va a ir, si una transacción es fraude o si un crédito se va a pagar.

¿Cuál es la diferencia entre regresión lineal y logística?

La lineal predice un valor numérico que puede ser cualquiera. La logística predice una probabilidad entre 0 y 1, y por eso sirve para clasificar. Si usaras regresión lineal para predecir algo que solo puede ser 0 o 1, la recta produciría valores imposibles.

¿Cómo se interpretan los coeficientes de una regresión?

Cada coeficiente indica cuánto cambia la variable objetivo cuando esa variable predictora sube en una unidad, manteniendo las demás constantes. Un coeficiente de 3.2 en publicidad significa que cada sol adicional de publicidad se asocia con 3.2 soles más de venta.

¿Qué supuestos tiene la regresión lineal?

Linealidad de la relación, independencia de las observaciones, varianza constante del error y errores distribuidos normalmente. La forma práctica de revisarlos es graficar los residuos: si ves una nube sin forma está bien, si ves una curva o un embudo algo falla.

Machine learning no se aprende memorizando fórmulas

La IA ya escribe el código del modelo. Lo que decide es saber qué técnica corresponde, si el resultado tiene sentido y cómo se lee. Eso es lo que enseño en el curso de SQL + Python, que incluye siete módulos de machine learning con proyectos y datasets reales. En vivo.

Formate con Gera

¿Quieres aprender datos?

Cursos en vivo de SQL, Python y Power BI con Gera. Clases por Zoom, datos reales y feedback directo. Tambien hacemos capacitacion in-company.

Ver cursos de datos
regresion lineal

Comparte este artículo:

Sigue a Miss Yera:
WhatsApp directo
¿Tienes alguna duda o consulta?