Capítulo 6 de 16 11 secciones 17 min

Atípicos: los tres métodos no se ponen de acuerdo

32, 203 o 222 filas raras según a quién le preguntes. Y las 21 ventas negativas que resultaron tener una cosa en común.

Hay tres métodos habituales y dan resultados muy distintos sobre los mismos datos: la puntuación z encontró 32 filas raras, el rango intercuartílico 203 y el MAD 222. Ninguno está mal: miden cosas distintas. Y antes de aplicar cualquiera hay que preguntarse contra qué se compara cada fila, porque aquí los 32 atípicos de la z resultaron ser las ventas normales del segmento Mayorista.

Un atípico no es un número grande. Es un número que no pertenece al grupo 🎯

Y esa diferencia, que parece filosófica, decide todo lo que viene. Una venta de 4.000 soles es enorme para una bodega y es martes por la tarde para un mayorista.

Vamos a verlo con los tres métodos que se usan, aplicados a las mismas 3.000 filas.

import pandas as pd
import numpy as np

URL = 'https://missyera.com/static/datasets/ventas-miss-yera.csv'


def carga_limpia(url):
    """La misma del capítulo 2."""
    v = pd.read_csv(url).drop_duplicates()
    v['ciudad'] = (v['ciudad'].str.strip().str.lower()
                   .str.normalize('NFKD')
                   .str.encode('ascii', 'ignore').str.decode('utf-8'))
    v['monto'] = pd.to_numeric(v['monto'].str.replace(',', '.'))
    for col in ['fecha', 'fecha_ultima_compra']:
        f = pd.to_datetime(v[col], format='%Y-%m-%d', errors='coerce')
        falta = f.isna() & v[col].notna()
        f[falta] = pd.to_datetime(v.loc[falta, col], format='%d/%m/%Y',
                                  errors='coerce')
        v[col] = f
    return v


v = carga_limpia(URL)
m = v['monto']

print('filas: %d | de %.2f a %.2f' % (len(m), m.min(), m.max()))
filas: 3000 | de -2497.72 a 4236.71

Método 1: la puntuación z

El clásico. Cuenta a cuántas desviaciones está cada fila del promedio, y marca las que pasen de 3:

zi=xix¯s

a cuántas desviaciones del centro está cada dato

z = (m - m.mean()) / m.std()

print('a mas de 3 desviaciones: %d filas' % (z.abs() > 3).sum())
print('a mas de 2 desviaciones: %d filas' % (z.abs() > 2).sum())
a mas de 3 desviaciones: 32 filas
a mas de 2 desviaciones: 193 filas

32 filas sospechosas de 3.000, un 1,07%. Suena razonable.

Antes de seguir, vamos a mirarlas. Esto es lo que casi nadie hace y es lo único que hay que hacer siempre 🔍

raras = v[z.abs() > 3]
print(raras['segmento'].value_counts())
segmento
Mayorista    32
Name: count, dtype: int64

Las 32. Todas 😳

Ahí se cae el método entero. La z no encontró ventas raras: encontró el segmento que vende más caro. Un mayorista está a más de tres desviaciones del promedio de la empresa porque el promedio de la empresa está lleno de bodegas que venden a 178 soles.

Y si le hubieras hecho caso a la receta ("quita los atípicos y sigue"), habrías borrado a tus mejores clientes por ser tus mejores clientes 😬

Es exactamente el mismo fenómeno de los capítulos 3, 4 y 5: estamos metiendo cuatro poblaciones en el mismo saco. Ya nos rompió la media, la dispersión y la forma. Ahora nos rompe la detección de atípicos.

Nube de puntos con una frontera de densidad punteada alrededor del grueso de los casos y cuatro puntos marcados con un anillo fuera de ella: las anomalías viven donde la densidad es casi cero.
Un dato raro no es el que está lejos del promedio en una columna: es el que está donde casi no hay nadie mirando todas las columnas a la vez. Un cliente puede tener un monto normal y una frecuencia normal, y aun así ser rarísimo en la combinación de las dos.

Método 2: el rango intercuartílico

La versión robusta. Marca lo que caiga a más de 1,5 IQR fuera de los cuartiles, que es la regla del diagrama de caja de toda la vida:

q1, q3 = m.quantile(0.25), m.quantile(0.75)
iqr = q3 - q1
bajo, alto = q1 - 1.5 * iqr, q3 + 1.5 * iqr

print('limites: %.2f a %.2f' % (bajo, alto))
print('por debajo: %d | por encima: %d | total: %d'
      % ((m < bajo).sum(), (m > alto).sum(), ((m < bajo) | (m > alto)).sum()))
limites: -971.30 a 2292.68
por debajo: 3 | por encima: 200 | total: 203

203 filas, seis veces más que la z 😵

Y mira el reparto: 200 por arriba y 3 por abajo. Ese desequilibrio es la cola derecha del capítulo 5 asomando otra vez.

Método 3: el MAD, el más robusto de todos

La z usa media y desviación, que son justo las dos medidas que los atípicos estropean. Es un poco absurdo si lo piensas: le pides a un dato raro que se delate usando un promedio que él mismo está inflando 🙃

El MAD (desviación absoluta mediana) arregla eso usando mediana en los dos sitios:

zirob=0,6745(xix~)mediana(|xx~|)

lo mismo que la z pero con medianas en los dos sitios, para que los propios atípicos no inflen la vara con la que se les mide

mediana = m.median()
mad = (m - mediana).abs().median()
z_robusta = 0.6745 * (m - mediana) / mad

print('MAD: %.2f' % mad)
print('a mas de 3.5 z robustas: %d filas' % (z_robusta.abs() > 3.5).sum())
MAD: 325.67
a mas de 3.5 z robustas: 222 filas

222. Otro número distinto 🤯

El 0,6745 es una constante de conversión para que la escala se parezca a la de una desviación estándar normal, y el umbral de 3,5 es la convención que acompaña a este método.

Los tres a la vez

por_z = set(v.index[z.abs() > 3])
por_iqr = set(v.index[(m < bajo) | (m > alto)])
por_mad = set(v.index[z_robusta.abs() > 3.5])

print('z: %d | IQR: %d | MAD: %d' % (len(por_z), len(por_iqr), len(por_mad)))
print()
print('en z y en IQR:   %d' % len(por_z & por_iqr))
print('en IQR y en MAD: %d' % len(por_iqr & por_mad))
print('en los tres:     %d' % len(por_z & por_iqr & por_mad))
z: 32 | IQR: 203 | MAD: 222

en z y en IQR:   32
en IQR y en MAD: 202
en los tres:     32

Fíjate en el patrón, que es limpísimo: las 32 de la z están dentro de las 203 del IQR, y casi todas las 203 están dentro de las 222 del MAD.

No es que los métodos se contradigan. Es que son tres niveles de severidad del mismo criterio. La z es la más permisiva porque los propios atípicos inflan la desviación que se usa para juzgarlos; el MAD es el más estricto porque no se deja inflar.

MétodoUsaEncontróCuándo usarlo
Puntuación zMedia y desviación32Solo si los datos son acampanados
1,5 x IQRCuartiles203El de por defecto, funciona casi siempre
MADMediana dos veces222Cuando sospechas que hay muchos atípicos

Ahora hazlo bien: dentro de cada grupo

Lo que había que hacer desde el principio: comparar cada venta contra las de su propio segmento 🏪

for seg, g in v.groupby('segmento'):
    zz = (g['monto'] - g['monto'].mean()) / g['monto'].std()
    print('%-11s %3d atipicos de %d' % (seg, (zz.abs() > 3).sum(), len(g)))
Bodega        8 atipicos de 707
Horeca        4 atipicos de 742
Mayorista     4 atipicos de 750
Minimarket    5 atipicos de 801

21 filas repartidas entre los cuatro segmentos, en vez de 32 concentradas en uno 🙌

Y ahora sí son atípicos de verdad: ventas que no se parecen a las de su propio grupo. Mayorista pasa de 32 a 4, que es lo que tenía que pasar.

Regla para llevarte: antes de buscar atípicos, pregúntate contra qué se está comparando cada fila. Si tus datos tienen grupos con niveles distintos, la detección va por grupo o no vale nada 📌

Las ventas negativas, y lo que escondían

Llevan saliendo desde el capítulo 2. Vamos a por ellas:

negativas = v[v['monto'] < 0]

print('ventas negativas: %d' % len(negativas))
print('suman: %.2f soles' % negativas['monto'].sum())
print()
print(negativas.groupby('segmento')['monto'].agg(['count', 'mean', 'min']).round(2))
ventas negativas: 21
suman: -8954.04 soles

            count    mean      min
segmento
Bodega          7 -116.75  -224.61
Horeca          4 -438.13  -976.24
Mayorista       5 -984.06 -2497.72
Minimarket      5 -292.79  -494.70

21 filas y casi 9.000 soles en negativo. Repartidas por los cuatro segmentos, y con montos proporcionales al tamaño de cada uno.

Y ahora la pregunta que lo resolvió todo. ¿Qué tienen en común?

print(negativas['compro'].value_counts())
print()
print('de las 3000 filas, cuantas no compraron:', (v['compro'] == 0).sum())
compro
0    21
Name: count, dtype: int64

de las 3000 filas, cuantas no compraron: 1267

Las 21 son ventas que no se cerraron. Ni una sola excepción 🔎

Eso cambia por completo la interpretación. No son devoluciones repartidas al azar: son operaciones que quedaron en negativo y no llegaron a concretarse. Lo más probable es que sean anulaciones o notas de crédito que se colaron en la tabla de ventas.

Si hubiera sido casualidad, con 21 filas y un 42% de no-compras esperaríamos unas nueve, no veintiuna. Que salgan las 21 no es casualidad, es una regla del sistema que nadie documentó.

Y fíjate en lo que acaba de pasar: buscando datos que estorbaban, encontramos algo del negocio. Por eso los atípicos se miran antes de borrarlos. Suele haber más información en las 21 filas raras que en las 2.979 normales 💎

El error del capítulo

Este lo he cometido yo mil veces. Quiero filtrar por una columna que tiene nulos, así que la limpio antes:

v[v['satisfaccion'].dropna() > 4]
IndexingError: Unalignable boolean Series provided as indexer (index of the boolean Series and of the indexed object do not match).

Lo que pasa es que dropna() devuelve una serie de 2.769 filas, y estás usándola para filtrar un DataFrame de 3.000. pandas intenta alinearlas por índice, ve que no encajan y se planta.

Y menos mal que se planta 🙏 porque la alternativa habría sido rellenar los huecos con algo y devolverte filas que no pediste.

La forma correcta es filtrar sobre el original, que trata los nulos como falsos:

print('satisfaccion mayor que 4:', (v['satisfaccion'] > 4).sum())
print('filas con satisfaccion nula:', v['satisfaccion'].isna().sum())
satisfaccion mayor que 4: 563
filas con satisfaccion nula: 231

563 filas, y los 231 nulos quedaron fuera sin drama. Que es lo que querías.

Y ahora, ¿qué hago con ellos?

La pregunta que casi nadie hace. Hay cuatro respuestas y solo una es automática:

Qué hacesCuándoEn este archivo
InvestigarSiempre, primeroLas 21 negativas resultaron ser todas no-compras
CorregirSi es un error de captura demostrableUn monto con la coma mal puesta
DejarSi son reales y te importanLas ventas de 4.000 soles de Mayorista
CaparSi estorban al modelo pero existenPonerles el valor del percentil 99

Lo que nunca se hace es borrarlos sin mirarlos. Es la diferencia entre limpiar los datos y maquillarlos 💄

Practica 💪

1. ¿Cuánto cambia todo si los quitas?

Quita las 32 filas de la puntuación z y mira qué le pasa a la media, a la mediana y a la desviación.

sin_ellos = m[z.abs() <= 3]

print('           con        sin      cambio')
print('media    %8.2f %8.2f %+9.2f' % (m.mean(), sin_ellos.mean(), sin_ellos.mean() - m.mean()))
print('mediana  %8.2f %8.2f %+9.2f' % (m.median(), sin_ellos.median(), sin_ellos.median() - m.median()))
print('desv.    %8.2f %8.2f %+9.2f' % (m.std(), sin_ellos.std(), sin_ellos.std() - m.std()))
           con        sin      cambio
media      803.76   779.52    -24.24
mediana    533.63   526.44     -7.19
desv.      751.99   702.73    -49.25

Quitar el 1% de las filas mueve la media 24 soles y la mediana 7 🤏

Lo cual dice dos cosas. La primera, que la mediana aguanta bastante mejor, como ya sabíamos.

La segunda, y más importante: quitarlos no cambia gran cosa, así que la decisión de quitarlos o no no se justifica por el impacto. Se justifica por si esas filas son reales o no.

Y ya sabemos que son reales: son mayoristas comprando como mayoristas. O sea que se quedan 🙅

2. Capar en vez de borrar

Prueba la alternativa: en vez de quitar las filas extremas, ponles el valor del percentil 1 y del 99.

capado = m.clip(lower=m.quantile(0.01), upper=m.quantile(0.99))

print('filas: original %d | capado %d' % (len(m), len(capado)))
print('media    %8.2f -> %8.2f' % (m.mean(), capado.mean()))
print('desv.    %8.2f -> %8.2f' % (m.std(), capado.std()))
print('minimo   %8.2f -> %8.2f' % (m.min(), capado.min()))
print('maximo   %8.2f -> %8.2f' % (m.max(), capado.max()))
filas: original 3000 | capado 3000
media      803.76 ->   803.43
desv.      751.99 ->   732.89
minimo   -2497.72 ->    35.64
maximo    4236.71 ->  3058.59

La gracia del capado es que no pierdes ninguna fila: siguen siendo 3.000 🎉

Eso importa cuando esas filas tienen otras columnas que sí te sirven. Si borras la venta de 4.236 soles, pierdes también su ciudad, su canal y su satisfacción.

El precio es que estás inventando datos: esa venta ya no dice 4.236 sino 3.058,59. Y el mínimo pasa de -2.497 a +35,64, o sea que las 21 negativas desaparecieron sin que nadie las investigara.

Por eso el capado va después de investigar, nunca en lugar de. Es una herramienta para que un modelo no se vuelva loco, no para limpiar 🧽

3. Los atípicos de una columna que no tiene cola

Aplica los tres métodos a unidades, que en el capítulo 5 era la más acampanada. ¿Siguen discrepando tanto?

u = v['unidades']
zu = (u - u.mean()) / u.std()
q1u, q3u = u.quantile(0.25), u.quantile(0.75)
iqru = q3u - q1u
madu = (u - u.median()).abs().median()

print('por z:   %d' % (zu.abs() > 3).sum())
print('por IQR: %d' % ((u < q1u - 1.5 * iqru) | (u > q3u + 1.5 * iqru)).sum())
print('por MAD: %d' % ((0.6745 * (u - u.median()) / madu).abs() > 3.5).sum())
por z:   7
por IQR: 10
por MAD: 0

7, 10 y 0. Comparado con 32, 203 y 222, esto es un acuerdo 🤝

Los tres métodos coinciden en que aquí casi no hay nada raro, y el MAD, que era el más estricto con el monto, aquí no marca ni una sola fila.

El motivo es el del capítulo 5: unidades es acampanada y no tiene cola. Sin cola, los tres criterios acaban dibujando el mismo límite.

Aquí está la moraleja que quiero que te lleves: cuando los métodos discrepan mucho, el problema no son los atípicos, es la forma de la distribución. Aquellas 32, 203 y 222 no eran tres opiniones sobre unas filas raras: eran tres formas de reaccionar a una cola larga.

4. Un atípico que no está en ninguna punta

Todos los métodos de arriba miran una columna sola. Busca filas raras mirando dos a la vez: ventas con muchas unidades y monto bajo.

por_unidad = v['monto'] / v['unidades']

print(por_unidad.describe().round(2))
print()
raras_precio = v[(por_unidad < 5) & (v['monto'] > 0)]
print('ventas a menos de 5 soles la unidad: %d' % len(raras_precio))
print(raras_precio[['segmento', 'unidades', 'monto']].head(5))
count    3000.00
mean      121.28
std       255.15
min      -599.90
25%        23.94
50%        53.02
75%       121.76
max      3586.26
dtype: float64

ventas a menos de 5 soles la unidad: 39
    segmento  unidades  monto
404   Bodega        13  62.60
534   Bodega         9  36.49
565   Bodega        13  56.90
570   Bodega        24  35.53
889   Bodega        21  73.97

39 ventas a menos de 5 soles la unidad, y 35 de las 39 son de Bodega 👀

Lo interesante es que ninguna de estas filas es atípica en ninguna de las dos columnas por separado. Un monto de 53 soles es normalísimo en Bodega. 30 unidades es normalísimo en cualquier sitio. Lo raro es la combinación.

Eso se llama atípico multivariante y es el que se escapa siempre, porque nadie mira dos columnas a la vez. Aquí lo cazamos fabricando la razón entre ellas, que es el truco más barato que hay 🪄

Y de paso ahí tienes una hipótesis de negocio: hay bodegas comprando a precio de mayorista. Puede ser un descuento mal aplicado o puede ser un revendedor disfrazado de bodega.

5. Los atípicos por grupo, todos a la vez

Escribe algo que marque cada fila como atípica respecto a su propio segmento, y devuelve el DataFrame con esa columna nueva.

def z_dentro_del_grupo(g):
    return (g - g.mean()) / g.std()


v['z_segmento'] = v.groupby('segmento')['monto'].transform(z_dentro_del_grupo)
v['raro'] = v['z_segmento'].abs() > 3

print('atipicos por grupo: %d' % v['raro'].sum())
print()
print(v[v['raro']].groupby('segmento')['monto'].agg(['count', 'min', 'max']).round(2))
atipicos por grupo: 21

            count      min      max
segmento                           
Bodega          8  -224.61   415.12
Horeca          4  -976.24  1640.51
Mayorista       4 -2497.72  4236.71
Minimarket      5  -494.70   896.44

21 atípicos por grupo. Y hay 21 ventas negativas. Cuando vi los dos números iguales di por hecho que eran las mismas filas, y estuve a punto de escribirlo aquí. Menos mal que lo comprobé 😅

negativas = v['monto'] < 0

print('atipicos del grupo que son negativos: %d' % (v['raro'] & negativas).sum())
print('atipicos del grupo que son positivos: %d' % (v['raro'] & ~negativas).sum())
print('negativas que el metodo NO marco:     %d' % (negativas & ~v['raro']).sum())
atipicos del grupo que son negativos: 15
atipicos del grupo que son positivos: 6
negativas que el metodo NO marco:     6

No eran las mismas. Son 15 negativas más 6 ventas grandes de verdad, y hay 6 negativas que el método deja pasar 🙃

Las que deja pasar son las negativas chicas, como una de -70 soles en Bodega: dentro de un segmento que vende a 178 de media, eso no llega a tres desviaciones. Y las 6 positivas que sí marca son ventas enormes para su propio grupo, como una de 4.236 en Mayorista o una de 415 en Bodega.

Dos totales iguales no son el mismo conjunto. Esa coincidencia me la creí un minuto, y comprobarla costó tres líneas.

Ese transform es la pieza clave y vale la pena que te la quedes: calcula algo por grupo y lo devuelve con la forma de la tabla original, una fila por fila. Con apply tendrías que recomponerlo a mano.

6. Tu informe de atípicos

Junta el capítulo en una función que reciba una columna y un grupo, y te diga qué se encontró antes de decidir nada.

def informe(df, columna, grupo):
    s = df[columna]
    z_global = ((s - s.mean()) / s.std()).abs() > 3
    z_grupo = df.groupby(grupo)[columna].transform(
        lambda g: ((g - g.mean()) / g.std()).abs()) > 3

    print('%s, mirando %s' % (columna, grupo))
    print('  atipicos globales: %3d' % z_global.sum())
    print('  atipicos por %s: %3d' % (grupo, z_grupo.sum()))
    print('  marcados solo por el global: %3d' % (z_global & ~z_grupo).sum())
    if (z_global & ~z_grupo).sum() > z_grupo.sum():
        print('  AVISO: el metodo global esta marcando grupos enteros')


informe(v, 'monto', 'segmento')
print()
informe(v, 'unidades', 'segmento')
monto, mirando segmento
  atipicos globales:  32
  atipicos por segmento:  21
  marcados solo por el global:  28
  AVISO: el metodo global esta marcando grupos enteros

unidades, mirando segmento
  atipicos globales:   7
  atipicos por segmento:   6
  marcados solo por el global:   1

El aviso salta donde tenía que saltar 🚨

Y ese "marcados solo por el global: 28" es lo demoledor: de las 32 filas que el método global señala, 28 no son raras dentro de su propio segmento. Solo 4 sobreviven a mirar bien.

Con unidades el aviso no salta: 7 contra 6, y solo una fila de diferencia. Ahí da casi igual cómo mires, que es lo que pasa cuando no hay grupos de niveles distintos escondidos dentro.

Esta función la puedes correr sobre cualquier tabla antes de aplicar ninguna receta de limpieza. Tarda un segundo y te evita borrar a tu mejor cliente 💚

Comprueba que lo tienes

La puntuación z marca 32 ventas como atípicas y las 32 son del segmento Mayorista. ¿Qué haces?

  • Comparo cada venta contra su propio segmento antes de decidir
  • Las quito, porque el método las marcó
  • Uso el IQR, que es más robusto
  • Las dejo porque son pocas

Lo que te llevas

  • 🎯 Un atípico no es un número grande, es un número que no pertenece al grupo. Todo depende de contra qué lo compares.
  • 🔢 Los tres métodos dan 32, 203 y 222 sobre los mismos datos. No se contradicen: son tres niveles de severidad, y la z es la más permisiva porque los atípicos inflan la desviación con la que se les juzga.
  • 🏪 Los 32 atípicos globales eran los 32 mayoristas más grandes: 28 de ellos no son raros dentro de su propio segmento. Comparando por grupo salen 21 repartidos entre los cuatro.
  • 🧮 Dos totales iguales no son el mismo conjunto. Los 21 atípicos por grupo y las 21 ventas negativas coincidían en el número y compartían solo 15 filas.
  • 💎 Las 21 negativas tienen las tres en común: ninguna se cerró. Buscando basura encontramos una regla del sistema que nadie había documentado.
  • 🔀 Los atípicos multivariantes no salen en ninguna punta. 39 ventas a menos de 5 soles la unidad son normales en las dos columnas por separado.
  • 🚫 Nunca borrar sin mirar. Investigar, corregir, dejar o capar, en ese orden.

Qué viene ahora

Cerramos la parte descriptiva. A partir del capítulo 7 dejamos de describir lo que tenemos y empezamos a afirmar cosas sobre lo que no medimos, que es donde la estadística se pone interesante y peligrosa a la vez. Empezamos por la probabilidad, y solo la que hace falta 🎲

¿Tienes alguna duda o consulta?