Automatización IA

Web scraping: qué es, para qué sirve y si es legal en Perú

5 min de lectura
Web scraping: qué es y para qué sirve

El web scraping es la técnica de extraer información de páginas web de forma automática, con un programa que lee el contenido del sitio y lo guarda en una tabla. Se usa para monitorear precios de la competencia, recopilar listados de productos, armar bases de datos de contactos públicos o alimentar análisis de mercado. En Perú y en general en LATAM, extraer datos públicos no está prohibido en sí mismo, pero sí puede infringir los términos de uso del sitio, la propiedad intelectual del contenido, o la Ley de Protección de Datos Personales (Ley 29733) si lo que extraes incluye datos de personas identificables. La regla práctica: datos públicos y agregados, sin datos personales y sin saturar el servidor.

Tabla de contenidos

Respuesta rápida: El web scraping es la técnica de extraer información de páginas web de forma automática, con un programa que lee el contenido del sitio y lo guarda en una tabla. Se usa para monitorear precios de la competencia, recopilar listados de productos, armar bases de datos de contactos públicos o alimentar análisis de mercado. En Perú y en general en LATAM, extraer datos públicos no está prohibido en sí mismo, pero sí puede infringir los términos de uso del sitio, la propiedad intelectual del contenido, o la Ley de Protección de Datos Personales (Ley 29733) si lo que extraes incluye datos de personas identificables. La regla práctica: datos públicos y agregados, sin datos personales y sin saturar el servidor.

¿Qué es el web scraping?

Imagina que necesitas los precios de 500 productos de la web de tu competencia. Puedes abrir el navegador, copiar y pegar 500 veces, y perder tres días. O puedes escribir un programa que entre a cada página, lea el precio y lo guarde en una tabla en cinco minutos. Eso segundo es web scraping.

Técnicamente: un scraper hace una petición a una URL, recibe el HTML de la página (el mismo que ve tu navegador) y extrae de ahí los pedazos que le interesan según una regla que tú definiste. Después lo guarda en CSV, Excel o una base de datos.

No es hacking. No entra a nada privado. Lee exactamente lo mismo que verías tú abriendo la página, solo que a velocidad de máquina y sin cansarse.

Para qué sirve de verdad en un negocio

  • Monitoreo de precios. El uso más común. Saber a diario a cuánto vende la competencia sin tener a alguien revisando webs.
  • Investigación de mercado. Recopilar catálogos completos de una categoría para entender surtido, rangos de precio y vacíos.
  • Seguimiento de reseñas. Extraer opiniones públicas de productos para analizar qué se queja la gente. Aquí el cruce con IA es potente.
  • Listados inmobiliarios o de empleo. Armar una base con miles de avisos para analizar tendencias de precio o de demanda de perfiles.
  • Alimentar un dashboard. Que los datos externos entren solos a tu Power BI en vez de que alguien los cargue a mano cada lunes.

Lo que casi nunca vale la pena: scrapear para "tener datos". Si no tienes claro qué decisión vas a tomar con esa información, vas a terminar con un CSV gigante que nadie mira. Es el mismo error del que hablo en qué son los insights.

Cómo hacerlo sin programar

No necesitas saber Python para empezar. Hay tres caminos según tu nivel:

CaminoHerramientaPara quién
Sin códigoExtensiones de navegador tipo point and clickNecesitas 200 filas una sola vez
Bajo códigon8n, Make, Google Sheets con IMPORTXMLNecesitas que corra solo cada semana
CódigoPython con requests y BeautifulSoup, o PlaywrightVolumen alto o sitios complicados

Para un negocio pequeño o mediano, el camino del medio es casi siempre el correcto. Con n8n montas un flujo que entra a las páginas, extrae los datos y los deja en una hoja de cálculo, corriendo solo todos los lunes a las 8 de la mañana. Sin programar y sin que nadie se acuerde de hacerlo.

Si el sitio carga el contenido con JavaScript (muy común en ecommerce moderno), las herramientas simples fallan porque el HTML inicial viene vacío. Ahí sí necesitas algo que ejecute el navegador de verdad, como Playwright.

¿Es legal el web scraping en Perú?

Te lo respondo con honestidad porque en internet abunda la respuesta fácil en ambos sentidos. No hay una ley que prohíba el web scraping como tal. Lo que sí hay son cuatro frentes donde te puedes meter en problemas:

  1. Términos y condiciones del sitio. Muchos los prohíben expresamente. Violarlos es un incumplimiento contractual, no un delito, pero te pueden bloquear o demandar civilmente.
  2. Propiedad intelectual. Extraer datos fácticos (un precio, una fecha) es distinto de copiar contenido creativo (textos, fotos). Lo segundo puede infringir derechos de autor.
  3. Datos personales. Aquí está el riesgo mayor en Perú. La Ley 29733 de Protección de Datos Personales aplica aunque el dato esté publicado. Recopilar nombres, correos o teléfonos de personas identificables para armar una base sin consentimiento te expone a sanción de la Autoridad Nacional de Protección de Datos Personales.
  4. Sobrecarga del servidor. Si tu scraper hace miles de peticiones por segundo y tumba el sitio, eso sí puede constituir un delito informático.

La regla práctica que aplico con clientes: datos públicos y fácticos, sin información de personas identificables, respetando el archivo robots.txt, con pausas entre peticiones y sin republicar el contenido tal cual. Si el proyecto se acerca al borde en cualquiera de los cuatro frentes, consúltalo con un abogado antes, no después.

Web scraping y las APIs: revisa esto primero

Antes de montar un scraper, revisa si el sitio tiene una API pública. Una API es una puerta oficial para pedir los datos, y cuando existe es mejor en todo sentido: más estable, más rápida, sin riesgo legal y sin romperse cada vez que rediseñan la web.

El punto débil del scraping es justamente ese: depende de la estructura visual del sitio. Si mueven un div, tu scraper deja de funcionar y no te avisa. Es mantenimiento permanente. Muchos proyectos de scraping mueren no por lo legal sino porque nadie los arregló después del tercer cambio de diseño.

Preguntas frecuentes sobre web scraping

¿Qué es el web scraping en palabras simples?

Es usar un programa para copiar automáticamente información de páginas web y guardarla en una tabla, en vez de hacerlo a mano.

¿El web scraping es ilegal?

No en sí mismo. Se vuelve problemático si viola los términos de uso del sitio, copia contenido protegido por derechos de autor, recoge datos personales sin consentimiento o satura el servidor.

¿Qué herramienta uso si no sé programar?

Para algo puntual, una extensión de navegador de point and click. Para algo recurrente, n8n o Make, que además dejan el resultado en tu Google Sheets automáticamente.

¿Cuál es la diferencia entre web scraping y una API?

La API es una puerta oficial que el sitio te da para pedir datos de forma estructurada. El scraping es leer la página como lo haría una persona. Si hay API, siempre usa la API.

¿Se puede scrapear LinkedIn o redes sociales?

Sus términos lo prohíben expresamente y además casi todo lo que hay ahí son datos personales. Es el caso donde más rápido te metes en problemas. No lo recomiendo.

Aprende datos en vivo, desde cero y con acompañamiento

Leer sobre datos no es lo mismo que saber trabajarlos. En los cursos de datos practicas Excel, SQL, Power BI y Python sobre casos reales, en vivo y con alguien que te corrige cuando te trabas. Sales usando, no tomando notas.

Ejecuta tu proyecto

Aterriza tu proyecto de IA con Gera

Si ya tienes claro lo que quieres implementar, agendemos directo y armemos el roadmap. 30 minutos sin compromiso.

Agenda tu reunion con Gera
web scraping

Comparte este artículo:

Sigue a Miss Yera:
WhatsApp directo
¿Tienes alguna duda o consulta?