Saltar al contenido
Logotipo de Trainontech Trainontech

Lenguajes y Fundamentos de Programación · PY-130

Webscraping con Python

Extracción estructurada de información pública con Python: parseo, sesiones, límites técnicos y legales.

Disponible Intermedio 7 módulos · 34 clases

Formato asíncrono Desarrollo Python

Lo que aprenderás

  • Analizar la estructura de una página y localizar datos con selectores CSS y con BeautifulSoup
  • Recorrer listados paginados y seguir enlaces de detalle manteniendo una sesión
  • Extraer datos de páginas que cargan contenido por JavaScript usando un navegador automatizado
  • Respetar robots.txt, condiciones de uso y ritmo de peticiones para no degradar el servicio ajeno
  • Normalizar y validar lo extraído antes de guardarlo en CSV, JSON o base de datos
  • Detectar cambios en el HTML de origen y reparar un extractor roto con rapidez
  • Distinguir qué información pública se puede extraer y tratar y qué datos quedan fuera por normativa

Contenido del curso

7 módulos · 34 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Antes de extraer 5 clases
  • Cuándo hay API y no hace falta extraer
  • robots.txt, condiciones de uso y límites
  • Datos personales y qué no se puede tratar
  • Entorno de trabajo y biblioteca de apoyo
  • Análisis de la estructura de la página objetivo
Módulo 2 · Descarga de páginas 5 clases
  • Peticiones con requests y sesiones
  • Cabeceras, cookies y agente de usuario
  • Ritmo de peticiones y espera entre llamadas
  • Reintentos y tiempos límite
  • Caché local para no repetir descargas
Módulo 3 · Parseo del HTML 5 clases
  • BeautifulSoup: árbol y navegación
  • Selectores CSS estables frente a frágiles
  • Extraer texto, atributos y tablas
  • Campos ausentes y estructuras irregulares
  • Expresiones regulares como último recurso
Módulo 4 · Recorrer un sitio 5 clases
  • Listados paginados y fin de recorrido
  • Seguir enlaces de detalle
  • Formularios de búsqueda y parámetros
  • Autenticación en zonas con acceso
  • Control de lo ya visitado
Módulo 5 · Contenido dinámico 5 clases
  • Cuándo el HTML no trae los datos
  • Localizar la llamada interna que devuelve el JSON
  • Automatizar un navegador con Playwright
  • Esperas por elemento y no por tiempo fijo
  • Coste y alternativas del navegador automatizado
Módulo 6 · Salida y mantenimiento 5 clases
  • Normalización de textos, fechas y números
  • Validación de registros antes de guardar
  • Escritura a CSV, JSON o base de datos
  • Detección de cambios en el origen
  • Registro de errores y alertas de extractor roto
Módulo 7 · Proyecto de cierre 4 clases
  • Extractor completo de un listado público paginado
  • Recorrido, detalle y normalización
  • Ejecución periódica y control de novedades
  • Documentación del extractor y de sus límites

Requisitos

  • Programar en Python con funciones, diccionarios y excepciones
  • Conocer HTML a nivel de etiquetas, atributos y estructura del documento
  • Haber hecho peticiones HTTP desde Python resulta útil aunque se repasa en el curso

Descripción

Muchos datos públicos siguen sin API: licitaciones, listados de centros, catálogos, tablones de anuncios. Copiarlos a mano cada semana no es sostenible y produce errores. La extracción automatizada resuelve el problema, pero mal hecha satura el servidor ajeno, se rompe con cualquier cambio de maquetación y puede pisar límites legales.

El curso enseña a construir extractores que aguantan: análisis previo de la estructura, selectores estables, sesiones y paginación, control del ritmo de peticiones, reintentos y validación de lo extraído. Se trata también el caso de las páginas que montan el contenido con JavaScript, y se dedica un bloque a robots.txt, condiciones de uso y tratamiento de datos personales.

El resultado es un extractor documentado, con su salida normalizada, su control de ritmo y su mantenimiento previsto para cuando la web de origen cambie de maquetación. A partir de ahí se puede alimentar un proceso de análisis, un panel de seguimiento o un aviso automático que informe en cuanto aparezca una publicación nueva.

¿Para quién es este curso?

  • Desarrolladores que necesitan alimentar un proceso con datos publicados sin API
  • Perfiles técnicos que hacen seguimiento de publicaciones oficiales o de catálogos externos
  • Programadores que mantienen extractores heredados que se rompen con cada cambio del origen
Disponible

Contenido ya grabado y publicado en el campus. Puedes empezar en cuanto te inscribas.

Código
PY-130
Nivel
Intermedio
Público
Desarrollo
Entorno
Python

Este curso incluye

  • 34 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

PY-104Lenguajes y Fundamentos de Programación

Ficheros, excepciones y módulos

Lectura y escritura robusta, gestión de errores e importaciones para código que otros mantendrán.

Python

Intermedio 32 clases