Saltar al contenido
Logotipo de Trainontech Trainontech

Lenguajes y Fundamentos de Programación · PY-131

Webscraping con agentes de IA en local

Agentes que navegan, interpretan páginas y extraen datos con modelos servidos en local mediante Ollama.

Disponible Avanzado 7 módulos · 34 clases

Formato asíncrono Desarrollo Python, Ollama

Lo que aprenderás

  • Montar un agente que decide qué navegar y qué extraer combinando Python con un modelo servido por Ollama
  • Servir modelos en local con Ollama y ajustar contexto, temperatura y formato de salida
  • Reducir el HTML a un contexto útil antes de enviarlo al modelo para no desbordar la ventana
  • Obligar al modelo a devolver JSON conforme a un esquema y validar la respuesta antes de usarla
  • Combinar extracción determinista por selectores con interpretación por modelo solo donde aporta
  • Controlar el bucle del agente con límite de pasos, coste y criterio de parada
  • Evaluar el extractor con un conjunto de páginas etiquetadas y medir aciertos y alucinaciones

Contenido del curso

7 módulos · 34 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Punto de partida 5 clases
  • Límites del extractor por selectores
  • Qué aporta y qué no aporta un modelo de lenguaje
  • Instalación de Ollama y primer modelo local
  • Requisitos de hardware y elección de modelo
  • Arquitectura del agente que se construye
Módulo 2 · Modelos en local con Ollama 5 clases
  • Servir un modelo y consultarlo desde Python
  • Ventana de contexto y coste por petición
  • Temperatura, semilla y reproducibilidad
  • Modelos pequeños frente a modelos grandes en esta tarea
  • Medición de latencia y rendimiento
Módulo 3 · Preparar el contexto 5 clases
  • Limpieza del HTML y eliminación de ruido
  • Reducción a bloques relevantes
  • Conversión a texto estructurado o a Markdown
  • Fragmentación cuando la página no cabe
  • Coste de contexto y cómo bajarlo
Módulo 4 · Salida estructurada 5 clases
  • Definir el esquema de los datos esperados
  • Prompt que fuerza JSON válido
  • Validación con Pydantic y reintento guiado
  • Campos no encontrados frente a campos inventados
  • Comparación con extracción por selectores
Módulo 5 · El bucle del agente 5 clases
  • Herramientas disponibles para el agente
  • Navegación decidida por el modelo
  • Límite de pasos y criterio de parada
  • Memoria del recorrido y evitación de bucles
  • Registro completo de decisiones
Módulo 6 · Evaluación y fiabilidad 5 clases
  • Conjunto de páginas etiquetadas para evaluar
  • Métricas de acierto por campo
  • Detección de alucinaciones en la extracción
  • Estrategia mixta: reglas primero, modelo después
  • Coste computacional frente a mejora obtenida
Módulo 7 · Proyecto de cierre 4 clases
  • Agente que extrae la misma ficha de varios sitios distintos
  • Ajuste del esquema y del prompt
  • Evaluación sobre el conjunto de prueba
  • Puesta en ejecución periódica y supervisión

Requisitos

  • Experiencia previa de extracción web con Python, HTML y selectores
  • Manejar Python con clases, excepciones y llamadas HTTP
  • Equipo con memoria suficiente para ejecutar un modelo local con Ollama, o servidor propio disponible

Descripción

Un extractor por selectores se rompe con cada rediseño y no sirve cuando hay que recorrer cien sitios distintos con la misma información colocada de forma diferente. Los modelos de lenguaje pueden interpretar esa variedad, pero enviar páginas enteras a un servicio en la nube es caro, lento y a menudo inaceptable cuando el contenido no puede salir de la organización.

El curso construye agentes que ejecutan modelos en local con Ollama. Se trabaja la reducción del HTML a contexto útil, la salida estructurada validada contra un esquema, la combinación de reglas deterministas con interpretación del modelo, y el control del bucle del agente para que no se pierda ni se dispare. La evaluación con páginas etiquetadas cierra cada iteración.

Al terminar se dispone de un extractor que tolera variaciones de maquetación sin depender de servicios externos ni exponer los datos fuera de la organización. Encaja con proyectos de vigilancia de información, con integraciones internas entre sistemas y con cualquier caso donde la privacidad, la conectividad o el coste por petición descarten trabajar contra la nube.

¿Para quién es este curso?

  • Desarrolladores que mantienen extractores frágiles sobre muchos orígenes con estructuras distintas
  • Perfiles técnicos que no pueden enviar el contenido extraído a servicios en la nube
  • Programadores que quieren aplicar modelos locales a una tarea concreta y medible
Disponible

Contenido ya grabado y publicado en el campus. Puedes empezar en cuanto te inscribas.

Código
PY-131
Nivel
Avanzado
Público
Desarrollo
Entorno
Python, Ollama

Este curso incluye

  • 34 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

PY-106Lenguajes y Fundamentos de Programación

Concurrencia: multihilo y multiproceso

Paralelizar adquisición de datos y tareas de E/S sin introducir errores difíciles de reproducir.

Python

Avanzado 33 clases

PY-107Lenguajes y Fundamentos de Programación

Testing y TDD en Python

Pruebas unitarias, fixtures y desarrollo dirigido por pruebas en proyectos técnicos reales.

Python

Avanzado 34 clases

Bajo demanda

PY-141Lenguajes y Fundamentos de Programación

JupyterLab colaborativo para equipos y aulas

JupyterHub multiusuario: cuentas, cuotas y cuadernos compartidos para prácticas simultáneas.

JupyterLabDocker

Avanzado 39 clases