Montar un agente que decide qué navegar y qué extraer combinando Python con un modelo servido por Ollama
Servir modelos en local con Ollama y ajustar contexto, temperatura y formato de salida
Reducir el HTML a un contexto útil antes de enviarlo al modelo para no desbordar la ventana
Obligar al modelo a devolver JSON conforme a un esquema y validar la respuesta antes de usarla
Combinar extracción determinista por selectores con interpretación por modelo solo donde aporta
Controlar el bucle del agente con límite de pasos, coste y criterio de parada
Evaluar el extractor con un conjunto de páginas etiquetadas y medir aciertos y alucinaciones
Contenido del curso
7 módulos · 34 clases en vídeo · práctica guiada en cada módulo
Módulo 1 · Punto de partida5 clases
Límites del extractor por selectores
Qué aporta y qué no aporta un modelo de lenguaje
Instalación de Ollama y primer modelo local
Requisitos de hardware y elección de modelo
Arquitectura del agente que se construye
Módulo 2 · Modelos en local con Ollama5 clases
Servir un modelo y consultarlo desde Python
Ventana de contexto y coste por petición
Temperatura, semilla y reproducibilidad
Modelos pequeños frente a modelos grandes en esta tarea
Medición de latencia y rendimiento
Módulo 3 · Preparar el contexto5 clases
Limpieza del HTML y eliminación de ruido
Reducción a bloques relevantes
Conversión a texto estructurado o a Markdown
Fragmentación cuando la página no cabe
Coste de contexto y cómo bajarlo
Módulo 4 · Salida estructurada5 clases
Definir el esquema de los datos esperados
Prompt que fuerza JSON válido
Validación con Pydantic y reintento guiado
Campos no encontrados frente a campos inventados
Comparación con extracción por selectores
Módulo 5 · El bucle del agente5 clases
Herramientas disponibles para el agente
Navegación decidida por el modelo
Límite de pasos y criterio de parada
Memoria del recorrido y evitación de bucles
Registro completo de decisiones
Módulo 6 · Evaluación y fiabilidad5 clases
Conjunto de páginas etiquetadas para evaluar
Métricas de acierto por campo
Detección de alucinaciones en la extracción
Estrategia mixta: reglas primero, modelo después
Coste computacional frente a mejora obtenida
Módulo 7 · Proyecto de cierre4 clases
Agente que extrae la misma ficha de varios sitios distintos
Ajuste del esquema y del prompt
Evaluación sobre el conjunto de prueba
Puesta en ejecución periódica y supervisión
Requisitos
Experiencia previa de extracción web con Python, HTML y selectores
Manejar Python con clases, excepciones y llamadas HTTP
Equipo con memoria suficiente para ejecutar un modelo local con Ollama, o servidor propio disponible
Descripción
Un extractor por selectores se rompe con cada rediseño y no sirve cuando hay que recorrer cien sitios distintos con la misma información colocada de forma diferente. Los modelos de lenguaje pueden interpretar esa variedad, pero enviar páginas enteras a un servicio en la nube es caro, lento y a menudo inaceptable cuando el contenido no puede salir de la organización.
El curso construye agentes que ejecutan modelos en local con Ollama. Se trabaja la reducción del HTML a contexto útil, la salida estructurada validada contra un esquema, la combinación de reglas deterministas con interpretación del modelo, y el control del bucle del agente para que no se pierda ni se dispare. La evaluación con páginas etiquetadas cierra cada iteración.
Al terminar se dispone de un extractor que tolera variaciones de maquetación sin depender de servicios externos ni exponer los datos fuera de la organización. Encaja con proyectos de vigilancia de información, con integraciones internas entre sistemas y con cualquier caso donde la privacidad, la conectividad o el coste por petición descarten trabajar contra la nube.
¿Para quién es este curso?
Desarrolladores que mantienen extractores frágiles sobre muchos orígenes con estructuras distintas
Perfiles técnicos que no pueden enviar el contenido extraído a servicios en la nube
Programadores que quieren aplicar modelos locales a una tarea concreta y medible
Disponible
Contenido ya grabado y publicado en el campus. Puedes empezar en cuanto te inscribas.
Este sitio web utiliza cookies propias y de terceros para recopilar información con finalidad técnica. No se recaban ni ceden datos de carácter personal sin tu consentimiento. Más información en la política de cookies.