Saltar al contenido
Logotipo de Trainontech Trainontech

Datos, Visualización y Observabilidad · DAT-109

Calidad del dato y procesos ETL ligeros

Validar, deduplicar y cargar por incrementos para que el panel de arriba no muestre datos falsos.

Próximamente Avanzado 7 módulos · 28 clases

Formato asíncrono Desarrollo, Ingeniería / Industria Python, n8n

Lo que aprenderás

  • Definir reglas de calidad por columna: tipo, rango, obligatoriedad, unicidad y formato.
  • Implementar validaciones en Python con pandas y detener la carga cuando falla una regla crítica.
  • Deduplicar registros con claves naturales y criterios de supervivencia documentados.
  • Diseñar cargas incrementales con marca temporal o secuencia, y controlar los reprocesos.
  • Orquestar en n8n la extracción, la validación y la carga con reintentos y avisos.
  • Instrumentar el proceso con métricas de filas leídas, rechazadas y cargadas por ejecución.
  • Reconstruir un histórico tras un fallo sin duplicar registros ni perder los del intervalo.

Contenido del curso

7 módulos · 28 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Presentación y entorno 4 clases
  • Dónde se rompe realmente un cuadro de mando
  • Entorno de trabajo: Python, base de datos y n8n
  • Conjuntos de datos sucios que se usarán en el curso
  • Criterios de aceptación de una carga
Módulo 2 · Perfilado y reglas de calidad 4 clases
  • Perfilar un conjunto nuevo antes de tocarlo
  • Completitud, validez, unicidad y consistencia
  • Escribir reglas por columna y por registro
  • Reglas críticas frente a avisos
Módulo 3 · Validación en Python 4 clases
  • Lectura robusta de CSV, Excel y JSON
  • Comprobaciones con pandas y tipos declarados
  • Cuarentena de registros rechazados
  • Informe de calidad por ejecución
Módulo 4 · Normalización y deduplicación 4 clases
  • Normalizar textos, fechas, unidades e identificadores
  • Claves naturales y claves sustitutas
  • Coincidencia aproximada y sus riesgos
  • Criterio de supervivencia del registro ganador
Módulo 5 · Cargas incrementales 4 clases
  • Marca temporal, secuencia y captura de cambios
  • Idempotencia: ejecutar dos veces sin duplicar
  • Inserción y actualización combinadas
  • Reproceso controlado de un intervalo concreto
Módulo 6 · Orquestación con n8n 4 clases
  • Disparadores por horario, por webhook y por fichero nuevo
  • Reintentos, esperas y control de errores
  • Avisos cuando se incumple una regla crítica
  • Credenciales y variables por entorno
Módulo 7 · Caso práctico: canalización completa 4 clases
  • Diseño del flujo de extremo a extremo
  • Métricas y trazas de cada ejecución
  • Simulacro de fallo y reconstrucción del histórico
  • Entrega: canalización documentada y reproducible

Requisitos

  • Programación en Python a nivel práctico: funciones, lectura de ficheros y uso de pandas.
  • Conocimiento básico de SQL y de alguna base de datos relacional.
  • Haber trabajado antes con paneles o informes alimentados por datos de otros sistemas.

Descripción

Un cuadro de mando deja de servir en cuanto alguien encuentra una cifra que no cuadra. Casi siempre el fallo no está en la visualización sino aguas arriba: un fichero con el separador cambiado, un identificador repetido, una carga que se ejecutó dos veces por un reintento. Este curso trabaja esa capa intermedia, la que nadie mira hasta el día en que falla y hay que explicarlo.

Se construye una canalización completa sobre conjuntos de datos deliberadamente sucios: extracción desde ficheros y desde API, validación por reglas explícitas, cuarentena de lo que no pasa, normalización, deduplicación y carga incremental en base de datos. La transformación se escribe en Python y la orquestación, los reintentos y los avisos se montan en n8n, para separar la lógica de la planificación.

El resultado es una canalización que se puede volver a ejecutar sin miedo, con trazas de cada pasada y un informe de calidad que acompaña a los datos entregados. Desde ahí se conecta con la monitorización de la infraestructura, con el modelado analítico y con la publicación de indicadores que otros equipos consumen a diario.

¿Para quién es este curso?

  • Perfiles de desarrollo que mantienen integraciones entre aplicaciones internas.
  • Ingeniería de datos en industria que consolida lecturas de planta y sistemas de gestión.
  • Analistas técnicos responsables de que los indicadores publicados sean defendibles.
Próximamente

Curso en hoja de ruta. Se prioriza según la demanda recogida y los proyectos en cartera.

Código
DAT-109
Nivel
Avanzado
Público
Desarrollo, Ingeniería / Industria
Entorno
Python, n8n

Este curso incluye

  • 28 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

Próximamente

DAT-104Datos, Visualización y Observabilidad

Grafana para indicadores de gestión

Paneles de KPI y transparencia para dirección y ciudadanía.

Grafana

Intermedio 24 clases