Saltar al contenido
Logotipo de Trainontech Trainontech

Big Data e Ingeniería de Datos · BIG-171

Calidad y gobierno del dato

Contratos de datos, validación automática, linaje y catálogo para que alguien responda del dato.

Bajo demanda Avanzado 7 módulos · 32 clases

Formato asíncrono Ingeniería / Industria, Empresa / PYME, Administración pública dbt, Python

Lo que aprenderás

  • Definir contratos de datos con esquema, semántica, frecuencia y responsable identificado.
  • Implantar pruebas de datos en dbt y validaciones con Great Expectations dentro del flujo de carga.
  • Detectar deriva de esquema y de distribución antes de que llegue al informe de dirección.
  • Construir el linaje de un indicador desde su origen hasta el panel donde se consume.
  • Publicar un catálogo con definiciones de negocio, propietario y nivel de servicio de cada conjunto.
  • Estimar el coste de un dato erróneo y priorizar controles según el impacto en el proceso afectado.

Contenido del curso

7 módulos · 32 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · El problema de la confianza 4 clases
  • Por qué dos informes dan cifras distintas
  • Calidad, gobierno y responsabilidad: qué es cada cosa
  • Dimensiones de calidad del dato
  • Flujo de partida del curso
Módulo 2 · Contratos de datos 5 clases
  • Qué contiene un contrato y qué no
  • Esquema, tipos y valores admitidos
  • Semántica, frecuencia y puntualidad
  • Productor y consumidor: obligaciones de cada parte
  • Versionado y cambios que rompen
Módulo 3 · Validación automática 5 clases
  • Pruebas genéricas y propias en dbt
  • Great Expectations: conjuntos de expectativas
  • Validar en ingesta, en transformación y en salida
  • Detener la carga o marcar y continuar
  • Informes de validación consultables
Módulo 4 · Observabilidad del dato 5 clases
  • Volumen, frescura y nulos como señales
  • Deriva de esquema y de distribución
  • Anomalías en series de indicadores
  • Alertas dirigidas a quien puede actuar
  • Incidentes de datos y su registro
Módulo 5 · Linaje 4 clases
  • Linaje a nivel de tabla y de columna
  • Generarlo desde dbt y desde el orquestador
  • Análisis de impacto antes de un cambio
  • Rastrear una cifra hasta su origen
Módulo 6 · Catálogo y responsabilidad 5 clases
  • Glosario de negocio y definiciones únicas
  • Propietario, custodio y consumidor
  • Niveles de servicio y clasificación por criticidad
  • Datos personales y su tratamiento en el catálogo
  • Adopción real del catálogo por el equipo
Módulo 7 · Implantación 4 clases
  • Priorizar controles por impacto y coste
  • Plan de despliegue por conjuntos críticos
  • Métricas de calidad que se presentan a dirección
  • Caso final: indicador con contrato, controles y linaje completos

Requisitos

  • SQL avanzado y experiencia con procesos de transformación de datos.
  • Manejo de Python y de dbt a nivel de crear y ejecutar modelos.
  • Conviene haber trabajado en un entorno con informes que consume otra área.

Descripción

El indicador del comité no cuadra con el del área y nadie sabe cuál está mal ni desde cuándo. Se abre una investigación manual que consume días y termina con un ajuste sin causa raíz identificada. El problema rara vez es técnico: es que nadie responde del dato y no hay controles que avisen antes que el receptor.

El curso implanta esas piezas sobre un flujo existente. Se redactan contratos de datos con esquema y semántica explícitos, se añaden pruebas en dbt y validaciones con Great Expectations que detienen la carga cuando procede, se instrumenta la detección de deriva, se reconstruye el linaje de los indicadores y se publica un catálogo con propietario y nivel de servicio.

El resultado es un flujo donde los fallos se detectan en origen, cada conjunto tiene responsable y cualquiera puede rastrear de dónde sale una cifra. Para una empresa o una administración esto reduce el trabajo de conciliación y sostiene las obligaciones de trazabilidad; encaja después del curso de ingeniería de datos de extremo a extremo.

¿Para quién es este curso?

  • Ingeniería de datos responsable de flujos cuyos resultados consumen otras áreas de la organización.
  • Responsables de datos en una PYME que necesitan reducir el tiempo dedicado a conciliar cifras.
  • Personal técnico de administraciones públicas con obligaciones de trazabilidad sobre la información que publican.
Bajo demanda

Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.

Código
BIG-171
Nivel
Avanzado
Público
Ingeniería / Industria, Empresa / PYME, Administración pública
Entorno
dbt, Python

Este curso incluye

  • 32 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

Bajo demanda

BIG-110Big Data e Ingeniería de Datos

Apache Spark con PySpark

DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.

SparkPythonJupyterLab

Avanzado 30 clases

Próximamente

BIG-112Big Data e Ingeniería de Datos

Spark con Scala en notebook

La API nativa de Spark con el kernel Almond, para equipos que necesitan el máximo rendimiento.

SparkScalaJupyterLab

Avanzado 25 clases

Bajo demanda

BIG-120Big Data e Ingeniería de Datos

Apache Kafka: fundamentos

Topics, particiones, grupos de consumidores y retención: el sistema nervioso de la arquitectura de datos.

KafkaDocker

Avanzado 28 clases