Saltar al contenido
Logotipo de Trainontech Trainontech

Big Data e Ingeniería de Datos · BIG-170

Ingeniería de datos de extremo a extremo

Diseñar ingesta, almacenamiento, transformación y consumo como un sistema con Airflow, Spark y dbt.

Bajo demanda Avanzado 8 módulos · 36 clases

Formato asíncrono Desarrollo, Ingeniería / Industria Airflow, Spark, dbt, Python

Lo que aprenderás

  • Diseñar la arquitectura por capas de una plataforma de datos separando materia prima, modelo y consumo.
  • Orquestar dependencias en Airflow con DAGs idempotentes, reejecución por intervalo y sensores.
  • Procesar cargas incrementales con Spark evitando reprocesar el histórico en cada ejecución.
  • Modelar la capa analítica con dbt usando modelos, pruebas, macros y documentación generada.
  • Instrumentar los procesos con métricas, alertas y trazas que permitan responder a un fallo nocturno.
  • Documentar acuerdos de servicio de los datos y el coste de cada proceso para la organización.

Contenido del curso

8 módulos · 36 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Arquitectura antes que código 4 clases
  • De scripts sueltos a un sistema de datos
  • Capas: aterrizaje, materia prima, modelo y consumo
  • Elegir entre proceso por lotes y continuo
  • Entorno de prácticas y caso del curso
Módulo 2 · Ingesta 5 clases
  • Fuentes: bases de datos, ficheros y APIs
  • Cargas completas frente a incrementales
  • Captura de cambios y marcas de agua
  • Reintentos, duplicados y entrega al menos una vez
  • Aterrizaje inmutable y trazabilidad del origen
Módulo 3 · Orquestación con Airflow 5 clases
  • DAGs, tareas y dependencias explícitas
  • Intervalos, ejecuciones y reejecución histórica
  • Idempotencia: la regla que lo sostiene todo
  • Sensores, ramificación y grupos de tareas
  • Conexiones, variables y secretos
Módulo 4 · Transformación con Spark 5 clases
  • Trabajos parametrizados por intervalo
  • Particionado de escritura y poda de lectura
  • Barajados costosos y cómo evitarlos
  • Escrituras idempotentes sobre tabla destino
  • Pruebas de un trabajo de Spark
Módulo 5 · Modelado con dbt 5 clases
  • Modelos, referencias y grafo de dependencias
  • Materializaciones: vista, tabla e incremental
  • Pruebas genéricas y propias
  • Macros y reutilización
  • Documentación y linaje generados
Módulo 6 · Consumo 4 clases
  • Tablas de hechos y dimensiones para informes
  • Servir datos a herramientas de visualización
  • Exposición mediante API o extracciones
  • Control de acceso por capa
Módulo 7 · Operación 4 clases
  • Métricas de proceso y de datos
  • Alertas útiles y ruido evitable
  • Coste por proceso y optimización
  • Acuerdos de servicio y expectativas del negocio
Módulo 8 · Proyecto integrador 4 clases
  • Diseño de la plataforma para el caso completo
  • Implementación de extremo a extremo
  • Ensayo de fallo y recuperación
  • Revisión de arquitectura y entrega

Requisitos

  • Python con soltura y SQL avanzado.
  • Experiencia previa con Spark o con procesamiento de datos a escala.
  • Manejo de Docker, Git y línea de comandos en Linux.

Descripción

En muchas organizaciones el flujo de datos es una colección de scripts programados con cron, sin dependencias explícitas, sin reejecución fiable y sin nadie que sepa qué se rompe si falla el primero. El coste no aparece en el presupuesto: aparece en informes que cuadran mal y en mañanas dedicadas a rehacer cargas.

Este curso construye una plataforma completa sobre un caso continuo. Se define la arquitectura por capas, se implementa la ingesta desde varias fuentes, se orquesta con Airflow cuidando la idempotencia y la reejecución, se transforma con Spark y se modela la capa analítica con dbt incluyendo pruebas y documentación. Se cierra con observabilidad y con el tratamiento de incidentes.

Al terminar se puede diseñar y defender la arquitectura de datos de una organización mediana, no solo escribir procesos sueltos. Continúa de forma natural en los cursos de calidad y gobierno del dato y de arquitecturas en tiempo real, que añaden contratos, linaje y latencia baja al mismo esquema.

¿Para quién es este curso?

  • Perfiles de desarrollo que han acabado manteniendo los procesos de datos de su empresa sin haberlos diseñado.
  • Ingeniería de datos que quiere pasar de scripts programados a una plataforma orquestada y observable.
  • Equipos técnicos que preparan la base analítica sobre la que se apoyarán informes y modelos.
Bajo demanda

Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.

Código
BIG-170
Nivel
Avanzado
Público
Desarrollo, Ingeniería / Industria
Entorno
Airflow, Spark, dbt, Python

Este curso incluye

  • 36 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

Bajo demanda

BIG-110Big Data e Ingeniería de Datos

Apache Spark con PySpark

DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.

SparkPythonJupyterLab

Avanzado 30 clases

Próximamente

BIG-112Big Data e Ingeniería de Datos

Spark con Scala en notebook

La API nativa de Spark con el kernel Almond, para equipos que necesitan el máximo rendimiento.

SparkScalaJupyterLab

Avanzado 25 clases

Bajo demanda

BIG-120Big Data e Ingeniería de Datos

Apache Kafka: fundamentos

Topics, particiones, grupos de consumidores y retención: el sistema nervioso de la arquitectura de datos.

KafkaDocker

Avanzado 28 clases