Saltar al contenido
Logotipo de Trainontech Trainontech

Big Data e Ingeniería de Datos · BIG-130

Apache Airflow: orquestación de pipelines

Orquestar procesos con DAGs de Airflow, con reintentos y alertas para cargas que no pueden fallar.

Bajo demanda Avanzado 7 módulos · 29 clases

Formato asíncrono Desarrollo, Ingeniería / Industria Airflow, Python, Docker

Lo que aprenderás

  • Definir DAGs con dependencias explícitas, planificación y ventanas de ejecución.
  • Elegir el operador adecuado y trasladar lógica pesada fuera del proceso planificador.
  • Configurar reintentos, tiempos de espera y acuerdos de nivel para detectar retrasos a tiempo.
  • Pasar información entre tareas y gestionar conexiones y variables sin exponer credenciales.
  • Ejecutar recuperaciones de periodos pasados y rellenar históricos sin duplicar datos.
  • Desplegar Airflow con Docker y separar entornos de desarrollo y de producción.

Contenido del curso

7 módulos · 29 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Orquestar en lugar de programar horas 4 clases
  • Del cron al grafo de dependencias
  • Arquitectura de Airflow: planificador, trabajadores y metadatos
  • Despliegue de prácticas con Docker
  • Primer DAG en funcionamiento
Módulo 2 · Construir DAGs 5 clases
  • Tareas, dependencias y orden de ejecución
  • Planificación, intervalo y fecha lógica
  • Parámetros, plantillas y contexto de ejecución
  • Grupos de tareas y organización del código
  • DAGs dinámicos con criterio
Módulo 3 · Operadores y conexiones 4 clases
  • Operadores de Bash, Python y contenedor
  • Conexiones, credenciales y variables
  • Sensores y espera de ficheros o de eventos
  • Intercambio de información entre tareas
Módulo 4 · Fiabilidad 4 clases
  • Reintentos, retardo y tiempos de espera
  • Idempotencia: repetir sin duplicar
  • Alertas por fallo y por retraso
  • Ejecuciones concurrentes y control de solapamiento
Módulo 5 · Recuperación y reproceso 4 clases
  • Relleno de periodos históricos
  • Volver a lanzar una parte del grafo
  • Limpiar estado de tareas y consecuencias
  • Cambios de DAG con ejecuciones en curso
Módulo 6 · Operación 4 clases
  • Ejecutores y dimensionado de trabajadores
  • Registros centralizados y búsqueda de errores
  • Pruebas del código de los DAGs
  • Despliegue y separación de entornos
Módulo 7 · Caso práctico 4 clases
  • Flujo nocturno de ingesta, transformación y publicación
  • Alertas y acuerdos de nivel por tarea
  • Simulacro de fallo y recuperación
  • Traspaso del flujo al equipo de operación

Requisitos

  • Programación en Python a nivel de módulos y paquetes.
  • Manejo de Docker y de línea de comandos.
  • Experiencia previa con procesos de datos programados, aunque sean scripts en cron.

Descripción

Los procesos nocturnos empiezan siendo tres scripts en cron y acaban siendo veinte, con dependencias implícitas que solo conoce una persona. Cuando uno falla a las tres de la madrugada nadie se entera hasta que el informe de la mañana sale vacío, y volver a lanzar solo la parte afectada es una operación manual y arriesgada.

El curso construye un flujo real en Airflow desplegado con Docker. Se modelan las dependencias como un grafo explícito, se configuran reintentos y avisos, se prueban fallos provocados y se practican recuperaciones de días concretos. También se trata lo que suele descuidarse: gestión de credenciales, idempotencia de las tareas y organización del código del proyecto.

Al terminar se dispone de una orquestación en la que el equipo confía y que otra persona puede operar sin explicaciones. Es la pieza que ordena los procesos de Spark, las transformaciones con dbt y las cargas hacia el almacén analítico, y el paso previo a diseñar una plataforma de datos completa.

¿Para quién es este curso?

  • Perfiles de ingeniería de datos que mantienen procesos programados que fallan en silencio.
  • Personas desarrolladoras que heredan una colección de scripts en cron sin documentar.
  • Equipos técnicos que necesitan que las cargas nocturnas sean operables por más de una persona.
Bajo demanda

Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.

Código
BIG-130
Nivel
Avanzado
Público
Desarrollo, Ingeniería / Industria
Entorno
Airflow, Python, Docker

Este curso incluye

  • 29 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

Bajo demanda

BIG-110Big Data e Ingeniería de Datos

Apache Spark con PySpark

DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.

SparkPythonJupyterLab

Avanzado 30 clases

Próximamente

BIG-112Big Data e Ingeniería de Datos

Spark con Scala en notebook

La API nativa de Spark con el kernel Almond, para equipos que necesitan el máximo rendimiento.

SparkScalaJupyterLab

Avanzado 25 clases

Bajo demanda

BIG-120Big Data e Ingeniería de Datos

Apache Kafka: fundamentos

Topics, particiones, grupos de consumidores y retención: el sistema nervioso de la arquitectura de datos.

KafkaDocker

Avanzado 28 clases