Diseñar la arquitectura por capas de una plataforma de datos separando materia prima, modelo y consumo.
Orquestar dependencias en Airflow con DAGs idempotentes, reejecución por intervalo y sensores.
Procesar cargas incrementales con Spark evitando reprocesar el histórico en cada ejecución.
Modelar la capa analítica con dbt usando modelos, pruebas, macros y documentación generada.
Instrumentar los procesos con métricas, alertas y trazas que permitan responder a un fallo nocturno.
Documentar acuerdos de servicio de los datos y el coste de cada proceso para la organización.
Contenido del curso
8 módulos · 36 clases en vídeo · práctica guiada en cada módulo
Módulo 1 · Arquitectura antes que código4 clases
De scripts sueltos a un sistema de datos
Capas: aterrizaje, materia prima, modelo y consumo
Elegir entre proceso por lotes y continuo
Entorno de prácticas y caso del curso
Módulo 2 · Ingesta5 clases
Fuentes: bases de datos, ficheros y APIs
Cargas completas frente a incrementales
Captura de cambios y marcas de agua
Reintentos, duplicados y entrega al menos una vez
Aterrizaje inmutable y trazabilidad del origen
Módulo 3 · Orquestación con Airflow5 clases
DAGs, tareas y dependencias explícitas
Intervalos, ejecuciones y reejecución histórica
Idempotencia: la regla que lo sostiene todo
Sensores, ramificación y grupos de tareas
Conexiones, variables y secretos
Módulo 4 · Transformación con Spark5 clases
Trabajos parametrizados por intervalo
Particionado de escritura y poda de lectura
Barajados costosos y cómo evitarlos
Escrituras idempotentes sobre tabla destino
Pruebas de un trabajo de Spark
Módulo 5 · Modelado con dbt5 clases
Modelos, referencias y grafo de dependencias
Materializaciones: vista, tabla e incremental
Pruebas genéricas y propias
Macros y reutilización
Documentación y linaje generados
Módulo 6 · Consumo4 clases
Tablas de hechos y dimensiones para informes
Servir datos a herramientas de visualización
Exposición mediante API o extracciones
Control de acceso por capa
Módulo 7 · Operación4 clases
Métricas de proceso y de datos
Alertas útiles y ruido evitable
Coste por proceso y optimización
Acuerdos de servicio y expectativas del negocio
Módulo 8 · Proyecto integrador4 clases
Diseño de la plataforma para el caso completo
Implementación de extremo a extremo
Ensayo de fallo y recuperación
Revisión de arquitectura y entrega
Requisitos
Python con soltura y SQL avanzado.
Experiencia previa con Spark o con procesamiento de datos a escala.
Manejo de Docker, Git y línea de comandos en Linux.
Descripción
En muchas organizaciones el flujo de datos es una colección de scripts programados con cron, sin dependencias explícitas, sin reejecución fiable y sin nadie que sepa qué se rompe si falla el primero. El coste no aparece en el presupuesto: aparece en informes que cuadran mal y en mañanas dedicadas a rehacer cargas.
Este curso construye una plataforma completa sobre un caso continuo. Se define la arquitectura por capas, se implementa la ingesta desde varias fuentes, se orquesta con Airflow cuidando la idempotencia y la reejecución, se transforma con Spark y se modela la capa analítica con dbt incluyendo pruebas y documentación. Se cierra con observabilidad y con el tratamiento de incidentes.
Al terminar se puede diseñar y defender la arquitectura de datos de una organización mediana, no solo escribir procesos sueltos. Continúa de forma natural en los cursos de calidad y gobierno del dato y de arquitecturas en tiempo real, que añaden contratos, linaje y latencia baja al mismo esquema.
¿Para quién es este curso?
Perfiles de desarrollo que han acabado manteniendo los procesos de datos de su empresa sin haberlos diseñado.
Ingeniería de datos que quiere pasar de scripts programados a una plataforma orquestada y observable.
Equipos técnicos que preparan la base analítica sobre la que se apoyarán informes y modelos.
Bajo demanda
Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.
Este sitio web utiliza cookies propias y de terceros para recopilar información con finalidad técnica. No se recaban ni ceden datos de carácter personal sin tu consentimiento. Más información en la política de cookies.