BIG-110Big Data e Ingeniería de Datos
Apache Spark con PySpark
DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.
SparkPythonJupyterLab
7 módulos · 29 clases en vídeo · práctica guiada en cada módulo
Los procesos nocturnos empiezan siendo tres scripts en cron y acaban siendo veinte, con dependencias implícitas que solo conoce una persona. Cuando uno falla a las tres de la madrugada nadie se entera hasta que el informe de la mañana sale vacío, y volver a lanzar solo la parte afectada es una operación manual y arriesgada.
El curso construye un flujo real en Airflow desplegado con Docker. Se modelan las dependencias como un grafo explícito, se configuran reintentos y avisos, se prueban fallos provocados y se practican recuperaciones de días concretos. También se trata lo que suele descuidarse: gestión de credenciales, idempotencia de las tareas y organización del código del proyecto.
Al terminar se dispone de una orquestación en la que el equipo confía y que otra persona puede operar sin explicaciones. Es la pieza que ordena los procesos de Spark, las transformaciones con dbt y las cargas hacia el almacén analítico, y el paso previo a diseñar una plataforma de datos completa.
Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.
Sigue aprendiendo
BIG-110Big Data e Ingeniería de Datos
DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.
SparkPythonJupyterLab
BIG-112Big Data e Ingeniería de Datos
La API nativa de Spark con el kernel Almond, para equipos que necesitan el máximo rendimiento.
SparkScalaJupyterLab
BIG-120Big Data e Ingeniería de Datos
Topics, particiones, grupos de consumidores y retención: el sistema nervioso de la arquitectura de datos.
KafkaDocker