BIG-110Big Data e Ingeniería de Datos
Apache Spark con PySpark
DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.
SparkPythonJupyterLab
Big Data e Ingeniería de Datos · BIG-131
Transformar datos con modelos SQL versionados, probados y documentados, con el linaje siempre visible.
Formato asíncrono Desarrollo, Ingeniería / Industria, Empresa / PYME dbt, SQL
7 módulos · 28 clases en vídeo · práctica guiada en cada módulo
La capa de transformación de muchas organizaciones vive en vistas creadas a mano, consultas guardadas en el gestor gráfico y algún procedimiento que nadie se atreve a tocar. Nadie sabe qué informe depende de qué tabla, ningún cambio se puede revisar antes de aplicarse y los errores de dato se descubren cuando alguien de negocio los nota.
El curso reconstruye esa capa como código. Se organiza un proyecto dbt por capas, se escriben modelos con referencias explícitas que generan el linaje, se añaden pruebas que fallan cuando el dato deja de cumplir lo pactado y se pasan las tablas grandes a carga incremental. Todo con Git, revisión de cambios y separación entre desarrollo y producción.
Lo que queda es una capa analítica en la que se puede confiar y sobre la que trabaja un equipo, no una persona, con documentación que se genera del propio proyecto. Encaja directamente con la orquestación de las ejecuciones, con el modelado dimensional del almacén y con las prácticas de calidad y gobierno del dato.
Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.
Sigue aprendiendo
BIG-110Big Data e Ingeniería de Datos
DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.
SparkPythonJupyterLab
BIG-112Big Data e Ingeniería de Datos
La API nativa de Spark con el kernel Almond, para equipos que necesitan el máximo rendimiento.
SparkScalaJupyterLab
BIG-120Big Data e Ingeniería de Datos
Topics, particiones, grupos de consumidores y retención: el sistema nervioso de la arquitectura de datos.
KafkaDocker