BIG-113Big Data e Ingeniería de Datos
Spark Structured Streaming
Procesamiento continuo con ventanas temporales, marcas de agua y garantías de entrega.
SparkKafka
Big Data e Ingeniería de Datos · BIG-111
Optimizar trabajos de Spark leyendo el plan de Catalyst y llevar el lago a tablas transaccionales.
Formato asíncrono Desarrollo, Ingeniería / Industria Spark, Delta Lake
7 módulos · 29 clases en vídeo · práctica guiada en cada módulo
Un trabajo de Spark que funciona en pruebas y se arrastra en producción suele tener siempre las mismas causas: una clave de unión que concentra la mitad de las filas, miles de ficheros diminutos, una caché que nadie retira y un plan que hace dos veces la misma lectura. Ninguna de esas cosas se ve sin abrir el plan y las métricas de etapa.
El curso trabaja sobre trabajos reales que van mal a propósito. Se localiza el cuello de botella con la interfaz de Spark, se corrige y se vuelve a medir. La segunda mitad lleva ese mismo rigor al almacenamiento: se sustituyen directorios de Parquet por tablas Delta Lake con registro de transacciones, cargas incrementales con MERGE y mantenimiento de ficheros.
Lo que se obtiene es un método reproducible de diagnóstico y una base de almacenamiento sobre la que se puede reprocesar y auditar sin miedo. Enlaza con el procesamiento continuo, con las arquitecturas de lakehouse basadas en formatos de tabla abiertos y con el diseño de plataformas de datos completas.
Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.
Sigue aprendiendo
BIG-113Big Data e Ingeniería de Datos
Procesamiento continuo con ventanas temporales, marcas de agua y garantías de entrega.
SparkKafka
BIG-121Big Data e Ingeniería de Datos
Conectores, procesamiento de flujos y las garantías reales que ofrece cada configuración.
Kafka
BIG-150Big Data e Ingeniería de Datos
Formatos de tabla abiertos, viaje en el tiempo y evolución de esquema sobre almacenamiento de objetos.
SparkDelta Lake