BIG-111Big Data e Ingeniería de Datos
Spark avanzado: optimización y Delta Lake
Particionado, sesgo de datos, caché, plan de Catalyst y tablas transaccionales sobre el lago.
SparkDelta Lake
Big Data e Ingeniería de Datos · BIG-113
Procesar flujos continuos con ventanas temporales, marcas de agua y garantías de entrega comprobadas.
Formato asíncrono Desarrollo, Ingeniería / Industria Spark, Kafka
7 módulos · 30 clases en vídeo · práctica guiada en cada módulo
Pasar de lotes a flujo continuo parece un cambio de API y en realidad es un cambio de modelo mental. Aparecen los eventos que llegan tarde, el estado que crece hasta reventar la memoria, los reinicios que duplican registros y las agregaciones por hora que dan cifras distintas según cuándo se pregunte. Sin marcas de agua y sin puntos de control nada de eso se controla.
El curso trabaja con Kafka como origen y varios sumideros, ejecutando consultas continuas que se paran, se reinician y se rompen a propósito. Se implementan ventanas de los tres tipos, se ajustan marcas de agua midiendo qué datos se descartan, y se comprueba de forma empírica qué garantía ofrece cada combinación de sumidero y punto de control.
El resultado es la capacidad de poner en servicio un proceso continuo y responder de sus cifras, incluso después de un incidente. Enlaza con las arquitecturas industriales en tiempo real, con las plataformas de eventos basadas en Kafka y con el diseño de sistemas donde conviven la vía por lotes y la vía continua.
Curso en hoja de ruta. Se prioriza según la demanda recogida y los proyectos en cartera.
Sigue aprendiendo
BIG-111Big Data e Ingeniería de Datos
Particionado, sesgo de datos, caché, plan de Catalyst y tablas transaccionales sobre el lago.
SparkDelta Lake
BIG-121Big Data e Ingeniería de Datos
Conectores, procesamiento de flujos y las garantías reales que ofrece cada configuración.
Kafka
BIG-150Big Data e Ingeniería de Datos
Formatos de tabla abiertos, viaje en el tiempo y evolución de esquema sobre almacenamiento de objetos.
SparkDelta Lake