Saltar al contenido
Logotipo de Trainontech Trainontech

Big Data e Ingeniería de Datos · BIG-113

Spark Structured Streaming

Procesar flujos continuos con ventanas temporales, marcas de agua y garantías de entrega comprobadas.

Próximamente Especialización 7 módulos · 30 clases

Formato asíncrono Desarrollo, Ingeniería / Industria Spark, Kafka

Lo que aprenderás

  • Construir consultas continuas sobre Kafka con la API de Structured Streaming.
  • Diferenciar tiempo de evento y tiempo de proceso y elegir el correcto para cada agregación.
  • Definir ventanas fijas, deslizantes y de sesión y controlar los datos que llegan tarde.
  • Aplicar marcas de agua para acotar el estado y evitar que crezca sin límite.
  • Configurar puntos de control y sumideros idempotentes para lograr entrega efectiva única.
  • Diagnosticar retraso del consumidor y latencia de lote con las métricas de la consulta.

Contenido del curso

7 módulos · 30 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Del lote al flujo 4 clases
  • La tabla infinita como modelo mental
  • Entorno con Kafka y Spark en contenedores
  • Primera consulta continua y modos de salida
  • Qué cambia respecto al procesamiento por lotes
Módulo 2 · Orígenes y destinos 4 clases
  • Leer de Kafka: desplazamientos y particiones
  • Deserialización y esquemas de mensaje
  • Escritura en fichero, en Kafka y en tabla
  • El sumidero foreachBatch y sus usos
Módulo 3 · Tiempo y ventanas 5 clases
  • Tiempo de evento frente a tiempo de proceso
  • Ventanas fijas y deslizantes
  • Ventanas de sesión
  • Datos que llegan tarde y desorden
  • Marcas de agua y descarte controlado
Módulo 4 · Estado y uniones 5 clases
  • Agregaciones con estado y su almacén
  • Deduplicación de eventos repetidos
  • Unión de flujo con tabla estática
  • Unión entre dos flujos con restricción temporal
  • Tamaño del estado y su vigilancia
Módulo 5 · Garantías y tolerancia a fallos 4 clases
  • Puntos de control y recuperación
  • Al menos una vez, como mucho una vez y efectivamente una vez
  • Sumideros idempotentes y escritura transaccional
  • Reinicio tras un cambio de código o de esquema
Módulo 6 · Operación 4 clases
  • Disparadores y microlotes
  • Métricas de la consulta y retraso del consumidor
  • Contrapresión y dimensionado
  • Errores frecuentes en producción
Módulo 7 · Caso práctico 4 clases
  • Flujo de eventos de operación con retrasos reales
  • Indicadores por ventana y alertas
  • Prueba de reinicio y verificación de cifras
  • Puesta en servicio documentada

Requisitos

  • Experiencia consolidada con Spark en procesamiento por lotes.
  • Conocimiento de Kafka: topics, particiones y grupos de consumidores.
  • Haber operado procesos de datos en producción y manejar Docker.

Descripción

Pasar de lotes a flujo continuo parece un cambio de API y en realidad es un cambio de modelo mental. Aparecen los eventos que llegan tarde, el estado que crece hasta reventar la memoria, los reinicios que duplican registros y las agregaciones por hora que dan cifras distintas según cuándo se pregunte. Sin marcas de agua y sin puntos de control nada de eso se controla.

El curso trabaja con Kafka como origen y varios sumideros, ejecutando consultas continuas que se paran, se reinician y se rompen a propósito. Se implementan ventanas de los tres tipos, se ajustan marcas de agua midiendo qué datos se descartan, y se comprueba de forma empírica qué garantía ofrece cada combinación de sumidero y punto de control.

El resultado es la capacidad de poner en servicio un proceso continuo y responder de sus cifras, incluso después de un incidente. Enlaza con las arquitecturas industriales en tiempo real, con las plataformas de eventos basadas en Kafka y con el diseño de sistemas donde conviven la vía por lotes y la vía continua.

¿Para quién es este curso?

  • Perfiles de ingeniería de datos que deben pasar procesos nocturnos a resultados casi inmediatos.
  • Personas desarrolladoras que consumen eventos de Kafka y necesitan agregaciones con estado fiables.
  • Equipos técnicos responsables de indicadores en tiempo real sobre los que se toman decisiones.
Próximamente

Curso en hoja de ruta. Se prioriza según la demanda recogida y los proyectos en cartera.

Código
BIG-113
Nivel
Especialización
Público
Desarrollo, Ingeniería / Industria
Entorno
Spark, Kafka

Este curso incluye

  • 30 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

Bajo demanda

BIG-111Big Data e Ingeniería de Datos

Spark avanzado: optimización y Delta Lake

Particionado, sesgo de datos, caché, plan de Catalyst y tablas transaccionales sobre el lago.

SparkDelta Lake

Especialización 29 clases

Próximamente

BIG-150Big Data e Ingeniería de Datos

Data Lakehouse: Iceberg, Delta y Hudi

Formatos de tabla abiertos, viaje en el tiempo y evolución de esquema sobre almacenamiento de objetos.

SparkDelta Lake

Especialización 32 clases