Saltar al contenido
Logotipo de Trainontech Trainontech

Big Data e Ingeniería de Datos · BIG-121

Kafka avanzado: Connect, Streams y exactly-once

Integrar sistemas con Kafka Connect, procesar flujos con Streams y comprobar las garantías reales.

Próximamente Especialización 7 módulos · 30 clases

Formato asíncrono Desarrollo, Ingeniería / Industria Kafka

Lo que aprenderás

  • Desplegar conectores de origen y destino con Kafka Connect en modo distribuido.
  • Configurar captura de cambios desde una base de datos y controlar el arranque inicial.
  • Aplicar transformaciones de mensaje individuales y decidir qué no debe hacerse en el conector.
  • Construir topologías con Kafka Streams usando estado local, tablas y uniones.
  • Configurar el procesamiento transaccional y verificar de forma empírica la entrega efectiva única.
  • Recuperar un conector o una aplicación de flujos tras un fallo sin duplicar ni perder registros.

Contenido del curso

7 módulos · 30 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Más allá del productor y el consumidor 4 clases
  • Repaso de garantías y desplazamientos
  • Qué resuelve Connect y qué resuelve Streams
  • Entorno de prácticas completo
  • Criterios para repartir responsabilidades
Módulo 2 · Kafka Connect 5 clases
  • Modo autónomo y modo distribuido
  • Conectores de origen y de destino
  • Convertidores y esquemas
  • Transformaciones de mensaje individuales
  • Reinicio, tolerancia a fallos y estado del conector
Módulo 3 · Captura de cambios 4 clases
  • Captura desde el registro de la base de datos
  • Instantánea inicial y paso a flujo continuo
  • Cambios de esquema en el origen
  • Borrados, claves y compactación
Módulo 4 · Kafka Streams 5 clases
  • Topología, nodos y paralelismo
  • KStream y KTable: flujo y estado
  • Agregaciones con almacén de estado
  • Uniones entre flujos y tablas
  • Ventanas y datos que llegan tarde
Módulo 5 · Entrega efectiva única 4 clases
  • Productor transaccional y consumo aislado
  • Configuración de procesamiento exactamente una vez
  • Escritura en sistemas externos e idempotencia
  • Experimento de fallo y recuento de resultados
Módulo 6 · Operación y evolución 4 clases
  • Escalado de instancias y reparticionado
  • Actualizar una topología sin perder estado
  • Vigilancia de conectores y de aplicaciones de flujo
  • Costes de almacenamiento y de reproceso
Módulo 7 · Caso práctico 4 clases
  • Integración de una base de datos heredada con captura de cambios
  • Enriquecimiento del flujo con Kafka Streams
  • Entrega a un destino analítico
  • Prueba de fallo y verificación de cifras

Requisitos

  • Conocimiento sólido de Kafka: particiones, grupos de consumidores y retención.
  • Experiencia desarrollando servicios y operando despliegues.
  • Manejo de Docker y de configuración de sistemas distribuidos.

Descripción

El clúster funciona, los topics están definidos y entonces empiezan las preguntas difíciles: cómo entra el dato de la base de datos heredada sin escribir un productor a mano, dónde se hace la agregación que necesitan tres consumidores distintos y qué significa exactamente que el sistema entrega una sola vez cuando el proceso se reinicia a media escritura.

El curso aborda esas tres cuestiones con montajes reales. Se despliega Kafka Connect con conectores de origen y destino, incluida captura de cambios; se construyen topologías de Kafka Streams con estado, tablas y uniones; y se comprueban las garantías provocando fallos en distintos puntos y contando los registros que salen al otro lado.

Al terminar se puede decidir qué parte de un flujo corresponde a un conector, cuál a una aplicación de flujos y cuál a un proceso por lotes, con una idea precisa de lo que cada configuración garantiza. Conecta con el procesamiento continuo sobre Spark, con la orquestación de flujos completos y con el diseño de plataformas de datos en tiempo real.

¿Para quién es este curso?

  • Perfiles de ingeniería de datos que integran sistemas heredados en una plataforma de eventos.
  • Personas desarrolladoras responsables de aplicaciones de flujo en producción.
  • Equipos de arquitectura que deben justificar las garantías de entrega de su plataforma.
Próximamente

Curso en hoja de ruta. Se prioriza según la demanda recogida y los proyectos en cartera.

Código
BIG-121
Nivel
Especialización
Público
Desarrollo, Ingeniería / Industria
Entorno
Kafka

Este curso incluye

  • 30 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

Bajo demanda

BIG-111Big Data e Ingeniería de Datos

Spark avanzado: optimización y Delta Lake

Particionado, sesgo de datos, caché, plan de Catalyst y tablas transaccionales sobre el lago.

SparkDelta Lake

Especialización 29 clases

Próximamente

BIG-113Big Data e Ingeniería de Datos

Spark Structured Streaming

Procesamiento continuo con ventanas temporales, marcas de agua y garantías de entrega.

SparkKafka

Especialización 30 clases

Próximamente

BIG-150Big Data e Ingeniería de Datos

Data Lakehouse: Iceberg, Delta y Hudi

Formatos de tabla abiertos, viaje en el tiempo y evolución de esquema sobre almacenamiento de objetos.

SparkDelta Lake

Especialización 32 clases