Saltar al contenido
Logotipo de Trainontech Trainontech

Big Data e Ingeniería de Datos · BIG-150

Data Lakehouse: Iceberg, Delta y Hudi

Tablas Iceberg, Delta y Hudi sobre almacenamiento de objetos con viaje en el tiempo y evolución de esquema.

Próximamente Especialización 7 módulos · 32 clases

Formato asíncrono Desarrollo, Ingeniería / Industria Spark, Delta Lake

Lo que aprenderás

  • Explicar la capa de metadatos de Iceberg, Delta Lake y Hudi y qué garantiza cada una.
  • Ejecutar operaciones ACID de merge, update y delete sobre tablas en almacenamiento de objetos con Spark.
  • Consultar versiones anteriores por instantánea o marca temporal y revertir una escritura errónea.
  • Evolucionar el esquema y el particionado de una tabla sin reescribir el histórico completo.
  • Compactar ficheros pequeños y caducar instantáneas para controlar coste de almacenamiento y latencia.
  • Elegir entre los tres formatos a partir del patrón de escritura, del catálogo y del motor de consulta.

Contenido del curso

7 módulos · 32 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Del lago al lakehouse 4 clases
  • Límites de un lago de directorios con Parquet
  • Qué añade una capa de metadatos transaccional
  • Panorama de Iceberg, Delta y Hudi
  • Entorno de prácticas con Spark y almacenamiento de objetos
Módulo 2 · Apache Iceberg 5 clases
  • Metadatos, manifiestos e instantáneas
  • Catálogos: Hive, REST y basados en ficheros
  • Particionado oculto y transformaciones
  • Escritura, merge y borrado
  • Procedimientos de mantenimiento
Módulo 3 · Delta Lake 5 clases
  • El registro de transacciones y sus puntos de control
  • MERGE INTO y captura de cambios
  • Delta con Spark Structured Streaming
  • OPTIMIZE, Z-ORDER y VACUUM
  • Restricciones y propiedades de tabla
Módulo 4 · Apache Hudi 4 clases
  • Copy on write frente a merge on read
  • Claves de registro y deduplicación
  • Consultas de instantánea, incremental y de lectura optimizada
  • Servicios de tabla: compactación y limpieza
Módulo 5 · Esquema y tiempo 5 clases
  • Evolución de esquema segura y rupturas
  • Cambio de particionado sin reescribir
  • Viaje en el tiempo por instantánea y por fecha
  • Revertir una escritura errónea
  • Retención frente a coste de almacenamiento
Módulo 6 · Rendimiento y coste 5 clases
  • El problema de los ficheros pequeños
  • Compactación y ordenación de datos
  • Poda de particiones y de ficheros
  • Escrituras concurrentes y conflictos
  • Medir coste por consulta
Módulo 7 · Decisión y proyecto 4 clases
  • Matriz de comparación entre los tres formatos
  • Interoperabilidad y motores de consulta
  • Migrar una tabla existente a formato abierto
  • Caso final: tabla de hechos con correcciones y auditoría

Requisitos

  • Experiencia con Spark y con procesamiento de datos distribuido.
  • Manejo de formatos columnares como Parquet y de almacenamiento de objetos compatible con S3.
  • SQL avanzado y nociones de modelado analítico.

Descripción

Un lago de datos hecho de directorios con Parquet funciona mientras solo se añaden ficheros. En cuanto hay que corregir registros, cumplir una solicitud de borrado, cambiar el esquema o saber qué se leyó exactamente en un informe ya cerrado, la ausencia de metadatos transaccionales se convierte en un problema serio y caro.

Este curso trabaja los tres formatos de tabla abiertos sobre el mismo caso. Se inspecciona la capa de metadatos de cada uno, se ejecutan escrituras concurrentes y operaciones de merge, se prueba el viaje en el tiempo y la reversión, se hace evolucionar esquema y particionado, y se aplican las tareas de mantenimiento sin las cuales el rendimiento se degrada sin remedio.

El resultado es criterio para decidir el formato de tabla de una plataforma de datos y para operarlo, no solo para configurarlo. Es la base sobre la que se apoyan los cursos de ingeniería de datos de extremo a extremo y de calidad y gobierno del dato, donde el linaje y los contratos se asientan en estas garantías.

¿Para quién es este curso?

  • Ingeniería de datos que diseña o migra la capa de almacenamiento analítico de su organización.
  • Perfiles de desarrollo responsables de procesos Spark que deben soportar correcciones y borrados.
  • Arquitectos de datos que necesitan justificar la elección de formato de tabla ante el equipo.
Próximamente

Curso en hoja de ruta. Se prioriza según la demanda recogida y los proyectos en cartera.

Código
BIG-150
Nivel
Especialización
Público
Desarrollo, Ingeniería / Industria
Entorno
Spark, Delta Lake

Este curso incluye

  • 32 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

Bajo demanda

BIG-111Big Data e Ingeniería de Datos

Spark avanzado: optimización y Delta Lake

Particionado, sesgo de datos, caché, plan de Catalyst y tablas transaccionales sobre el lago.

SparkDelta Lake

Especialización 29 clases

Próximamente

BIG-113Big Data e Ingeniería de Datos

Spark Structured Streaming

Procesamiento continuo con ventanas temporales, marcas de agua y garantías de entrega.

SparkKafka

Especialización 30 clases