Explicar la capa de metadatos de Iceberg, Delta Lake y Hudi y qué garantiza cada una.
Ejecutar operaciones ACID de merge, update y delete sobre tablas en almacenamiento de objetos con Spark.
Consultar versiones anteriores por instantánea o marca temporal y revertir una escritura errónea.
Evolucionar el esquema y el particionado de una tabla sin reescribir el histórico completo.
Compactar ficheros pequeños y caducar instantáneas para controlar coste de almacenamiento y latencia.
Elegir entre los tres formatos a partir del patrón de escritura, del catálogo y del motor de consulta.
Contenido del curso
7 módulos · 32 clases en vídeo · práctica guiada en cada módulo
Módulo 1 · Del lago al lakehouse4 clases
Límites de un lago de directorios con Parquet
Qué añade una capa de metadatos transaccional
Panorama de Iceberg, Delta y Hudi
Entorno de prácticas con Spark y almacenamiento de objetos
Módulo 2 · Apache Iceberg5 clases
Metadatos, manifiestos e instantáneas
Catálogos: Hive, REST y basados en ficheros
Particionado oculto y transformaciones
Escritura, merge y borrado
Procedimientos de mantenimiento
Módulo 3 · Delta Lake5 clases
El registro de transacciones y sus puntos de control
MERGE INTO y captura de cambios
Delta con Spark Structured Streaming
OPTIMIZE, Z-ORDER y VACUUM
Restricciones y propiedades de tabla
Módulo 4 · Apache Hudi4 clases
Copy on write frente a merge on read
Claves de registro y deduplicación
Consultas de instantánea, incremental y de lectura optimizada
Servicios de tabla: compactación y limpieza
Módulo 5 · Esquema y tiempo5 clases
Evolución de esquema segura y rupturas
Cambio de particionado sin reescribir
Viaje en el tiempo por instantánea y por fecha
Revertir una escritura errónea
Retención frente a coste de almacenamiento
Módulo 6 · Rendimiento y coste5 clases
El problema de los ficheros pequeños
Compactación y ordenación de datos
Poda de particiones y de ficheros
Escrituras concurrentes y conflictos
Medir coste por consulta
Módulo 7 · Decisión y proyecto4 clases
Matriz de comparación entre los tres formatos
Interoperabilidad y motores de consulta
Migrar una tabla existente a formato abierto
Caso final: tabla de hechos con correcciones y auditoría
Requisitos
Experiencia con Spark y con procesamiento de datos distribuido.
Manejo de formatos columnares como Parquet y de almacenamiento de objetos compatible con S3.
SQL avanzado y nociones de modelado analítico.
Descripción
Un lago de datos hecho de directorios con Parquet funciona mientras solo se añaden ficheros. En cuanto hay que corregir registros, cumplir una solicitud de borrado, cambiar el esquema o saber qué se leyó exactamente en un informe ya cerrado, la ausencia de metadatos transaccionales se convierte en un problema serio y caro.
Este curso trabaja los tres formatos de tabla abiertos sobre el mismo caso. Se inspecciona la capa de metadatos de cada uno, se ejecutan escrituras concurrentes y operaciones de merge, se prueba el viaje en el tiempo y la reversión, se hace evolucionar esquema y particionado, y se aplican las tareas de mantenimiento sin las cuales el rendimiento se degrada sin remedio.
El resultado es criterio para decidir el formato de tabla de una plataforma de datos y para operarlo, no solo para configurarlo. Es la base sobre la que se apoyan los cursos de ingeniería de datos de extremo a extremo y de calidad y gobierno del dato, donde el linaje y los contratos se asientan en estas garantías.
¿Para quién es este curso?
Ingeniería de datos que diseña o migra la capa de almacenamiento analítico de su organización.
Perfiles de desarrollo responsables de procesos Spark que deben soportar correcciones y borrados.
Arquitectos de datos que necesitan justificar la elección de formato de tabla ante el equipo.
Próximamente
Curso en hoja de ruta. Se prioriza según la demanda recogida y los proyectos en cartera.
Este sitio web utiliza cookies propias y de terceros para recopilar información con finalidad técnica. No se recaban ni ceden datos de carácter personal sin tu consentimiento. Más información en la política de cookies.