Saltar al contenido
Logotipo de Trainontech Trainontech

Big Data e Ingeniería de Datos · BIG-111

Spark avanzado: optimización y Delta Lake

Optimizar trabajos de Spark leyendo el plan de Catalyst y llevar el lago a tablas transaccionales.

Bajo demanda Especialización 7 módulos · 29 clases

Formato asíncrono Desarrollo, Ingeniería / Industria Spark, Delta Lake

Lo que aprenderás

  • Diagnosticar sesgo de datos en una unión y corregirlo con salado o con sugerencias de unión.
  • Ajustar el particionado y el número de ficheros de salida para eliminar tareas desequilibradas.
  • Interpretar el plan de Catalyst y comprobar el efecto de la ejecución adaptativa de consultas.
  • Decidir cuándo la caché o la persistencia compensan y cuándo solo consumen memoria.
  • Crear tablas Delta Lake con transacciones, evolución de esquema y viaje en el tiempo.
  • Aplicar operaciones MERGE para cargas incrementales y compactar ficheros pequeños.

Contenido del curso

7 módulos · 29 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Método de diagnóstico 4 clases
  • Qué mirar primero en un trabajo lento
  • Métricas de etapa, tarea y barajado
  • Reproducir el problema con datos controlados
  • Registrar el antes y el después de cada cambio
Módulo 2 · Catalyst y ejecución adaptativa 4 clases
  • Del plan lógico al plan físico
  • Poda de columnas, empuje de filtros y poda de particiones
  • Ejecución adaptativa: unión y particiones en tiempo real
  • Comprobar qué optimización se aplicó de verdad
Módulo 3 · Particionado y ficheros 4 clases
  • Número de particiones y tamaño objetivo
  • repartition frente a coalesce
  • El problema de los ficheros pequeños
  • Particionado de tabla y claves de alta cardinalidad
Módulo 4 · Uniones y sesgo de datos 4 clases
  • Difusión de tablas pequeñas y sus límites
  • Detectar una clave sesgada
  • Salado y división de la clave problemática
  • Sugerencias de unión y cuándo usarlas
Módulo 5 · Memoria, caché y recursos 4 clases
  • Memoria de ejecución y de almacenamiento
  • Niveles de persistencia y su coste
  • Volcado a disco y errores de memoria
  • Dimensionar ejecutores y núcleos
Módulo 6 · Delta Lake 5 clases
  • Registro de transacciones y atomicidad
  • MERGE para cargas incrementales
  • Evolución de esquema controlada
  • Viaje en el tiempo y reprocesado
  • OPTIMIZE, compactación y limpieza de versiones
Módulo 7 · Caso práctico 4 clases
  • Trabajo con sesgo y ficheros pequeños heredado
  • Plan de optimización priorizado
  • Migración del destino a tablas Delta
  • Comparativa final y documentación del cambio

Requisitos

  • Experiencia real desarrollando con PySpark o con la API de Scala.
  • Conocer los conceptos de barajado, particionado y planes de ejecución.
  • Haber operado procesos de datos en algún entorno con volumen apreciable.

Descripción

Un trabajo de Spark que funciona en pruebas y se arrastra en producción suele tener siempre las mismas causas: una clave de unión que concentra la mitad de las filas, miles de ficheros diminutos, una caché que nadie retira y un plan que hace dos veces la misma lectura. Ninguna de esas cosas se ve sin abrir el plan y las métricas de etapa.

El curso trabaja sobre trabajos reales que van mal a propósito. Se localiza el cuello de botella con la interfaz de Spark, se corrige y se vuelve a medir. La segunda mitad lleva ese mismo rigor al almacenamiento: se sustituyen directorios de Parquet por tablas Delta Lake con registro de transacciones, cargas incrementales con MERGE y mantenimiento de ficheros.

Lo que se obtiene es un método reproducible de diagnóstico y una base de almacenamiento sobre la que se puede reprocesar y auditar sin miedo. Enlaza con el procesamiento continuo, con las arquitecturas de lakehouse basadas en formatos de tabla abiertos y con el diseño de plataformas de datos completas.

¿Para quién es este curso?

  • Personas desarrolladoras de datos responsables de trabajos de Spark que incumplen su ventana de proceso.
  • Perfiles de ingeniería que están migrando un lago de ficheros a tablas transaccionales.
  • Equipos que revisan el coste de su plataforma de datos y buscan margen en la eficiencia del proceso.
Bajo demanda

Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.

Código
BIG-111
Nivel
Especialización
Público
Desarrollo, Ingeniería / Industria
Entorno
Spark, Delta Lake

Este curso incluye

  • 29 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

Próximamente

BIG-113Big Data e Ingeniería de Datos

Spark Structured Streaming

Procesamiento continuo con ventanas temporales, marcas de agua y garantías de entrega.

SparkKafka

Especialización 30 clases

Próximamente

BIG-150Big Data e Ingeniería de Datos

Data Lakehouse: Iceberg, Delta y Hudi

Formatos de tabla abiertos, viaje en el tiempo y evolución de esquema sobre almacenamiento de objetos.

SparkDelta Lake

Especialización 32 clases