BIG-112Big Data e Ingeniería de Datos
Spark con Scala en notebook
La API nativa de Spark con el kernel Almond, para equipos que necesitan el máximo rendimiento.
SparkScalaJupyterLab
7 módulos · 30 clases en vídeo · práctica guiada en cada módulo
Llega el momento en que el proceso nocturno tarda tanto que ya no cabe en la noche, o en que el fichero de entrada no entra en memoria y el script en Pandas muere sin explicación. Repartir ese trabajo entre varias máquinas cambia la forma de programar: aparecen el barajado de datos, el particionado y una ejecución que no ocurre cuando se escribe la línea.
El curso se apoya en cuadernos de JupyterLab conectados a Spark, con conjuntos de datos lo bastante grandes para que las decisiones se noten. Se construyen transformaciones encadenadas, se observan los planes generados, se comparan estrategias de unión y se sigue cada trabajo en la interfaz web hasta entender dónde se va el tiempo.
Al terminar se pueden escribir procesos distribuidos que funcionan y, sobre todo, explicar por qué funcionan. Desde aquí el itinerario sigue hacia la optimización fina y las tablas transaccionales del lago, hacia el procesamiento continuo con Structured Streaming y hacia la orquestación de estos trabajos dentro de un flujo completo.
Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.
Sigue aprendiendo
BIG-112Big Data e Ingeniería de Datos
La API nativa de Spark con el kernel Almond, para equipos que necesitan el máximo rendimiento.
SparkScalaJupyterLab
BIG-120Big Data e Ingeniería de Datos
Topics, particiones, grupos de consumidores y retención: el sistema nervioso de la arquitectura de datos.
KafkaDocker
BIG-130Big Data e Ingeniería de Datos
DAGs, dependencias, reintentos y alertas para procesos nocturnos que no se pueden caer.
AirflowPythonDocker