BIG-110Big Data e Ingeniería de Datos
Apache Spark con PySpark
DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.
SparkPythonJupyterLab
6 módulos · 25 clases en vídeo · práctica guiada en cada módulo
Cuando el trabajo de Spark está en el camino crítico, la penalización de serializar datos entre la máquina virtual de Java y Python deja de ser un detalle. La API nativa en Scala evita ese salto, permite Dataset tipado y detecta en compilación errores que en Python aparecen a mitad de un proceso largo. El precio es un lenguaje nuevo y una cadena de construcción distinta.
El curso reduce ese precio trabajando en cuadernos con el kernel Almond, de modo que se prueba código Scala de forma interactiva sin montar antes un proyecto completo. Se recorre la sintaxis necesaria, se reescriben procesos conocidos de PySpark a Scala, se comparan tiempos con las mismas cargas y al final se empaqueta el resultado en un proyecto sbt.
Al terminar, un equipo puede decidir con datos qué procesos merecen estar en Scala y cuáles se quedan en Python, y mantener ambos sin fricción. Continúa de forma natural hacia la optimización avanzada de Spark, hacia el procesamiento continuo y hacia el diseño de plataformas donde conviven varios lenguajes.
Curso en hoja de ruta. Se prioriza según la demanda recogida y los proyectos en cartera.
Sigue aprendiendo
BIG-110Big Data e Ingeniería de Datos
DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.
SparkPythonJupyterLab
BIG-120Big Data e Ingeniería de Datos
Topics, particiones, grupos de consumidores y retención: el sistema nervioso de la arquitectura de datos.
KafkaDocker
BIG-130Big Data e Ingeniería de Datos
DAGs, dependencias, reintentos y alertas para procesos nocturnos que no se pueden caer.
AirflowPythonDocker