BIG-110Big Data e Ingeniería de Datos
Apache Spark con PySpark
DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.
SparkPythonJupyterLab
Big Data e Ingeniería de Datos · BIG-120
Diseñar topics, particiones y grupos de consumidores para que los eventos lleguen y se conserven.
Formato asíncrono Desarrollo, Ingeniería / Industria Kafka, Docker
7 módulos · 28 clases en vídeo · práctica guiada en cada módulo
Cuando varios sistemas necesitan el mismo dato, la salida rápida es que cada uno consulte la base de datos del otro. Al cabo de un tiempo hay integraciones cruzadas, procesos que se pisan y nadie sabe quién dispara qué. Kafka propone otra cosa: un registro ordenado y duradero de lo que ha pasado, que cada consumidor lee a su ritmo sin acoplarse al resto.
El curso levanta un clúster con Docker y construye productores y consumidores reales. Se diseñan topics decidiendo particiones y claves, se observa el reequilibrio de un grupo al añadir instancias, se prueban las políticas de retención y compactación y se provoca la caída de un nodo para ver qué ocurre con las réplicas y los desplazamientos.
Al terminar se puede diseñar la columna vertebral de eventos de un sistema y explicar sus garantías y sus límites. Es el paso previo a los conectores y al procesamiento de flujos, al procesamiento continuo con Spark y a las arquitecturas industriales donde el dato debe llegar del equipo al indicador en segundos.
Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.
Sigue aprendiendo
BIG-110Big Data e Ingeniería de Datos
DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.
SparkPythonJupyterLab
BIG-112Big Data e Ingeniería de Datos
La API nativa de Spark con el kernel Almond, para equipos que necesitan el máximo rendimiento.
SparkScalaJupyterLab
BIG-130Big Data e Ingeniería de Datos
DAGs, dependencias, reintentos y alertas para procesos nocturnos que no se pueden caer.
AirflowPythonDocker