BIG-160Big Data e Ingeniería de Datos
Hadoop y HDFS: fundamentos y herencia
Qué sigue vivo del ecosistema Hadoop y qué ha sustituido el almacenamiento de objetos.
Hadoop
6 módulos · 24 clases en vídeo · práctica guiada en cada módulo
Muchas organizaciones abren un proyecto de Big Data para resolver algo que cabía en una base de datos bien indexada, y otras siguen intentando cuadrar en la hoja de cálculo un problema que hace tiempo que la desbordó. Las dos decisiones cuestan dinero y tiempo. Antes de elegir tecnología hay que saber medir el problema.
El curso trabaja con ejemplos reales de distinta escala en cuadernos de JupyterLab. Se mide el tamaño de los datos, se comprueba a partir de qué punto una herramienta deja de responder y se recorren las piezas de una arquitectura de datos con vocabulario preciso. Todo con explicaciones accesibles, sin dar por sabido nada de infraestructura.
Al terminar se puede participar en una conversación técnica sobre datos con criterio propio, entender qué propone un proveedor y estimar si el planteamiento encaja con la organización. Es la puerta de entrada al itinerario de ingeniería de datos, que continúa con procesamiento distribuido, orquestación de procesos y gobierno del dato.
Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.
Sigue aprendiendo
BIG-160Big Data e Ingeniería de Datos
Qué sigue vivo del ecosistema Hadoop y qué ha sustituido el almacenamiento de objetos.
Hadoop
BIG-110Big Data e Ingeniería de Datos
DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.
SparkPythonJupyterLab
BIG-112Big Data e Ingeniería de Datos
La API nativa de Spark con el kernel Almond, para equipos que necesitan el máximo rendimiento.
SparkScalaJupyterLab