BIG-101Big Data e Ingeniería de Datos
Fundamentos de Big Data
Volumen, velocidad y variedad sin humo: cuándo un problema es realmente de Big Data y cuándo no.
JupyterLab
Big Data e Ingeniería de Datos · BIG-160
Qué queda vivo del ecosistema Hadoop, cómo opera HDFS y qué ha ocupado su lugar.
Formato asíncrono Ingeniería / Industria, Desarrollo Hadoop
7 módulos · 30 clases en vídeo · práctica guiada en cada módulo
Muchas organizaciones conservan un clúster Hadoop que sigue sosteniendo procesos críticos, y a la vez cuesta encontrar quien sepa operarlo. Al mismo tiempo abundan las afirmaciones de que Hadoop ha muerto, sin distinguir entre las piezas que efectivamente se abandonaron y las que siguen presentes en cualquier plataforma de datos moderna.
El curso separa esas dos cosas. Se monta un clúster de prácticas y se opera HDFS de verdad: ingesta, replicación, permisos, cuotas y recuperación ante la pérdida de un nodo. Se estudia MapReduce para entender su modelo y sus límites, se trabaja YARN y colas de recursos, y se consulta con Hive prestando atención al metastore, que sobrevive en muchas arquitecturas actuales.
Al terminar se puede mantener una instalación heredada sin miedo y participar con criterio en la decisión de migrar a almacenamiento de objetos y motores como Spark. Es la antesala natural de los cursos de lakehouse y de ingeniería de datos de extremo a extremo.
Curso en hoja de ruta. Se prioriza según la demanda recogida y los proyectos en cartera.
Sigue aprendiendo
BIG-101Big Data e Ingeniería de Datos
Volumen, velocidad y variedad sin humo: cuándo un problema es realmente de Big Data y cuándo no.
JupyterLab
BIG-110Big Data e Ingeniería de Datos
DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.
SparkPythonJupyterLab
BIG-112Big Data e Ingeniería de Datos
La API nativa de Spark con el kernel Almond, para equipos que necesitan el máximo rendimiento.
SparkScalaJupyterLab