Saltar al contenido
Logotipo de Trainontech Trainontech

Big Data e Ingeniería de Datos · BIG-160

Hadoop y HDFS: fundamentos y herencia

Qué queda vivo del ecosistema Hadoop, cómo opera HDFS y qué ha ocupado su lugar.

Próximamente Intermedio 7 módulos · 30 clases

Formato asíncrono Ingeniería / Industria, Desarrollo Hadoop

Lo que aprenderás

  • Describir la arquitectura de HDFS: NameNode, DataNodes, bloques, replicación y tolerancia a fallos.
  • Operar HDFS desde línea de comandos: ingesta, permisos, cuotas, informes de estado y equilibrado.
  • Explicar el modelo MapReduce y por qué los motores en memoria lo desplazaron.
  • Gestionar recursos con YARN entendiendo colas, contenedores y planificadores.
  • Consultar datos con Hive y comprender el papel del metastore en plataformas actuales.
  • Valorar una migración desde HDFS a almacenamiento de objetos comparando coste, rendimiento y operación.

Contenido del curso

7 módulos · 30 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Contexto y clúster de prácticas 4 clases
  • Qué problema resolvió Hadoop y en qué momento
  • Componentes del ecosistema y su estado actual
  • Levantar el clúster de prácticas
  • Recorrido por las interfaces web
Módulo 2 · HDFS por dentro 5 clases
  • NameNode, DataNodes y metadatos
  • Bloques, replicación y colocación
  • Lectura y escritura paso a paso
  • Alta disponibilidad del NameNode
  • Codificación de borrado frente a réplicas
Módulo 3 · Operar HDFS 5 clases
  • Comandos de sistema de ficheros
  • Permisos, ACL y cuotas
  • fsck, informes y bloques corruptos
  • Equilibrado del clúster
  • Simular la pérdida de un DataNode
Módulo 4 · MapReduce 4 clases
  • Fases de map, barajado y reduce
  • Escribir y ejecutar un trabajo sencillo
  • Combinadores, particionadores y contadores
  • Por qué el modelo se quedó atrás
Módulo 5 · YARN 4 clases
  • ResourceManager y NodeManagers
  • Contenedores y solicitudes de recursos
  • Colas y planificador de capacidad
  • Diagnosticar un trabajo que no arranca
Módulo 6 · Hive y el metastore 4 clases
  • Tablas, particiones y formatos de almacenamiento
  • Consultas y su traducción a trabajos
  • El metastore como catálogo compartido
  • Hive junto a motores actuales
Módulo 7 · Herencia y migración 4 clases
  • Qué componentes se han abandonado y por qué
  • HDFS frente a almacenamiento de objetos
  • Plan de migración por fases
  • Caso práctico: inventariar y decidir sobre un clúster heredado

Requisitos

  • Manejo de Linux en línea de comandos y nociones de redes y sistemas distribuidos.
  • SQL para la parte de Hive.
  • No hace falta experiencia previa con Hadoop.

Descripción

Muchas organizaciones conservan un clúster Hadoop que sigue sosteniendo procesos críticos, y a la vez cuesta encontrar quien sepa operarlo. Al mismo tiempo abundan las afirmaciones de que Hadoop ha muerto, sin distinguir entre las piezas que efectivamente se abandonaron y las que siguen presentes en cualquier plataforma de datos moderna.

El curso separa esas dos cosas. Se monta un clúster de prácticas y se opera HDFS de verdad: ingesta, replicación, permisos, cuotas y recuperación ante la pérdida de un nodo. Se estudia MapReduce para entender su modelo y sus límites, se trabaja YARN y colas de recursos, y se consulta con Hive prestando atención al metastore, que sobrevive en muchas arquitecturas actuales.

Al terminar se puede mantener una instalación heredada sin miedo y participar con criterio en la decisión de migrar a almacenamiento de objetos y motores como Spark. Es la antesala natural de los cursos de lakehouse y de ingeniería de datos de extremo a extremo.

¿Para quién es este curso?

  • Ingeniería de datos que ha heredado un clúster Hadoop en producción y debe mantenerlo o migrarlo.
  • Perfiles de desarrollo que se incorporan a una plataforma con componentes del ecosistema Hadoop.
  • Técnicos que participan en la decisión de sustituir infraestructura de datos heredada.
Próximamente

Curso en hoja de ruta. Se prioriza según la demanda recogida y los proyectos en cartera.

Código
BIG-160
Nivel
Intermedio
Público
Ingeniería / Industria, Desarrollo
Entorno
Hadoop

Este curso incluye

  • 30 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

Bajo demanda

BIG-101Big Data e Ingeniería de Datos

Fundamentos de Big Data

Volumen, velocidad y variedad sin humo: cuándo un problema es realmente de Big Data y cuándo no.

JupyterLab

Iniciación 24 clases

Bajo demanda

BIG-110Big Data e Ingeniería de Datos

Apache Spark con PySpark

DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.

SparkPythonJupyterLab

Avanzado 30 clases

Próximamente

BIG-112Big Data e Ingeniería de Datos

Spark con Scala en notebook

La API nativa de Spark con el kernel Almond, para equipos que necesitan el máximo rendimiento.

SparkScalaJupyterLab

Avanzado 25 clases