Saltar al contenido
Logotipo de Trainontech Trainontech

Big Data e Ingeniería de Datos · BIG-101

Fundamentos de Big Data

Distinguir cuándo un problema es realmente de Big Data y cuándo basta con una base de datos.

Bajo demanda Iniciación 6 módulos · 24 clases

Formato asíncrono Empresa / PYME, Ingeniería / Industria, Administración pública JupyterLab

Lo que aprenderás

  • Situar volumen, velocidad y variedad frente al problema concreto de una organización.
  • Estimar el tamaño real de un conjunto de datos y compararlo con la memoria y el disco disponibles.
  • Diferenciar procesamiento por lotes de procesamiento continuo con ejemplos de cada uno.
  • Reconocer las piezas de una arquitectura de datos: ingesta, almacenamiento, proceso y consumo.
  • Valorar el coste de una plataforma distribuida frente a una solución sencilla en un único servidor.
  • Formular preguntas de datos que una organización pueda responder con lo que ya tiene.

Contenido del curso

6 módulos · 24 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Qué es y qué no es Big Data 4 clases
  • Las tres uves y sus matices
  • Casos que parecen Big Data y no lo son
  • Entorno de trabajo en JupyterLab
  • Vocabulario básico sin jerga innecesaria
Módulo 2 · Medir el problema 4 clases
  • Tamaño en disco, en memoria y en tiempo
  • El punto en que la hoja de cálculo se rompe
  • Crecimiento del dato y proyección
  • Frecuencia de llegada y de consulta
Módulo 3 · Dónde viven los datos 4 clases
  • Bases de datos relacionales y sus límites
  • Almacenamiento de objetos y sistemas de ficheros distribuidos
  • Formatos: CSV, JSON, Parquet
  • Lago de datos, almacén y punto intermedio
Módulo 4 · Cómo se procesan 4 clases
  • Proceso por lotes explicado con un ejemplo
  • Proceso continuo y qué problemas resuelve
  • Paralelismo y reparto del trabajo
  • Qué aporta un clúster y qué complica
Módulo 5 · El dato en la organización 4 clases
  • Roles: ingeniería, análisis y ciencia de datos
  • Propiedad del dato y responsabilidad
  • Protección de datos personales en proyectos de datos
  • Coste de una plataforma y alternativas más sencillas
Módulo 6 · Caso práctico 4 clases
  • Diagnóstico de un caso de la organización
  • Dimensionar el problema con datos, no con impresiones
  • Propuesta de arquitectura mínima suficiente
  • Presentar la decisión y sus alternativas

Requisitos

  • No se necesita experiencia previa en programación ni en administración de sistemas.
  • Es útil haber trabajado con hojas de cálculo o con informes de datos.
  • Para las prácticas basta con un navegador: se trabaja sobre JupyterLab.

Descripción

Muchas organizaciones abren un proyecto de Big Data para resolver algo que cabía en una base de datos bien indexada, y otras siguen intentando cuadrar en la hoja de cálculo un problema que hace tiempo que la desbordó. Las dos decisiones cuestan dinero y tiempo. Antes de elegir tecnología hay que saber medir el problema.

El curso trabaja con ejemplos reales de distinta escala en cuadernos de JupyterLab. Se mide el tamaño de los datos, se comprueba a partir de qué punto una herramienta deja de responder y se recorren las piezas de una arquitectura de datos con vocabulario preciso. Todo con explicaciones accesibles, sin dar por sabido nada de infraestructura.

Al terminar se puede participar en una conversación técnica sobre datos con criterio propio, entender qué propone un proveedor y estimar si el planteamiento encaja con la organización. Es la puerta de entrada al itinerario de ingeniería de datos, que continúa con procesamiento distribuido, orquestación de procesos y gobierno del dato.

¿Para quién es este curso?

  • Responsables de PYME que valoran una inversión en plataforma de datos y quieren decidir con criterio.
  • Perfiles de ingeniería de otras especialidades que empiezan a trabajar con volúmenes crecientes.
  • Personal técnico de administraciones públicas que participa en pliegos y proyectos de datos.
Bajo demanda

Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.

Código
BIG-101
Nivel
Iniciación
Público
Empresa / PYME, Ingeniería / Industria, Administración pública
Entorno
JupyterLab

Este curso incluye

  • 24 clases en vídeo bajo demanda
  • Práctica íntegramente en JupyterLab, solo con un navegador
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

Próximamente

BIG-160Big Data e Ingeniería de Datos

Hadoop y HDFS: fundamentos y herencia

Qué sigue vivo del ecosistema Hadoop y qué ha sustituido el almacenamiento de objetos.

Hadoop

Intermedio 30 clases

Bajo demanda

BIG-110Big Data e Ingeniería de Datos

Apache Spark con PySpark

DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.

SparkPythonJupyterLab

Avanzado 30 clases

Próximamente

BIG-112Big Data e Ingeniería de Datos

Spark con Scala en notebook

La API nativa de Spark con el kernel Almond, para equipos que necesitan el máximo rendimiento.

SparkScalaJupyterLab

Avanzado 25 clases