BIG-110Big Data e Ingeniería de Datos
Apache Spark con PySpark
DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.
SparkPythonJupyterLab
Big Data e Ingeniería de Datos · BIG-171
Contratos de datos, validación automática, linaje y catálogo para que alguien responda del dato.
Formato asíncrono Ingeniería / Industria, Empresa / PYME, Administración pública dbt, Python
7 módulos · 32 clases en vídeo · práctica guiada en cada módulo
El indicador del comité no cuadra con el del área y nadie sabe cuál está mal ni desde cuándo. Se abre una investigación manual que consume días y termina con un ajuste sin causa raíz identificada. El problema rara vez es técnico: es que nadie responde del dato y no hay controles que avisen antes que el receptor.
El curso implanta esas piezas sobre un flujo existente. Se redactan contratos de datos con esquema y semántica explícitos, se añaden pruebas en dbt y validaciones con Great Expectations que detienen la carga cuando procede, se instrumenta la detección de deriva, se reconstruye el linaje de los indicadores y se publica un catálogo con propietario y nivel de servicio.
El resultado es un flujo donde los fallos se detectan en origen, cada conjunto tiene responsable y cualquiera puede rastrear de dónde sale una cifra. Para una empresa o una administración esto reduce el trabajo de conciliación y sostiene las obligaciones de trazabilidad; encaja después del curso de ingeniería de datos de extremo a extremo.
Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.
Sigue aprendiendo
BIG-110Big Data e Ingeniería de Datos
DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.
SparkPythonJupyterLab
BIG-112Big Data e Ingeniería de Datos
La API nativa de Spark con el kernel Almond, para equipos que necesitan el máximo rendimiento.
SparkScalaJupyterLab
BIG-120Big Data e Ingeniería de Datos
Topics, particiones, grupos de consumidores y retención: el sistema nervioso de la arquitectura de datos.
KafkaDocker