Saltar al contenido
Logotipo de Trainontech Trainontech

Big Data e Ingeniería de Datos · BIG-131

dbt: transformación analítica versionada

Transformar datos con modelos SQL versionados, probados y documentados, con el linaje siempre visible.

Bajo demanda Avanzado 7 módulos · 28 clases

Formato asíncrono Desarrollo, Ingeniería / Industria, Empresa / PYME dbt, SQL

Lo que aprenderás

  • Estructurar un proyecto dbt en capas de preparación, intermedia y de consumo.
  • Escribir modelos SQL con referencias entre ellos y generar el grafo de linaje automáticamente.
  • Aplicar pruebas de unicidad, no nulos, valores admitidos e integridad referencial en cada modelo.
  • Configurar materializaciones e implementar modelos incrementales con clave única.
  • Usar macros y Jinja para eliminar lógica repetida sin volver el proyecto ilegible.
  • Integrar el proyecto en control de versiones con revisión de cambios y despliegue por entornos.

Contenido del curso

7 módulos · 28 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Transformación como código 4 clases
  • Qué resuelve dbt y qué no
  • Instalación, perfil de conexión y primer proyecto
  • Estructura de carpetas y convenciones
  • Primer modelo y primera ejecución
Módulo 2 · Modelos y linaje 4 clases
  • Orígenes declarados y frescura del dato
  • Referencias entre modelos y grafo de dependencias
  • Capas de preparación, intermedia y consumo
  • Nombrado y convenciones que sobreviven al equipo
Módulo 3 · Pruebas y calidad 4 clases
  • Pruebas genéricas incorporadas
  • Pruebas propias en SQL
  • Severidad, umbrales y avisos
  • Qué hacer cuando una prueba falla en producción
Módulo 4 · Materializaciones 4 clases
  • Vista, tabla y sus implicaciones de coste
  • Modelos incrementales y clave única
  • Estrategias de actualización y reconstrucción completa
  • Instantáneas para conservar el histórico
Módulo 5 · Jinja, macros y paquetes 4 clases
  • Variables y compilación de la plantilla
  • Macros para lógica repetida
  • Paquetes de la comunidad y utilidades
  • Cuándo el código generado deja de ser legible
Módulo 6 · Trabajo en equipo y despliegue 4 clases
  • Ramas, revisión de cambios y entornos
  • Ejecución programada del proyecto
  • Documentación generada y su publicación
  • Coste de ejecución y modelos que sobran
Módulo 7 · Caso práctico 4 clases
  • Migrar vistas dispersas a un proyecto dbt
  • Definir pruebas sobre las tablas críticas
  • Pasar el modelo principal a incremental
  • Publicar documentación y linaje para negocio

Requisitos

  • SQL sólido, incluidas consultas por capas y funciones de ventana.
  • Uso habitual de Git y de flujos de trabajo con ramas y revisión.
  • Acceso a un almacén analítico o base de datos sobre la que ejecutar los modelos.

Descripción

La capa de transformación de muchas organizaciones vive en vistas creadas a mano, consultas guardadas en el gestor gráfico y algún procedimiento que nadie se atreve a tocar. Nadie sabe qué informe depende de qué tabla, ningún cambio se puede revisar antes de aplicarse y los errores de dato se descubren cuando alguien de negocio los nota.

El curso reconstruye esa capa como código. Se organiza un proyecto dbt por capas, se escriben modelos con referencias explícitas que generan el linaje, se añaden pruebas que fallan cuando el dato deja de cumplir lo pactado y se pasan las tablas grandes a carga incremental. Todo con Git, revisión de cambios y separación entre desarrollo y producción.

Lo que queda es una capa analítica en la que se puede confiar y sobre la que trabaja un equipo, no una persona, con documentación que se genera del propio proyecto. Encaja directamente con la orquestación de las ejecuciones, con el modelado dimensional del almacén y con las prácticas de calidad y gobierno del dato.

¿Para quién es este curso?

  • Perfiles de ingeniería analítica que mantienen la capa de transformación de una organización.
  • Personas desarrolladoras y analistas con SQL fuerte que quieren trabajar con revisión y pruebas.
  • Responsables de datos en empresa que necesitan trazabilidad entre el origen y el informe final.
Bajo demanda

Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.

Código
BIG-131
Nivel
Avanzado
Público
Desarrollo, Ingeniería / Industria, Empresa / PYME
Entorno
dbt, SQL

Este curso incluye

  • 28 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

Bajo demanda

BIG-110Big Data e Ingeniería de Datos

Apache Spark con PySpark

DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.

SparkPythonJupyterLab

Avanzado 30 clases

Próximamente

BIG-112Big Data e Ingeniería de Datos

Spark con Scala en notebook

La API nativa de Spark con el kernel Almond, para equipos que necesitan el máximo rendimiento.

SparkScalaJupyterLab

Avanzado 25 clases

Bajo demanda

BIG-120Big Data e Ingeniería de Datos

Apache Kafka: fundamentos

Topics, particiones, grupos de consumidores y retención: el sistema nervioso de la arquitectura de datos.

KafkaDocker

Avanzado 28 clases