Saltar al contenido
Logotipo de Trainontech Trainontech

Bases de Datos · BBD-160

DuckDB: analítica local sobre ficheros

Consultar con SQL ficheros CSV y Parquet de gigabytes desde el portátil, sin montar infraestructura.

Bajo demanda Intermedio 6 módulos · 25 clases

Formato asíncrono Ingeniería / Industria, Desarrollo, Empresa / PYME DuckDB, JupyterLab, Python

Lo que aprenderás

  • Consultar ficheros CSV y Parquet directamente con SQL sin cargarlos antes en ninguna tabla.
  • Combinar DuckDB con Pandas y Polars dentro de JupyterLab intercambiando datos sin copiarlos.
  • Convertir conjuntos de datos a Parquet particionado y medir la diferencia de lectura.
  • Escribir consultas analíticas con funciones de ventana, agrupaciones múltiples y CTE.
  • Diagnosticar consumo de memoria y volcado a disco cuando el conjunto supera la memoria disponible.
  • Sustituir procesos de negocio que hoy dependen de hojas de cálculo por consultas reproducibles.

Contenido del curso

6 módulos · 25 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Analítica sin infraestructura 4 clases
  • Qué es DuckDB y en qué se parece a SQLite
  • Instalación e integración con JupyterLab
  • Primera consulta sobre un CSV sin cargarlo
  • Cuándo esto basta y cuándo hace falta un clúster
Módulo 2 · Formatos de fichero 4 clases
  • CSV: separadores, tipos y valores problemáticos
  • Parquet: columnas, compresión y metadatos
  • Leer varios ficheros con comodines
  • Particionado por carpetas y poda de particiones
Módulo 3 · SQL analítico 5 clases
  • Agregaciones, GROUP BY y HAVING
  • Uniones y semiuniones sobre ficheros
  • Funciones de ventana para acumulados y rankings
  • CTE y consultas por capas
  • Tipos, fechas y zonas horarias
Módulo 4 · Python y cuadernos 4 clases
  • Intercambio con Pandas sin copia
  • DuckDB y Polars en el mismo flujo
  • Materializar resultados y persistir el fichero de base de datos
  • Automatizar un informe reproducible
Módulo 5 · Rendimiento y límites 4 clases
  • Perfilado de consultas y uso de memoria
  • Volcado a disco con conjuntos grandes
  • Comparativa entre CSV y Parquet en el mismo análisis
  • Errores frecuentes de tipado y de nulos
Módulo 6 · Caso práctico 4 clases
  • Consolidar exportaciones mensuales dispersas
  • Convertir a Parquet particionado
  • Construir el cuadro de indicadores en SQL
  • Entrega del análisis y siguientes pasos

Requisitos

  • SQL de nivel medio: agrupaciones, uniones y subconsultas.
  • Nociones de Python y de trabajo en cuadernos.
  • No hace falta ningún servidor ni cuenta en la nube: todo se ejecuta en local.

Descripción

Buena parte del análisis diario se atasca en el mismo punto: un fichero de exportación demasiado grande para la hoja de cálculo y demasiado pequeño para justificar un clúster. La salida habitual es pedir infraestructura, esperar y perder el hilo del análisis. DuckDB rompe ese bloqueo porque consulta el fichero donde está, con SQL estándar y desde el mismo portátil.

El curso trabaja en JupyterLab sobre conjuntos de datos reales en CSV y Parquet. Se empieza consultando ficheros sin cargarlos, se pasa a construir un pequeño almacén local, y se comparan tiempos y memoria entre formatos y estrategias de particionado. También se conecta DuckDB con Pandas y con Polars para no duplicar datos en memoria durante el análisis.

Al final queda una manera de trabajar que reduce dependencia de plataformas grandes para tareas medianas, con el ahorro de coste y de espera que eso supone. Es el paso previo natural a Spark o a un almacén analítico cuando el volumen crece de verdad, y encaja bien con dbt y con flujos de datos versionados.

¿Para quién es este curso?

  • Perfiles de ingeniería y análisis que reciben exportaciones grandes y hoy pelean con la hoja de cálculo.
  • Personas desarrolladoras que quieren SQL analítico en local para prototipar antes de escalar.
  • Responsables de datos en PYME que necesitan resultados sin abrir un proyecto de infraestructura.
Bajo demanda

Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.

Código
BBD-160
Nivel
Intermedio
Público
Ingeniería / Industria, Desarrollo, Empresa / PYME
Entorno
DuckDB, JupyterLab, Python

Este curso incluye

  • 25 clases en vídeo bajo demanda
  • Práctica íntegramente en JupyterLab, solo con un navegador
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

Bajo demanda

BBD-104Bases de Datos

Diseño y normalización de esquemas

Del diagrama entidad-relación a un esquema que aguanta cinco años de cambios de requisitos.

SQLPostgreSQL

Intermedio 31 clases

Bajo demanda

BBD-120Bases de Datos

MySQL y MariaDB en producción

El motor que hay debajo de WordPress, PrestaShop y Moodle: ajuste, copias y replicación.

MySQLMariaDB

Intermedio 32 clases

Bajo demanda

BBD-130Bases de Datos

MongoDB: modelado documental

Documentos, colecciones e índices, y cuándo un esquema flexible es una ventaja o una trampa.

MongoDB

Intermedio 32 clases