Consultar ficheros CSV y Parquet directamente con SQL sin cargarlos antes en ninguna tabla.
Combinar DuckDB con Pandas y Polars dentro de JupyterLab intercambiando datos sin copiarlos.
Convertir conjuntos de datos a Parquet particionado y medir la diferencia de lectura.
Escribir consultas analíticas con funciones de ventana, agrupaciones múltiples y CTE.
Diagnosticar consumo de memoria y volcado a disco cuando el conjunto supera la memoria disponible.
Sustituir procesos de negocio que hoy dependen de hojas de cálculo por consultas reproducibles.
Contenido del curso
6 módulos · 25 clases en vídeo · práctica guiada en cada módulo
Módulo 1 · Analítica sin infraestructura4 clases
Qué es DuckDB y en qué se parece a SQLite
Instalación e integración con JupyterLab
Primera consulta sobre un CSV sin cargarlo
Cuándo esto basta y cuándo hace falta un clúster
Módulo 2 · Formatos de fichero4 clases
CSV: separadores, tipos y valores problemáticos
Parquet: columnas, compresión y metadatos
Leer varios ficheros con comodines
Particionado por carpetas y poda de particiones
Módulo 3 · SQL analítico5 clases
Agregaciones, GROUP BY y HAVING
Uniones y semiuniones sobre ficheros
Funciones de ventana para acumulados y rankings
CTE y consultas por capas
Tipos, fechas y zonas horarias
Módulo 4 · Python y cuadernos4 clases
Intercambio con Pandas sin copia
DuckDB y Polars en el mismo flujo
Materializar resultados y persistir el fichero de base de datos
Automatizar un informe reproducible
Módulo 5 · Rendimiento y límites4 clases
Perfilado de consultas y uso de memoria
Volcado a disco con conjuntos grandes
Comparativa entre CSV y Parquet en el mismo análisis
Errores frecuentes de tipado y de nulos
Módulo 6 · Caso práctico4 clases
Consolidar exportaciones mensuales dispersas
Convertir a Parquet particionado
Construir el cuadro de indicadores en SQL
Entrega del análisis y siguientes pasos
Requisitos
SQL de nivel medio: agrupaciones, uniones y subconsultas.
Nociones de Python y de trabajo en cuadernos.
No hace falta ningún servidor ni cuenta en la nube: todo se ejecuta en local.
Descripción
Buena parte del análisis diario se atasca en el mismo punto: un fichero de exportación demasiado grande para la hoja de cálculo y demasiado pequeño para justificar un clúster. La salida habitual es pedir infraestructura, esperar y perder el hilo del análisis. DuckDB rompe ese bloqueo porque consulta el fichero donde está, con SQL estándar y desde el mismo portátil.
El curso trabaja en JupyterLab sobre conjuntos de datos reales en CSV y Parquet. Se empieza consultando ficheros sin cargarlos, se pasa a construir un pequeño almacén local, y se comparan tiempos y memoria entre formatos y estrategias de particionado. También se conecta DuckDB con Pandas y con Polars para no duplicar datos en memoria durante el análisis.
Al final queda una manera de trabajar que reduce dependencia de plataformas grandes para tareas medianas, con el ahorro de coste y de espera que eso supone. Es el paso previo natural a Spark o a un almacén analítico cuando el volumen crece de verdad, y encaja bien con dbt y con flujos de datos versionados.
¿Para quién es este curso?
Perfiles de ingeniería y análisis que reciben exportaciones grandes y hoy pelean con la hoja de cálculo.
Personas desarrolladoras que quieren SQL analítico en local para prototipar antes de escalar.
Responsables de datos en PYME que necesitan resultados sin abrir un proyecto de infraestructura.
Bajo demanda
Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.
Este sitio web utiliza cookies propias y de terceros para recopilar información con finalidad técnica. No se recaban ni ceden datos de carácter personal sin tu consentimiento. Más información en la política de cookies.