Saltar al contenido
Logotipo de Trainontech Trainontech

Lenguajes y Fundamentos de Programación · PY-121

Pandas: análisis de datos

DataFrames, carga de ficheros, uniones y limpieza de valores ausentes sobre casos de datos reales.

Disponible Intermedio 8 módulos · 39 clases

Formato asíncrono Desarrollo, Ingeniería / Industria, Empresa / PYME Python, Pandas

Lo que aprenderás

  • Cargar datos desde CSV, Excel, JSON y bases de datos controlando tipos, separadores y codificación
  • Seleccionar y filtrar con loc e iloc y con condiciones combinadas sobre varias columnas
  • Detectar y tratar valores ausentes, duplicados y tipos mal inferidos en una tabla real
  • Agrupar con groupby y calcular agregados por categoría para obtener resúmenes de negocio
  • Combinar tablas con merge, join y concat entendiendo qué filas se pierden en cada tipo de unión
  • Trabajar con fechas, remuestrear series temporales y calcular medias móviles
  • Exportar resultados a fichero o a base de datos como paso final de un proceso repetible

Contenido del curso

8 módulos · 39 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Series y DataFrames 5 clases
  • Qué aporta Pandas frente a una hoja de cálculo
  • La Series y el índice
  • El DataFrame: filas, columnas y tipos
  • Primera exploración con head, info y describe
  • Entorno de trabajo y datos del curso
Módulo 2 · Cargar y guardar datos 5 clases
  • Lectura de CSV: separadores, decimales y codificación
  • Hojas de Excel y rangos
  • JSON anidado y normalización
  • Lectura desde base de datos SQL
  • Exportar resultados y elegir formato
Módulo 3 · Selección y filtrado 5 clases
  • Acceso por etiqueta con loc y por posición con iloc
  • Filtros con condiciones combinadas
  • Selección de columnas y renombrado
  • Ordenación por una o varias columnas
  • Columnas calculadas con assign
Módulo 4 · Limpieza de datos 5 clases
  • Detectar valores ausentes y decidir qué hacer
  • Rellenar, interpolar o eliminar
  • Duplicados exactos y duplicados por clave
  • Corrección de tipos y de textos inconsistentes
  • Valores atípicos y su tratamiento
Módulo 5 · Agrupación y agregación 5 clases
  • groupby y funciones de agregación
  • Varias métricas por grupo con agg
  • Transformaciones dentro del grupo
  • Tablas dinámicas con pivot_table
  • Resumen por categoría para un informe
Módulo 6 · Combinar tablas 5 clases
  • merge y tipos de unión
  • Claves compuestas y claves que no casan
  • concat para apilar periodos
  • Comprobar qué filas se han perdido
  • Unión de tres fuentes con códigos distintos
Módulo 7 · Series temporales 5 clases
  • Fechas: parseo, zonas horarias e índice temporal
  • Remuestreo a otra frecuencia
  • Medias móviles y ventanas
  • Comparación entre periodos
  • Huecos en una serie de medidas
Módulo 8 · Proyecto de cierre 4 clases
  • Enunciado: informe mensual a partir de tres fuentes
  • Carga, limpieza y trazabilidad de descartes
  • Cruce y agregación por dimensión de negocio
  • Exportación del informe y ejecución repetible

Requisitos

  • Programar en Python con colecciones y funciones
  • Conocer NumPy a nivel básico resulta útil aunque no es imprescindible
  • Basta con un navegador si se trabaja en cuaderno; no se necesita instalación local

Descripción

El trabajo con datos empieza casi siempre en una hoja de cálculo y se rompe cuando el fichero crece, cuando hay que repetir el mismo tratamiento cada mes o cuando hay que cruzar tres fuentes con códigos distintos. En ese punto, el proceso manual deja de ser fiable: nadie recuerda qué filtro se aplicó ni qué filas se descartaron.

El curso trabaja con Pandas sobre tablas sucias de verdad, con columnas mal tipadas, ausencias, duplicados y códigos inconsistentes. Se practican la carga desde varios formatos, la selección, la limpieza, la agrupación, las uniones entre tablas y las series temporales. Cada tratamiento queda escrito en un cuaderno que se puede volver a ejecutar sobre los datos del mes siguiente.

El resultado es un proceso de datos documentado y reproducible, con salida a fichero o a base de datos y con constancia de qué filas se descartaron. Desde ahí, la visualización con Matplotlib o Seaborn y el análisis estadístico posterior son continuación directa, y en una empresa permite sustituir trabajo manual de hoja de cálculo por un proceso que se ejecuta solo.

¿Para quién es este curso?

  • Analistas y personal de administración de PYME que repiten cada mes el mismo tratamiento en hoja de cálculo
  • Ingenieros que cruzan registros de producción, medidas y mantenimiento en varias fuentes
  • Desarrolladores que preparan datos para informes o para modelos posteriores
Disponible

Contenido ya grabado y publicado en el campus. Puedes empezar en cuanto te inscribas.

Código
PY-121
Nivel
Intermedio
Público
Desarrollo, Ingeniería / Industria, Empresa / PYME
Entorno
Python, Pandas

Este curso incluye

  • 39 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

PY-104Lenguajes y Fundamentos de Programación

Ficheros, excepciones y módulos

Lectura y escritura robusta, gestión de errores e importaciones para código que otros mantendrán.

Python

Intermedio 32 clases