Preparar datos tabulares con imputación, escalado y codificación de variables categóricas.
Encadenar preprocesado y modelo en un Pipeline y en un ColumnTransformer sin fugas de información.
Entrenar y comparar regresión lineal, árboles, random forest y gradient boosting sobre el mismo problema.
Elegir métricas según el coste del error: precisión, exhaustividad, F1, MAE o RMSE según el caso.
Validar con validación cruzada y ajustar hiperparámetros con GridSearchCV y RandomizedSearchCV.
Segmentar clientes o procesos con k-means y evaluar el número de grupos con criterios objetivos.
Contenido del curso
7 módulos · 31 clases en vídeo · práctica guiada en cada módulo
Módulo 1 · Entorno y primer modelo4 clases
Instalación y trabajo en cuaderno
Anatomía de la API de scikit-learn: fit, predict y score
Carga de un conjunto de datos y exploración inicial
Primer modelo de referencia en pocas líneas
Módulo 2 · Preparación de datos5 clases
Valores ausentes y estrategias de imputación
Escalado y normalización: cuándo hace falta
Codificación de variables categóricas
ColumnTransformer para tratar cada columna a su manera
Pipeline y fugas de información entre conjuntos
Módulo 3 · Regresión5 clases
Regresión lineal y regularización ridge y lasso
Árboles de regresión
Random forest y gradient boosting
MAE, RMSE y R cuadrado: qué elegir
Análisis de residuos
Módulo 4 · Clasificación5 clases
Regresión logística y frontera de decisión
Árboles y bosques para clasificación
Matriz de confusión, precisión y exhaustividad
Curva ROC, AUC y elección de umbral
Clases desbalanceadas y pesos
Módulo 5 · Validación y ajuste4 clases
Validación cruzada y particiones estratificadas
GridSearchCV y RandomizedSearchCV
Curvas de aprendizaje y de validación
Importancia de variables e interpretación
Módulo 6 · Aprendizaje no supervisado4 clases
k-means y elección del número de grupos
Clustering jerárquico y DBSCAN
PCA para reducción de dimensionalidad
Visualización e interpretación de los grupos
Módulo 7 · Del modelo a la decisión4 clases
Coste del error y umbral de negocio
Explicar el modelo a quien lo aprueba
Serialización del modelo y reutilización
Caso práctico completo sobre datos tabulares
Requisitos
Python básico y manejo de pandas para leer y filtrar un DataFrame.
Estadística descriptiva: media, desviación, correlación y noción de distribución.
No hace falta experiencia previa en machine learning; basta un navegador para trabajar en cuaderno.
Descripción
En la mayoría de organizaciones el problema no pide una red neuronal: pide predecir una demanda, clasificar incidencias, estimar un consumo o agrupar clientes a partir de una tabla que ya existe. Con scikit-learn eso se resuelve en poco código, pero el resultado solo sirve si el preprocesado, la validación y la métrica se han elegido con criterio.
El curso trabaja sobre conjuntos de datos tabulares realistas, con valores ausentes y columnas categóricas. Se construye un Pipeline que encapsula preprocesado y modelo, se comparan familias de algoritmos sobre el mismo problema y se ajustan hiperparámetros con búsqueda y validación cruzada. También se ve la parte no supervisada, con k-means y reducción de dimensionalidad para explorar.
El último bloque conecta el modelo con la decisión de negocio: qué cuesta un falso positivo, qué umbral conviene, cómo se explica el modelo a quien tiene que aprobarlo y cuándo la mejora no compensa el esfuerzo. Es la base natural antes de pasar a redes neuronales, a series temporales o al despliegue del modelo como servicio.
¿Para quién es este curso?
Perfiles de desarrollo que reciben peticiones de predicción sobre datos que la empresa ya tiene.
Responsables de PYME o de área que quieren saber qué modelo pedir y qué coste tiene equivocarse.
Ingeniería de proceso que analiza datos de planta en hoja de cálculo y quiere dar el salto a modelos.
Bajo demanda
Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.
Este sitio web utiliza cookies propias y de terceros para recopilar información con finalidad técnica. No se recaban ni ceden datos de carácter personal sin tu consentimiento. Más información en la política de cookies.