Saltar al contenido
Logotipo de Trainontech Trainontech

Machine Learning y Visión Artificial · ML-110

Machine learning clásico con scikit-learn

Regresión, clasificación y clustering con scikit-learn: los modelos que resuelven casi todo el trabajo real.

Bajo demanda Intermedio 7 módulos · 31 clases

Formato asíncrono Desarrollo, Ingeniería / Industria, Empresa / PYME Python, scikit-learn

Lo que aprenderás

  • Preparar datos tabulares con imputación, escalado y codificación de variables categóricas.
  • Encadenar preprocesado y modelo en un Pipeline y en un ColumnTransformer sin fugas de información.
  • Entrenar y comparar regresión lineal, árboles, random forest y gradient boosting sobre el mismo problema.
  • Elegir métricas según el coste del error: precisión, exhaustividad, F1, MAE o RMSE según el caso.
  • Validar con validación cruzada y ajustar hiperparámetros con GridSearchCV y RandomizedSearchCV.
  • Segmentar clientes o procesos con k-means y evaluar el número de grupos con criterios objetivos.

Contenido del curso

7 módulos · 31 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Entorno y primer modelo 4 clases
  • Instalación y trabajo en cuaderno
  • Anatomía de la API de scikit-learn: fit, predict y score
  • Carga de un conjunto de datos y exploración inicial
  • Primer modelo de referencia en pocas líneas
Módulo 2 · Preparación de datos 5 clases
  • Valores ausentes y estrategias de imputación
  • Escalado y normalización: cuándo hace falta
  • Codificación de variables categóricas
  • ColumnTransformer para tratar cada columna a su manera
  • Pipeline y fugas de información entre conjuntos
Módulo 3 · Regresión 5 clases
  • Regresión lineal y regularización ridge y lasso
  • Árboles de regresión
  • Random forest y gradient boosting
  • MAE, RMSE y R cuadrado: qué elegir
  • Análisis de residuos
Módulo 4 · Clasificación 5 clases
  • Regresión logística y frontera de decisión
  • Árboles y bosques para clasificación
  • Matriz de confusión, precisión y exhaustividad
  • Curva ROC, AUC y elección de umbral
  • Clases desbalanceadas y pesos
Módulo 5 · Validación y ajuste 4 clases
  • Validación cruzada y particiones estratificadas
  • GridSearchCV y RandomizedSearchCV
  • Curvas de aprendizaje y de validación
  • Importancia de variables e interpretación
Módulo 6 · Aprendizaje no supervisado 4 clases
  • k-means y elección del número de grupos
  • Clustering jerárquico y DBSCAN
  • PCA para reducción de dimensionalidad
  • Visualización e interpretación de los grupos
Módulo 7 · Del modelo a la decisión 4 clases
  • Coste del error y umbral de negocio
  • Explicar el modelo a quien lo aprueba
  • Serialización del modelo y reutilización
  • Caso práctico completo sobre datos tabulares

Requisitos

  • Python básico y manejo de pandas para leer y filtrar un DataFrame.
  • Estadística descriptiva: media, desviación, correlación y noción de distribución.
  • No hace falta experiencia previa en machine learning; basta un navegador para trabajar en cuaderno.

Descripción

En la mayoría de organizaciones el problema no pide una red neuronal: pide predecir una demanda, clasificar incidencias, estimar un consumo o agrupar clientes a partir de una tabla que ya existe. Con scikit-learn eso se resuelve en poco código, pero el resultado solo sirve si el preprocesado, la validación y la métrica se han elegido con criterio.

El curso trabaja sobre conjuntos de datos tabulares realistas, con valores ausentes y columnas categóricas. Se construye un Pipeline que encapsula preprocesado y modelo, se comparan familias de algoritmos sobre el mismo problema y se ajustan hiperparámetros con búsqueda y validación cruzada. También se ve la parte no supervisada, con k-means y reducción de dimensionalidad para explorar.

El último bloque conecta el modelo con la decisión de negocio: qué cuesta un falso positivo, qué umbral conviene, cómo se explica el modelo a quien tiene que aprobarlo y cuándo la mejora no compensa el esfuerzo. Es la base natural antes de pasar a redes neuronales, a series temporales o al despliegue del modelo como servicio.

¿Para quién es este curso?

  • Perfiles de desarrollo que reciben peticiones de predicción sobre datos que la empresa ya tiene.
  • Responsables de PYME o de área que quieren saber qué modelo pedir y qué coste tiene equivocarse.
  • Ingeniería de proceso que analiza datos de planta en hoja de cálculo y quiere dar el salto a modelos.
Bajo demanda

Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.

Código
ML-110
Nivel
Intermedio
Público
Desarrollo, Ingeniería / Industria, Empresa / PYME
Entorno
Python, scikit-learn

Este curso incluye

  • 31 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

VA-101Machine Learning y Visión Artificial

OpenCV: procesamiento de imagen

Umbralización, filtrado, transformaciones geométricas, canales de color e histogramas.

PythonOpenCV

Intermedio 34 clases

VA-102Machine Learning y Visión Artificial

Visión por computador clásica

Detección de características (Harris, MSER, SIFT, ORB), Hough y segmentación por regiones.

PythonOpenCV

Avanzado 33 clases