Saltar al contenido
Logotipo de Trainontech Trainontech

Inteligencia Artificial Aplicada · IA-181

Evaluación y observabilidad de sistemas LLM

Evals, trazas y coste por petición para detectar regresiones antes de que las note el usuario.

Bajo demanda Especialización 6 módulos · 24 clases

Formato asíncrono Desarrollo, Ingeniería / Industria Python, Grafana

Lo que aprenderás

  • Construir un conjunto de evaluación con casos reales y respuestas de referencia acordadas.
  • Automatizar evals que se ejecuten en cada cambio de prompt, de modelo o de recuperación.
  • Instrumentar la aplicación para emitir trazas de cada llamada con sus tiempos y su contexto.
  • Publicar métricas de latencia, tokens y coste por petición en un panel de Grafana.
  • Definir alertas sobre tasa de error y sobre desviación de calidad respecto a la línea base.
  • Diagnosticar una regresión comparando las trazas de dos versiones del mismo sistema.

Contenido del curso

6 módulos · 24 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Qué significa evaluar aquí 4 clases
  • Por qué las pruebas clásicas no bastan
  • Calidad, latencia y coste como tres ejes distintos
  • Preparación del entorno de prácticas
  • Sistema de ejemplo sobre el que se trabaja
Módulo 2 · Construir el conjunto de evaluación 4 clases
  • Seleccionar casos reales representativos
  • Respuestas de referencia y criterios de acierto
  • Casos límite y casos que deben rechazarse
  • Mantener el conjunto vivo con los fallos reales
Módulo 3 · Ejecutar evals automáticamente 4 clases
  • Comprobaciones deterministas frente a evaluación por modelo
  • Puntuación y umbrales de aceptación
  • Integración en el flujo de despliegue
  • Falsos positivos y ajuste de los criterios
Módulo 4 · Trazas 4 clases
  • Qué registrar de cada llamada
  • Contexto recuperado, prompt final y respuesta
  • Identificadores de correlación entre componentes
  • Datos personales en las trazas y su tratamiento
Módulo 5 · Métricas y paneles 4 clases
  • Latencia total y por componente
  • Tokens de entrada y salida y coste por petición
  • Tasa de error y de rechazo
  • Construcción del panel en Grafana
Módulo 6 · Alertas y diagnóstico 4 clases
  • Definir alertas útiles y evitar el ruido
  • Detectar desviación respecto a la línea base
  • Comparar trazas de dos versiones
  • Caso práctico: regresión provocada, detectada y explicada

Requisitos

  • Experiencia operando aplicaciones en producción: despliegues, registros y monitorización.
  • Python avanzado y manejo de integración continua.
  • Haber construido un sistema con modelos de lenguaje en uso real, sea RAG o agente.
  • Acceso a una instancia de Grafana o capacidad de desplegar una para las prácticas.

Descripción

Un sistema basado en modelos de lenguaje no se rompe con un error en el registro: empeora en silencio. Cambia un prompt, se actualiza el modelo del proveedor, se reindexan los documentos, y la calidad cae sin que ninguna alarma salte. El primer aviso suele llegar por una queja, mucho después y sin forma de saber qué cambió.

El curso monta la infraestructura que evita eso. Se construye un conjunto de evaluación con casos reales y respuestas de referencia, se automatiza su ejecución en cada cambio, se instrumenta la aplicación para emitir trazas completas y se publica en Grafana lo que de verdad importa: latencia, tokens, coste por petición y tasa de error.

El bloque final es de diagnóstico: ante una regresión, comparar trazas de dos versiones y localizar si el problema está en el prompt, en la recuperación o en el modelo. Complementa los cursos de despliegue de modelos afinados y de agentes sobre infraestructura propia, que son justamente los sistemas que hay que vigilar.

¿Para quién es este curso?

  • Equipos que ya tienen un asistente o un RAG en producción y no saben si su calidad se mantiene.
  • Perfiles de ingeniería de plataforma responsables de la observabilidad de servicios internos.
  • Personas técnicas que deben justificar ante dirección el coste por petición de un sistema en uso.
Bajo demanda

Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.

Código
IA-181
Nivel
Especialización
Público
Desarrollo, Ingeniería / Industria
Entorno
Python, Grafana

Este curso incluye

  • 24 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

IA-152Inteligencia Artificial Aplicada

Agentes con múltiples servidores MCP

Orquestar varias fuentes y herramientas en un mismo agente sin perder control ni trazabilidad.

MCPBionic

Especialización 28 clases

IA-160Inteligencia Artificial Aplicada

Fine-tuning de LLM con Unsloth

Cuándo compensa afinar un modelo, preparación del dataset y entrenamiento eficiente con LoRA.

UnslothHugging Face

Especialización 26 clases

IA-161Inteligencia Artificial Aplicada

Fine-tuning en local: hardware y despliegue

GPU, cuantización, evaluación y puesta en servicio del modelo afinado en infraestructura propia.

UnslothOllama

Especialización 24 clases