Saltar al contenido
Logotipo de Trainontech Trainontech

Bases de Datos · BBD-170

Bases de datos vectoriales para IA

Almacenar embeddings e indexarlos para búsqueda semántica, la pieza que sostiene cualquier sistema RAG.

Bajo demanda Avanzado 7 módulos · 28 clases

Formato asíncrono Desarrollo, Ingeniería / Industria Qdrant, Chroma, PostgreSQL

Lo que aprenderás

  • Generar embeddings de texto y comprender qué distancia mide cada métrica de similitud.
  • Crear colecciones en Qdrant con esquema de carga útil, filtros y control de versiones.
  • Comparar Chroma, Qdrant y pgvector según volumen, filtrado y necesidades de operación.
  • Ajustar índices HNSW moviendo parámetros y midiendo el intercambio entre exhaustividad y latencia.
  • Combinar búsqueda densa con búsqueda léxica y reordenar los resultados con un reranker.
  • Evaluar la recuperación con un conjunto de preguntas y métricas de acierto en las primeras posiciones.

Contenido del curso

7 módulos · 28 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Vectores y similitud 4 clases
  • De texto a embedding: qué representa el vector
  • Coseno, producto escalar y distancia euclídea
  • Dimensionalidad, normalización y coste de almacenamiento
  • Entorno de prácticas con Docker
Módulo 2 · Ingesta y troceado 4 clases
  • Estrategias de troceado y solapamiento
  • Metadatos que después se van a filtrar
  • Actualización e idempotencia de la ingesta
  • Documentos con tablas, imágenes y estructura
Módulo 3 · Qdrant en detalle 4 clases
  • Colecciones, puntos y carga útil
  • Filtros combinados con la búsqueda vectorial
  • Instantáneas, réplicas y persistencia
  • Cliente de Python y operaciones por lotes
Módulo 4 · Alternativas y comparación 4 clases
  • Chroma para prototipos y entornos ligeros
  • pgvector: vectores dentro de PostgreSQL
  • Criterios de elección: volumen, filtrado y operación
  • Migrar una colección de un motor a otro
Módulo 5 · Índices y rendimiento 4 clases
  • Búsqueda exacta frente a búsqueda aproximada
  • HNSW: parámetros de construcción y de consulta
  • Cuantización y reducción de memoria
  • Medir latencia y exhaustividad en el mismo banco de pruebas
Módulo 6 · Calidad de la recuperación 4 clases
  • Búsqueda híbrida densa y léxica
  • Reordenación con modelos de reranking
  • Conjunto de evaluación y métricas de acierto
  • Diagnóstico de fallos frecuentes de recuperación
Módulo 7 · Caso práctico 4 clases
  • Índice sobre documentación técnica interna
  • Filtrado por producto, versión y permisos
  • Evaluación comparada de dos configuraciones
  • Puesta en servicio y mantenimiento del índice

Requisitos

  • Experiencia con Python y con consumo de APIs.
  • Conocimiento previo de modelos de lenguaje y del planteamiento general de RAG.
  • Manejo de SQL y de Docker para levantar los servicios de prácticas.

Descripción

Casi todos los sistemas de recuperación aumentada que fallan lo hacen en el mismo sitio, y no es el modelo de lenguaje: es la recuperación. Fragmentos mal troceados, un índice sin filtros, una métrica de distancia elegida por inercia y ninguna forma de medir si el documento correcto llega o no llega. La base de datos vectorial es donde se decide la calidad de todo el sistema.

El curso se centra ahí. Se levantan Qdrant y Chroma con Docker y se compara con pgvector dentro de PostgreSQL, se cargan colecciones reales, se ajustan los parámetros del índice aproximado y se mide qué se pierde al ganar velocidad. Se trabajan además el filtrado por metadatos, la búsqueda híbrida y la reordenación posterior con un conjunto de evaluación propio.

Al terminar se sabe elegir motor y configuración con argumentos medibles, no por defecto, y se dispone de un procedimiento de evaluación reutilizable. Desde aquí se continúa hacia la construcción completa de asistentes con recuperación, hacia la ingesta automatizada de documentación y hacia el despliegue de estos servicios en producción.

¿Para quién es este curso?

  • Personas desarrolladoras que ya han montado un prototipo de RAG y quieren que responda bien.
  • Perfiles de ingeniería de datos responsables de la indexación de documentación técnica.
  • Equipos de producto que necesitan búsqueda semántica sobre catálogos o bases de conocimiento propias.
Bajo demanda

Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.

Código
BBD-170
Nivel
Avanzado
Público
Desarrollo, Ingeniería / Industria
Entorno
Qdrant, Chroma, PostgreSQL

Este curso incluye

  • 28 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

Bajo demanda

BBD-103Bases de Datos

SQL avanzado: ventanas, CTE y analítica

Funciones de ventana, expresiones comunes recursivas y consultas que sustituyen a cientos de líneas de código.

SQLPostgreSQLJupyterLab

Avanzado 30 clases

Bajo demanda

BBD-110Bases de Datos

PostgreSQL: administración y rendimiento

Configuración, índices, vacío, réplicas y monitorización de la base de datos libre de referencia.

PostgreSQLLinux

Avanzado 34 clases