Generar embeddings de texto y comprender qué distancia mide cada métrica de similitud.
Crear colecciones en Qdrant con esquema de carga útil, filtros y control de versiones.
Comparar Chroma, Qdrant y pgvector según volumen, filtrado y necesidades de operación.
Ajustar índices HNSW moviendo parámetros y midiendo el intercambio entre exhaustividad y latencia.
Combinar búsqueda densa con búsqueda léxica y reordenar los resultados con un reranker.
Evaluar la recuperación con un conjunto de preguntas y métricas de acierto en las primeras posiciones.
Contenido del curso
7 módulos · 28 clases en vídeo · práctica guiada en cada módulo
Módulo 1 · Vectores y similitud4 clases
De texto a embedding: qué representa el vector
Coseno, producto escalar y distancia euclídea
Dimensionalidad, normalización y coste de almacenamiento
Entorno de prácticas con Docker
Módulo 2 · Ingesta y troceado4 clases
Estrategias de troceado y solapamiento
Metadatos que después se van a filtrar
Actualización e idempotencia de la ingesta
Documentos con tablas, imágenes y estructura
Módulo 3 · Qdrant en detalle4 clases
Colecciones, puntos y carga útil
Filtros combinados con la búsqueda vectorial
Instantáneas, réplicas y persistencia
Cliente de Python y operaciones por lotes
Módulo 4 · Alternativas y comparación4 clases
Chroma para prototipos y entornos ligeros
pgvector: vectores dentro de PostgreSQL
Criterios de elección: volumen, filtrado y operación
Migrar una colección de un motor a otro
Módulo 5 · Índices y rendimiento4 clases
Búsqueda exacta frente a búsqueda aproximada
HNSW: parámetros de construcción y de consulta
Cuantización y reducción de memoria
Medir latencia y exhaustividad en el mismo banco de pruebas
Módulo 6 · Calidad de la recuperación4 clases
Búsqueda híbrida densa y léxica
Reordenación con modelos de reranking
Conjunto de evaluación y métricas de acierto
Diagnóstico de fallos frecuentes de recuperación
Módulo 7 · Caso práctico4 clases
Índice sobre documentación técnica interna
Filtrado por producto, versión y permisos
Evaluación comparada de dos configuraciones
Puesta en servicio y mantenimiento del índice
Requisitos
Experiencia con Python y con consumo de APIs.
Conocimiento previo de modelos de lenguaje y del planteamiento general de RAG.
Manejo de SQL y de Docker para levantar los servicios de prácticas.
Descripción
Casi todos los sistemas de recuperación aumentada que fallan lo hacen en el mismo sitio, y no es el modelo de lenguaje: es la recuperación. Fragmentos mal troceados, un índice sin filtros, una métrica de distancia elegida por inercia y ninguna forma de medir si el documento correcto llega o no llega. La base de datos vectorial es donde se decide la calidad de todo el sistema.
El curso se centra ahí. Se levantan Qdrant y Chroma con Docker y se compara con pgvector dentro de PostgreSQL, se cargan colecciones reales, se ajustan los parámetros del índice aproximado y se mide qué se pierde al ganar velocidad. Se trabajan además el filtrado por metadatos, la búsqueda híbrida y la reordenación posterior con un conjunto de evaluación propio.
Al terminar se sabe elegir motor y configuración con argumentos medibles, no por defecto, y se dispone de un procedimiento de evaluación reutilizable. Desde aquí se continúa hacia la construcción completa de asistentes con recuperación, hacia la ingesta automatizada de documentación y hacia el despliegue de estos servicios en producción.
¿Para quién es este curso?
Personas desarrolladoras que ya han montado un prototipo de RAG y quieren que responda bien.
Perfiles de ingeniería de datos responsables de la indexación de documentación técnica.
Equipos de producto que necesitan búsqueda semántica sobre catálogos o bases de conocimiento propias.
Bajo demanda
Curso diseñado con la ficha cerrada. Se produce al confirmarse un grupo o un contrato.
Este sitio web utiliza cookies propias y de terceros para recopilar información con finalidad técnica. No se recaban ni ceden datos de carácter personal sin tu consentimiento. Más información en la política de cookies.