Saltar al contenido
Logotipo de Trainontech Trainontech

Big Data e Ingeniería de Datos · BIG-190

Elasticsearch y búsqueda a gran escala

Índice invertido, relevancia, agregaciones y explotación de registros con Elasticsearch sobre Docker.

Próximamente Avanzado 7 módulos · 33 clases

Formato asíncrono Desarrollo, Ingeniería / Industria Elasticsearch, Docker

Lo que aprenderás

  • Explicar cómo funcionan el índice invertido, los analizadores y el troceado en fragmentos y réplicas.
  • Diseñar un mapeo explícito eligiendo entre text, keyword y campos multivalor según el uso previsto.
  • Escribir consultas con Query DSL combinando bool, filtros, coincidencia y búsqueda por prefijo.
  • Ajustar la relevancia con boosting, function score y análisis de la explicación de puntuación.
  • Construir agregaciones anidadas de términos, rangos e histogramas de fecha para paneles operativos.
  • Montar la ingesta de registros con pipelines y explotarlos para diagnosticar incidencias de servicio.

Contenido del curso

7 módulos · 33 clases en vídeo · práctica guiada en cada módulo

Módulo 1 · Clúster y conceptos 4 clases
  • Índice invertido: por qué la búsqueda es rápida
  • Nodos, fragmentos, réplicas y segmentos
  • Levantar el clúster con Docker
  • API REST y primeras operaciones
Módulo 2 · Análisis y mapeo 5 clases
  • Tokenizadores, filtros y analizadores
  • Analizadores para castellano y gallego
  • text frente a keyword y campos multivalor
  • Mapeo explícito y plantillas de índice
  • Reindexar cuando el mapeo cambia
Módulo 3 · Consultas 5 clases
  • Contexto de consulta y contexto de filtro
  • match, match_phrase y multi_match
  • bool: must, should, filter y must_not
  • Búsqueda por prefijo, comodín y difusa
  • Paginación profunda y search_after
Módulo 4 · Relevancia 5 clases
  • Cómo se calcula la puntuación
  • Leer la explicación de un resultado
  • Boosting por campo y por documento
  • function_score y señales de negocio
  • Sugerencias, autocompletado y corrección
Módulo 5 · Agregaciones 5 clases
  • Agregaciones de métrica y de cubo
  • Términos, rangos e histograma de fecha
  • Agregaciones anidadas y de tubería
  • Facetas para filtrar en la interfaz
  • Coste de una agregación y cómo acotarlo
Módulo 6 · Registros y operación 5 clases
  • Ingesta de registros y pipelines de procesamiento
  • Índices por fecha y política de ciclo de vida
  • Cuántos fragmentos y de qué tamaño
  • Vigilancia del clúster y estado amarillo o rojo
  • Copias con instantáneas
Módulo 7 · Proyecto de cierre 4 clases
  • Buscador sobre un catálogo real
  • Ajuste de relevancia con casos de prueba
  • Panel de agregaciones para operación
  • Diagnóstico de una incidencia usando los registros

Requisitos

  • Manejo de JSON, HTTP y APIs REST.
  • Docker para levantar el clúster de prácticas.
  • Conviene tener experiencia previa con alguna base de datos y con explotación de registros.

Descripción

Dos necesidades acaban en la misma herramienta: un buscador que devuelva resultados útiles con texto libre, y un sitio donde mirar cuando un servicio falla y hay que cruzar registros de varias máquinas. Elasticsearch resuelve ambas, pero configurado sin criterio da resultados irrelevantes y un clúster caro que se degrada.

El curso levanta un clúster en Docker y trabaja los dos frentes. Se estudia el índice invertido y el proceso de análisis del texto, se diseñan mapeos explícitos, se escriben consultas con Query DSL y se ajusta la relevancia leyendo la explicación de la puntuación. Después se construyen agregaciones para paneles y se monta una ingesta de registros con sus pipelines y su política de ciclo de vida.

Al terminar se puede diseñar un índice pensado para su consulta real, mantenerlo y explotarlo, y decidir el número de fragmentos con argumentos. Conecta con el curso de arquitecturas de datos en tiempo real, donde la búsqueda y la explotación de registros forman parte de un sistema mayor.

¿Para quién es este curso?

  • Desarrolladores que deben incorporar búsqueda por texto libre a una aplicación con catálogo amplio.
  • Ingeniería de plataforma que centraliza registros de varios servicios para diagnosticar incidencias.
  • Perfiles técnicos que mantienen un clúster de Elasticsearch heredado y quieren operarlo con criterio.
Próximamente

Curso en hoja de ruta. Se prioriza según la demanda recogida y los proyectos en cartera.

Código
BIG-190
Nivel
Avanzado
Público
Desarrollo, Ingeniería / Industria
Entorno
Elasticsearch, Docker

Este curso incluye

  • 33 clases en vídeo bajo demanda
  • Práctica en entornos web y simuladores, sin instalar nada
  • Tutorización en el campus
  • Acceso desde móvil, tableta y ordenador
  • Actualizaciones cuando cambia la versión de la herramienta
  • Certificado de finalización

Sigue aprendiendo

Cursos relacionados

Bajo demanda

BIG-110Big Data e Ingeniería de Datos

Apache Spark con PySpark

DataFrames distribuidos, transformaciones perezosas y ejecución sobre clúster desde el cuaderno.

SparkPythonJupyterLab

Avanzado 30 clases

Próximamente

BIG-112Big Data e Ingeniería de Datos

Spark con Scala en notebook

La API nativa de Spark con el kernel Almond, para equipos que necesitan el máximo rendimiento.

SparkScalaJupyterLab

Avanzado 25 clases

Bajo demanda

BIG-120Big Data e Ingeniería de Datos

Apache Kafka: fundamentos

Topics, particiones, grupos de consumidores y retención: el sistema nervioso de la arquitectura de datos.

KafkaDocker

Avanzado 28 clases