Los sistemas de agentes de inteligencia artificial, en su núcleo, operan en dos fases principales: primero, construyen un contexto relevante, y luego, utilizan ese contexto para generar una respuesta o ejecutar una acción. La tesis central de este análisis es que la mayoría de los fallos percibidos como problemas de 'generación' por parte de los Large Language Models (LLMs) son, en realidad, síntomas de una recuperación de contexto deficiente. Si el agente no logra acceder a la información correcta y pertinente en la fase de construcción de contexto, incluso el modelo de generación más avanzado producirá resultados subóptimos o incorrectos. Este problema se agrava con la creciente complejidad y volumen de los corpus de datos, que van desde código plano hasta documentos PDF, tablas, historiales de chat y entradas multimodales.
La relevancia de este desafío es más crítica ahora que los sistemas de agentes se están adoptando ampliamente en dominios como la asistencia de codificación, la investigación y el soporte al estudio. La capacidad de un agente para responder preguntas complejas, como las razones detrás de una decisión de diseño de software o la información clave de una presentación académica, depende directamente de su habilidad para recuperar no solo datos relacionados, sino los datos correctos y más relevantes dentro de un vasto conjunto de posibilidades. La falta de precisión en la recuperación no solo lleva a respuestas erróneas (alucinaciones), sino también a un 'context rot' (contexto degradado) debido a la inclusión de ruido, y a un aumento de la latencia por la necesidad de realizar más llamadas a herramientas o procesar ventanas de contexto más grandes.
Arquitectura del Sistema
La arquitectura de un sistema de agentes eficaz debe integrar un pipeline de recuperación multifásico que va más allá de la búsqueda de texto plano o la búsqueda puramente semántica. Este pipeline se estructura típicamente en las siguientes etapas: construcción de argumentos de búsqueda, generación de candidatos, filtrado, ordenamiento, ranking, retorno de resumen y ensamblaje de contexto. La fase de 'construcción de argumentos de búsqueda' convierte la solicitud del usuario y el estado del sistema en una consulta estructurada, incluyendo filtros y criterios de ordenación.
La 'generación de candidatos' identifica fragmentos plausibles de diversas fuentes (texto, vectores, datos estructurados) utilizando técnicas como BM25 para coincidencia de palabras clave, búsqueda semántica basada en embeddings (representaciones numéricas de significado) y consultas SQL. El 'filtrado' aplica restricciones de negocio o permisos para reducir el conjunto de candidatos. El 'ordenamiento' (sorting) organiza los resultados por campos estructurados como fecha o precio. El 'ranking' asigna una puntuación a los candidatos basándose en su utilidad probable para la solicitud, combinando factores como la coincidencia semántica, la coincidencia exacta, la frescura y la calidad de la fuente. Opcionalmente, se puede aplicar un 'reranking' con un modelo más lento y preciso sobre un subconjunto más pequeño de candidatos. Finalmente, el 'ensamblaje de contexto' selecciona y formatea los fragmentos y campos estructurados para el prompt del modelo de generación, respetando las limitaciones de tokens. Esta arquitectura de 'fan out' para la construcción de contexto y 'fan in' para la generación es fundamental para asegurar que el LLM reciba un contexto conciso y de alta calidad.
Flujo de Recuperación de Contexto en Agentes de IA
- 1 Solicitud del Usuario El usuario o agente inicia una consulta.
- 2 Construcción de Argumentos El sistema convierte la solicitud en una consulta estructurada con filtros y ...
- 3 Generación de Candidatos Búsqueda inicial (BM25, Semántica, SQL) para obtener fragmentos plausibles.
- 4 Filtrado Aplicación de permisos y restricciones de negocio para reducir candidatos.
- 5 Ordenamiento Ordena los candidatos por campos estructurados (ej. fecha, precio).
- 6 Ranking / Reranking Puntuación de candidatos por utilidad; re-evaluación con modelo más lento si ...
- 7 Ensamblaje de Contexto Selección y formateo de fragmentos para el prompt del LLM.
- 8 Generación LLM El LLM produce la respuesta o acción basada en el contexto.
| Capa | Tecnología | Justificación |
|---|---|---|
| data-processing | BM25 | Algoritmo de ranking para búsqueda de texto completo, útil para coincidencia léxica y palabras clave exactas. vs TF-IDF |
| data-processing | Semantic Search (Vector Embeddings) | Permite encontrar contenido relacionado por significado, incluso si la redacción difiere, utilizando representaciones vectoriales de texto. vs Keyword Search (regex, grep) |
| storage | Vector Database | Almacena y permite la búsqueda eficiente de embeddings vectoriales para la búsqueda semántica. vs Traditional RDBMS (with vector extensions), Specialized search engines |
| data-processing | Reranker Models | Modelos más complejos y lentos que refinan el orden de un conjunto reducido de candidatos para mejorar la precisión. vs Single-stage ranking models |
| observability | Tracing Systems | Captura el flujo de ejecución y los datos en cada etapa del pipeline de recuperación para diagnóstico y evaluación. vs Logging (less structured) |
Trade-offs
Ganancias
- ▲ Precisión de la respuesta del agente
- ▲ Reducción de alucinaciones
- ▲ Eficiencia en el uso de tokens del LLM
- △ Reducción de latencia en la generación
Costes
- ▲ Complejidad de la arquitectura de recuperación
- △ Costo computacional de múltiples etapas de búsqueda y ranking
- ▲ Esfuerzo de ingeniería para implementar trazabilidad y evaluación
Fundamentos Teóricos
El problema de la recuperación de información (Information Retrieval, IR) es un campo de estudio consolidado en la informática, con raíces que se remontan a los trabajos pioneros de Vannevar Bush sobre el Memex en la década de 1940 y los primeros sistemas de recuperación de texto en los años 60. Algoritmos como TF-IDF (Term Frequency-Inverse Document Frequency) y BM25 (Okapi BM25), desarrollados en los años 80 y 90, son ejemplos clásicos de cómo se ha abordado la relevancia de documentos basada en la frecuencia y distribución de términos. Estos algoritmos, aunque robustos para la coincidencia léxica, no capturan el significado semántico, un problema que la investigación en procesamiento de lenguaje natural (NLP) ha buscado resolver a través de modelos de embeddings vectoriales. La combinación de estos enfoques (híbridos) refleja la evolución de la IR, donde la precisión y el recall son métricas fundamentales.
La necesidad de trazar y evaluar cada etapa del pipeline de recuperación resuena con los principios de sistemas distribuidos y bases de datos, donde la observabilidad y la depuración son críticas. Conceptos como la 'propagación de la relevancia' a través de un pipeline de procesamiento de datos tienen paralelos en la gestión de transacciones y la consistencia de datos. La idea de que un sistema debe 'saber' qué información necesita y cómo obtenerla se alinea con la investigación en sistemas de preguntas y respuestas (Question Answering Systems) y la representación del conocimiento, donde la calidad de los datos de entrada es tan crucial como la lógica de inferencia. La integración de filtros y criterios de ordenación en la recuperación también se relaciona con los sistemas de gestión de bases de datos relacionales, donde las cláusulas WHERE y ORDER BY son esenciales para refinar los resultados de las consultas.