El problema fundamental que aborda este enfoque es la dificultad y el alto costo de entrenar agentes de inteligencia artificial (IA) para interactuar eficazmente con grandes volúmenes de datos corporativos. Los modelos de lenguaje grandes (LLM) de frontera, aunque potentes, son caros y lentos para tareas de búsqueda multi-salto. La tesis es que los modelos de código abierto, post-entrenados con técnicas de Reinforcement Learning (RL) sobre datos específicos de la empresa, pueden superar a los modelos de frontera en rendimiento y eficiencia de costos para tareas de búsqueda, democratizando así el acceso a agentes de IA avanzados.
Históricamente, la búsqueda para LLMs evolucionó desde la búsqueda por incrustaciones (embedding search) y pipelines RAG (Retrieval Augmented Generation) hacia sistemas de recuperación agénticos multi-salto. Sin embargo, estos últimos incrementan significativamente la latencia y el costo debido a múltiples llamadas al modelo. La solución propuesta se centra en optimizar el proceso de entrenamiento para que los agentes puedan realizar búsquedas complejas de manera más eficiente y económica.
Arquitectura del Sistema
La arquitectura propuesta por Castform se integra con Neon (una base de datos Postgres con extensiones de búsqueda, 'Lakebase Search') para gestionar el ciclo de vida del entrenamiento de agentes. Los documentos corporativos se almacenan como corpus en Postgres. Castform utiliza las extensiones lakebase_text y lakebase_vector de Neon para generar datos sintéticos de entrenamiento, que incluyen tareas, entornos de búsqueda y funciones de recompensa.
Durante la fase de entrenamiento por refuerzo (RL), cada 'rollout' (iteración de prueba) del agente realiza llamadas a 'Lakebase Search' en Neon para simular la interacción con el corpus. Este proceso genera una carga de trabajo altamente 'bursty'. Neon gestiona esta carga mediante su escalado dinámico de cómputo, que permite absorber picos de demanda y reducir recursos en periodos de inactividad. Para el entrenamiento de agentes con estado, Neon utiliza su capacidad de 'branching' para proporcionar entornos de base de datos aislados y de bajo costo para cada 'rollout', evitando interferencias entre ellos y permitiendo la reconstrucción del estado mediante 'time-travel queries'. La inferencia en producción utiliza el mismo mecanismo de búsqueda en Neon.
Flujo de Entrenamiento de Agentes con Castform y Neon
- 1 Corpus Storage Documentos raw almacenados en Postgres en Neon.
- 2 Synthetic Data Gen Castform usa `lakebase_text` y `lakebase_vector` para generar tareas de entre...
- 3 RL Training Loop Cada 'rollout' del agente realiza llamadas a Lakebase Search en Neon.
- 4 Reward Function Evalúa el rendimiento del agente y guía la optimización.
- 5 Neon Dynamic Scaling Absorbe cargas 'bursty' de búsqueda, escala cómputo arriba/abajo.
- 6 Neon Branching Proporciona estados de base de datos aislados para cada 'rollout'.
- 7 Production Inference Modelo final usa las mismas llamadas a Lakebase Search.
| Capa | Tecnología | Justificación |
|---|---|---|
| storage | PostgreSQL | Almacenamiento del corpus de documentos y datos de entrenamiento. vs MongoDB, Elasticsearch, Cassandra |
| storage | Neon (Lakebase Postgres) | Base de datos con escalado dinámico de cómputo, branching y extensiones de búsqueda (`lakebase_text`, `lakebase_vector`). vs AWS Aurora, Google Cloud SQL, CockroachDB |
| data-processing | Castform | Plataforma para la generación de datos sintéticos, gestión del ciclo de entrenamiento RL y post-entrenamiento de modelos LLM. vs Hugging Face TRL, RLHF frameworks customizados |
| compute | LLM (Open-source models) | Modelos de lenguaje base que son post-entrenados por Castform para tareas específicas de búsqueda. vs GPT-4, Claude, Gemini |
Trade-offs
Ganancias
- ▲▲ Costo por solicitud
- ▲ Latencia por solicitud
- ▲ Eficiencia de entrenamiento
- ▲ Acceso a datos corporativos para entrenamiento
Costes
- △ Complejidad inicial de configuración de RL
- ▲ Dependencia de la calidad de los datos corporativos
Fundamentos Teóricos
Este enfoque se conecta con principios fundamentales de la inteligencia artificial y las bases de datos. El entrenamiento por refuerzo (RL) tiene sus raíces en trabajos como los de Richard S. Sutton y Andrew G. Barto, particularmente en el concepto de aprendizaje por ensayo y error y la optimización de políticas mediante funciones de recompensa. La idea de generar datos sintéticos para el entrenamiento es una técnica bien establecida en el aprendizaje automático para superar la escasez de datos etiquetados, relacionada con conceptos de 'data augmentation' y 'self-supervision'.
Desde la perspectiva de bases de datos, el uso de 'branching' y 'time-travel queries' en Neon para entornos aislados de entrenamiento se alinea con los principios de inmutabilidad y control de versiones de datos, similares a los sistemas de control de versiones distribuidos para código. Esto permite la creación eficiente de 'sandboxes' transaccionales, un concepto que tiene paralelos en sistemas de bases de datos distribuidas y de procesamiento de transacciones, donde la consistencia y el aislamiento son críticos.