El despliegue de capacidades de IA generativa en entornos industriales y remotos presenta un desafío fundamental: cómo operar con inferencia de modelos de lenguaje grandes (LLMs) cuando la conectividad a la nube es poco fiable o inexistente. Este problema se agrava por las restricciones de hardware en el edge, que impiden el uso de modelos de gran tamaño. La solución propuesta es una arquitectura 'offline-first' que traslada la inferencia de IA al edge, mientras reserva la nube para la personalización del modelo, la orquestación del despliegue y la mejora continua.
Históricamente, los sistemas distribuidos han lidiado con la disponibilidad y la consistencia en entornos de red inestables, como se articula en el teorema CAP. Esta arquitectura prioriza la disponibilidad local y la tolerancia a particiones de red, sacrificando la consistencia inmediata con la nube. La necesidad de procesar datos y tomar decisiones en tiempo real en el edge, sin depender de la latencia o el ancho de banda de la red, impulsa esta evolución. La miniaturización de modelos de IA y la mejora del hardware de inferencia en el edge (GPUs con VRAM suficiente) hacen que esta aproximación sea viable ahora.
Arquitectura del Sistema
La arquitectura se organiza en tres capas: preparación en la nube, orquestación del despliegue y inferencia en el edge. La capa de preparación en la nube utiliza Amazon S3 como fuente de verdad para la documentación técnica. Amazon Bedrock procesa esta documentación para generar pares de preguntas-respuestas-contexto estructurados, que alimentan un pipeline de FMOps en Amazon SageMaker AI. Este pipeline realiza el fine-tuning de un Small Language Model (SLM) como gpt-oss-20b (arquitectura MoE) utilizando QLoRA, adaptándolo a un dominio específico. El modelo resultante se almacena en S3.
La orquestación del despliegue se realiza mediante AWS IoT Greengrass, que transfiere el modelo cuantizado (formato GGUF) al dispositivo edge. En el edge, un dispositivo con GPU (ej. NVIDIA Jetson Xavier o g4dn.12xlarge) ejecuta la inferencia. Ollama actúa como el runtime de inferencia ligero y compatible con contenedores. Strands Agents proporciona la capa de orquestación, dirigiendo las solicitudes a la base de conocimiento RAG local (implementada con ChromaDB, SQLite y HNSW para embeddings de sentence-transformer) o a herramientas de telemetría. Una interfaz web local basada en Flask permite a los operadores interactuar con el sistema. Un bucle de retroalimentación asíncrono, resistente a la conectividad intermitente, sincroniza las interacciones del usuario y los datos de retroalimentación con la nube para la mejora continua del modelo.
Flujo de Despliegue y Personalización de Modelo
- 1 Amazon S3 Almacena documentación técnica y SOPs.
- 2 Amazon Bedrock Procesa documentación en pares Q&A-contexto para fine-tuning.
- 3 Amazon SageMaker AI Pipelines Orquesta el fine-tuning (QLoRA) de SLM (gpt-oss-20b) con datos generados.
- 4 Amazon S3 Almacena el modelo personalizado y cuantizado (GGUF).
- 5 AWS IoT Greengrass Despliega el modelo cuantizado al dispositivo edge.
Flujo de Inferencia en el Edge
- 1 Flask Operator Portal Interfaz de usuario local para consultas.
- 2 Strands Agents Orquesta el flujo de consulta, enruta a herramientas.
- 3 ChromaDB (RAG) Base de conocimiento vectorial local para recuperación de documentos.
- 4 Ollama Runtime de inferencia para el SLM fine-tuned.
- 5 SLM (gpt-oss-20b) Genera respuestas basadas en contexto recuperado y prompt.
- 6 Feedback Loop Sincroniza interacciones y feedback con la nube (cuando hay conectividad).
| Capa | Tecnología | Justificación |
|---|---|---|
| storage | Amazon S3 | Almacenamiento de documentación base, artefactos de modelos y datos de entrenamiento. |
| data-processing | Amazon Bedrock | Generación automatizada de datos de entrenamiento (Q&A pairs) a partir de documentación raw. Uso de Amazon Nova Pro para procesamiento. |
| compute | Amazon SageMaker AI Pipelines | Orquestación del pipeline de FMOps para fine-tuning de modelos (QLoRA). Fine-tuning de gpt-oss-20b (MoE) con QLoRA. |
| orchestration | AWS IoT Greengrass | Despliegue y gestión del ciclo de vida de modelos cuantizados en dispositivos edge. vs AWS Systems Manager Uso de certificados de dispositivo para mTLS. |
| compute | Ollama | Runtime de inferencia ligero y containerizado para SLMs en el edge. Soporte para formatos de modelo cuantizados (GGUF). |
| orchestration | Strands Agents | Capa de orquestación en el edge para coordinar el flujo de procesamiento de consultas y enrutamiento a herramientas. Patrón basado en agentes para extensibilidad. |
| storage | ChromaDB | Base de datos vectorial local para Retrieval Augmented Generation (RAG). Uso de SQLite + HNSW, embeddings de sentence-transformer (384 dimensiones), chunking de 512 tokens. |
| compute | NVIDIA Jetson Xavier / g4dn.12xlarge | Hardware de inferencia GPU en el edge. Requiere >16 GB VRAM. Estrategias de despliegue: Model Replication vs. Tensor Parallelism. |
Trade-offs
Ganancias
- ▲ Disponibilidad de IA en entornos sin conectividad
- ▲ Reducción de latencia de inferencia
- ▲ Precisión de respuestas para dominio específico
Costes
- △ Complejidad arquitectónica en el edge
- ▲ Restricciones de hardware en el edge (VRAM)
- △ Costo inicial de hardware edge
Fundamentos Teóricos
La estrategia de Retrieval Augmented Generation (RAG) empleada en esta arquitectura se basa en principios de sistemas de recuperación de información y procesamiento de lenguaje natural. La idea de complementar un modelo generativo con información recuperada de una base de conocimiento externa para reducir alucinaciones y mejorar la precisión se ha explorado en trabajos como 'Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks' (Lewis et al., 2020). Este enfoque combina la capacidad de los modelos de lenguaje para generar texto coherente con la fiabilidad de la información factual obtenida de un corpus de documentos.
La cuantificación de modelos para su despliegue en hardware con recursos limitados se relaciona con la investigación en compresión de modelos y optimización de inferencia, buscando reducir el tamaño del modelo y el consumo de memoria (VRAM) sin una pérdida significativa de rendimiento. Algoritmos como QLoRA (Quantized Low-Rank Adaptation) son una evolución de técnicas de adaptación de modelos que permiten el fine-tuning eficiente de LLMs con menos recursos computacionales, como se describe en 'QLoRA: Efficient Finetuning of Quantized LLMs on Consumer GPUs' (Dettmers et al., 2023). La elección de HNSW (Hierarchical Navigable Small World) para la búsqueda de vecinos más cercanos en ChromaDB es un ejemplo de la aplicación de algoritmos eficientes para la búsqueda vectorial en espacios de alta dimensión, fundamental para el rendimiento de RAG.