Prompt Routing es un patrón arquitectónico en sistemas que utilizan Large Language Models (LLMs) que implica la selección y dirección inteligente de un prompt de entrada a uno o más LLMs específicos, o a secuencias de procesamiento (cadenas de prompts o agentes), en función de las características del prompt, el contexto del usuario, la complejidad de la tarea, el costo computacional o las capacidades especializadas de los modelos disponibles. Su objetivo principal es optimizar el rendimiento, la eficiencia, la latencia y el costo, asegurando que cada solicitud sea manejada por el recurso más adecuado.

En el mundo real, Prompt Routing se implementa en plataformas de orquestación de LLMs como LangChain o LlamaIndex, donde se pueden definir 'routers' que deciden qué herramienta, agente o LLM específico debe procesar una consulta. Por ejemplo, un sistema de atención al cliente podría usar Prompt Routing para enviar preguntas sobre facturación a un LLM optimizado para datos numéricos y bases de conocimiento internas, mientras que las preguntas sobre soporte técnico general se dirigirían a un LLM de propósito general. Otro caso es el uso de 'model gateways' que, basándose en la longitud del prompt, el idioma detectado o la sensibilidad del contenido, enrutan la solicitud a un modelo más pequeño y rápido, a un modelo de mayor capacidad o a un modelo con filtros de seguridad específicos, respectivamente. Empresas que construyen aplicaciones complejas sobre LLMs, como plataformas de IA conversacional o asistentes virtuales avanzados, utilizan esta técnica para gestionar la complejidad y la heterogeneidad de sus infraestructuras de modelos.

Para un Arquitecto de Sistemas, Prompt Routing es crucial porque permite construir sistemas de IA más robustos, escalables y rentables. Permite la modularización de las capacidades de IA, desacoplando la lógica de negocio de la implementación específica del modelo. Los trade-offs incluyen la complejidad adicional en el diseño del sistema de enrutamiento (reglas, clasificadores, monitoreo), la latencia potencial introducida por la fase de enrutamiento y la necesidad de mantener actualizadas las capacidades y el rendimiento de los modelos enrutados. Sin embargo, los beneficios superan estos desafíos al permitir la optimización de costos (usando modelos más baratos para tareas simples), la mejora de la calidad de respuesta (usando modelos especializados), la gestión de la carga (distribuyendo prompts entre diferentes proveedores o instancias) y la resiliencia (fallover a modelos alternativos). Es una estrategia clave para la gobernanza y la eficiencia en arquitecturas de IA a gran escala.