El incidente inicial fue causado por el agotamiento rápido de los límites de tokens de un modelo LLM (Claude Fable 5) al ser utilizado de forma indiscriminada para todas las tareas de un pipeline de investigación profunda. La estrategia inicial de usar un único modelo de alta capacidad para todas las fases de la investigación, incluyendo búsqueda, verificación y síntesis, resultó en un consumo ineficiente y excesivo de recursos, alcanzando el límite de la suscripción en solo 30 minutos sin producir resultados utilizables. Esto se clasifica como un fallo por agotamiento de recursos, exacerbado por una falta de optimización en la asignación de tareas a modelos.

Las salvaguardas existentes, como los límites de tokens por suscripción, funcionaron como se esperaba al detener el consumo excesivo, pero no ofrecieron una solución al problema subyacente de eficiencia. La ausencia de un mecanismo de orquestación inteligente o de una estrategia de asignación de modelos por rol significó que el modelo más caro y capaz estaba siendo utilizado para tareas que podrían haber sido manejadas por modelos más económicos o especializados. Esto llevó a una cascada de ineficiencia, donde el alto costo por token y la amplitud de las tareas asignadas al modelo principal agotaron rápidamente el presupuesto de tokens.

La solución implicó un rediseño arquitectónico del pipeline de agentes. Se introdujo una estrategia de orquestación multi-modelo, aprovechando suscripciones existentes de diferentes proveedores (Claude, Codex, Antigravity) y asignando roles específicos a cada modelo basándose en su costo y rendimiento para tareas particulares (ej. modelos baratos para 'Find', modelos precisos para 'Verify', modelos caros para 'Judge & plan'). Se implementó un sistema de memoria compartida y un mecanismo de fallback automático para garantizar la continuidad de la operación cuando un modelo alcanzara su límite. Además, se reordenó el flujo de trabajo, ejecutando la 'investigación profunda' (más costosa) como el último paso sobre datos pre-verificados, y se añadieron reglas explícitas de verificación para mejorar la confianza en los resultados y reducir las alucinaciones. Este enfoque transformó un pipeline inoperable en uno que podía funcionar durante horas sin costos adicionales y con mayor fiabilidad.