El problema fundamental que Ornith-1.5 aborda es la limitación de los métodos de entrenamiento de modelos de lenguaje que dependen de conjuntos de datos estáticos y tareas predefinidas. Estos enfoques, aunque efectivos, no permiten que el modelo explore de manera autónoma nuevas fronteras de conocimiento o adapte sus estrategias de aprendizaje de forma dinámica. La tesis central es que un bucle de auto-mejora, donde el modelo genera activamente su propio currículo de entrenamiento, puede superar estas limitaciones, llevando a ganancias de capacidad sostenidas y a una mayor robustez.

Este paradigma se inspira en la idea de que la inteligencia no solo reside en la capacidad de resolver problemas, sino también en la de formularlos y aprender de ellos. En el contexto de los sistemas distribuidos, la capacidad de un sistema para adaptarse y mejorar de forma autónoma a medida que interactúa con su entorno es un objetivo de diseño de larga data, aunque raramente logrado a esta escala en el ámbito de los modelos fundacionales. La relevancia actual radica en la creciente complejidad de las tareas que se espera que realicen los LLMs, desde la generación de código hasta la interacción con entornos complejos, donde un currículo estático se vuelve rápidamente obsoleto.

Arquitectura del Sistema

La arquitectura de Ornith-1.5 se basa en un bucle de auto-mejora de tres etapas que opera de forma iterativa. Primero, un componente de 'generación de tareas' propone nuevas tareas progresivamente más difíciles, basándose en un entorno o base de código, instrucciones de alto nivel y el historial de resolución de tareas del modelo. Este componente está diseñado para identificar y explotar las 'brechas de capacidad' del modelo actual, empujando continuamente la frontera de entrenamiento.

En la segunda etapa, para cada tarea generada, el modelo construye o refina un 'scaffold' específico. Un scaffold es una combinación de instrucciones, herramientas, estrategias de descomposición y orquestación que el modelo utiliza para abordar el problema. Esto es análogo a un plan de ejecución o un 'harness' de prueba dinámico. Finalmente, la tercera etapa es la 'generación de soluciones' o 'rollout', donde la política del modelo produce una solución para la tarea dada el scaffold. La recompensa obtenida de este rollout se propaga hacia atrás a través de las tres etapas, utilizando un algoritmo de aprendizaje por refuerzo como GRPO (Generalized Policy Optimization). Esto permite que el sistema no solo mejore en la producción de soluciones, sino también en la generación de tareas más útiles y en la construcción de scaffolds más efectivos. Este acoplamiento de optimización en las tres fases es la clave para el bucle de auto-mejora, permitiendo que el currículo y las estrategias de resolución evolucionen de forma conjunta.

Bucle de Auto-Mejora de Ornith-1.5

  1. 1 Generación de Tareas El modelo propone nuevas tareas, progresivamente más difíciles, basándose en ...
  2. 2 Construcción de Scaffold Para cada tarea, el modelo genera o refina instrucciones, herramientas y estr...
  3. 3 Generación de Solución (Rollout) La política del modelo produce una solución para la tarea usando el scaffold.
  4. 4 Cálculo de Recompensa Se evalúa la solución y se calcula la recompensa (validez, dificultad, novedad).
  5. 5 Propagación de Recompensa La recompensa se propaga a las tres etapas anteriores para optimización via G...
  6. 6 Mejora de Política El sistema aprende a generar mejores tareas, scaffolds y soluciones.
CapaTecnologíaJustificación
compute Mixture-of-Experts (MoE) Permite escalar el número de parámetros del modelo (397B, 35B) mientras se mantiene la activación de parámetros por token en un nivel manejable (3B), optimizando el rendimiento computacional y la inferencia. vs Dense models
compute Qwen3.5, Gemma 4 Modelos base sobre los cuales se desarrolló Ornith-1.0 y se realizó preentrenamiento continuo (CPT), mid-training y post-training para Ornith-1.5.
data-processing Reinforcement Learning (RL) Mecanismo principal para optimizar el bucle de auto-mejora, utilizando señales de recompensa para guiar la generación de tareas, scaffolds y soluciones. vs Supervised Learning (SL) on fixed datasets
data-processing GRPO (Generalized Policy Optimization) Algoritmo específico de RL utilizado para optimizar conjuntamente las tres etapas del bucle de auto-mejora (generación de preguntas, generación de harness y rollouts de soluciones). vs PPO, TRPO

Trade-offs

Ganancias
  • Capacidad de auto-mejora continua
  • Rendimiento en benchmarks de razonamiento, codificación y agentic
  • Adaptación del currículo de entrenamiento
  • Eficiencia en modelos MoE (parámetros activados vs. totales)
Costes
  • Complejidad del sistema de entrenamiento
  • Costos computacionales de entrenamiento (generación de tareas, scaffolds, rollouts y RL)
  • Riesgo de generación de tareas triviales o imposibles sin señales de recompensa adecuadas

Fundamentos Teóricos

El concepto de auto-mejora y generación de currículo tiene raíces profundas en la investigación de inteligencia artificial y aprendizaje por refuerzo. Principios como el 'curriculum learning' (Bengio et al., 2009) postulan que entrenar modelos en una secuencia de tareas de dificultad creciente puede acelerar el aprendizaje y mejorar el rendimiento final. Ornith-1.5 lleva esto un paso más allá al automatizar la generación de este currículo.

La propagación de la recompensa a través de las etapas de generación de tareas, scaffolds y soluciones recuerda a los enfoques de 'meta-learning' o 'learning to learn', donde el sistema aprende a optimizar su propio proceso de aprendizaje. El uso de señales de recompensa como 'validez', 'dificultad de frontera' y 'novedad' para guiar la generación de tareas es una aplicación directa de principios de exploración-explotación en el aprendizaje por refuerzo, buscando un equilibrio entre consolidar habilidades existentes y descubrir nuevas. La idea de que un agente pueda generar sus propios problemas para aprender es un tema recurrente en la investigación de la autonomía y la inteligencia artificial general, con trabajos seminales en 'intrinsically motivated learning' (Schmidhuber, 1991) y 'active learning'.