El problema fundamental que K2 Horizon aborda es la opacidad inherente al desarrollo y la evolución de las capacidades de los modelos de lenguaje de gran escala (LLM). Tradicionalmente, los modelos de vanguardia se liberan como "pesos finales", lo que limita la capacidad de los investigadores y desarrolladores para comprender cómo emergen las capacidades, diagnosticar comportamientos inesperados o adaptar los métodos de entrenamiento. Esto crea una brecha entre la investigación académica y la ingeniería de sistemas distribuidos a gran escala.

K2 Horizon busca cerrar esta brecha al proporcionar un "blueprint" completo: no solo los modelos en sí, sino también todo el proceso de desarrollo, desde el pre-entrenamiento hasta el post-entrenamiento agentic. Esto permite un estudio científico observable de la dinámica del entrenamiento, conectando las decisiones de diseño arquitectónico y de datos con el comportamiento final del modelo. La relevancia actual radica en la creciente complejidad y el impacto de los LLM, donde la transparencia y la reproducibilidad son cruciales para el avance responsable y la mitigación de riesgos como el "reward hacking".

Arquitectura del Sistema

La arquitectura de K2 Horizon se basa en una familia conectada de seis modelos, compartiendo decisiones arquitectónicas centrales, metodología de entrenamiento, interfaces y herramientas. Los modelos varían en tamaño, desde 0.9B hasta 375B parámetros, optimizados para diferentes entornos de despliegue, desde dispositivos edge hasta despliegues empresariales.

Una innovación clave es Mixture-of-Value-Attention (MoVA), una extensión del principio Mixture-of-Experts (MoE) a las capas de atención. Mientras que MoE aplica la dispersión principalmente a las capas feed-forward, MoVA integra el enrutamiento de expertos en la atención multi-cabeza, permitiendo escalar la capacidad del modelo más allá de la red feed-forward. Esto se ejemplifica en el modelo 36B-A4B, que logra un rendimiento cercano al modelo denso 32B con solo 4B parámetros activos por token. MoVA es compatible con técnicas eficientes como FlashAttention y grouped-query attention.

El pipeline de entrenamiento es exhaustivo, utilizando aproximadamente 20 billones de tokens para el pre-entrenamiento, con una mezcla diversa de datos web, código, matemáticos, científicos y sintéticos. Se incorporan "trayectorias de razonamiento" (problem-solving trajectories) directamente en el pre-entrenamiento. El post-entrenamiento incluye mid-training, supervised fine-tuning, model merging y reinforcement learning con entrenamiento agentic especializado, creando un "árbol de desarrollo" con ramas para razonamiento, codificación y uso de herramientas. Para la inferencia, se introduce Uno Diffusion, un adaptador LoRA ligero que acelera la generación de tokens en paralelo sin degradar la calidad, utilizando un proceso de Diffusion Distillation para aprender a generar bloques de tokens de manera más eficiente.

Flujo de Desarrollo y Transparencia de K2 Horizon

  1. 1 Pre-entrenamiento 20T tokens, mezcla diversa (web, código, sintético), 17% trayectorias de razo...
  2. 2 Mid-training Introducción temprana de datos de post-entrenamiento, documentos de contexto ...
  3. 3 Supervised Fine-tuning (SFT) Ajuste del modelo base con datos etiquetados para tareas específicas (razonam...
  4. 4 Model Merging Combinación de modelos o adaptadores para consolidar capacidades o especializ...
  5. 5 Reinforcement Learning (RL) Entrenamiento con feedback para mejorar el comportamiento y las capacidades a...
  6. 6 Uno Diffusion (Inferencia) Adaptador LoRA para aceleración de inferencia sin pérdida de calidad mediante...
  7. 7 Liberación Abierta Pesos finales, checkpoints intermedios, datos/recetas, código, logs y herrami...
CapaTecnologíaJustificación
compute Transformer Architecture Base para todos los modelos LLM de la flota, con variaciones en el tamaño y la densidad de parámetros.
compute Mixture-of-Experts (MoE) Mecanismo para aumentar la capacidad total del modelo manteniendo el costo computacional por token fijo, aplicado a capas feed-forward.
compute Mixture-of-Value-Attention (MoVA) Innovación que extiende MoE a las capas de atención, permitiendo mayor eficiencia y escalabilidad en modelos dispersos. vs Atención densa tradicional, MoE solo en feed-forward Compatible con FlashAttention, grouped-query attention, sparse attention.
data-processing Wzip Compressor Herramienta para cuantificar la diversidad de grandes corpora de datos de entrenamiento, utilizando un algoritmo LZ77 adaptativo. vs gzip, zstd LZ77 adaptativo multi-sliding-window con Huffman coding.
compute Uno Diffusion (LoRA Adapter) Mecanismo de aceleración de inferencia sin pérdida de calidad, que permite la generación paralela de tokens mediante Diffusion Distillation. vs Decodificación especulativa, Modelos de difusión discretos Parámetros autoregresivos congelados, parámetros de difusión ligeros.
orchestration xLLM Infraestructura de entrenamiento de producción para LLM, diseñada para rendimiento a gran escala y flexibilidad de investigación.

Trade-offs

Ganancias
  • Transparencia y reproducibilidad del entrenamiento de LLM
  • Eficiencia computacional por token en modelos grandes (MoVA)
  • Velocidad de inferencia sin pérdida de calidad (Uno Diffusion)
  • Rendimiento de modelos pequeños en entornos restringidos
Costes
  • Complejidad de gestión de múltiples checkpoints y artefactos de entrenamiento
  • Riesgo de "reward hacking" en modelos agentic (mitigado por transparencia)

Fundamentos Teóricos

La filosofía de K2 Horizon de liberar el ciclo de vida completo del entrenamiento, incluyendo checkpoints intermedios y datos, resuena con los principios de la ciencia abierta y la reproducibilidad en la investigación. Este enfoque se alinea con la necesidad de comprender la "emergencia de capacidades" en sistemas complejos, un tema de interés en la teoría de sistemas y la inteligencia artificial.

La arquitectura Mixture-of-Experts (MoE) y su extensión MoVA se basan en el concepto de especialización y paralelismo, con raíces en la investigación sobre redes neuronales dispersas y la combinación de expertos, que se remonta a trabajos como "Adaptive Mixture of Local Experts" de Jacobs et al. (1991). La idea de descomponer un problema complejo en subproblemas manejables por expertos especializados es un patrón recurrente en la computación distribuida y la inteligencia artificial. La liberación de logs detallados y checkpoints intermedios permite a los investigadores estudiar fenómenos como el "reward hacking", un problema conocido en el aprendizaje por refuerzo que se relaciona con la alineación de objetivos y la teoría de juegos, donde los agentes pueden encontrar soluciones subóptimas o explotar fallas en la función de recompensa en lugar de resolver el problema principal.