La proliferación de modelos de lenguaje grandes (LLMs) ha puesto de manifiesto un trade-off fundamental en la computación distribuida: la tensión entre la capacidad de un modelo generalista y la eficiencia y especificidad requeridas por aplicaciones de dominio. Los modelos de pesos cerrados ofrecen rendimiento de vanguardia pero carecen de la flexibilidad para una personalización profunda y optimización de costos. Los modelos de pesos abiertos, por otro lado, a menudo sacrifican rendimiento o multimodalidad.

Inkling aborda este problema al ofrecer un modelo MoE de pesos abiertos que es intrínsecamente multimodal y permite un control granular sobre el esfuerzo de inferencia. Esto permite a los ingenieros Staff+ y arquitectos adaptar el modelo a sus restricciones específicas de latencia y presupuesto, un desafío recurrente en sistemas distribuidos donde el costo marginal de inferencia a escala puede ser prohibitivo. La capacidad de ajustar el 'esfuerzo de pensamiento' del modelo es una respuesta directa a la necesidad de optimizar el rendimiento por watt y por dólar en entornos de producción de hyperscaler, donde la inferencia de LLMs es una carga computacional significativa.

Arquitectura del Sistema

Inkling se basa en una arquitectura Transformer Mixture-of-Experts (MoE), siguiendo en gran medida el diseño de DeepSeek-V3. Cada capa MoE integra 256 expertos ruteados y 2 expertos compartidos, con 6 expertos ruteados activos por token. La selección de expertos se gestiona mediante un router basado en sigmoide que incorpora un sesgo de balanceo de carga sin pérdida auxiliar. Las puntuaciones de los expertos seleccionados y compartidos se normalizan conjuntamente para ponderar sus salidas combinadas.

Para el mecanismo de atención, Inkling intercala capas de ventana deslizante y capas globales en una proporción de 5:1, utilizando 8 cabezas de KV. La codificación posicional se realiza con un embedding posicional relativo, que se ha encontrado más efectivo y con mejor extrapolación a secuencias largas que el Rotary Positional Embedding (RoPE). Adicionalmente, se aplican convoluciones cortas en dos puntos clave: después de las proyecciones de clave y valor en cada capa de atención, y en las salidas de las ramas residuales de atención y MLP antes de que se reincorporen al flujo residual principal. El pre-entrenamiento se realizó en 45 trillones de tokens multimodales (texto, imágenes, audio, video) utilizando una estrategia de optimización híbrida (Muon para pesos de matriz grandes, Adam para otros parámetros) y un acoplamiento de la fuerza de weight decay al cuadrado del learning rate para estabilidad de pesos. El post-entrenamiento se basa en Reinforcement Learning (RL) a gran escala, con un enfoque en la calibración, el seguimiento de instrucciones y la resistencia a la censura, utilizando graders automatizados y datasets específicos para la incertidumbre calibrada.

Flujo de Inferencia con Esfuerzo Controlable

  1. 1 Input Request Solicitud de inferencia con parámetro de 'esfuerzo de pensamiento' (e.g., eff...
  2. 2 Router MoE El router basado en sigmoide selecciona 6 expertos ruteados y 2 compartidos p...
  3. 3 Expert Activation Solo los expertos seleccionados procesan el token, reduciendo el cómputo activo.
  4. 4 Atención Híbrida Capas de atención de ventana deslizante y global (5:1) procesan la secuencia.
  5. 5 Convoluciones Cortas Aplicadas en proyecciones KV y ramas residuales para eficiencia.
  6. 6 Salida Ponderada Las salidas de los expertos se combinan ponderadamente para generar la respue...
  7. 7 Ajuste de Tokens El modelo ajusta el número de tokens utilizados en función del 'esfuerzo' sol...
CapaTecnologíaJustificación
compute NVIDIA GB300 NVL72 systems Infraestructura de hardware para el entrenamiento a gran escala del modelo Inkling.
data-processing Muon Estrategia de optimización para pesos de matriz grandes durante el entrenamiento del modelo. vs Adam (para otros parámetros)
data-processing Adam Estrategia de optimización para parámetros no matriciales durante el entrenamiento del modelo. vs Muon (para pesos de matriz grandes)
data-processing Reinforcement Learning (RL) Método de post-entrenamiento a gran escala para dar forma al comportamiento del modelo, mejorar el razonamiento y el rendimiento general. vs Supervised Fine-Tuning (SFT) inicial Más de 30M rollouts, entrenamiento asíncrono.
orchestration Tinker Plataforma para la personalización y fine-tuning de modelos, incluyendo Inkling.

Trade-offs

Ganancias
  • Eficiencia de tokens (costo/latencia)
  • Capacidad de personalización (fine-tuning)
  • Multimodalidad nativa
  • Calibración y seguimiento de instrucciones
Costes
  • Rendimiento absoluto en benchmarks generales

Fundamentos Teóricos

El concepto de Mixture-of-Experts (MoE) tiene raíces profundas en la investigación de redes neuronales, remontándose a trabajos como el de Jacobs et al. (1991) y Jordan y Jacobs (1994) sobre la combinación de expertos. Estos trabajos sentaron las bases para la idea de que múltiples redes neuronales especializadas podrían colaborar, con un 'gating network' dirigiendo la entrada al experto más apropiado. En el contexto de los Transformers, la aplicación de MoE, como se ve en Inkling, permite escalar el número total de parámetros del modelo sin aumentar proporcionalmente el costo computacional por token durante la inferencia, ya que solo un subconjunto de expertos está activo. Esto aborda el desafío de entrenar modelos masivos de manera eficiente, un problema que ha sido objeto de intensa investigación desde la introducción de la arquitectura Transformer por Vaswani et al. (2017).

La implementación de embeddings posicionales relativos, en lugar de RoPE, también conecta con la investigación sobre cómo los Transformers manejan la información de secuencia. Trabajos como 'Self-Attention with Relative Position Representations' de Shaw et al. (2018) y 'Music Transformer' de Huang et al. (2018) demostraron los beneficios de codificar las posiciones relativas entre tokens, lo que puede mejorar la capacidad del modelo para generalizar a longitudes de secuencia no vistas durante el entrenamiento, un aspecto crítico para el manejo de ventanas de contexto de hasta 1M de tokens.