El problema fundamental que aborda esta innovación es la tensión inherente entre la complejidad computacional de los modelos de secuencia basados en Transformers y los estrictos requisitos de latencia de los sistemas de recomendación de anuncios a escala de hyperscaler. Los sistemas de recomendación deben procesar miles de millones de interacciones de usuario y clasificar millones de candidatos en milisegundos, lo que históricamente ha obligado a comprometer la profundidad del modelado secuencial o la eficiencia en tiempo real.

La solución propuesta por Meta es una arquitectura de modelo de secuencia multi-etapa que desacopla las fases de procesamiento. Esto permite que el modelado de usuario intensivo en computación se realice de forma asíncrona y offline, mientras que la fase de ranking online se mantiene ligera y de baja latencia. Este enfoque no solo mejora la eficiencia, sino que también permite la aplicación de leyes de escalado tipo LLM, lo que significa que el rendimiento del modelo puede mejorar predeciblemente con el aumento de los recursos computacionales, sin los cuellos de botella de las arquitecturas híbridas anteriores.

Arquitectura del Sistema

La arquitectura se compone de dos etapas principales: un 'Offline User Model' y un 'Online Ranking Model'. El Offline User Model es un sistema basado en Transformers que procesa largas historias de usuario (secuencias de miles de eventos) de forma asíncrona. Su función es generar embeddings de usuario densos y de alta dimensión que capturan patrones de comportamiento profundos. Estos embeddings se precalculan y se almacenan en caché a nivel de usuario, y son independientes de cualquier candidato de anuncio específico.

El Online Ranking Model es la segunda etapa, optimizada para la velocidad y los presupuestos de latencia estrictos. Recibe los embeddings de usuario precalculados del Offline User Model y los combina con señales de usuario frescas en tiempo real y la información del candidato de anuncio. Utiliza una forma de atención multi-cabeza eficiente en memoria, denominada 'Target-Aware Multi-Head Attention', que permite a cada capa ponderar los comportamientos pasados del usuario contra el anuncio específico que se está puntuando. La 'Dense Tokenization' es otra innovación clave, que integra características dispersas con datos de comportamiento secuencial en un único vocabulario denso, permitiendo que los mecanismos de atención descubran interacciones directamente de los datos, eliminando la necesidad de ingeniería manual de características. La interacción entre estas dos etapas se realiza mediante la transferencia de los embeddings de usuario desde el sistema offline al online.

Flujo de Procesamiento Multi-Etapa

  1. 1 Offline User Model Procesa historias de usuario largas (miles de eventos) de forma asíncrona.
  2. 2 Generación de Embeddings Produce embeddings de usuario densos y de alta dimensión.
  3. 3 Caché de Embeddings Almacena los embeddings precalculados a nivel de usuario.
  4. 4 Online Ranking Model Recupera embeddings de usuario del caché.
  5. 5 Señales en Tiempo Real Combina embeddings con señales de usuario frescas y datos de anuncios candida...
  6. 6 Target-Aware Attention Pondera comportamientos pasados contra el anuncio específico.
  7. 7 Ranking Final Genera la clasificación de anuncios optimizada para latencia.
CapaTecnologíaJustificación
compute Transformers Base para el modelado de secuencias en ambas etapas, permitiendo capturar dependencias temporales complejas. vs RNNs, LSTMs, Modelos híbridos con feature engineering manual
storage Caché de Embeddings Almacena los embeddings de usuario precalculados para acceso de baja latencia por el modelo de ranking online. vs Recalcular embeddings en línea, Bases de datos de características en tiempo real
data-processing Dense Tokenization Integra características dispersas y datos secuenciales en un vocabulario denso para que los mecanismos de atención aprendan interacciones directamente. vs One-hot encoding, Embeddings dispersos tradicionales, Feature engineering manual
compute Target-Aware Multi-Head Attention Mecanismo de atención eficiente en memoria que permite a cada capa ponderar el historial del usuario contra un anuncio específico, destilando secuencias largas en representaciones compactas. vs Atención multi-cabeza estándar, Mecanismos de atención menos eficientes en memoria

Trade-offs

Ganancias
  • Profundidad de representación del usuario
  • Eficiencia de escalado computacional
  • Reducción de feature engineering manual
  • ▲▲ Capacidad de aplicar leyes de escalado tipo LLM
Costes
  • Complejidad arquitectónica inicial
  • Latencia de actualización de embeddings offline

Fundamentos Teóricos

El concepto de desacoplamiento de fases computacionales intensivas de fases de baja latencia tiene raíces en principios de diseño de sistemas distribuidos y bases de datos, como la separación de la escritura (write-ahead logging o WAL) y la lectura, o la distinción entre procesamiento por lotes (batch processing) y procesamiento en tiempo real (stream processing). La idea de precomputar y cachear resultados para acelerar consultas online es un patrón bien establecido en sistemas de información, similar a la materialización de vistas en bases de datos o el uso de índices.

La aplicación de Transformers y mecanismos de atención para el modelado de secuencias se basa en trabajos seminales como "Attention Is All You Need" (Vaswani et al., 2017), que introdujo la arquitectura Transformer. La observación de leyes de escalado tipo LLM en modelos de recomendación, donde el rendimiento mejora logarítmicamente con el aumento de la computación, conecta este trabajo con la investigación más reciente en modelos de lenguaje grandes, como los estudios de Kaplan et al. (2020) sobre las leyes de escalado para el entrenamiento de modelos de lenguaje, sugiriendo una universalidad en cómo la complejidad del modelo y los datos interactúan con la capacidad computacional para mejorar el rendimiento.