El problema fundamental que HIR aborda es la optimización de la relevancia de anuncios en escenarios de 'deep funnel' (conversiones de bajo volumen, alto valor) en sistemas a escala de hyperscaler, donde la escasez de señales de engagement y la naturaleza dinámica y dispersa de las interacciones usuario-anuncio dificultan la inferencia de intereses latentes. Tradicionalmente, los sistemas de recomendación luchan con la 'cold start problem' y la generalización a entidades poco frecuentes o nuevas, especialmente en grafos masivos con conexiones dispersas. HIR propone una solución mediante la construcción de representaciones de interés multi-jerárquicas, que fusionan el conocimiento del mundo real (contenido multimodal de productos y anunciantes) con las señales de engagement del usuario. Esto permite al sistema navegar entre anclajes de interés estables de alto nivel y señales específicas de baja granularidad, superando las limitaciones de los modelos que dependen únicamente de interacciones directas y mejorando la capacidad de razonamiento sobre relaciones de largo alcance en el grafo.
La relevancia de este enfoque radica en su capacidad para transformar un grafo de interacciones dispersas en un 'super-grafo' más denso y estable de primitivas de interés latente. Al hacerlo, HIR no solo mejora la precisión de la personalización de anuncios, sino que también sienta las bases para arquitecturas de ranking, recuperación y supervisión más avanzadas. La adopción de una arquitectura basada en Transformers, adaptada para grafos, es clave para manejar las dependencias de largo alcance y la heterogeneidad de los datos, un desafío computacionalmente intensivo que requiere optimizaciones específicas para la atención en grafos.
Arquitectura del Sistema
La arquitectura de Hierarchical Interest Representation se centra en un 'Enriched Engagement Graph' y un 'Hierarchical Encoder' basado en Transformers. El grafo es heterogéneo, tipado, ponderado y con decaimiento temporal, unificando entidades como usuarios, anuncios, anunciantes, campañas, productos y píxeles, conectados por aristas que representan interacciones y eventos. Para escalar a miles de millones de nodos y aristas, el sistema utiliza 'deep hash embeddings' para los nodos frecuentes, manteniendo la memoria acotada. La infraestructura de grafo online de Meta alimenta tanto el entrenamiento como el serving, asegurando consistencia de distribución.
El 'Hierarchical Encoder' es un Transformer adaptado para grafos. Su entrada combina múltiples codificadores: un 'node encoder' que fusiona el tipo de nodo, ID (vía deep hash embeddings), 'world knowledge' (características multimodales procesadas por LLMs) y metadatos; un 'position encoder' que inyecta topología local mediante 'random walks' y estrategias de prioridad; y un 'edge encoder' que prepara el tipo de arista, peso y señales temporales. La clave de la adaptación a grafos es la 'Bias Composition', donde las señales estructurales del grafo (transiciones de tipo de nodo, distancia de camino más corto) se incorporan como sesgos en el mecanismo de atención. Para la eficiencia, se utiliza 'FlexAttention', que calcula los términos de sesgo 'on the fly' sin materializar la matriz de sesgo completa, permitiendo atención consciente de la estructura del grafo de manera eficiente en memoria.
El entrenamiento se realiza mediante 'Cross-View Distillation' (un esquema teacher-student auto-supervisado) y 'Engagement Prediction' (un objetivo supervisado complementario). La destilación enseña al modelo a agrupar diferentes vistas del mismo nodo en el mismo cluster de interés, utilizando 'Sinkhorn-Knopp balanced assignment' para evitar el colapso de clusters. La predicción de engagement proporciona una conexión directa con el comportamiento observado del usuario. La infraestructura de entrenamiento está optimizada para GPU, con fetching de subgrafos y lectura de características de nodos en pipeline, logrando aceleraciones significativas y manteniendo la reproducibilidad. Para garantizar la causalidad y evitar la fuga de información, el entrenamiento y la evaluación respetan estrictamente el orden temporal de los eventos, aplicando 'cutoff timestamps' y mezclando batches solo dentro de ventanas de tiempo fijas. Finalmente, los embeddings continuos se discretizan en 'Bag-of-Meaning (BoM) tokens' mediante 'composite quantization', facilitando la recuperación con índices invertidos y la interpretación.
Flujo de Entrenamiento del Hierarchical Encoder
- 1 Enriched Engagement Graph Grafo heterogéneo (usuarios, ads, productos) con aristas tipadas, ponderadas ...
- 2 Subgraph Sampling Muestreo de vistas 'teacher' (amplia) y 'student' (estrecha) del grafo.
- 3 Node/Edge Encoders Fusión de ID, tipo, 'world knowledge' (LLM), metadatos, posición y señales te...
- 4 Hierarchical Encoder (Transformer) Mecanismo de atención con 'graph-structural bias' (FlexAttention).
- 5 Cross-View Distillation Student predice cluster de interés del teacher (Sinkhorn-Knopp).
- 6 Engagement Prediction Objetivo supervisado: predecir existencia de arista de engagement.
- 7 Universal Embeddings Salida: embeddings continuos para usuarios y entidades.
- 8 Bag-of-Meaning Tokenization Discretización de embeddings en tokens para recuperación.
| Capa | Tecnología | Justificación |
|---|---|---|
| data-processing | LLMs | Procesamiento de contenido multimodal (texto, imagen, video) para generar características de 'world knowledge' para entidades de anuncios. Customized LLM inference engine |
| compute | Transformers | Arquitectura principal del Hierarchical Encoder para aprender representaciones de largo alcance en grafos heterogéneos. vs Graph Neural Networks (GNNs) tradicionales, Message Passing Neural Networks Sparse attention con 'graph-structural bias' (FlexAttention) |
| storage | Online Graph Engine (Meta's in-house) | Almacenamiento y serving del grafo heterogéneo a escala de miles de millones de entidades e interacciones, garantizando consistencia entre entrenamiento y serving. Typed, weighted, time-decayed graph; cutoff timestamp para causalidad. |
| compute | GPU | Aceleración del entrenamiento del Hierarchical Encoder, con pipelining de fetching de subgrafos y lectura de características para maximizar la utilización. 30x speedup en wall-clock time sobre baseline síncrono. |
| data-processing | Deep Hash Embeddings | Manejo de la escala del vocabulario de IDs de nodos (decenas de miles de millones) manteniendo la memoria acotada. vs Embeddings densos para cada ID Pequeña red neuronal compartida aplicada a un vector de hashes del ID del nodo. |
Fundamentos Teóricos
La integración de conocimiento del mundo real y señales de engagement en un modelo de grafo con atención es un eco de los principios de 'knowledge graphs' y 'graph neural networks' (GNNs), que han sido un área activa de investigación académica. La idea de enriquecer nodos con información semántica de LLMs y modelos multimodales se alinea con trabajos recientes en 'heterogeneous information networks' y 'knowledge-aware recommendation systems', donde la información contextual y semántica es crucial para superar la escasez de datos de interacción. El uso de Transformers en grafos, aunque no es una idea nueva per se, se basa en la capacidad de los mecanismos de atención para capturar dependencias de largo alcance, un concepto popularizado por el paper "Attention Is All You Need" (Vaswani et al., 2017).
La técnica de 'Cross-View Distillation' para auto-supervisión tiene raíces en el aprendizaje contrastivo y la destilación de conocimiento, donde un modelo 'teacher' más robusto o con una vista más amplia guía el aprendizaje de un modelo 'student'. Esto se relaciona con trabajos como "Self-supervised Learning with SwAV" (Carón et al., 2020) o "SimCLR" (Chen et al., 2020), que buscan aprender representaciones invariantes a transformaciones de datos. La aplicación de 'Sinkhorn-Knopp balanced assignment' para evitar el colapso de clusters es una técnica conocida en el clustering y la asignación óptima, utilizada para asegurar una distribución equitativa de los datos entre los clusters, un problema común en métodos de auto-supervisión. La gestión de grafos a gran escala y la eficiencia de la atención en este contexto se relaciona con la investigación en 'sparse attention mechanisms' y 'graph sampling' para GNNs, buscando escalar estos modelos a grafos con miles de millones de nodos y aristas, como se discute en papers sobre 'GraphSAGE' (Hamilton et al., 2017) o 'PinSAGE' (Ying et al., 2018).