El problema fundamental que aborda este artículo es el 'cold-start' en sistemas de recomendación, específicamente en el contexto de la personalización de activos multimedia (imágenes y videos) para nuevos títulos o nuevas superficies de interfaz de usuario. Tradicionalmente, los sistemas de recomendación basados en interacciones de usuario (behavioral data) sufren cuando no hay suficiente historial de interacción para un ítem nuevo. Esto lleva a una experiencia subóptima para el usuario y a una lenta acumulación de datos relevantes.

La solución propuesta por Netflix es trascender la representación de los activos como IDs opacos y, en su lugar, dotar a los modelos de la capacidad de 'ver' y 'escuchar' el contenido de los activos. Esto se logra mediante la integración de embeddings multimodales pre-entrenados, que capturan las características semánticas del contenido visual y auditivo. Al hacerlo, se permite que el conocimiento sobre las preferencias del usuario, aprendido de activos similares, se transfiera inmediatamente a los nuevos, mitigando el problema del cold-start y permitiendo una personalización efectiva desde el lanzamiento de un título.

Arquitectura del Sistema

La arquitectura central se basa en la integración de embeddings de contenido en las representaciones de los activos dentro de los modelos de personalización. Para la personalización de imágenes (artwork), se utiliza CLIP (Contrastive Language-Image Pre-training) para generar un embedding de imagen de 768 dimensiones. Este vector se concatena con el embedding de ID tradicional del activo, creando una representación enriquecida que el modelo de personalización consume. Esta aproximación permite que las preferencias visuales del miembro (temas, actores, paletas de color) se apliquen a nuevas imágenes sin historial de interacción.

Un avance clave es la consolidación de cinco modelos de personalización de artwork (uno por cada 'canvas' o formato de visualización) en un único modelo unificado. Los embeddings de CLIP son robustos a variaciones de recorte y aspecto, permitiendo que un mismo embedding represente un activo a través de diferentes canvases. Para manejar la disparidad de volumen de impresiones y valor de interacción entre canvases, se emplea un esquema de 'reward-based weighting' durante el entrenamiento, utilizando 'long-term reward scores' para cada tipo de interacción. Esto asegura que el modelo optimice la satisfacción a largo plazo del miembro, no solo las interacciones más frecuentes.

Para la personalización de previsualizaciones de video, se utiliza MediaFM, un modelo fundacional multimodal interno de Netflix. MediaFM fusiona señales visuales (SeqCLIP, que promedia embeddings CLIP de frames), de audio (un modelo de embedding de voz y audio pre-entrenado) y de texto (subtítulos codificados por un modelo de texto a gran escala) en un único embedding por 'shot' de video. Estos embeddings se integran de manera similar a los de CLIP en la representación del activo de video. Todos estos embeddings son gestionados y servidos por el Netflix Embedding Store, que desacopla las actualizaciones de los modelos fundacionales de los despliegues de los modelos de personalización, asegurando consistencia entre entrenamiento e inferencia.

Flujo de Personalización de Artwork con Embeddings CLIP

  1. 1 Creación de Activo Nuevo artwork de título es creado.
  2. 2 Generación de Embedding El artwork es procesado por CLIP para generar un embedding de imagen.
  3. 3 Netflix Embedding Store El embedding CLIP se almacena junto con el ID del activo.
  4. 4 Modelo Unificado de Artwork El modelo consume el embedding CLIP + ID para representar el activo.
  5. 5 Personalización y Ranking El modelo aplica preferencias de miembro (en espacio de embedding) para ranke...
  6. 6 Servicio al Usuario Artwork personalizado se muestra en la interfaz de usuario.

Flujo de Evaluación Offline con IPS

  1. 1 Tráfico de Exploración Pequeña fracción de tráfico servida por política aleatoria conocida.
  2. 2 Registro de Propensiones La probabilidad de mostrar un activo (propensity) se registra en tiempo de se...
  3. 3 Observación de Recompensa Se registra la interacción (recompensa) del usuario con el activo.
  4. 4 Cálculo de IPS Cada observación se repondera por el inverso de su propensión loggeada.
  5. 5 Estimación de Recompensa Se obtiene una estimación insesgada de la recompensa para una política candid...
  6. 6 Decisión A/B Test Si el modelo candidato gana en IPS, pasa a A/B testing online.
CapaTecnologíaJustificación
data-processing CLIP Modelo pre-entrenado para generar embeddings de imagen-texto, utilizado para representar artworks y permitir la personalización basada en contenido visual.
data-processing MediaFM Modelo fundacional multimodal interno de Netflix para generar embeddings de video, fusionando señales visuales (SeqCLIP), de audio y de texto (subtítulos). vs SeqCLIP (solo visual) Entrenado en 80 millones de 'shots'.
storage Netflix Embedding Store Plataforma centralizada para almacenar y servir embeddings densos de diversos activos (títulos, perfiles, multimedia) a sistemas downstream, asegurando consistencia entre entrenamiento e inferencia. Desacopla actualizaciones de modelos fundacionales de despliegues de modelos de personalización.
compute Modelos de Personalización Unificados Modelos de machine learning que consumen embeddings de activos para rankear y personalizar la presentación de artworks y previsualizaciones de video. vs Múltiples modelos por 'canvas' (ej. 5 modelos para artwork) Utilizan 'reward-based weighting' para mezclar datos de entrenamiento de diferentes canvases.
observability Inverse Propensity Scoring (IPS) Metodología para la evaluación offline insesgada de modelos de recomendación, utilizando datos de tráfico de exploración aleatorizado para corregir el sesgo de la política de logging. Requiere una pequeña fracción de tráfico servida por una política de muestreo conocida.

Trade-offs

Ganancias
  • Reducción del problema de cold-start
  • Consolidación de modelos (5 a 1 para artwork)
  • Mejora en la personalización para canvases con pocos datos
  • Mejora en la relevancia de búsqueda (query-aware ranking)
  • Mejora en la personalización de previsualizaciones de video (multimodalidad)
  • Reducción de costos y tiempo en evaluación de nuevos embeddings (linear probe)
Costes
    asset_representation = concatenate(CLIP_image_embedding, learned_ID_embedding)
    Concatenación del embedding de contenido (ej. CLIP) con el embedding de ID tradicional para formar la representación final del activo en el modelo.
    training_example_weight = ρ[e(observed_positive_interaction)]
    Cálculo del peso de un ejemplo de entrenamiento basado en el valor de recompensa a largo plazo de su tipo de interacción.
    Expected_Reward = sum(r(x, a) / p(x, a)) for (x, a) in D
    Cálculo de la recompensa esperada de una política candidata usando IPS para corregir el sesgo de la política de logging.
    Final_Score = (1 - α) * personalization_score + α * cosine_similarity(CLIP_text_embedding(query), CLIP_image_embedding(asset))
    Combinación del score de personalización con la similitud coseno entre el embedding de la consulta y el embedding del activo.
    Minimize: Binary_Cross_Entropy_Loss(Linear_Probe(asset_embedding), is_popular_label)
    Entrenamiento de un clasificador lineal simple para predecir la popularidad de un activo a partir de su embedding, usando binary cross-entropy loss.

    Fundamentos Teóricos

    El problema del cold-start en sistemas de recomendación ha sido un tema central en la investigación académica desde los inicios de los sistemas de filtrado colaborativo. Trabajos seminales como los de Sarwar et al. (2001) en el contexto de la filtración colaborativa basada en ítems ya destacaban la dificultad de recomendar ítems nuevos sin historial. La solución de usar 'side information' o 'content-based features' para mitigar el cold-start es un enfoque bien establecido en la literatura, con trabajos como los de Pazzani y Billsus (2007) explorando la combinación de enfoques basados en contenido y colaborativos.

    La utilización de embeddings de modelos pre-entrenados, como CLIP, se alinea con el concepto de 'transfer learning', donde un modelo entrenado en una tarea general (como la comprensión de imagen-texto) se adapta a una tarea específica. Este principio ha sido ampliamente estudiado en el aprendizaje automático, especialmente en visión por computador y procesamiento de lenguaje natural. La combinación de múltiples modalidades (texto, imagen, audio) en MediaFM refleja la tendencia académica hacia modelos multimodales, que buscan una comprensión más rica del contenido, como se explora en trabajos sobre 'multimodal representation learning' (ej., Ngiam et al., 2011). La técnica de Inverse Propensity Scoring (IPS) para la evaluación offline sin sesgos es un método estadístico robusto, con raíces en la econometría y la inferencia causal, popularizado en el contexto de la evaluación de sistemas de recomendación por trabajos como los de Schnabel et al. (2016).