La detección de fraude en el sector asegurador es un problema fundamental de la computación que se manifiesta como la identificación de patrones anómalos y relaciones ocultas en grandes volúmenes de datos heterogéneos. Los métodos tradicionales, basados en reglas y análisis de datos estructurados, son insuficientes para descubrir redes de fraude sofisticadas que involucran múltiples entidades interconectadas (pólizas, reclamantes, vehículos, proveedores).
Este desafío se agrava por la necesidad de integrar los resultados de la detección en los flujos de trabajo operativos existentes, requiriendo sistemas resilientes y explicables. La solución de Mapfre USA aborda esto mediante la combinación de técnicas de Machine Learning con el poder expresivo de las bases de datos de grafos, permitiendo modelar y analizar las interconexiones que son invisibles para los enfoques relacionales tradicionales. La arquitectura se apoya en un data lakehouse moderno para gestionar la complejidad de los datos y en un motor de procesamiento elástico para escalar las cargas de trabajo.
Arquitectura del Sistema
La plataforma de detección de fraude de Mapfre USA, denominada Atenea, se construye sobre una arquitectura de data lakehouse en AWS. Los datos se almacenan en tablas Apache Iceberg sobre Amazon S3, con la gestión de metadatos a cargo de AWS Glue Data Catalog y la gobernanza de acceso mediante AWS Lake Formation. Esta estructura se organiza en capas lógicas: Silver (datos fuente estandarizados), Gold (datos intermedios y unificados) y Platinum (tablas Iceberg gestionadas como Feature Store, conteniendo características codificadas y predicciones de modelos).
Los pipelines de procesamiento se ejecutan en Amazon EMR Serverless, aprovechando Apache Spark para el procesamiento distribuido y elástico. La orquestación de estos pipelines se realiza con Apache Airflow, desplegado en Amazon Managed Workflows for Apache Airflow (Amazon MWAA), lo que centraliza la gestión de flujos de trabajo, monitoreo y recuperación. Para el enriquecimiento con características de grafo, la plataforma se conecta a una base de datos Neo4j, que permite calcular métricas de centralidad y detectar enlaces sospechosos entre entidades. La integración con el sistema de gestión de reclamaciones Guidewire se realiza mediante un flujo asíncrono: los resultados de los modelos se escriben como archivos JSON en S3, lo que dispara una función AWS Lambda que invoca la API de Guidewire de forma individual, con mecanismos de reintento, Dead-Letter Queue (DLQ) en Amazon SQS y notificaciones vía Amazon SNS para asegurar la resiliencia. AWS Secrets Manager se utiliza para la gestión segura de credenciales.
Flujo de Procesamiento de Datos y Detección de Fraude
- 1 Ingesta de Datos Datos de reclamaciones (AS400, Guidewire) se suben a S3 y se materializan en ...
- 2 Enriquecimiento de Grafos Datos procesados para actualizar la base de datos Neo4j, generando caracterís...
- 3 Entrenamiento/Scoring ML Amazon EMR Serverless ejecuta modelos ML para entrenamiento y scoring por lotes.
- 4 Almacenamiento de Features Características codificadas y predicciones se guardan en Feature Store (Capa ...
- 5 Orquestación Apache Airflow (MWAA) gestiona y coordina todos los pasos del pipeline.
Integración de Predicciones con Guidewire
- 1 Resultados ML a S3 Predicciones de fraude se escriben como archivos JSON en un path específico d...
- 2 Evento S3 Una notificación de evento de S3 dispara una función AWS Lambda.
- 3 Lambda Procesa JSON La función Lambda lee el archivo JSON y prepara llamadas individuales a la AP...
- 4 Llamada a API Guidewire Lambda invoca la API de Guidewire Predictive Model para crear actividades.
- 5 Manejo de Errores Reintentos en Lambda; fallos se envían a SQS DLQ y se notifican vía SNS.
- 6 Actividad en Guidewire Se crea una actividad en Guidewire con la alerta de fraude y sus drivers prin...
| Capa | Tecnología | Justificación |
|---|---|---|
| storage | Amazon S3 | Almacenamiento de objetos escalable y duradero para el data lake, base de las tablas Iceberg. |
| storage | Apache Iceberg | Formato de tabla para el data lakehouse, permitiendo transacciones ACID, evolución de esquema y gestión de versiones sobre S3. vs Apache Hudi, Delta Lake |
| data-processing | Amazon EMR Serverless | Plataforma de cómputo elástica y sin servidor para Apache Spark, utilizada para el procesamiento de datos y la ejecución de modelos ML. vs AWS Glue, Amazon EMR (clusters gestionados) |
| orchestration | Apache Airflow (Amazon MWAA) | Orquestación de workflows de datos y ML, gestionando la secuencia de tareas, dependencias y reintentos. vs AWS Step Functions |
| storage | Neo4j | Base de datos de grafos para almacenar y consultar relaciones entre entidades, permitiendo el cálculo de características de grafo para la detección de fraude. vs Amazon Neptune |
| security | AWS Secrets Manager | Almacenamiento seguro de credenciales y tokens para la integración con sistemas externos como Guidewire. vs HashiCorp Vault |
| messaging | Amazon SQS (Dead-Letter Queue) | Cola de mensajes para manejar solicitudes fallidas a la API de Guidewire, asegurando la durabilidad de los eventos. |
| messaging | Amazon SNS | Servicio de notificación para alertar sobre fallos en el pipeline y en la integración con Guidewire. |
| compute | AWS Lambda | Función serverless para orquestar la integración asíncrona con la API de Guidewire, disparada por eventos de S3. vs AWS Step Functions |
| observability | Amazon CloudWatch | Monitoreo de métricas y logs de los componentes de AWS, proporcionando visibilidad sobre la salud de la plataforma. |
Fundamentos Teóricos
El problema de la detección de fraude, especialmente cuando involucra redes complejas de entidades, tiene profundas raíces en la teoría de grafos y el análisis de redes. Conceptos como la centralidad (degree, betweenness, closeness) y la detección de comunidades, popularizados por trabajos como los de Newman (2004) en la identificación de estructuras en redes complejas, son directamente aplicables para descubrir patrones de colusión o anomalías en las relaciones entre asegurados, proveedores y reclamaciones. La combinación de estas características de grafo con modelos de Machine Learning se alinea con el campo del 'Graph Neural Networks' (GNNs), aunque en este caso se utilizan características de grafo precalculadas como inputs para modelos ML tradicionales.
La arquitectura de data lakehouse, con su énfasis en la separación de almacenamiento y cómputo, la gestión de metadatos y la gobernanza de datos, refleja principios de sistemas distribuidos que buscan escalabilidad y flexibilidad. La elección de Apache Iceberg para la gestión de tablas transaccionales en S3 es un ejemplo de la aplicación de principios de sistemas de bases de datos (como el Write-Ahead Log y la gestión de versiones) a un entorno de almacenamiento de objetos, permitiendo operaciones ACID y evolución de esquemas en un data lake, un concepto explorado en papers sobre sistemas de almacenamiento de datos a gran escala.