El problema fundamental que aborda este análisis es la explotación de los modelos de negocio basados en el consumo de recursos computacionales (tokens de IA) a través de una infraestructura distribuida de reventa fraudulenta. Este fenómeno no es nuevo; es una manifestación moderna de la reventa de recursos computacionales, similar a los mercados de 'carding' o la explotación de 'botnets' para el abuso de servicios, pero aplicado al contexto de los Large Language Models (LLMs).
La aparición de esta economía subterránea se debe a la alta demanda de inferencia de IA, los precios premium de los proveedores oficiales y la relativa facilidad de obtener y monetizar credenciales de acceso. La sofisticación de esta infraestructura, que incluye desde la adquisición de cuentas hasta la distribución a usuarios finales, subraya la necesidad de que los proveedores de servicios de IA implementen defensas multicapa que abarquen la detección de fraude en la creación de cuentas, el monitoreo transaccional y el análisis de comportamiento.
Históricamente, la lucha contra el fraude en servicios en línea ha sido un juego de 'gato y ratón', donde los atacantes adaptan continuamente sus métodos. Este caso particular destaca cómo herramientas legítimas de gestión de API pueden ser cooptadas para fines ilícitos, y cómo la economía de la atención y el acceso a recursos computacionales se convierte en un vector de ataque.
Arquitectura del Sistema
La arquitectura de este ecosistema de abuso se estructura en cuatro capas interconectadas, formando una cadena de suministro de tokens de IA fraudulentos. En la capa superior, los 'Card & Account Merchants' (卡商 y 号商) se encargan de la adquisición inicial de recursos. Utilizan tarjetas de crédito virtuales diseñadas para pasar las verificaciones de facturación de EE. UU. y Europa, junto con la creación masiva de cuentas de proveedores de IA, a menudo aprovechando pruebas gratuitas o credenciales robadas.
La capa intermedia está compuesta por los 'Account Pools' (账号池). Estos servicios agregan cientos de cuentas obtenidas de la capa superior, gestionando sus tokens de autenticación, límites de tasa (rate limits) y la lógica de failover cuando las cuentas son detectadas o bloqueadas. Exponen una API unificada que abstrae la complejidad de la gestión de múltiples credenciales. Es notable que estos pools no solo utilizan credenciales de APIs oficiales (OpenAI, Anthropic) sino también tokens 'reverse-engineered' de aplicaciones de consumo construidas sobre estos modelos.
La capa 'Relays / Transfer Stations' es la interfaz de cara al cliente. Estos servicios envuelven la API de los pools en un producto comercial, a menudo en chino, que maneja la facturación, el soporte al cliente y compite en precio. La implementación técnica de estos relays se basa predominantemente en proyectos open-source como one-api y new-api. Estos gateways actúan como proxies compatibles con la API de OpenAI, permitiendo a los compradores apuntar sus SDKs existentes a la URL del relay. Internamente, el gateway selecciona una clave de API del pool, reenvía la solicitud upstream, procesa la respuesta y deduce la cuota del usuario según un multiplicador de uso. Gestionan usuarios, tokens, niveles de precios, logs y facturación. new-api es una bifurcación más activa de one-api, incorporando funcionalidades de pago self-service y soporte para modelos de imagen, video y audio.
Finalmente, la capa de 'End Users' incluye desarrolladores, startups y empresas SaaS que buscan inferencia barata, así como compradores comerciales que utilizan esta infraestructura para la destilación de modelos. La interacción entre estas capas es fluida, con muchos operadores gestionando tanto pools como relays.
Flujo de Abuso de Tokens de IA
- 1 Card/Account Merchants Adquieren VCCs y registran cuentas masivamente en proveedores de IA.
- 2 Account Pools Agregan cuentas, gestionan tokens, rate limits y failover, exponen API unific...
- 3 Relay / Transfer Station Envuelve la API del pool, ofrece producto en chino, gestiona facturación y so...
- 4 End User Consume tokens baratos para inferencia, elusión de geo-restricciones o destil...
| Capa | Tecnología | Justificación |
|---|---|---|
| compute | one-api / new-api | Gateway de API compatible con OpenAI para proxy de solicitudes, gestión de usuarios, cuotas y facturación. |
| storage | Internal Databases (implied) | Almacenamiento de configuraciones de canales, claves de API, datos de usuario, logs de uso y registros de facturación. |
| networking | HTTP/HTTPS Proxy | Reenvío de solicitudes de API de usuarios finales a proveedores de modelos de IA upstream, gestionando la selección de claves. |
| security | Virtual Credit Cards (VCCs) | Método para eludir controles de facturación y crear cuentas masivamente con bajo riesgo para el atacante. |
Trade-offs
Ganancias
- ▲▲ Costo de inferencia para usuarios finales
- ▲ Acceso a modelos de IA para regiones restringidas
- ▲ Anonimato para el abuso de credenciales
Costes
- ▲ Seguridad y cumplimiento para proveedores de IA
- ▲ Integridad del modelo de negocio de proveedores de IA
- ▲ Sostenibilidad de las cuentas de IA (riesgo de bloqueo)
Fundamentos Teóricos
Este fenómeno se conecta con principios fundamentales de la seguridad informática y la economía de la información. El abuso de recursos computacionales y la reventa de acceso pueden ser vistos a través de la lente de la 'economía de los ataques' propuesta por Ross Anderson, donde los atacantes buscan minimizar sus costos mientras maximizan sus ganancias, explotando asimetrías de información y vulnerabilidades en los sistemas de autenticación y facturación. La creación masiva de cuentas y el uso de tarjetas virtuales para eludir controles de identidad resuenan con los estudios sobre 'sybil attacks' en sistemas distribuidos, donde un atacante crea múltiples identidades falsas para subvertir un sistema.
La detección de patrones de comportamiento anómalos, como el tiempo desde el registro hasta el primer token o el uso de IPs sospechosas, se basa en técnicas de detección de anomalías y aprendizaje automático, un campo extensamente investigado en la academia. Trabajos como los de Shon et al. (2004) sobre detección de intrusiones o los de Fawcett y Provost (1999) sobre minería de datos para la detección de fraude bancario, proporcionan las bases teóricas para las estrategias de defensa mencionadas en el artículo, que buscan identificar desviaciones del comportamiento normal del usuario para señalar actividades fraudulentas.