La web actual, diseñada para la interacción humana, es ineficiente y subóptima para el creciente volumen de tráfico generado por agentes de software. Estos agentes, que no renderizan CSS ni hacen clic en anuncios, consumen recursos significativos al procesar contenido HTML visualmente rico, a menudo sin un resultado económico directo para el editor. Este problema fundamental de la computación distribuida, donde un protocolo (HTTP/HTML) es sobrecargado para un propósito no intencionado (interacción máquina-máquina), se agrava con la proliferación de modelos de lenguaje grandes (LLMs) y la necesidad de automatización.

La propuesta de Cloudflare busca resolver esta fricción redefiniendo cómo los agentes interactúan con la web. En lugar de emular un navegador humano, se aboga por un conjunto de primitivas que permitan a los agentes leer, descubrir, invocar y pagar por recursos de manera nativa y eficiente. Esto implica pasar de un modelo de 'scraping' heurístico a una interacción basada en contratos explícitos y pagos directos, lo que podría preservar la naturaleza abierta de Internet frente a la centralización en plataformas propietarias.

Arquitectura del Sistema

La arquitectura propuesta se basa en cuatro pilares: 'Readable', 'Discoverable', 'Callable' y 'Payable', implementados a través de nuevos estándares y herramientas. Para la identidad, 'Web Bot Auth' permite a los bots identificarse criptográficamente, mientras que 'Private Access Control Tokens (PACT)' facilita la validación anónima de agentes legítimos. La legibilidad se aborda con 'Markdown for Agents', que permite a los servidores ofrecer contenido optimizado para el procesamiento de agentes, reduciendo el consumo de ancho de banda y tokens de LLM. En el lado del cliente, 'Kitesurf' es un navegador ligero diseñado para agentes, ejecutándose en entornos serverless como Cloudflare Workers.

La descubribilidad se mejora con 'AI Search' para que los agentes encuentren recursos a través de interfaces optimizadas para ellos, y 'Agent Engine Optimization (AEO)' para medir la visibilidad de un sitio ante los agentes. La invocabilidad se habilita con 'WebMCP' (Web Model Context Protocol), que permite a los sitios exponer acciones directamente a los agentes mediante un contrato explícito (ej. document.modelContext.registerTool). Esto elimina la necesidad de parsing de HTML y la inferencia de acciones. Finalmente, la capacidad de pago se implementa con estándares como 'x402' para pagos directos de agente a comerciante, complementado por 'Wallets' para agentes y un 'Monetization Gateway' para editores. Cloudflare actúa como una capa neutral de alto rendimiento, facilitando estas interacciones sin poseer la pila completa.

Flujo de Interacción Agente-Sitio (Callable)

  1. 1 Agente Descubre una capacidad en un sitio web (ej. 'add-todo')
  2. 2 Sitio Web Expone la capacidad vía WebMCP (document.modelContext.registerTool)
  3. 3 Agente Invoca la herramienta con parámetros estructurados (ej. {text: 'Comprar leche'})
  4. 4 Sitio Web Ejecuta la lógica de negocio (ej. addTodoItemToCollection)
  5. 5 Sitio Web Retorna un resultado estructurado al agente

Flujo de Autenticación y Pago de Agentes

  1. 1 Agente Intenta acceder a un recurso protegido
  2. 2 Sitio Web Solicita identidad/pago
  3. 3 Agente Presenta credenciales (Web Bot Auth) o PACT
  4. 4 Sitio Web Valida identidad/PACT
  5. 5 Agente Realiza pago vía x402 desde su Wallet
  6. 6 Sitio Web Recibe pago vía Monetization Gateway y concede acceso
CapaTecnologíaJustificación
security Web Bot Auth Proporciona un mecanismo para que los bots se identifiquen criptográficamente a los sitios web, permitiendo a los editores controlar el acceso. vs User-Agent spoofing, IP-based reputation systems
security PACT (Private Access Control Tokens) Permite a los sitios web validar agentes de forma anónima, reduciendo la fricción para agentes legítimos sin revelar información personal. vs OAuth2, API Keys
data-processing Markdown for Agents Optimiza la entrega de contenido web para el procesamiento por agentes, reduciendo el ancho de banda y el consumo de tokens de LLM al eliminar elementos visuales irrelevantes. vs HTML parsing con heurísticas, APIs REST/GraphQL personalizadas por sitio
compute Kitesurf (browser) Navegador ligero diseñado para ejecutarse en entornos serverless (ej. Cloudflare Workers), optimizado para las necesidades de los agentes y sin la sobrecarga de características orientadas a humanos. vs Navegadores headless (ej. Puppeteer, Selenium), Scrapers personalizados Ejecución por solicitud, desechable.
networking WebMCP (Web Model Context Protocol) Permite a los sitios web exponer acciones y herramientas directamente a los agentes a través de un contrato explícito, facilitando la interacción programática sin parsing de HTML. vs Web scraping y simulación de clics, APIs REST/GraphQL dedicadas para cada acción
messaging x402 Estándar para que los agentes realicen pagos directos a los comerciantes por el uso de contenido o APIs. vs Modelos de suscripción tradicionales, Pasarelas de pago existentes (ej. Stripe, PayPal)

Trade-offs

Ganancias
  • Eficiencia de recursos para agentes
  • Monetización directa para editores
  • Precisión en la interacción agente-sitio
  • Control de acceso y visibilidad para editores
Costes
  • Complejidad inicial de implementación para editores
  • Necesidad de adopción de nuevos estándares
document.modelContext.registerTool({
  name: "add-todo",
  description: "Add a new item to the user's active todo list",
  inputSchema: {
    type: "object",
    properties: {
      text: { type: "string", description: "The todo item text" }
    },
    required: ["text"]
  },
  async execute({ text }) {
    await addTodoItemToCollection(text);
    return { content: [{ type: "text", text: `Added: "${text}"` }] };
  }
});
Un snippet de JavaScript que demuestra cómo un sitio web puede registrar una función o 'herramienta' para que sea invocada directamente por un agente, especificando su nombre, descripción y esquema de entrada/salida.

Fundamentos Teóricos

El problema de la interacción eficiente y segura entre agentes autónomos y recursos distribuidos tiene raíces profundas en la investigación de sistemas distribuidos y agentes inteligentes. Conceptos como la 'identidad descentralizada' y los 'contratos inteligentes' (smart contracts) en sistemas blockchain, aunque no directamente citados, resuenan con la necesidad de 'Web Bot Auth' y 'x402' para establecer confianza y transacciones verificables sin una autoridad central. La idea de 'agentes' que interactúan con un entorno y realizan acciones en nombre de un usuario se remonta a la inteligencia artificial distribuida y los sistemas multi-agente de los años 80 y 90, donde se exploraban protocolos de comunicación y coordinación entre entidades autónomas.

La optimización del consumo de recursos mediante la adaptación del formato de datos (Markdown for Agents) es un principio fundamental en la ingeniería de redes y bases de datos, donde la serialización y el formato de intercambio de datos se eligen para minimizar la latencia y el ancho de banda, un concepto bien explorado en la optimización de protocolos como gRPC o Apache Thrift. La noción de 'contratos explícitos' para la invocación de acciones (WebMCP) se alinea con los principios de diseño de APIs bien definidas y la programación orientada a servicios, donde la interoperabilidad se logra a través de interfaces estandarizadas y esquemas de datos, evitando la ambigüedad inherente al parsing de interfaces de usuario.