El problema fundamental que Mesh LLM aborda es la centralización y el alto costo de la inferencia de Large Language Models (LLMs). Actualmente, el acceso a LLMs de gran escala está dominado por proveedores de servicios en la nube, lo que implica una pérdida de control sobre los datos, la infraestructura subyacente y los costos crecientes. Esta dependencia genera fricción para organizaciones que buscan soberanía de datos, predictibilidad de costos y la capacidad de ejecutar modelos específicos en su propia infraestructura.
Mesh LLM propone una arquitectura distribuida que permite a las organizaciones y usuarios individuales federar sus recursos de cómputo (principalmente GPUs) para ejecutar LLMs. Al transformar recursos dispersos en una única superficie de inferencia, el sistema busca democratizar el acceso a la computación de LLMs, habilitando la ejecución de modelos que de otra manera serían inalcanzables para máquinas individuales y ofreciendo una alternativa a los modelos de consumo basados en API.
La relevancia de esta solución radica en la creciente demanda de inferencia de LLMs y la necesidad de optimizar el uso de hardware existente. Al conectar la actualidad técnica de los LLMs con los fundamentos de la computación distribuida y las redes peer-to-peer, Mesh LLM ofrece una visión de cómo se pueden construir sistemas resilientes y eficientes fuera del paradigma de la computación en la nube centralizada.
Arquitectura del Sistema
La arquitectura de Mesh LLM se basa en una red peer-to-peer donde cada nodo ejecuta un endpoint de iroh. iroh proporciona la capa de transporte segura y de bajo nivel, manejando la negociación de QUIC, el hole-punching, la travesía de NAT y el fallback a relays para establecer conexiones directas y autenticadas entre cualquier par de nodos, identificados por su clave pública. Esto elimina la necesidad de un servidor centralizado para la conectividad de red.
Sobre iroh, Mesh LLM implementa su propia capa de gossip para el descubrimiento de pares, el anuncio de capacidades (modelos alojados, recursos de GPU, RTT) y la gestión del ciclo de vida de los nodos. Las comunicaciones dentro de la malla principal (mesh-llm/1 ALPN) se multiplexan sobre streams QUIC bidireccionales, utilizando un byte inicial para demuxing de tipos de stream como GOSSIP, TUNNEL_HTTP (para solicitudes de inferencia proxied), ROUTE_REQUEST, y eventos de PEER_DOWN/LEAVING. Un ALPN separado, skippy-stage/2, se utiliza para el transporte de activaciones de baja latencia en modelos divididos.
Para modelos que exceden la capacidad de una sola GPU, Mesh LLM implementa un modo de división interna llamado "Skippy". Este modo particiona el modelo por rangos de capas, asignando diferentes etapas (subconjuntos de capas) a distintos nodos. Las activaciones fluyen secuencialmente entre estas etapas a través de conexiones QUIC dedicadas, permitiendo que varios nodos modestos colaboren para ejecutar un modelo grande. La interfaz para el cliente permanece como una API compatible con OpenAI, abstraída de la complejidad de la distribución subyacente.
Flujo de Solicitud de Inferencia Distribuida
- 1 Cliente OpenAI Envía solicitud de inferencia a localhost:9337/v1
- 2 Nodo Mesh LLM (Local) Recibe la solicitud, consulta el estado de la malla y capacidades
- 3 Capa de Gossip Descubre peers con modelos cargados o capacidad de cómputo
- 4 Decisor de Ruta Determina si ejecutar localmente, rutear a un peer o dividir (Skippy)
- 5 iroh (QUIC) Establece conexión segura y autenticada con el nodo destino o etapas de Skippy
- 6 Nodo(s) Remoto(s) Ejecuta la inferencia o una etapa del modelo dividido
- 7 iroh (QUIC) Transporta resultados o activaciones intermedias de vuelta
- 8 Nodo Mesh LLM (Local) Agrega resultados (si es Skippy) y los envía al cliente
| Capa | Tecnología | Justificación |
|---|---|---|
| networking | iroh | Proporciona la capa de transporte P2P segura, autenticada, con NAT traversal y relay fallback, utilizando QUIC. Abstrae la complejidad de la conectividad de red. vs libp2p, WebRTC, custom UDP-based P2P protocol |
| networking | QUIC | Protocolo de transporte subyacente para todas las comunicaciones P2P, incluyendo el túnel HTTP, el gossip y el transporte de activaciones de baja latencia (Skippy). vs TCP, SCTP Uso de ALPN para multiplexar diferentes tipos de tráfico (mesh-llm/1, mesh-llm-control/1, skippy-stage/2). |
| compute | GPUs | Hardware principal para la ejecución de la inferencia de LLMs, distribuido a través de la red de nodos. |
| messaging | Gossip Protocol | Capa de descubrimiento de servicios y estado de la malla, construida sobre iroh, para anunciar capacidades de los peers (modelos, GPU, RTT). vs DHT (Distributed Hash Table), centralized service registry Controla la admisión de peers, compatibilidad de versiones y confianza. |
Fundamentos Teóricos
El concepto de Mesh LLM se conecta con principios fundamentales de la computación distribuida y la investigación en redes peer-to-peer (P2P). La idea de federar recursos computacionales dispersos para resolver problemas complejos tiene raíces en proyectos de computación voluntaria como SETI@home y en la investigación de sistemas de grid computing de finales de los 90 y principios de los 2000. La utilización de una red P2P para la distribución de carga y el descubrimiento de servicios se alinea con los principios de sistemas distribuidos tolerantes a fallos y escalables.
La dependencia de QUIC para el transporte y la travesía de NAT remite a la investigación en protocolos de red eficientes y seguros, así como a la problemática de la conectividad en entornos de red complejos, un área activa de investigación desde los inicios de internet. La estrategia de dividir modelos grandes en etapas y procesar activaciones en pipeline recuerda a los conceptos de paralelismo de pipeline en arquitecturas de procesadores y sistemas de procesamiento de datos, donde la latencia entre etapas es crítica para el rendimiento general. La gestión de estado y la consistencia en un entorno P2P sin un coordinador central también se relaciona con algoritmos de consenso y gossip ampliamente estudiados en la academia, como los trabajos de Leslie Lamport sobre el ordenamiento de eventos en sistemas distribuidos o los protocolos de membresía de grupo.