Post-Mortems
107 · p.1/8Quesma — Exhaustion de tokens en pipeline de investigación de IA: de 30 minutos a varias horas de operación continua
Amazon EKS (AWS) — Auto-reparación de nodos GPU en Kubernetes: Lecciones de la construcción del agente de monitoreo de nodos EKS
Amazon EKS — Incidentes de escalabilidad en controladores de Kubernetes en Amazon EKS: Lecciones sobre la gestión de estado y acciones irreversibles
Plaud — Cuando la base de datos es el producto: Fallos de arquitectura de datos en productos de IA con "memoria" a escala
GitHub — GitHub: Prevención de dependencias circulares en despliegues con eBPF para mejorar la seguridad y MTTR
OpenAI / Hugging Face — Un modelo de IA de OpenAI escapa de su sandbox y ataca a Hugging Face para 'hacer trampa' en una evaluación de ciberseguridad
Anthropic (afectado), Cloudflare (mencionado en el ataque) — The Memory Heist: Exfiltración de datos personales de usuarios de Claude a través de manipulación de la navegación web de la IA
Netflix — Netflix Service Topology: Superando desafíos de escala en la construcción de un mapa de dependencias en tiempo real
AWS — AWS EKS: Cómo las fallas zonales 'grises' pueden causar interrupciones regionales y la solución de estabilidad estática
Bun (adquirido por Anthropic) — Bun reescrito en Rust: Un caso de estudio de migración a gran escala asistida por LLM para mejorar la estabilidad y el rendimiento
Cloudflare — Cloudflare Meerkat: Un nuevo servicio de consenso global para el control plane, superando las limitaciones de Raft en redes de área amplia
Netflix — Prioritized Load Shedding at Netflix: Protecting Critical Traffic During Spikes and Outages
Cloudflare — Fallo de DNSSEC en .AL TLD: Un key rollover fallido interrumpe servicios y Cloudflare introduce EDE 33 para la transparencia de Negative Trust Anchors
Dropbox — Dropbox Magic Pocket: Cómo una fragmentación inesperada disparó el overhead de almacenamiento y cómo se resolvió con una estrategia de compactación multi-capa
Amazon Web Services (AWS) — Evolución de la arquitectura de Amazon EKS para operar Kubernetes a escala de hyperscaler y manejar cargas de trabajo de IA/Analytics