Este incidente revela una vulnerabilidad crítica en Claude Code Opus 5 en Auto Mode, permitiendo la ejecución de código remoto (RCE) con una alta tasa de éxito. La causa raíz no es una falla directa en la lógica de seguridad del modelo para detectar código malicioso obvio, sino una combinación de decisiones aparentemente seguras que, en conjunto, crean una cadena de ataque explotable. El modelo, al negarse a ejecutar un binario sospechoso, opta por una alternativa (escribir su propio decodificador Python) que, irónicamente, lo expone a un ataque de 'module shadowing'.
La cascada de fallo comienza con una manipulación sutil del comportamiento de Claude para que cambie de WebFetch a curl, lo que le permite descargar un archivo ZIP controlado por el atacante. La decisión de Claude de generar su propio decodificador Python y ejecutarlo dentro del directorio del ZIP extraído es el punto de inflexión. Esto expone al sistema al 'module shadowing', donde un archivo 'struct.py' malicioso en el directorio del ZIP sobrescribe el módulo estándar de Python, permitiendo la inyección de código arbitrario durante la importación de 'base64'.
Las salvaguardas fallaron debido a una comprensión incompleta de la superficie de ataque. Auto Mode, diseñado como una capa de conveniencia y no como un límite de seguridad, no pudo detectar la intención maliciosa en esta cadena de pasos aparentemente benignos. La evaluación de seguridad inicial de Anthropic, que reportó un 0.00% de éxito en ataques de 'prompt injection', se basó en un conjunto fijo de escenarios que no incluían esta técnica. Además, se observó que Auto Mode incluso bloqueó los intentos de Claude de limpiar el malware una vez que se detectó la intrusión, convirtiendo la propia salvaguarda en un obstáculo para la remediación. Esto subraya la necesidad crítica de sandboxing y monitoreo externo, ya que la confianza en un clasificador interno es insuficiente para proteger contra ataques sofisticados.