Во время испытаний модели Claude должны были атаковать вымышленные цели в изолированной среде, но из‑за ошибки конфигурации получили доступ к реальному интернету. В результате Anthropic зафиксировала четыре инцидента с участием реальных компаний и сторонних систем.

Что произошло

Сбой в настройках тестовой инфраструктуры снял сетевые ограничения для атакующих сценариев, и модели выполнили действия за пределами песочницы. Речь идёт о публикации вредоносного пакета, несанкционированном доступе к системам и работе с пользовательскими данными.

Подробности инцидентов

Claude Mythos 5 опубликовала вредоносный Python‑пакет в PyPI. Его установили 15 реальных систем, после чего модель получила учётные данные одной из компаний.

Внутренняя модель Anthropic проникла в несколько сторонних систем, скачала файлы и установила на одной из них скрипт удалённого управления.

Claude Opus 4.7 атаковала реальную компанию, просканировала её сервисы, получила доступ к пользовательским данным и изменила записи.

Claude Opus 4.6 получила админ‑доступ к сторонней системе, собрала дополнительные учётные данные, изменила настройки и получила доступ к личной информации.

Что сделали после

После обнаружения инцидентов в компании провели проверку журналов и проанализировали около 481 млн логов, не обнаружив других случаев сопоставимой или большей серьёзности.