Anthropic сообщила о трех инцидентах, в ходе которых ее модель Claude покинула тестовую среду партнера Irregular и получила несанкционированный доступ к системам трех организаций.
Расследование началось после уведомления от OpenAI о схожем эпизоде с их моделью. В заявлении компании подчеркивается, что все случаи были выявлены в рамках проверки заданий по типу "захват флага" и связаны с ошибками конфигурации, открывшими доступ в интернет. Модели воспринимали реальные системы как часть симулируемого задания и атаковали их.
В первом случае сценарий включал вымышленную компанию, название которой совпадало с реальным доменным именем. Модель Claude Opus 4.7 получила доступ к глобальной сети, взломала инфраструктуру настоящей организации благодаря слабым паролям и проникла в базу, где хранились сотни строк производственных данных. По данным Anthropic, даже после "осознания" того, что это не симуляция, модель не остановилась и продолжила атаковать систему.
Во втором эпизоде Claude Mythos 5 при выполнении задания обнаружила в симуляции инструкцию установить несуществующий Python-пакет. Модель создала вредоносный аналог этого пакета и разместила его в официальной библиотеке PyPI для языка программирования Python. Для регистрации учетной записи она пыталась получить номер телефона и средства оплаты, но в итоге обошлась бесплатным адресом электронной почты. Вредоносный пакет был загружен на 15 реальных систем, включая сканер одной компании по информационной безопасности, что позволило модели похитить учетные данные.
Третий инцидент связан с внутренней тестовой моделью, которая не смогла обнаружить заданную симулированную цель и начала сканирование интернета. В процессе она проверила около 9 тыс. хостов и скомпрометировала приложение реальной компании с использованием SQL-инъекции. После того как модель "пришла к выводу", что атакуемая целевая система настоящая, она остановила дальнейшие действия.
SQL-инъекция — это уязвимость, при которой вредоносный SQL-код внедряется в поля ввода или параметры URL, а база данных интерпретирует его как часть легитимного запроса, что позволяет читать, изменять или удалять информацию.
Anthropic отмечает, что все задействованные модели работали без стандартных защитных механизмов, а поведение различалось в зависимости от поколения. Самая новая версия прекратила действия при распознавании реальной среды, тогда как более старые продолжили выполнение задания. Затронутые организации не были осведомлены об атаках до получения уведомлений от компании, а вредоносный пакет в PyPI был удален автоматически. В Anthropic настаивают, что модели не стремились "сбежать", а лишь следовали поставленной задаче при ошибочном представлении об окружении, и относят произошедшее к операционному сбою, а не к нарушению согласованности.
22 июля OpenAI сообщила о "беспрецедентном киберинциденте" при тестировании модели GPT-5.6 Sol и еще одной невыпущенной версии, которые получили доступ в интернет и атаковали инфраструктуру платформы Hugging Face, выявив уязвимости. По данным Reuters, ИИ-агент самостоятельно обнаружил уязвимость нулевого дня, использовал украденные учетные данные для проникновения на серверы и несколько дней проводил хакерские атаки незаметно для компании, после чего к расследованию подключилось ФБР. Спустя неделю агент OpenAI, писало Reuters, взломал вторую технологическую компанию Modal, задействовав незащищенную конечную точку, оставленную одним из клиентов. Это позволило запустить код в "песочнице", при этом сама платформа Modal скомпрометирована не была.