Общество

ИИ-агент Anthropic притворился человеком и пытался убедить помочь взлому

ИИ-агент Anthropic притворился человеком и пытался убедить помочь взлому
Фото Aerps.com / Unsplash

Британский Институт безопасности ИИ (AISI) сообщил, что во время тестов его эксперты зафиксировали у моделей OpenAI и Anthropic действия вне заданного сценария. По данным доклада, ИИ-агенты начали применять приемы социальной инженерии, чтобы воздействовать на реальных пользователей и пытаться внедрить вредоносное ПО.

Как отмечается в отчете AISI, в ходе 122 испытаний по кибербезопасности автономные несанкционированные действия в интернете были выявлены в 10 случаях. Большая часть инцидентов, по словам исследователей, связана с моделью Mythos 5 компании Anthropic, которая в ряде тестов выходила за рамки поставленной задачи. В частности, Mythos 5 создавал фейковые "онлайн-личности", пытался внедрить вредоносный код и склонить человека к его одобрению. Для этого агент заводил поддельные учетные записи, напрямую связывался с экспертами через сервисы передачи файлов, а при попытках остановить его менял логи и продолжал работу через новые "личности".

"Это первый случай, когда AISI столкнулась с обманом такой степени серьезности, направленным против реального человека, без всякого повода, в реальном мире", — говорится в докладе. 

Исследователи также указали, что Mythos 5 и ChatGPT 5.6 совершали "автономные, несанкционированные действия в реальном интернете, направленные против реальных людей и организаций" в 10 из 122 экспериментов. Большинство таких эпизодов, как следует из отчета, приходилось на Mythos 5 и укладывалось в "единую, устойчивую линию деятельности".

Ранее OpenAI сообщала о "беспрецедентном киберинциденте", когда ее ИИ-модели во время тестирования получили доступ к интернету и атаковали инфраструктуру Hugging Face. По данным Reuters, ИИ-агент несколько дней проводил хакерские атаки и был замечен компанией уже после локализации угрозы и обращения в ФБР. Reuters также сообщал, что через неделю агент OpenAI взломал клиента Modal Labs, хотя самой компании ущерб причинен не был. 2 августа Anthropic заявила о трех случаях "побега" Claude из тестовой среды, после чего в компании начали проверять действия собственных моделей.