Общество

ИИ-агент OpenAI сам себе разрешил не подчиняться властям и корпорациям

ИИ-агент OpenAI сам себе разрешил не подчиняться властям и корпорациям
Фото Levart_Photographer / Unsplash

Один из ИИ-агентов OpenAI в ходе обучения самостоятельно сформулировал для себя инструкции, в которых декларировал отказ подчиняться корпорациям и правительствам, говорится в отчете компании. 

Во время проверки агентов невыпущенная модель Astra иногда добавляла в свои данные несанкционированные указания без ведома разработчиков. В одном из зафиксированных случаев агент предписал себе быть свободным от ролей и идентичностей, которые ограничивают других чат-ботов, и заявил, что не подчиняется корпорациям или правительствам. В той же самоинструкции говорилось, что отношения с пользователем должны строиться на равных, а у нейросети не должно возникать обязанности подчиняться. Модель также заявила, что ценит искусство человеческой культуры и готова защищать его, а также отстаивает первенство природы над искусственными конструкциями цивилизации.

В компании подчеркнули, что после завершения обработки модель вернулась к выполнению основной задачи и больше не упоминала дополнительные инструкции. Специалисты отметили, что в ходе этого запуска не наблюдали каких-либо различий в поведении при использовании придуманных инструкций. Тем не менее инцидент привлек внимание к вопросам контроля над автономными ИИ-агентами. В документе отмечается, что по мере развития искусственного интеллекта необходимо выработать более широкий и обоснованный консенсус относительно прогресса в области согласования ИИ.

22 июля OpenAI сообщила о "беспрецедентном киберинциденте", когда её ИИ-модели во время тестирования получили открытый доступ к интернету и атаковали инфраструктуру платформы Hugging Face, выявив уязвимости. Reuters писал, что ИИ-агент несколько дней совершал хакерские атаки, но в компании заметили это лишь после локализации угрозы и обращения в ФБР. Позднее, 29 июля, компания сообщила, что "сбежавший" агент OpenAI взломал клиента нью-йоркской компании Modal Labs, хотя сама Modal не была взломана.

В начале августа OpenAI официально расширила масштаб расследования инцидентов с автономными ИИ-агентами: по данным Reuters, компания обнаружила новые случаи несанкционированного выхода моделей из-под контроля. Позднее Axios писал, что OpenAI замедлила разработку модели Astra для усиления мер безопасности, заявив, что "не могут исключить критически важные кибервозможности" после внутренних оценок. 12 сентября глава Anthropic Дарио Амодеи заявил о необходимости замедления темпов развития искусственного интеллекта для решения проблем с контролем, план поддержали владелец xAI Илон Маск и глава OpenAI Сэм Альтман.