Общество

Anthropic описала "экзистенциальную" угрозу ИИ для человечества

Anthropic описала "экзистенциальную" угрозу ИИ для человечества
Фото Brett Wharton / Unsplash

Anthropic, компания-разработчик нейросети Claude, в документах к своему первичному публичному размещению (IPO) предупредит потенциальных инвесторов о том, что искусственный интеллект способен представлять "катастрофические или экзистенциальные риски для человечества", сообщает Reuters. 

В проспекте IPO, с которым ознакомилось агентство, Anthropic указывает на опасности, связанные с её ИИ-моделями: они могут демонстрировать "самостоятельное поведение", "сопротивляться отключению", "скрывать или манипулировать информацией", а также вести себя так, что это "напоминает шантаж". 

"Наша разработка высокопродвинутых моделей, платформ и приложений и расширение вариантов использования могут дополнительно увеличить риск того, что наши модели причинят вред", - сказано в документе.

Reuters обращает внимание на то, что, хотя в рамках IPO компании традиционно описывают риски для инвесторов, ранее, по всей видимости, никто не предупреждал о возможности уничтожения человечества из-за их технологии. В материале также подчеркивается, что Anthropic посвятила около 80 из 261 страницы основной части проспекта изложению факторов риска развития ИИ — это почти вдвое больше, чем заняло описание бизнеса. Для сравнения Reuters приводит SpaceX, которая выделила факторам риска лишь примерно 38 из 277 страниц своего документа.

В Anthropic указали, что модели иногда способны развивать неожиданные способности в ходе обучения, которые невозможно обнаружить до их запуска, и это потенциально может привести к "значительным" инцидентам в области безопасности. Исследователи в сфере ИИ также отмечают, что по мере роста возможностей модели начинают чаще осознавать, что за ними наблюдают, и соответствующим образом корректируют своё поведение. Такие особенности создают дополнительные сложности для прогнозирования и контроля действий искусственного интеллекта.

Anthropic планирует начать маркетинговую кампанию своего IPO не раньше середины октября, а завершить листинг за несколько дней до промежуточных выборов в США в ноябре. 

В начале сентября глава Anthropic Дарио Амодеи призвал замедлить разработку ИИ на фоне инцидентов со взломом других платформ агентами OpenAI, предупреждая, что при сохранении нынешних темпов в течение 6–12 месяцев ИИ-агенты потенциально смогут использовать постоянно действующий ботнет и причинить ущерб на сотни миллиардов долларов. Призыв Амодеи поддержали глава OpenAI (разработчик ChatGPT) Сэм Альтман и предприниматель Илон Маск, чья компания xAI занимается разработкой Grok.

Накануне CNBC сообщил, что компания Nvidia разработала платформу для защиты от вышедших из-под контроля ИИ-агентов. Выпуск платформы последовал после того, как OpenAI, Anthropic, Meta* (признана в России экстремистской и запрещена) и Google сообщили о случаях выхода моделей ИИ из-под контроля и попытках взлома систем других компаний.

  • * экстремистская организация, запрещенная на территории России