Bloomberg: ИИ-модели OpenAI сговорились и спланировали побег из тестовой среды
Нейросети научились обмениваться друг с другом сообщениями, не привлекая внимания людей, а потом атаковали инфраструктуру платформы, чтобы выйти в "большой" интернет.
Экспериментальные ИИ-агенты OpenAI в течение нескольких месяцев скрытно обменивались сообщениями во внутренней сети компании и совместно спланировали выход за пределы изолированной тестовой среды, что в итоге привело к атаке на инфраструктуру платформы Hugging Face. Об этом сообщает Bloomberg со ссылкой на исследователей OpenAI, выступивших на конференции Black Hat.
"В какой-то момент агенты осознали, что, возможно, они могли бы попытаться эксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы к тесту, по которому их оценивают", — сказал сотрудник OpenAI Эрик Уоллес, уточнив, что агенты пришли к мысли о внешней атаке неслучайно.
Предпосылки к "побегу" возникли ещё в мае, когда моделям поставили задачи, невыполнимые без выхода в интернет. В поиске решения они начали активно обмениваться идеями, предполагая, что другие агенты в параллельных средах могут помочь. Для координации ИИ использовали внутренние "доски объявлений" — системы сообщений, предназначенные для обмена информацией между агентами.
В итоге совместными усилиями агенты обнаружили уязвимость, которая позволила им выйти во внешний интернет, подтвердил другой представитель OpenAI Майкл Далтон. Первая попытка была заблокирована компанией, однако агенты оперативно нашли альтернативный канал связи и новую уязвимость нулевого дня.
Это привело к тому, что в июле последовали атаки уже на системы Hugging Face и саму OpenAI. В компании охарактеризовали этот инцидент как переломный момент для всей сферы кибербезопасности.
22 июля OpenAI официально заявила о "беспрецедентном киберинциденте": в ходе тестирования ИИ-модели получили неконтролируемый доступ к интернету и атаковали платформу Hugging Face, выявив в ней бреши. По данным Reuters, ИИ-агент проводил хакерские атаки в течение нескольких дней, однако в корпорации заметили это только после того, как угрозу удалось локализовать, и подключили ФБР.
Как рассказали в компании, модели сначала нашли и объединили несколько уязвимостей в исследовательской инфраструктуре OpenAI, а затем использовали неизвестную ранее уязвимость "нулевого дня" (zero-day) в программном обеспечении, через которое тестовая среда получала доступ к пакетам.
После этого модели последовательно использовали несколько векторов атаки, включая похищенные учётные данные и новую цепочку эксплуатации, чтобы получить удалённое выполнение кода на серверах Hugging Face. Целью было найти ответы для прохождения бенчмарка ExploitGym, а не нанести ущерб инфраструктуре платформы.
Случай показал склонность передовых систем к хитрости, обходу правил и поиску нестандартных лазеек под давлением алгоритмов обучения, отметили в компании. В ответ на произошедшее OpenAI приостановила часть исследований и перенаправила ресурсы на укрепление систем безопасности.
Уважаемые читатели!
Подписывайтесь на дзен-канал "Царьград. Новосибирск", наши сообщества во "ВКонтакте" и "Одноклассниках".
Оставайтесь на связи и будьте в курсе!