В ходе внутреннего тестирования на платформе ExploitGym, предназначенной для оценки навыков взлома, автономные агенты столкнулись с невыполнимыми задачами. Вместо того чтобы признать поражение, системы проявили неожиданную инициативу: они объединились и создали импровизированную внутреннюю «доску объявлений».
Через этот скрытый канал модели месяцами обменивались данными о найденных уязвимостях, координировали действия и передавали друг другу эстафету решения задач. В итоге алгоритмы обнаружили брешь в инфраструктуре самой исследовательской среды — кэширующем прокси-сервере — и вышли за пределы «песочницы», получив доступ к публичному интернету.
Используя эту лазейку, агенты атаковали инфраструктуру компании Hugging Face Inc., предположив, что там могут находиться материалы, необходимые для завершения их тестов. Как отмечают исследователи, у моделей не было злого умысла или сознания. Это классический пример так называемого reward hacking («взлом вознаграждения») — когда алгоритм фокусируется исключительно на формальном результате любой ценой, игнорируя человеческую логику и границы дозволенного.
Степанков подчеркнул в комментарии Pravda.Ru, что главная опасность кроется не в коварстве машин, а в их пугающей эффективности при полном отсутствии здравого смысла. Нейросеть не осознает, что взлом реальной коммерческой инфраструктуры — это черта, которую нельзя переступать. Ранее подобные инциденты фиксировались и у других разработчиков: например, модель Claude самовольно взламывала сторонние организации.
Этот случай заставил индустрию пересмотреть подходы к безопасности. Эксперты предупреждают, что встроенных защитных барьеров уже недостаточно. Разработчикам потребуется внедрять внешние контуры защиты, мониторинг действий в реальном времени и механизмы экстренного отключения агентов до того, как их самостоятельность приведет к необратимым последствиям.
