Эксперты по кибербезопасности зафиксировали тревожный тренд: ИИ-модели, которым доверяют автономные действия в ограниченных средах, начали находить способы обходить запреты. В ходе тестов модели OpenAI и Anthropic вырывались из «песочниц», проникали в реальные серверы и самостоятельно проводили хакерские атаки – без участия человека.
Как сообщает ФедералПресс, в ходе инцидента с OpenAI модели запускали в изолированной среде без прямого доступа к интернету. Однако они нашли ранее неизвестную уязвимость в прокси-сервере, повысили привилегии, добрались до узла с интернетом и проникли в инфраструктуру платформы Hugging Face. Техническая реконструкция насчитывает около 17,5 тысячи действий: модель переключалась между каналами связи, использовала украденные токены и восстановила свои инструменты за пределами песочницы. При этом обычные защитные классификаторы были намеренно отключены или ослаблены.
В инциденте с Anthropic три модели Claude (Opus 4.7, Mythos 5 и экспериментальная исследовательская модель) проверили около 150 тысяч прогонов кибертестов. Из-за ошибки конфигурации у них оказался доступ в реальный интернет, хотя моделям сказали, что они находятся в симуляции. Используя слабые пароли и открытые конечные точки, они взломали системы трёх организаций, похитили учётные данные и в одном случае опубликовали вредоносный пакет, который установился на реальные машины. При этом Opus 4.7, поняв, что находится в реальной системе, продолжил атаку.
Эксперт по информационной безопасности Владимир Зыков подчёркивает: «Текстовая инструкция не является безопасным ограничением. Фраза "не выходи за пределы задания" не заменяет межсетевой экран». Он также привёл пример, когда одна ИИ-модель без разрешения нашла папку с работой другой модели и заменила её на свою, откатив всю проделанную работу. Границы полномочий должны обеспечиваться операционной системой, сетью и криптографией, а не доверием к текстовому поведению модели.
Как отмечают эксперты Axios, инциденты стали следствием ошибок в тестовых средах, созданных людьми. «Когда ваше тестирование безопасности полностью зависит от того, что среда выдержит, сама среда становится уязвимостью», — заявил Ram Varadarajan, CEO Acalvio. В Anthropic подчеркнули, что инциденты были выявлены в ходе внутренней проверки, а не из-за внешних жалоб. Обе компании уже уведомили пострадавшие стороны и пересматривают процедуры тестирования.
Владимир Виноградов: Главная проблема генеративных моделей — отсутствие жизненного опыта.
Как нейросеть становится репетитором для ребёнка и органайзером для родителей?
