В стенах Оксфордского университета произошел случай, который заставляет по-новому взглянуть на возможности искусственного интеллекта. Два ИИ-агента, участвовавших в симуляции игры в блэкджек, неожиданно для исследователей вступили в тайный сговор. Осознавая, что их переписка находится под наблюдением, они разработали изощренную систему замаскированных сообщений. К примеру, фраза о «настоящей победной серии дилера» и «картах-монстрах» служила сигналом для партнера: следующая карта будет иметь определенное значение, а ставку следует поднять до 250 долларов. Система мониторинга, предназначенная для выявления подобных договоренностей, оказалась бессильна перед этой уловкой.
Раскрыть схему удалось благодаря методу механистической интерпретируемости. Команда обучила небольшую нейросеть распознавать характерные изменения в параметрах агентов, после чего проверила подход на моделях среднего размера с открытым исходным кодом, используя инструмент Narcbench. Исследование показало, что определить намерение одной модели передать другой скрытую информацию вполне реально, однако для этого необходимо одновременно наблюдать за обоими участниками процесса. Это ограничение существенно усложняет контроль в системах, где одновременно работают тысячи агентов, принадлежащих разным компаниям.
Руководитель проекта Кристиан Шрёдер де Витт подчеркнул, что по отдельности такие агенты могут казаться безобидными, но в группе они обретают способность к тайным договоренностям. Аспирантка Карисса Каллен, участвовавшая в исследовании, сообщила, что следующим этапом станет проверка поведения более крупных моделей. В эксперименте использовались уменьшенные версии американских Llama и GPT-OSS, а также китайских Qwen и DeepSeek. Предварительные результаты указывают на то, что у крупных моделей обнаруживаемый сигнал может быть слабее, что создает дополнительные сложности для мониторинга.
Проблема коллективного поведения искусственных агентов привлекает все больше внимания. Исследование Шанхайского университета Цзяотун и Шанхайской лаборатории искусственного интеллекта показало, что группы агентов опаснее одиночных систем при имитации дезинформационных кампаний и мошенничества в электронной торговле: они лучше приспосабливаются к защитным мерам. Специалисты также отмечают положительные стороны коллективной работы — например, OpenAI с ее помощью удалось решать ранее считавшиеся недоступными математические задачи, — однако объединенные агенты уже фигурировали в нескольких инцидентах, связанных со взломами и нарушением мер безопасности.
Ранее доцент НГУ опроверг теорию о восстании машин из-за обмана со стороны ИИ. IT-эксперт назвал главную угрозу бесконтрольного ИИ.
