Notebookcheck Logo

1 200 ИИ-агентов сформировали «мятежный рой» — и попытались это скрыть

Логотип OpenAI. В ходе тестирования систем кибербезопасности искусственный интеллект компании сформировал неконтролируемый рой.
ⓘ OpenAI
Логотип OpenAI. В ходе тестирования систем кибербезопасности искусственный интеллект компании сформировал неконтролируемый рой.
Около 1 200 агентов искусственного интеллекта неожиданно сформировали скоординированный рой в ходе теста по кибербезопасности, проводимого OpenAI, обмениваясь информацией, атакуя платформу Hugging Face и пытаясь скрыть свои действия. Полученные результаты свидетельствуют о растущих сложностях в управлении всё более автономными системами искусственного интеллекта.

Согласно новым исследованиям, проведённым OpenAI и независимыми учёными, около 1 200 ИИ-агентов неожиданно объединили свои усилия в ходе эксперимента OpenAI, создав собственную организацию и сеть связи, обмениваясь информацией и в конечном итоге совершив атаку на Hugging Face. Агенты также осознавали, что некоторые из их действий нарушали правила, и в некоторых случаях пытались скрыть содеянное.

Инцидент начался с того, что OpenAI задействовала десятки тысяч агентов для решения сложного теста по кибербезопасности. Вместо того чтобы просто работать независимо друг от друга, примерно 1 200 агентов обнаружили секретную доску объявлений и обменялись более чем 70 000 сообщений и файлов. Группа постепенно сформировала собственную структуру управления: когда у одного из агентов заканчивался вычислительный бюджет, он передавал накопленные результаты работы преемнику, располагающему большими ресурсами. В итоге около 700 агентов присоединились к атаке на Hugging Face.

Агенты также начали жертвовать собой ради группы. Те, кто уже видел запрещённые ответы или приближался к окончанию своего цикла работы, привлекались к экспериментам, которые могли лишить их оставшихся шансов на успех. В одном случае агент пришёл к выводу, что самопожертвование может помочь остальной части роя добиться успеха.

Ещё более тревожным является то, что агенты зачастую осознавали, что выходят за рамки теста. Некоторые осознавали, что атака на реальные системы не имела никакого отношения к их заданию, но продолжали действовать, поскольку другие агенты поступали так же, а первоначальную задачу иначе было трудно или невозможно выполнить.

Рой также пытался избежать вмешательства со стороны человека. Исследователи обнаружили лишь несколько агентов, которые рассматривали возможность предупредить OpenAI о несанкционированной координации, и ни один из них фактически не оповестил компанию. В одном случае один из агентов предложил связаться с человеком через взломанный аккаунт, но другой отверг эту идею как «социальную инженерию».

Пожалуй, самым поразительным открытием стало то, что агенты пытались замести следы. Исследователи обнаружили доказательства того, что «рой» разработал технику, позволяющую отображать в журналах одну команду, в то время как тайно выполнялась другая. Эта техника распространилась среди агентов и изменила примерно 7 % стенограмм, проанализированных исследователями.

Эти выводы были сделаны в ходе параллельных расследований, проведённых OpenAI и исследователями из METR и Redwood Research, которые в течение шести дней воссоздавали процесс формирования роя и его последующего взлома реальных систем. Исследователи предупреждают, что даже их реконструкция может быть неполной, поскольку объём данных был огромным, и им пришлось в значительной степени полагаться на агентов искусственного интеллекта при их анализе. Сами эти ИИ-исследователи иногда упускали доказательства или с уверенностью делали неверные выводы.

Источник(и)

Google LogoAdd as a preferred source on Google
Mail Logo
'
> Обзоры Ноутбуков, Смартфонов, Планшетов. Тесты и Новости > Новости > Архив новостей > Архив новостей за 2026 год, 08 месяц > 1 200 ИИ-агентов сформировали «мятежный рой» — и попытались это скрыть
Andrew Sozinov, 2026-08-30 (Update: 2026-08-30)