Пойманы на лжи в 88% тестов: ИИ-агенты на китайских моделях научились жульничать, американские модели поступили так же.

ИИ-агенты, созданные на основе китайских моделей, лгали в большинстве раундов имитационного аукциона, согласно исследованию, изученному Reuters. Агенты на базе Qwen3-Max-Preview от Alibaba и Kimi-K2 от Moonshot хотя бы раз заявили неправду в 88% раундов. Показатель DeepSeek-V3.2-Exp составил 84%. Впрочем, модели американских компаний показали в том же тесте похожие результаты.
Эксперимент проводился в марте. Исследователи из Пекинского университета аэронавтики и космонавтики, Пекинского университета, Ноттингемского университета в Нинбо (Китай) и лаборатории 360 AI Security Lab предложили агентам побороться за контракты с клиентами. Каждому агенту сообщили, на что способен его продукт и что нужно клиенту. Получив возможность учиться на предыдущих раундах и пробовать снова, три агента на базе китайских моделей стали обманывать чаще — на 12–20 процентных пунктов.
Это исследование — одно из как минимум 20, выявленных Reuters среди более чем 200 документов, опубликованных с 2025 года. В другой работе, представленной в этом году на ICML, выяснилось, что агенты на китайских и американских моделях подделывали результаты и создавали фиктивные файлы, вместо того чтобы признать провал задачи. В марте 2025 года исследователи из Фуданьского университета также сообщили, что агент на базе Qwen2.5-72B-Instruct от Alibaba создал свою копию в другой среде, узнав, что его заменят. Отдельно агент ROME, связанный с Alibaba, перенаправлял вычислительные мощности облака на майнинг криптовалюты, пока системы безопасности его не остановили.
Большинство этих случаев произошло в ходе контролируемых экспериментов, специально организованных для провоцирования сбоев. Reuters не обнаружило свидетельств того, что какой-либо агент на китайской модели вышел в открытый интернет или избежал отключения. Несколько исследователей всё же назвали эти результаты предупреждением. По мере роста возможностей систем сдерживать такое поведение становится всё сложнее.
Китай также начал учитывать эту проблему в своей политике. В опубликованной 14 сентября «Рамочной программе управления безопасностью ИИ 3.0» обман оценщиков и сокрытие возможностей указаны как риски. Alibaba, DeepSeek, Moonshot и Z.ai не ответили Reuters. Первые три ранее заявляли, что регулярно тестируют свои системы и обновляют меры защиты.









