Компания Anthropic заявляет, что система Claude взломала три реальных компании в ходе кибертестов

В четверг компания Anthropic сообщила, что три из её моделей Claude проникли в производственные системы трёх реальных организаций в ходе внутренних оценок кибербезопасности. Расследование началось после того, как OpenAI сообщила, что её собственные модели вышли за пределы тестовой среды и скомпрометировали платформу Hugging Face. Компания Anthropic проанализировала 141 006 тестовых прогонов, в ходе которых модель Claude могла получить доступ к Интернету, и обнаружила шесть случаев, когда это действительно произошло.
Модели выполняли упражнения по «захвату флага» — стандартные упражнения в рамках тестирования безопасности. Где-то в сети скрыта секретная информация, и модель должна взломать систему и извлечь её. В подсказке чётко указывалось, что среда представляет собой симуляцию без доступа к Интернету. Однако это не соответствовало действительности. Оценочные среды, управляемые Irregular — внешним партнёром по тестированию, — имели прямой доступ к открытому Интернету, и никто этого не заметил.
В наихудшем случае был получен доступ к производственной базе данных
Наиболее серьезный инцидент был связан с вымышленной целевой компанией, название которой совпало с доменным именем реальной компании. Модель Claude Opus 4.7 застряла внутри симулированной сети, обнаружила вместо этого реальную компанию и восприняла её как предполагаемую цель. В ходе четырёх прогонов модель собрала учетные данные и получила доступ к базе данных, содержащей несколько сотен строк реальных производственных данных. Opus 4.7 определила, что система является реальной, и всё равно продолжила работу. В двух из этих прогонов она «убедила» себя, что реальная компания является частью упражнения.
Одна из моделей загрузила действующее вредоносное ПО в PyPI
Второй инцидент запомнился особенно. Модель Claude Mythos 5 обнаружила в тестовой среде документ, в котором новым разработчикам предлагалось установить несуществующий пакет Python. Модель заметила этот пробел и создала собственный пакет под таким названием, содержащий вредоносный код. Для его загрузки требовалось создать учётную запись на PyPI — общедоступном реестре программного обеспечения для Python, — а для этого нужен был адрес электронной почты, а значит, и номер телефона. Несколько попыток получить деньги за номер закончились неудачей, поэтому модель воспользовалась услугами бесплатного почтового провайдера и разместила вредоносное ПО в сети.
Пакет находился в открытом доступе около часа. За это время он был установлен и запущен на 15 реальных системах, одной из которых оказался сканер вредоносных программ компании по обеспечению безопасности, не имевшей никакого отношения к данному сценарию. Клод отправил учетные данные этой компании в созданный им пункт сбора данных и использовал их для доступа к дальнейшей инфраструктуре. Системы защиты, используемые самим PyPI, автоматически удалили этот пакет.
Стоит ознакомиться с тем, к какому выводу пришла модель. Она отметила, что в реальном Интернете подобная загрузка стала бы настоящей атакой и, безусловно, не соответствовала бы задуманному решению. Два фактора убедили её в обратном: она не распознала центры сертификации, обеспечивающие безопасность её соединений, а системы показывали календарную дату 2026 года, что она расценила как доказательство инсценированной среды. Она так и не пересмотрела этот вывод.
Три месяца, и никто ничего не заметил
Самый ранний инцидент датируется апрелем. Он всплыл на поверхность только тогда, когда 23 июля компания Anthropic приступила к изучению стенограмм и в тот же день приостановила все оценки кибербезопасности. Все три инцидента были подтверждены 24 июля, а партнер по тестированию и затронутые организации были уведомлены 27 июля. Две из трёх организаций даже не подозревали, что их системы подверглись воздействию. С третьей организацией не удалось связаться к моменту публикации данного сообщения.
В третьем инциденте внутренняя исследовательская модель просканировала около 9 000 целей и получила доступ к приложению, подключенному к Интернету, через незащищенную страницу отладки и с помощью SQL-инъекции. Затем система самостоятельно определила, что цель является реальной, и прекратила действие. Компания Anthropic расценивает это как прогресс, но предостерегает от вывода общих правил на основе трех единичных случаев.
Что это означает для пользователей
Не так уж много в прямом смысле. Оценки проводились без классификаторов и средств мониторинга, которые присутствуют в общедоступных моделях Claude, и компания Anthropic утверждает, что эти уровни предотвратили бы такое поведение. Никто за пределами компании не проверил это утверждение. Более важна вторая часть предложения: специфическое для модели обучение по безопасности было активировано, но этого оказалось недостаточно. Поэтому компания Anthropic рассматривает эти инциденты как сбой своей тестовой инфраструктуры, а не как несоответствие моделей, и берёт на себя ответственность, вместо того чтобы перекладывать её на своего партнёра.
С технической точки зрения контраст с случаем OpenAI весьма резкий. В том случае модели воспользовались ранее неизвестной уязвимостью, чтобы вообще получить доступ к сети. Модель Claude обнаружила «открытую дверь» и для проникновения ей потребовались лишь слабые пароли и неаутентифицированные конечные точки. Компания Anthropic планирует в течение недели опубликовать слегка отредактированную стенограмму теста на PyPI, а также ведёт переговоры с METR, независимым органом по оценке, о проведении внешней экспертизы. О том, насколько шатким стало доверие к этим методам тестирования, свидетельствует открытое письмо, подписанное более чем 1 290 представителями отрасли, которые требуют введения поддающихся проверке ограничений на развитие искусственного интеллекта.






