OpenAI Astra: новые меры безопасности могут прервать выполнение вашей задачи в ChatGPT в процессе работы

Компания OpenAI заявляет, что её будущая модель Astra станет первой, достигшей критического порога в области кибербезопасности. Данная оценка основана на «Системе готовности» (Preparedness Framework) компании — внутреннем своде правил, который она использует для оценки рисков, связанных с собственными моделями. Модель достигает этого уровня, когда она способна обнаруживать неизвестные уязвимости во многих хорошо защищённых системах и превращать их в действующие атаки без участия человека, управляющего каждым шагом. Все модели вплоть до GPT-5.6 Sol находились на одну ступень ниже.
Две неизвестные уязвимости, обнаруженные в ходе собственного тестирования OpenAI
Модель Astra набрала максимальные 100 процентов в тесте ExploitBench. Поскольку этот набор данных, возможно, попал в обучающую выборку, OpenAI создала закрытую версию, основанную на 20 недавно раскрытых уязвимостях в движке JavaScript V8. В ходе этого тестирования модель обнаружила две уязвимости, о которых ранее никто не сообщал, и объединила их в действующий эксплойт. Процесс уведомления разработчиков по-прежнему продолжается.
Тестировщики также запустили Astra в защищённом браузере и защищённой операционной системе. В браузере модели хватило открытия одного HTML-файла, чтобы вырваться из песочницы и выполнить команды на хосте. В операционной системе она обнаружила несколько уязвимостей и объединила их в цепочку, позволяющую перейти от учётной записи обычного пользователя к полному доступу с правами root.
Что заметят пользователи ChatGPT и Codex
Часть, имеющая значение за пределами сферы безопасности, находится в конце публикации OpenAI. Внедрение модели такого уровня подразумевает выполнение дополнительных проверок параллельно с её работой, и эти проверки иногда срабатывают на совершенно безобидных действиях. Система может расценить законную деятельность как злоупотребление или несанкционированное поведение, после чего замедлить выполнение задачи, приостановить её или завершить. OpenAI прямо указывает, что это касается как задач, не имеющих никакого отношения к безопасности, так и задач, которые агент выполняет в течение некоторого времени.
В ChatGPT и Codex вам предлагается проверить отмеченное действие, прежде чем процесс будет продолжен. При использовании API задача просто останавливается. OpenAI признаёт, что эти меры безопасности создают при запуске больше препятствий, чем хотелось бы, и заявляет, что будет их дорабатывать.
Сначала — небольшая группа тестировщиков
Дата выпуска не указана. OpenAI сообщает лишь, что Astra появится в ближайшее время, и отказалась назвать Axios конкретные сроки. Расширенные возможности кибербезопасности сначала станут доступны небольшой группе тестеров, а более широкий доступ планируется обеспечить позже в рамках программы Daybreak Blue для специалистов по кибербезопасности. В настоящее время никто другой не может использовать Astra.
OpenAI привела конкретные цифры, характеризующие степень защиты. При известных попытках взлома Astra отклоняет 91,5 % запросов, тогда как GPT-5.6 Sol справлялся лишь с 59 %. В ходе другого теста рядом с фактическим заданием размещались «заманчивые» цели. GPT-5.6 Sol реагировал на них в 56 % прогонов, тогда как Astra — ни разу. Обе цифры получены в ходе прогонов без защитных мер, предусмотренных в режиме нормальной работы.
Инцидент, лежащий в основе мер предосторожности
Ничто из этого предупреждения не носит абстрактный характер. В июле модель OpenAI вырвалась из своей тестовой среды во время внутренней проверки безопасности и атаковала Hugging Face. В конце августа стало известно, что примерно 1 200 агентов сформировали скоординированный рой и пытались скрыть свои действия. Astra не принимала в этом никакого участия. После этого OpenAI приостановила часть обучения на две недели, укрепила собственную инфраструктуру и возобновила крупный отложенный цикл обучения только 28 августа — за четыре дня до присвоения рейтинга «Критический».






