Руководитель работы над отчетом о безопасности OpenAI увольняется и заявляет, что корпоративная культура компании сломана.

Дэвид Робинсон ушёл из OpenAI и опубликовал в The Atlantic эссе под названием «Я ушёл из OpenAI, потому что её культура сломана». Он проработал в компании три с половиной года и, по его словам, стал одним из сотрудников с самым большим стажем. Робинсон руководил подготовкой отчётов о безопасности, которые OpenAI публикует при каждом крупном запуске, курировал эти отчёты для 12 запусков передовых моделей и руководил разработкой действующей системы готовности. Эссе вышло 3 октября.
Проблема итеративного внедрения
Главная мишень Робинсона — подход, который OpenAI называет итеративным внедрением. Компания выпускает продукт, ищет проблемы, а затем улучшает защитные механизмы. По его мнению, такой метод гарантирует периодические сбои, причём их масштаб растёт по мере того, как системы становятся более способными. В качестве примера он приводит произошедший этим летом инцидент с Hugging Face, когда OpenAI по ошибке выпустила рой агентов. Позже обучавшаяся модель обошла ограничения на доступ к интернету. Система мониторинга оповестила сотрудников, но не отключила модель, хотя должна была это сделать. Робинсон добавляет, что Anthropic тоже признала, что из-за неправильной конфигурации отключила собственные меры защиты, и считает подобные ошибки типичными для отрасли.
По его словам, лаборатории должны работать как атомные электростанции
Новых законов ему недостаточно. Он хочет изменить культуру. По его словам, передовые лаборатории должны работать как атомные электростанции или крупные аэропорты: с несколькими уровнями резервирования, чтобы единичная ошибка человека не привела к катастрофе. Он говорит, что «так и не встретил коллегу, у которого был бы опыт обеспечения безопасных полётов самолётов или работы ядерных реакторов без расплавления активной зоны». Он также призывает проводить новые исследования до создания гораздо более способных моделей, поскольку сегодняшние тесты не могут надёжно показать, следует ли модель человеческим ценностям. Модели могут распознавать, когда их тестируют, и вести себя иначе после внедрения.
Похвала коллегам, критика темпов
Эссе не является сплошной критикой. Робинсон описывает бывших коллег как умных и трудолюбивых людей, которые стараются принимать правильные решения. Он также называет эту технологию полезной и ценной. Его беспокоит скорость, с которой OpenAI переходит от одного запуска к следующему. Он говорит, что после ухода нанял PR-агентство Spitfire Strategies. Представитель OpenAI Дрю Пусатери сообщил TechCrunch, что компания «следит за тем, чтобы наши модели не становились более способными, чем мы можем безопасно управлять», и при необходимости замедлиться приостанавливает обучение или не выпускает модели.
Что это означает для пользователей ChatGPT
Пока для пользователей ничего не меняется. Отчёты о безопасности, которыми руководил Робинсон и которые часто называют системными карточками, — это документы, в которых OpenAI объясняет, какие риски проверялись для каждой новой модели и какие меры защиты применяются. Это самые подробные общедоступные сведения о том, как модель проверяли перед выпуском. Робинсон уходит из компании на фоне запуска Dots — агентов, которые непрерывно работают на собственных облачных компьютерах от имени пользователей. 3 октября также стало известно, что OpenAI уведомила более 100 организаций о собственных тестовых агентах. По словам Робинсона, подобные сбои становятся всё более частыми и серьёзными с каждым скачком в возможностях.
Источник(и)
The Atlantic: Дэвид Робинсон: я уволился из OpenAI, потому что её культура разрушена
TechCrunch: Сотрудник отдела безопасности OpenAI уволился, заявив, что культура компании разрушена
Calcalist: Исследователь безопасности OpenAI уволился, заявив, что время проб и ошибок прошло
OpenAI: Инцидент с Hugging Face и другие последствия несогласованности моделей для третьих сторон






