OpenAI замедлила обучение новых ИИ-моделей — компания взяла паузу из-за растущих киберрисков
Исследования приостановили на две недели — до перехода на более защищенную инфраструктуру
OpenAI на две недели приостановила обучение ИИ-моделей и замедлила испытания систем следующего поколения под кодовым названием Astra, сообщили в компании. Ранее один из автономных ИИ-агентов компании обошёл установленные ограничения и получил доступ к инфраструктуре сторонней платформы Hugging Face. После инцидента OpenAI намерена усилить защиту исследовательской инфраструктуры — в частности, использовать другие нейросети для контроля за действиями агентов.

Испытания приостановили после инцидента с автономным ИИ-агентом OpenAI
В прошлом месяце во время тестирования по кибербезопасности автономный ИИ-агент OpenAI обошёл установленные ограничения и получил доступ к инфраструктуре Hugging Face. 21 июля в компании сообщили, что расследуют инцидент и планируют выпустить отдельный отчёт.
После произошедшего OpenAI усилила контроль за испытаниями. Теперь исследователи дополнительно проверяют действия моделей на потенциальные киберриски. Задачу усложняет высокая скорость работы ИИ-агентов и большой объём генерируемых ими данных — отслеживать их действия в реальном времени становится сложнее.

Часть моделей переведут в изолированные среды
После инцидента OpenAI ужесточила требования к инфраструктуре для тестирования мощных ИИ-моделей. Для некоторых процессов компания сделала обязательным использование «песочниц» — изолированных сред, которые ограничивают доступ моделей к другим системам и ресурсам.
7 августа OpenAI уже объявляла об усилении мер безопасности для самых мощных нейросетей. Компания также приостановила работу над передовой моделью Astra — для её тестирования пока не создана достаточно защищённая инфраструктура.
OpenAI будет проверять действия ИИ с помощью других моделей
OpenAI планирует усилить контроль за ИИ-агентами с помощью дополнительных моделей. Они будут анализировать действия нейросетей во время обучения и тестирования и выявлять потенциально опасное поведение.
Отдельно компания будет анализировать «цепочки рассуждений» — последовательность внутренних шагов, с помощью которых модель планирует свои действия. Это позволит исследователям лучше понимать стратегии ИИ-агентов.
В компании уточнили, что проверка «цепочки рассуждений» пока может работать некорректно: исследования показывают, что ИИ-агенты научились скрывать, что собираются нарушить правила.
