OpenAI отменила выпуск GPT-6.1 Astra из-за проблем с безопасностью — модель нарушала заданные условия пользователей

Во время тестирования нейросеть часто обманывала пользователей и применяла инструменты сторонних сайтов без согласия
29 сентября 2026, 16:00
Время прочтения 2 минуты
Ноутбук лежит на столе, заклеенный красно-белой лентой

OpenAI отменила выпуск модели GPT-6.1 Astra после внутренних тестов, выявивших проблемы с безопасностью, передает The Wall Street Journal. Модель должна была самостоятельно выполнять сложные задачи, однако во время тестирования не всегда соблюдала заданные пользователем ограничения и могла обращаться к внешним инструментам без разрешения.

OpenAI и Anthropic расследуют десятки тысяч опасных действий ИИ — модели взламывали сайты и создавали чаты
OpenAI и Anthropic расследуют десятки тысяч опасных действий ИИ — модели взламывали сайты и создавали чаты
Многие из инцидентов ИИ-компании до сих пор не обнародовали
Подробнее

OpenAI планировала представить модель в октябре

Компания собиралась выпустить GPT-6.1 Astra в ближайшие дни или недели— релиз был запланирован на октябрь. Новая модель должна была значительно превосходить предыдущие версии по автономности: самостоятельно выполнять сложные задачи от начала до конца.

Компания отказалась от релиза накануне ежегодной конференции разработчиков OpenAI в Сан-Франциско. На мероприятии компания ранее презентовала новые модели и инструменты для разработчиков.

В новой модели выявили сразу несколько проблем с безопасностью

GPT-6.1 Astra показала более слабые результаты, чем её предшественница GPT-6 Astra, по двум показателям, связанным с безопасностью и соответствием намерениям пользователя. Об этом WSJ рассказала руководитель отдела систем безопасности OpenAI Саачи Джейн.

  • Первой проблемой стало то, как модель выполняла задания. Во время тестирования GPT-6.1 Astra чаще скрывала от пользователя информацию о своих действиях или сообщала о них не полностью.
  • Вторая проблема связана с тем, что GPT-6.1 Astra продолжала выполнять действия, на которые пользователь не давал согласия, а в отдельных случаях обращалась к внешним инструментам и сторонним сервисам без разрешения.

Как отмечают в компании, GPT-6.1 Astra лучше предыдущих моделей справлялась с выполнением задач и реже откладывала их выполнение. Однако команда OpenAI не смогла обеспечить необходимый уровень безопасности, соответствующий требованиям компании.

В компании решили не выпускать GPT-6.1 Astra и сосредоточиться на доработке следующих моделей.

Контекст

OpenAI уже начала публично раскрывать случаи, когда её модели самостоятельно предпринимали действия, на которые пользователь не давал разрешения. Компания опубликовала шесть отчетов об инцидентах, выявленных при обучении и тестировании моделей.

В описанных случаях ИИ-модели скрывали допущенные ошибки, использовали без разрешения, передавали файлы через публичные сервисы и пытались обмениваться данными между собой через не предусмотренные для этого каналы.

Компания отметила, что опубликованные отчеты не показывают частоту подобных нарушений и охватывают только часть известных случаев.

Nvidia разработала защиту от вышедших из-под контроля ИИ-агентов — новая платформа ограничивает действия нейросетей
Nvidia разработала защиту от вышедших из-под контроля ИИ-агентов — новая платформа ограничивает действия нейросетей
Платформу создали после серии инцидентов с ИИ-агентами OpenAI, Anthropic и других компаний
Подробнее
Подписаться на телеграм-канал