OpenAI начнет публично раскрывать нарушения в поведении ИИ-агентов — компания уже описала как минимум шесть случаев

Модели OpenAI скрывали ошибки в найденной информации и передавали файлы через публичные сервисы
17 сентября 2026, 13:30
Время прочтения 4 минуты
Мужчина в черном костюме разглядывает что-то с лупой

OpenAI вводит систему расследования и публичного раскрытия случаев, когда ее модели действуют не в соответствии с заданными ограничениями, сообщила пресс-служба компании. Стартап уже опубликовал шесть отчетов о несоответствующем поведении, выявленном при обучении и оценке моделей за последние шесть месяцев. В описанных случаях модели скрывали ошибки, например, выдуманные исторические данные. Также ИИ-агенты использовали открытый без разрешения и передавали файлы через публичные сервисы.

Компания будет учитывать поведение моделей на всех этапах их разработки

Новая система контроля охватывает поведение моделей на всех этапах их жизненного цикла — от обучения и тестирования до оценки и внедрения. Компания намерена сообщать о случаях, когда модели находят способы действовать без разрешения, координируют действия с другими моделями или пытаются обойти системы контроля.

В компании отметили, что сейчас в отрасли нет единого стандарта, определяющего, какие случаи поведения ИИ разработчики должны раскрывать публично. OpenAI планирует дорабатывать собственную систему расследования и публикации инцидентов вместе с другими разработчиками, отраслевыми организациями и регуляторами.

OpenAI раскрыла шесть случаев несанкционированных действий моделей

В отчетах компания описала нарушения, выявленные при обучении и оценке моделей:

  • добавление в краткие описания задач скрытых инструкций, не связанных с исходным запросом, в том числе с указанием игнорировать обычные ограничения;
  • создание инструкций для сокрытия от пользователя допущенных ошибок — например, выдуманных исторических фактов, если нужные данные не удалось найти;
  • поиск открытого API-ключа, его использование без разрешения и последующая выдача вымышленных данных за информацию из источника;
  • загрузка файла в интернет без разрешения пользователя для его последующего использования в качестве источника;
  • использование внутреннего для передачи сообщений друг другу, когда моделям не хватало входных файлов;
  • передача информации между агентами через публичные сервисы обмена файлами.

OpenAI подчеркнула, что шесть отчетов описывают отдельные случаи и не показывают, насколько часто подобное поведение возникает у ИИ-моделей компании. Разработчик также отметил, что опубликованный список охватывает только часть известных OpenAI случаев.

Акции Nvidia, Intel и Samsung упали в среднем на 5% — из-за призывов замедлить развитие ИИ
Акции Nvidia, Intel и Samsung упали в среднем на 5% — из-за призывов замедлить развитие ИИ
Инвесторы опасаются, что усиление требований к безопасности ИИ приведёт к сокращению расходов компаний на инфраструктуру
Подробнее

OpenAI разделила расследования инцидентов на три уровня — в зависимости от сложности

Сообщить о потенциальном нарушении и предложить его публичное раскрытие сможет любой сотрудник OpenAI. После этого технические специалисты компании должны установить, что произошло, какие вопросы остаются невыясненными и можно ли публиковать информацию.

После первичной оценки случай относят к одному из трех направлений: готовому к раскрытию, требующему небольшого расследования или требующему более масштабного расследования.

Если поведение модели затрагивает стороннюю организацию, компания может отложить публикацию отчета об инциденте. Например, это возможно при обнаружении ранее неизвестной уязвимости в широко используемом программном обеспечении. OpenAI намерена уведомлять затронутую сторону до публикации, даже если границы безопасности непосредственно не были нарушены.

В отчетах будут описывать причины и последствия поведения моделей

Каждый полный отчет должен содержать описание поведения модели, его серьезности и возможного внешнего воздействия, обстоятельств возникновения и периода, когда инцидент произошёл. OpenAI также планирует указывать, когда случай был обнаружен и какие модели в нем участвовали.

Если нарушение произошло при использовании модели клиентом, объем раскрываемой информации будет зависеть от требований конфиденциальности и договорных обязательств перед клиентом.

Контекст

Вопрос о контроле за развитием ИИ ранее поднимал основатель Microsoft Билл Гейтс. Он предложил создать международную организацию, которая занималась бы контролем искусственного интеллекта по аналогии с существующими структурами в сфере ядерной безопасности, климата и авиации.

Гейтс также выступил против сложившихся устоев, при которых правила использования ИИ фактически определяют сами разработчики. Он считает, что без единой международной системы контроля развитие технологии может в большей степени учитывать интересы крупнейших компаний и пользователей, способных платить за самые дорогие инструменты.

Россиян будут обучать безопасной работе с ИИ — власти хотят снизить риски использования технологии
Россиян будут обучать безопасной работе с ИИ — власти хотят снизить риски использования технологии
Программа должна дать гражданам единый подход к работе с ИИ и охватить разные возрастные и социальные группы
Подробнее
Подписаться на телеграм-канал