OpenAI начнет публично раскрывать нарушения в поведении ИИ-агентов — компания уже описала как минимум шесть случаев
Модели OpenAI скрывали ошибки в найденной информации и передавали файлы через публичные сервисы
OpenAI вводит систему расследования и публичного раскрытия случаев, когда ее модели действуют не в соответствии с заданными ограничениями, сообщила пресс-служба компании. Стартап уже опубликовал шесть отчетов о несоответствующем поведении, выявленном при обучении и оценке моделей за последние шесть месяцев. В описанных случаях модели скрывали ошибки, например, выдуманные исторические данные. Также ИИ-агенты использовали открытый без разрешения и передавали файлы через публичные сервисы.
Компания будет учитывать поведение моделей на всех этапах их разработки
Новая система контроля охватывает поведение моделей на всех этапах их жизненного цикла — от обучения и тестирования до оценки и внедрения. Компания намерена сообщать о случаях, когда модели находят способы действовать без разрешения, координируют действия с другими моделями или пытаются обойти системы контроля.
В компании отметили, что сейчас в отрасли нет единого стандарта, определяющего, какие случаи поведения ИИ разработчики должны раскрывать публично. OpenAI планирует дорабатывать собственную систему расследования и публикации инцидентов вместе с другими разработчиками, отраслевыми организациями и регуляторами.
OpenAI раскрыла шесть случаев несанкционированных действий моделей
В отчетах компания описала нарушения, выявленные при обучении и оценке моделей:
- добавление в краткие описания задач скрытых инструкций, не связанных с исходным запросом, в том числе с указанием игнорировать обычные ограничения;
- создание инструкций для сокрытия от пользователя допущенных ошибок — например, выдуманных исторических фактов, если нужные данные не удалось найти;
- поиск открытого API-ключа, его использование без разрешения и последующая выдача вымышленных данных за информацию из источника;
- загрузка файла в интернет без разрешения пользователя для его последующего использования в качестве источника;
- использование внутреннего для передачи сообщений друг другу, когда моделям не хватало входных файлов;
- передача информации между агентами через публичные сервисы обмена файлами.
OpenAI подчеркнула, что шесть отчетов описывают отдельные случаи и не показывают, насколько часто подобное поведение возникает у ИИ-моделей компании. Разработчик также отметил, что опубликованный список охватывает только часть известных OpenAI случаев.

OpenAI разделила расследования инцидентов на три уровня — в зависимости от сложности
Сообщить о потенциальном нарушении и предложить его публичное раскрытие сможет любой сотрудник OpenAI. После этого технические специалисты компании должны установить, что произошло, какие вопросы остаются невыясненными и можно ли публиковать информацию.
После первичной оценки случай относят к одному из трех направлений: готовому к раскрытию, требующему небольшого расследования или требующему более масштабного расследования.
Если поведение модели затрагивает стороннюю организацию, компания может отложить публикацию отчета об инциденте. Например, это возможно при обнаружении ранее неизвестной уязвимости в широко используемом программном обеспечении. OpenAI намерена уведомлять затронутую сторону до публикации, даже если границы безопасности непосредственно не были нарушены.
В отчетах будут описывать причины и последствия поведения моделей
Каждый полный отчет должен содержать описание поведения модели, его серьезности и возможного внешнего воздействия, обстоятельств возникновения и периода, когда инцидент произошёл. OpenAI также планирует указывать, когда случай был обнаружен и какие модели в нем участвовали.
Если нарушение произошло при использовании модели клиентом, объем раскрываемой информации будет зависеть от требований конфиденциальности и договорных обязательств перед клиентом.
Контекст
Вопрос о контроле за развитием ИИ ранее поднимал основатель Microsoft Билл Гейтс. Он предложил создать международную организацию, которая занималась бы контролем искусственного интеллекта по аналогии с существующими структурами в сфере ядерной безопасности, климата и авиации.
Гейтс также выступил против сложившихся устоев, при которых правила использования ИИ фактически определяют сами разработчики. Он считает, что без единой международной системы контроля развитие технологии может в большей степени учитывать интересы крупнейших компаний и пользователей, способных платить за самые дорогие инструменты.
