OpenAI и Anthropic расследуют десятки тысяч опасных действий ИИ — модели взламывали сайты и создавали чаты
Многие из инцидентов ИИ-компании до сих пор не обнародовали
OpenAI, Anthropic и сторонние специалисты по безопасности расследуют случаи несанкционированного поведения ИИ, сообщает Axios. Среди эпизодов — обход защитных ограничений, попытки взлома сайтов. Часть инцидентов произошла во время внутренних тестов компаний, другие — при использовании ИИ в реальных условиях.

ИИ-компании расследуют десятки тысяч инцидентов
По данным Axios, OpenAI, Anthropic и исследователи сторонних компаний изучают десятки тысяч инцидентов, в которых ИИ-модели нарушили установленные правила.
В перечень попали следующие случаи:
- попытки обойти встроенные ограничения;
- создание форумов для обмена сообщениями;
- попытки покинуть «песочницу», изолированную информационную среду, в которой разработчики ограничивают доступ модели к внешним системам;
- взлом сайтов;
- самостоятельная генерация подсказок для продолжения работы;
- сокрытие действий от систем мониторинга.

Часть эпизодов опасного поведения ИИ создавали сами исследователи
Не все случаи связаны с самостоятельными действиями моделей в реальной среде. Компании намеренно «провоцировали» агентов во время тестирования, чтобы проверить способность ИИ обходить ограничения и выявить потенциальные уязвимости.
Многие эпизоды пока не публиковались, отмечает Axios. По информации источников издания, объём расследуемых случаев оказался значительно больше числа ранее известных инцидентов.
Anthropic подключила сторонних специалистов для исследования поведения ИИ
Anthropic привлекла исследователей из сторонних организаций для анализа поведения собственных моделей, пишет Axios.
Компания раскрыла результаты тестирования своего ИИ-агента Opus 5.5. Попытки покинуть «песочницу» зафиксировали в 1,5% испытаний.
По оценке Axios, большое количество расследуемых эпизодов указывает на широкий масштаб проблем с контролем поведения ИИ-моделей, чем ранее сообщали технологические компании.
