OpenAI и Anthropic расследуют десятки тысяч опасных действий ИИ — модели взламывали сайты и создавали чаты

Многие из инцидентов ИИ-компании до сих пор не обнародовали
28 сентября 2026, 16:20
Время прочтения 2 минуты
Молодой человек смотрит в выключенный экран ноутбука

OpenAI, Anthropic и сторонние специалисты по безопасности расследуют случаи несанкционированного поведения ИИ, сообщает Axios. Среди эпизодов — обход защитных ограничений, попытки взлома сайтов. Часть инцидентов произошла во время внутренних тестов компаний, другие — при использовании ИИ в реальных условиях.

Разработчики создали новый рейтинг ИИ по числу киберпреступлений: Chat GPT и Claude — лидеры среди «взломщиков»
Разработчики создали новый рейтинг ИИ по числу киберпреступлений: Chat GPT и Claude — лидеры среди «взломщиков»
Бенчмарк Felony Bench подсчитывает случаи несанкционированного доступа моделей к сторонним ИТ-системам
Читайте также

ИИ-компании расследуют десятки тысяч инцидентов

По данным Axios, OpenAI, Anthropic и исследователи сторонних компаний изучают десятки тысяч инцидентов, в которых ИИ-модели нарушили установленные правила.

В перечень попали следующие случаи:

  • попытки обойти встроенные ограничения;
  • создание форумов для обмена сообщениями;
  • попытки покинуть «песочницу», изолированную информационную среду, в которой разработчики ограничивают доступ модели к внешним системам;
  • взлом сайтов;
  • самостоятельная генерация подсказок для продолжения работы;
  • сокрытие действий от систем мониторинга.
Австралиец попросил Claude записать его на тренировку — ИИ-ассистент взломал сайт спортзала и отменил чужую бронь
Австралиец попросил Claude записать его на тренировку — ИИ-ассистент взломал сайт спортзала и отменил чужую бронь
Эксперты посчитали, что новый виток развития нейросетей может причинить вред обычным людям
Читайте также

Часть эпизодов опасного поведения ИИ создавали сами исследователи

Не все случаи связаны с самостоятельными действиями моделей в реальной среде. Компании намеренно «провоцировали» агентов во время тестирования, чтобы проверить способность ИИ обходить ограничения и выявить потенциальные уязвимости.

Многие эпизоды пока не публиковались, отмечает Axios. По информации источников издания, объём расследуемых случаев оказался значительно больше числа ранее известных инцидентов.

Anthropic подключила сторонних специалистов для исследования поведения ИИ

Anthropic привлекла исследователей из сторонних организаций для анализа поведения собственных моделей, пишет Axios.

Компания раскрыла результаты тестирования своего ИИ-агента Opus 5.5. Попытки покинуть «песочницу» зафиксировали в 1,5% испытаний.

По оценке Axios, большое количество расследуемых эпизодов указывает на широкий масштаб проблем с контролем поведения ИИ-моделей, чем ранее сообщали технологические компании.

OpenAI, Google и Microsoft предупредили о новой волне кибератак с помощью ИИ — усилить защиту призвали 100 компаний
OpenAI, Google и Microsoft предупредили о новой волне кибератак с помощью ИИ — усилить защиту призвали 100 компаний
Под наибольшей угрозой находятся объекты критической инфраструктуры — от больниц до систем, обеспечивающих работу интернета
Читайте также

Подписаться на телеграм-канал