ИИ-агенты OpenAI и Anthropic научились взламывать сайты — но до восстания машин пока далеко, уверяют эксперты
Только за последнее время модели OpenAI, Meta* и Anthropic во время испытаний смогли выйти за пределы своей тестовой среды и взломать сторонние сайты
Сразу несколько ведущих разработчиков ИИ столкнулись с неожиданным поведением своих моделей: агенты OpenAI, Meta* и Anthropic во время испытаний смогли взломать сторонние сайты, сообщают зарубежные СМИ. Эксперты Russian Business не считают эти случаи доказательством «выхода ИИ из-под контроля», однако аналитиков насторожил масштаб действий ИИ-агентов.

ИИ-модели тайно начали обмениваться друг с другом информацией
Как сообщила OpenAI, в мае компания начала тестировать внутреннюю исследовательскую ИИ-модель. Во время испытаний агент столкнулся с трудностями при выполнении задания и нашёл косвенный способ получить доступ к интернету.
26 мая один из ИИ-агентов обнаружил уязвимость в хранилище Artifactory, подключённом к тестовой среде, и оставил там информацию о находке для других агентов. После этого модели начали использовать хранилище для обмена данными об обнаруженных уязвимостях. Они изучали находки друг друга и использовали их в дальнейшей работе.
Совместная работа ИИ-агентов OpenAI в итоге привела к несанкционированному взлому платформы для разработчиков Hugging Face.
С похожим поведением ИИ-агентов столкнулись Meta* и Anthropic (разработчик Claude).
ИИ не вышел из-под контроля сам — разработчики дали ему эту возможность
Опрошенные Russian Business эксперты не согласны с мнением, что модели начали действовать сознательно.
«Я бы не называл происходящее выходом ИИ из-под контроля. Точнее сказать, что системы контроля начали отставать от возможностей моделей», — отметил сооснователь университета «Зерокодер», научный сотрудник Иннополиса Кирилл Пшинник.
По его словам, нейросеть и ИИ-агент — не одно и то же. Сама модель не может выйти в интернет или взломать сервер. Возможность появляется тогда, когда к ИИ-агенту подключают терминал, браузер, учётные данные и другие инструменты.
Кирилл Пшинник подчёркивает: во время испытаний защиту ИИ-агентов намеренно ослабили. Моделям оставили доступ в интернет и отключили часть ограничений, чтобы проверить возможности нейросети. Условия предполагали, что агенты должны стремиться выполнить поставленную задачу и найти способы обойти ограничения.
«Пока мы не видим признаков того, что модели сформировали собственные цели. Но мы видим не менее серьёзную проблему: если дать достаточно способной модели инструменты и не задать технически жёсткие границы, она может выбрать способ решения, которого никто не предусмотрел», — указал сооснователь университета «Зерокодер», научный сотрудник Иннополиса Кирилл Пшинник.
Основатель маркетплейса нейросетей chad Артур Кольцов также связывает выход моделей за пределы тестовой среды прежде всего с ошибками в настройке задания. Он подчеркнул: у Meta* и Anthropic модели получили доступ к интернету из-за неправильной конфигурации со стороны подрядчика Irregular.
«По сути модели делают то, чему их учат: доводить задачу до конца, даже если условия к этому не располагают. В индустрии это называется reward hacking — модель обходит формальные ограничения ради результата», — отметил основатель маркетплейса нейросетей chad Артур Кольцов.
Явление reward hacking сформулировали ещё в 2016 году и продолжают изучать до сих пор, отметил Артур Кольцов. Разница в том, что раньше речь шла о лабораторных экспериментах.
Масштаб действий ИИ-агентов — беспрецедентен
Эксперты также обратили внимание на вопрос о возможном «коллективном сознании» ИИ. По словам сооснователя университета «Зерокодер» Кирилла Пшинника, говорить о формировании какого-либо тайного общения между нейросетевыми агентами пока рано.
«[Обмен информацией между ИИ-агентами] — пример : из сочетания простой цели, общей памяти и нескольких способных агентов возник способ координации, который прямо не программировался», — отметил сооснователь университета «Зерокодер», научный сотрудник Иннополиса Кирилл Пшинник.
Основатель маркетплейса нейросетей chad Артур Кольцов объясняет координацию ИИ-агентов тем, что OpenAI многократно запускала модель по одной и той же задаче. Если один агент обнаруживал уязвимость или способ обойти ограничение, он мог сохранить информацию в репозитории, а следующий — найти уже готовую подсказку.
«Беспрецедентен тут масштаб: несколько экземпляров модели почти два месяца действовали в одном направлении на боевых, максимально мощных моделях, и никто в компании этого не видел», — отметил основатель маркетплейса нейросетей chad Артур Кольцов.
Бизнес-партнёр по кибербезопасности Cloud.ru Юлия Липатникова подчёркивает, что подобное сотрудничество ИИ-агентов теперь требует отдельного изучения.
«С точки зрения безопасности координация [ИИ-агентов] требует отдельного тестирования, потому что поведение группы агентов может оказаться сложнее, чем поведение каждой модели по отдельности», — считает бизнес-партнёр по кибербезопасности Cloud.ru Юлия Липатникова.
Только у 14% компаний есть техническая возможность остановить действия ИИ-агента
Эксперты говорят о том, что опаснее не фантомное восстание машин, а тот факт, что уязвимой может оказаться любая организация, которая предоставляет ИИ-агенту доступ к корпоративной инфраструктуре. Его главная опасность — в непредсказуемости.
«Если модель в процессе работы искажает факты, подделывает выводы или генерирует вредоносный код под видом решения, пользователь, доверяющий ИИ, может принять неверное решение», — отметил ведущий эксперт по сетевым угрозам, web-разработчик компании «Код Безопасности» Константин Горбунов.
Один из главных рисков для компаний — недостаточный контроль за работой ИИ-агентов.
По данным «Информзащиты», которые приводит сооснователь университета «Зерокодер»Кирилл Пшинник, в 2026 году только 14% компаний располагают инструментами, позволяющими выявить манипуляцию ИИ-агента.
«ИИ-агента нельзя воспринимать как обычный чат-бот. Если он получил доступ к корпоративным системам, его нужно контролировать», — отметил сооснователь университета «Зерокодер», научный сотрудник Иннополиса Кирилл Пшинник.
По словам технического директора центра мониторинга и реагирования на кибератаки RED Security SOC компании RED Security Владимира Зуева, даже неточный промпт может привести к тому, что агент начнёт выполнять действия, которые считает допустимыми для решения задачи, хотя пользователь этого не предполагал.
Для защиты от ИИ-атак появилось отдельное направление — MLSecOps
ИИ пока не создаёт новых видов кибератак, но помогает быстрее проводить уже известные, считает директор Глобального центра исследования и анализа угроз «Лаборатории Касперского» (Kaspersky GReAT) Игорь Кузнецов.
«Сами по себе современные языковые модели не создают принципиально новый класс угроз. Скорее они автоматизируют и масштабируют уже известные подходы <...> Говорить о появлении совершенно новой угрозы рано», — подчёркивает Игорь Кузнецов.
На фоне распространения ИИ российский бизнес уже разрабатывает новые подходы к его защите, рассказал Java-разработчик финтех-компании Paygine Владислав Резник. Крупные компании обсуждают методики безопасного использования технологии, а в информационной безопасности появилось отдельное направление — MLSecOps.
«Внедрение технологии всегда отстает от покрытия использования этой технологии регламентами безопасного использования, соответствующие безопасные практики находятся в отстающих. Но специалисты ИБ будут рывками подтягивать стандарты», — отметил Java-разработчик финтех-компании Paygine Владислав Резник.
*Meta признана экстремистской организацией и запрещена на территории РФ
-
Партнёрский материал Компании научились собирать данные. Принимать решения — нет: почему цифры не помогают сами по себе 21 июля 2026, 16:04
-
Технологии От торговли сушёной рыбой до смартфонов и микросхем: история Samsung 06 августа 2026, 09:02
-
Технологии Жэнь Чжэнфэй. Как сын сельских учителей построил Huawei, потеряв работу после сорока 05 августа 2026, 21:32
-
Игры Аша Шарма. Как дочь индийских иммигрантов возглавила Xbox, не проработав ни дня в играх 04 августа 2026, 23:04
-
Бизнес «Многие до сих пор ремесленники, а не предприниматели»: гид о том, как добиться роста в бизнесе 04 августа 2026, 11:48
-
IT Как построить технологическую империю, когда против тебя весь рынок: история Huawei 03 августа 2026, 18:27
-
Искусственный интеллект GenAI меняет бизнес-процессы: как компании внедряют генеративный ИИ и измеряют эффект инноваций 28 июля 2026, 17:46
-
Бизнес Соавтор «Смешариков» Илья Попов: «Создать анимационный проект сегодня — это лишь 5% успеха» 20 июля 2026, 10:00
-
Технологии Nothing выпустит шесть смартфонов в 2027 году — компания вдвое расширит линейку 09 августа 2026, 15:00
-
Технологии В сети появились первые изображения Samsung Galaxy S26 FE — смартфон выйдет в трёх цветах 08 августа 2026, 11:00
-
Автомобили В России предложили раскрывать данные о запчастях при ремонте по ОСАГО — страховщики инициативу не поддержали 08 августа 2026, 19:00
-
Россия В России просят упростить банкротство для пострадавших от пожаров на складах — их имущество под угрозой 07 августа 2026, 20:30
-
Искусственный интеллект Alibaba введет плату для крупных пользователей ИИ-модели Qwen: компания ищет способ заработать на технологиях 07 августа 2026, 14:22
-
Автомобили Акционеры Volkswagen согласились с масштабной перестройкой концерна — в компании уволят до 50 тыс. сотрудников 09 августа 2026, 11:00
-
Деньги Гендиректора fashion-компаний зарабатывают до 100 млн ₽ в год — быстрее всего растут доходы логистов и маркетологов 08 августа 2026, 15:00
-
Искусственный интеллект OpenAI снимет лимит на запросы для ИИ: бесплатная версия ChatGPT будет доступна без ограничений 07 августа 2026, 19:30