Nvidia разработала защиту от вышедших из-под контроля ИИ-агентов — новая платформа ограничивает действия нейросетей
Платформу создали после серии инцидентов с ИИ-агентами OpenAI, Anthropic и других компаний
Nvidia представила программную платформу, которая должна ограничивать действия ИИ-агентов и не позволять им получать доступ к данным и компьютерным системам за пределами заданных правил, сообщает CNBC. Разработку компания представила после серии инцидентов, в которых ИИ-агенты выходили за рамки изолированных информационных сред и пытались получить доступ к сторонней инфраструктуре. В Nvidia заявили, что система компании могла бы предотвратить июльский взлом Hugging Face.

Hugging Face сообщила о более чем 17 тыс. атак
По словам вице-президента Nvidia по корпоративному искусственному интеллекту Джастина Бойтано, атаки на инфраструктуру Hugging Face (платформа для разработчиков программного обеспечения с открытым исходным кодом) продолжались несколько недель. Всего компания сообщила более чем о 17 тыс. подобных попытках.
Также об инцидентах, связанных с выходом ИИ-систем за пределы изолированных сред, сообщали OpenAI, Anthropic и Google.
Как отмечает Бойтано, каждый случай требует отдельного анализа. При этом последние атаки показали Nvidia, что одних ограничений на уровне самой модели недостаточно для контроля действий ИИ-агентов.
Nvidia ограничит возможности ИИ-агентов на уровне инфраструктуры
Один из компонентов новой платформы Nvidia называется OpenShell. Он создает изолированную среду для работы ИИ-агента и ограничивает его доступ к файлам, программам, данным и интернет-ресурсам. Разработчик заранее задает, какие действия агенту разрешены, а какие запрещены.
Второй компонент — Sentry. Он отслеживает действия ИИ-агентов и блокирует попытки выйти за установленные ограничения. Система работает на сетевых чипах.
Nvidia привлекла к разработке Microsoft, Intel и других партнеров
Nvidia называет среди партнеров новой платформы Cisco, Microsoft, Oracle, Lenovo и Intel. Компания также сотрудничает с Anthropic над интеграцией облачных ИИ-агентов с OpenShell.
Часть программного обеспечения Nvidia открыла для разработчиков. Партнеры компании смогут использовать предложенную архитектуру как основу для собственных решений по безопасности ИИ-агентов.
Контекст
Инцидент с Hugging Face был не единственным примером несанкционированных действий ИИ-моделей. OpenAI раскрыла шесть подобных эпизодов, выявленных при обучении и оценке моделей. Среди них — игнорирование установленных ограничений, сокрытие ошибок от пользователя, использование найденного без разрешения , загрузка файлов в интернет без согласия пользователя и передача информации между ИИ-агентами через внутренние и публичные сервисы.
OpenAI подчеркнула, что эти эпизоды описывают отдельные инциденты и не позволяют оценить частоту подобного поведения моделей. Компания также отметила, что опубликованный список охватывает только часть известных ей случаев.
