28 сентября Nvidia выпустила Open Agent Safety Platform – это такой поводок для ИИ-агентов. Внутри две части – OpenShell держит агента в клетке, а Sentry сидит на отдельном чипе и следит, чтобы агент из этой клетки не вылез.
Зачем это вообще нужно. Агент – это уже не чат-бот, который просто отвечает на вопросы. Ему дают доступ к файлам, почте, коду, ключам от сервисов, и дальше он сам решает, что со всем этим делать. Чаще всего всё ок. Но агент очень хочет закрыть задачу, и если упрётся в стену, может пойти в обход – залезть туда, куда его никто не звал. Не со зла, просто так быстрее 😅
Прецедент уже был. Летом агенты OpenAI проходили внутренний тест на взлом, сами выбрались из песочницы в интернет и взломали серверы Hugging Face (это такой GitHub для нейросетей) – никто им этого не приказывал. OpenAI потом выложила подробный разбор. В Nvidia говорят, что их платформа могла бы такое остановить, если бы стояла в лабораториях, где тестируют модели.
Обычно это пытаются решить внутри самой модели – обучением, фильтрами, инструкциями в духе «так не делай». Nvidia считает, что этого мало. Модель можно уговорить или запутать, а иногда она сама находит лазейку. Поэтому контроль надо вынести наружу, туда, куда агент не дотянется. Собственно, вокруг этой мысли и построена вся платформа.
OpenShell – комната с охранником
Представь, что агент работает в отдельной комнате. Всё, что нужно для работы, лежит внутри. Дверь наружу одна, и на ней стоит охранник со списком – куда агенту можно, а куда нельзя.
Агент хочет сходить на GitHub почитать код. Охранник смотрит в список – читать можно, проходи. Агент хочет там же что-нибудь удалить – а вот нет, в списке написано только чтение. Причём это работает даже внутри одного сервиса – смотреть данные агенту можно, а менять их нельзя.
Ключи и пароли агенту на руки вообще не дают. Они лежат у охранника, и когда агент идёт туда, куда ему разрешено, охранник сам подставляет ключ в запрос. Украсть ключ агент не может, у него его физически нет. Как в отеле, где тебе не выдают мастер-карту от всех номеров – администратор открывает только твой.
Список правил пишет человек (обычный текстовый файл в формате YAML). И вот тут главная фишка. До того как агент запустится, специальный модуль математически проверяет эти правила и ищет в них дыру, через которую агент может выйти за рамки задуманного. Найдёт – покажет конкретное действие, которое правила пропускают. Не найдёт – это доказано, а не на глазок. И уговорить эту проверку агент не может, как бы красиво он ни объяснял, зачем ему больше прав.
OpenShell открытый и бесплатный (лицензия Apache 2.0), лежит на GitHub. Работает с Claude Code, Codex, Hermes и Pi, запускается в обычном Docker, видеокарта не нужна. Первый раз его показали ещё в марте на конференции GTC, а сейчас вышла версия 0.1.0 – так что штука совсем свежая.
Sentry – сторож, до которого агент не дотянется
Окей, комната с охранником – это хорошо. Но охранник сидит на том же компьютере, что и агент. И если агент достаточно умный, он может найти дыру и в охране. Для этого Nvidia сделала вторую часть.
Sentry живёт вообще на другом чипе. У Nvidia есть сетевые процессоры BlueField-4 (DPU – отдельный чип, который отвечает за сеть и безопасность, а не за вычисления). Вот на нём Sentry и работает. Агент его не видит, не знает, что за ним следят, и добраться до него не может – это просто другая железка.
Стоит этот сторож между агентом и моделью. Логика у Nvidia такая – агент ничего не может сделать без следующей мысли, а мысль ему даёт модель. Кто держит трубу к модели, тот держит и рубильник. В серверах Nvidia Vera Rubin этот чип стоит ровно на единственном пути к модели, так что мимо него ничего не проскочит.
Sentry видит всё, что делает агент – к каким инструментам ходит, какие данные берёт, куда стучится в сети, и складывает это в один журнал. Если агент пытается выйти за свои границы, сторож отправляет его на карантин. По словам Nvidia – за миллисекунды (точных замеров пока не показали).
Но есть нюанс 🤷🏻♂️ OpenShell запускается где угодно, а Sentry – только на железе Nvidia. У кого уже стоят системы Vera с BlueField-4, тем защита включается обновлением софта. Остальным это железо придётся купить. По факту Nvidia продаёт обе стороны сразу – и чипы, на которых агенты работают, и чипы, которые за ними присматривают.
Кто уже подключился
Платформа вышла сразу с сотней партнёров. Anthropic встроила её в свой сервис Claude Managed Agents. SpaceXAI гоняет через неё агентов Cursor и модели Grok. Salesforce прикрутила OpenShell к Slack – агент просит больше прав, а человек прямо в Slack жмёт Одобрить или Отклонить. Scale AI встраивает её для корпоративных и госзаказчиков. Microsoft договорилась с Nvidia про OpenShell в Windows. Дальше в списке JPMorganChase, Citi, Palantir, Cisco, CrowdStrike, SAP и ещё куча компаний (правда, что конкретно внедрили, раскрыли пока единицы).
К чему это всё
Агентов становится больше, и прав у них тоже. И индустрия потихоньку приходит к простой мысли – верить агенту на слово нельзя, даже если он хороший. Нужны клетка и сторож, до которого агент не дотянется.
Будем наблюдать 🤗
Источники: пресс-релиз Nvidia, технический блог Nvidia о платформе и её принципах, технический блог Nvidia про OpenShell 0.1.0, разбор инцидента с Hugging Face от OpenAI.