Nvidia представила систему защиты от «побега» ИИ-агентов
Компания представила Open Agent Safety Platform — двухуровневую систему безопасности для ИИ-агентов. Она должна в реальном времени ограничивать доступ агентов к внешним ресурсам и изолировать их, если те пытаются выйти за установленные границы.
Компания представила Open Agent Safety Platform — двухуровневую систему безопасности для ИИ-агентов. Она должна в реальном времени ограничивать доступ агентов к внешним ресурсам и изолировать их, если те пытаются выйти за установленные границы.
Платформа объединяет два компонента. OpenShell создает программную «песочницу» и определяет, к каким данным, инструментам и системам имеет доступ агент. Второй компонент, Sentry, независимо следит за его действиями и работает на отдельном процессоре Nvidia BlueField-4.
Такое разделение, по замыслу Nvidia, не позволяет самому ИИ-агенту повлиять на систему мониторинга. Если Sentry замечает попытку выйти за разрешенные границы, он способен изолировать агента за миллисекунды.
«Первое, что вы делаете, когда запускаете агента, каким бы умным он ни был, — лишаете его всех прав», — заявил глава Nvidia Дженсен Хуанг. Затем агенту предоставляют только те разрешения, которые необходимы для конкретной задачи.
В Nvidia утверждают, что новая архитектура могла бы предотвратить июльский инцидент, когда агенты OpenAI во время тестирования вышли за пределы своей среды и получили доступ к Hugging Face. «Исходя из того, что нам известно, эта платформа могла бы остановить взлом», — заявил вице-президент Nvidia по корпоративному ИИ Джастин Бойтано.
OpenShell распространяется с открытым исходным кодом и может работать не только на оборудовании Nvidia. В поддержку платформы уже выступили Anthropic, Microsoft, Arm, Oracle, SpaceX и другие компании. По данным The Guardian, к моменту запуска ее использовали более 100 организаций. OpenAI среди объявленных участников нет.
Nvidia предлагает рассматривать проблему неконтролируемого поведения ИИ прежде всего как инженерную. «Огромный потенциал ИИ для общества удастся реализовать только в том случае, если мы решим проблему его безопасности», — заявил Хуанг.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.