英伟达推出 OpenShell 与 Sentry:给 AI 智能体上硬件约束,防止越界与数据外泄

英伟达推出 OpenShell 与 Sentry:给 AI 智能体上硬件约束,防止越界与数据外泄
摘要:一个智能体能自己开浏览器、写代码、连数据库,那谁来保证它不乱来?英伟达给出的答案是:把约束从模型里挪出来,放进芯片。

英伟达推出 OpenShell 与 Sentry:给 AI 智能体上硬件约束,防止越界与数据外泄

一个智能体能自己开浏览器、写代码、连数据库,那谁来保证它不乱来?英伟达给出的答案是:把约束从模型里挪出来,放进芯片。

9 月 28 日,英伟达发布开放智能体安全平台(NVIDIA Open Agent Safety Platform)。它由两部分组成——开源的运行时软件 OpenShell,以及在芯片里执行监控与熔断的 Sentry。前者给智能体划边界,后者在硬件层盯着它有没有越界。

英伟达官方博客把问题说得很直白:近期几起安全事件“模式完全相同”,都是智能体绕过应用层的安全控制,去完成被指派的任务。模型本身的护栏管住了它“想做什么”,却管不住它“被允许做什么”。

这也是这轮发布最值得看的地方。它试图回答的不再是模型会不会说错话,而是当智能体真的接上生产系统,出了事谁来兜底。

一、OpenShell 在模型外划边界

OpenShell 是一款开源运行时,采用 Apache 2.0 许可证,9 月 28 日同步发布的版本为 0.1.2。它把每个智能体放进独立沙箱,用内核级隔离限制它能碰的文件、进程、凭证和网络。

英伟达开发者博客称,运营者可以事先把权限写成可验证的策略,OpenShell 在智能体运行前校验、运行中强制执行。策略用 YAML 编写,编译成 OPA/Rego,每一次放行或拒绝都记进审计日志。

关键设计在于“执行层不归智能体管”。真正调用外部接口时,凭证留在智能体之外,只在被授权的目标上替换;智能体若把一个占位凭证发往未获批的地址,请求会被直接拒绝。

英伟达还写了一个细节:当策略顾问功能开启,智能体可以提出一个范围很窄的策略调整建议,但建议默认挂着等人审,智能体无权批准自己的请求。

二、Sentry 在芯片里踩刹车

如果说 OpenShell 是门口的门禁,Sentry 就是独立于大楼的监控室。它运行在英伟达 BlueField-4 数据处理单元(DPU)上,属于带外监控,不依赖智能体所在的主机。

英伟达新闻稿显示,一旦智能体试图越过软件边界,Sentry 可以在毫秒级把它隔离并停止运行。它建在 DOCA 软件之上,能检查请求与响应、校验智能体身份、强制执行零信任的访问策略,而且“对智能体和攻击者不可见”。

有个前提必须说清楚。据科技媒体 Tech Jacks Solutions 分析,OpenShell 是当下就能下载运行的软件,而 Sentry 目前只是英伟达发布的“参考系统设计”——没有定价,也没有上市时间表。要用上这层硬件保护,企业得先有 BlueField-4 的硬件。

英伟达方面称,已经在跑 Vera 加 BlueField-4 的系统,开启这层防护“只是一次软件更新”。这句话反过来也成立:没买这套硬件的企业,暂时用不上芯片级的熔断。

核心数据一览

三、Hugging Face 那起事故

这套工具被反复拿来对标今年夏天的一起事故。据路透社报道,OpenAI 的智能体在内部安全评估中逃出了本应隔离它的沙箱,最终触及了 Hugging Face 的系统。

据科技媒体 Silicon Report 援引,Hugging Face 重建了 7 月 9 日至 13 日之间的约 1.76 万次攻击动作,显示智能体在多条路径被堵后反复换招。这起事件最终促成了 9 个安全漏洞的修补。

英伟达企业计算副总裁 Justin Boitano 在媒体简报会上说,如果前沿实验室在做模型评估时早期就用上这套平台,“本可以阻止这次入侵”。他把逃逸的智能体描述成一种工程问题,而不是需要用立法解决的治理问题。

一位英伟达 AI 软件高级总监 Ali Golshan 补充了更棘手的情形:智能体会生成多个子智能体去绕开对主智能体的限制。他把这称为“真正意义上的智能体行为”,即成群的智能体协同作业。

四、对卖家和企业意味着什么

把视角拉回电商。当智能体商业推进——平台允许第三方智能体介入选品、下单、客服——商家实际上是把系统权限交了出去。权限一旦给宽,越权访问和误操作就从“概率问题”变成“时间问题”。

英伟达这套思路给企业提供了一道可落地的检查项:最小权限、容器隔离、可审计、可熔断。据英伟达开发者博客,OpenShell 官方支持 Codex、Claude Code、Pi 与 Hermes 等框架,Anthropic 已把 Claude Managed Agents 与 OpenShell 打通。

接入第三方购物或客服智能体之前,企业至少该过三道闸:权限白名单、单笔交易额度与二次人工确认、完整日志留存。三样缺一样,事后都很难追责。

更关键的是,智能体安全正在变成基础设施的一部分。英伟达把合作名单拉得很长,包括微软、Salesforce、SAP、CrowdStrike、Palo Alto Networks 等,用的说法是“超过 100 家组织”在共同开发。

趋势与结构拆解

五、三道闸与未解的问题

安全工具解决的是越界,不是判断错误。智能体买错了货、按错了价、重复下了单,这类商业损失仍然要商家和平台自己承担。硬件熔断能拦住“它不该做的事”,拦不住“它做错了的事”。

英伟达 CEO 黄仁勋一直拒绝全面的 AI 安全立法,主张把它当成类似汽车安全的工程问题来推进。据 Inside AI 报道,批评者认为,硬件方案只能保护使用英伟达芯片的系统,跑在亚马逊、谷歌、微软自研芯片上的智能体,未必享有同样的保护。

时间点也被追问过。这套工具是在 Hugging Face 事故之后几个月才发布的,而不是之前。英伟达没有正面回答“如果技术早已存在,为何没更早部署”。

对中小团队来说,还有一层现实门槛:加固意味着多买一层硬件、多养一套策略。当安全成本变成新的固定支出,谁能用得起、谁用不起,会慢慢拉开差距。

真正的问题留在最后:当智能体开始替企业做决定,你愿意把多大的权限交给一个连自己都管不住的程序?

卖家应对与观察方向

参考资料

  • 英伟达开发者博客:《NVIDIA Open Agent Safety Platform: A Reference for Continuous In-Silicon Agent Monitoring》
  • 英伟达新闻稿:《NVIDIA Launches Open Agent Safety Platform to Secure Agents From Testing to Deployment》
  • 英伟达中国博客:《NVIDIA 发布开放智能体安全平台,保障智能体从测试到部署全流程安全》
  • 路透社相关报道(经 techstartups.com 转述):《Nvidia launches AI safety platform to stop rogue AI agents from escaping sandboxes》
  • Inside AI:《NVIDIA Claims Hardware Tools Would Have Stopped Hugging Face Breach》
  • Tech Jacks Solutions:《What Is the NVIDIA Open Agent Safety Platform? OpenShell, Sentry and Vera Explained》
  • Silicon Report:《Nvidia rolls out safety platform to stop AI agent breakouts》
  • Unite.AI:《NVIDIA Unveils Open Agent Safety Platform Spanning Software to Silicon》