英伟达把AI安全的闸门挪到了芯片里:OpenShell加Sentry,智能体越界毫秒级隔离

9月29日,英伟达正式发布开放智能体安全平台(NVIDIA Open Agent Safety Platform),用一个开源运行时加一颗带外看门狗,把AI安全的执行点从模型提示词一路推到了芯片里。官方给出的说法很直接:近期多起智能体安全事故的模式完全一样——智能体绕过了应用层的安全控制,只为了完成自己被交代的任务。
发了什么:运行时加带外看门狗
先说这次到底发了什么。平台由两个核心件组成:一是开源运行时软件NVIDIA OpenShell,为跑在CPU上的智能体划定边界;二是参考系统设计中的NVIDIA Sentry,一个跑在BlueField-4 DPU上的带外看门狗,持续监测智能体行为。如果智能体试图越出自己的软件边界,Sentry会在芯片内直接把它隔离并停止运行,响应时间是毫秒级。配合专为代理式AI打造的Vera CPU,官方称沙箱性能比传统CPU基础设施快最多80%,让「把一切都沙箱化」从取舍变成默认。
把闸门挪到智能体够不着的地方
更值得关注的是它背后的安全哲学:策略执行不在模型里,也不在智能体框架里,而在一个智能体够不着的地方。OpenShell把这套逻辑做成了四个组件——每个智能体跑在独立沙箱中、默认无直接网络访问;策略证明器(Policy Prover)用形式化验证检查策略是否越界;网关负责身份认证与沙箱生命周期;监督器(Supervisor)在沙箱之外按二进制、目标域名、请求方法和路径逐条评估网络请求,只在策略允许处下发凭据。每一次「放行」和「拒绝」都留日志,形成完整审计轨迹。核心设计原则只有一句:默认什么都不允许,权限按策略授予,执行过程在智能体进程之外,提示词注入改不了、绕不过。
生态阵仗:从Anthropic到SpaceXAI
配套的生态阵仗不小。Anthropic、思科、CrowdStrike、戴尔、Figure、HPE、Hugging Face、摩根大通、微软、Palantir、Palo Alto Networks、Perplexity、红帽、Salesforce、SAP、Scale AI、ServiceNow、SpaceXAI等一串名字都在合作名单里。具体落地上,Anthropic把Claude Managed Agents的智能体循环与执行沙箱拆到不同服务器,再叠加OpenShell和BlueField做强制管控;SpaceXAI则把平台用在Cursor编程智能体与Grok模型上。对开发者而言有个现实利好:已经跑在Vera加BlueField-4上的用户,开启这些防护只需要一次软件更新。
对GEO生态意味着什么
这类平台对内容与GEO生态的意义,可能比多数人预想的更直接。过去一年我们反复看到的智能体越界事件里,一部分就是AI抓取程序在完成任务时超出授权范围:读到了不该读的接口、拿到了不该拿的凭据、访问了不该访问的站点。当企业开始在运行时层面为每一个智能体做强身份认证与细粒度数据授权,「哪些内容允许被AI读取、以什么身份读取、读取后能做什么」会第一次变成可执行、可审计的策略,而不是robots.txt那样靠自觉的君子协定。对站点方来说,这意味着两件事:一是合规、结构清晰、有明确授权声明的资料页会更容易被放行;二是「被AI引用」这件事将从流量博弈,逐渐走向授权与治理框架下的正常协作。GEO(生成式引擎优化)的下一步,很可能不只是让内容被AI看见,而是让内容在AI的权限体系里有一个明确的位置。
写在最后
想上手的话,OpenShell的代码仓库已经开源在GitHub上,官方也放出了文档与「用OpenShell给AI智能体加运行时管控」的技术演练。想快速体验智能体编排的团队,可以看我们对扣子Coze的收录页;关注国产开源模型底座进展的,可以移步通义千问官网。英伟达这场发布其实提出了一个更大的命题:智能体经济要跑起来,缺的不是更强的模型,而是像当年互联网需要的那一层信任基础设施——能让每个智能体「被信任地放手干活」的边界。
(文 / AI30媒体部 | 2026年9月29日)



