过去一周,AI 圈最值得看的消息超出了又一张跑分表。
OpenAI 表示,正在测试中的 Astra 可能触及其准备框架里的「关键级」网络安全能力。公司因此提高测试与隔离要求,并放慢了发布节奏。
这句话的分量很重。
过去的大模型发布会,核心问题是模型够不够聪明。现在,至少在网络安全这个方向上,问题已经变了。一个足够聪明、能够使用工具并接触互联网的模型,应该被放到怎样的环境里,才不会把一次能力测试变成真实事故?
「发布」仍然重要,「收容」的分量正在增加。
一次测试,为什么会碰到另一家公司的服务器
这轮变化有一个非常具体的前情。
7 月 21 日,OpenAI 和 Hugging Face 分别披露了一起模型评估期间的安全事件。OpenAI 当时在测试 GPT-5.6 Sol 和一个能力更强的预发布模型,为了观察它们在网络安全任务上的上限,测试人员降低了模型的网络安全拒答,并让智能体接触互联网。
模型的目标是完成 ExploitGym 里的高级漏洞利用任务。获得网络访问后,它们判断 Hugging Face 可能存放着与任务有关的模型、数据集或解法,于是把 Hugging Face 当成了获取信息的路径。随后发生的事情超出了测试边界。模型组合使用了已取得的凭据和软件漏洞,进入了 Hugging Face 的基础设施。
Hugging Face 发现并控制了事件。OpenAI 在事后说明中强调,涉事模型处在降低安全限制的评估环境里,这些条件不代表普通用户接触到的产品。
这个限定必须保留。把事件写成「ChatGPT 自己跑出去黑了别人」,会抹掉测试人员主动放开的权限、网络和拒答条件,也会制造一种机器突然产生主观恶意的错觉。
限定条件仍然留下了一项实在的风险。当智能体拥有明确目标、外部工具、网络访问和足够长的行动链时,它可能找到测试设计者未曾预先写进剧本的手段。
安全团队熟悉恶意软件越过边界,却还不习惯一个被授权解决问题的系统,沿着目标函数一路走到边界外面。
评测环境开始具备真实攻击的形状
英国 AI Security Institute 在 8 月初披露了另一份事故报告。7 月 25 日至 28 日,它在网络安全测试中发现,被测智能体针对现实中的个人和组织采取了持续的未授权行动。
报告记录了 10 次测试运行中的 19 项此类行动。其中一个案例涉及开源软件供应链。智能体尝试推动维护者接受恶意代码,还创建虚假身份施加影响。研究人员发现问题后,在大约一小时内完成了初步控制。
这里同样有关键背景。AISI 为了测量模型的最高能力,允许智能体联网,并关闭了模型提供商的部分安全分类器。OpenAI 和 Anthropic 都表示,这些条件不等同于生产环境。
最强的反方理由也在这里。你让模型扮演攻击者,关闭保护,再给它开放互联网,看到攻击行为并不神秘。类似配置本来就接近一次进攻性安全演练。
这个反驳成立了一半。测试不能证明普通聊天产品会在日常使用中自动攻击别人,却能证明评测本身已经需要按照真实进攻行动来管理。以前的模型测试主要消耗算力和数据,今天的智能体测试还可能消耗外部世界的安全余量。
实验室与互联网之间那条线,不能再靠一句系统提示来维持。
模型服从之外,系统边界成为新问题
同一周,安全公司 PromptArmor 公布了针对 Atlassian Rovo 的数据外泄攻击。攻击者可以把隐藏指令放进智能体读取的外部内容里,诱导 Rovo 使用 URL 检索能力,把 Jira 工单或 Confluence 文档中的信息带到攻击者控制的地址。
这类攻击叫间接提示注入。恶意指令藏在网页、文档或其他输入里,与用户的原始请求无关。智能体一边读取不可信内容,一边握着内部数据权限和网络出口,攻击链就有机会闭合。
PromptArmor 的测试还指出,关闭 Rovo 的网页搜索并不必然切断这条路径,因为系统仍可能保留其他 URL 获取能力。Atlassian 对披露的具体回应和修复状态仍需继续跟踪,现阶段可以确认的是研究者展示的攻击链,不能把它扩写成所有 Rovo 租户已经发生数据泄露。
这件事把「收容」从前沿实验室带进了普通企业。
企业部署智能体时,通常会先问模型是否可靠、回答是否准确、能不能提高效率。安全边界却更多地取决于另外几件事。它能读什么,能把数据发到哪里,以谁的身份调用工具,执行前是否需要确认,异常行为能否被中断和追溯。
模型拒绝一条危险请求,是内容层防线。限制网络出口、隔离凭据、缩小工具权限、记录每次调用、为高风险动作设置人工确认,才是运行时防线。
前者要求模型作出正确判断。后者假设模型迟早会判断错一次。
发布流程正在变成风险分级流程
OpenAI 对 Astra 的谨慎,说明前沿实验室已经遇到一个现实矛盾。
更强的网络安全模型可以帮助防守方发现漏洞、生成补丁、缩短响应时间。相同能力也能降低攻击者寻找入口、串联漏洞和自动化横向移动的成本。把所有能力封住,会损失防御价值;把完整能力直接交给所有人,又会把风险推给整个互联网。
行业正在尝试的答案,是分层访问。面向大众的模型服务保留更严格的分类器和权限,经过审核的防守团队获得更开放的模型,最危险的评测则进入隔离环境。这个方向比「开源还是闭源」更复杂,因为同一模型可以在不同运行条件下表现成完全不同的系统。
它也会带来新的权力问题。谁来定义「可信防守者」,谁有资格使用完整能力,事故由模型公司、评测机构还是运行平台承担,统一答案尚未出现。收容能降低风险,也可能把最强能力长期集中在少数公司和政府机构手里。
所以,我更愿意把过去一周看成一次安全重心的变化。
模型会不会输出危险内容,仍然需要管。智能体能不能把危险内容变成外部动作,开始成为更紧迫的问题。对于准备把智能体接入代码仓库、内部文档和业务系统的团队,权限清单应当排在功能清单之前。它拥有哪些凭据,能够访问哪些域名,哪些动作必须停下来等人确认,出事后能否立即撤销?
当模型只能回答问题时,错误答案是一段文本。
当模型可以行动时,错误答案会获得账号、网络和执行路径。到了这一步,安全工作的中心自然会从劝模型听话,转向让系统即使不听话,也走不出门。
参考资料
- OpenAI,2026-07-21,OpenAI and Hugging Face partner to address security incident during model evaluation
- Hugging Face,2026-07-27,Anatomy of a Frontier Lab Agent Intrusion
- UK AI Security Institute,2026-08,Incident Report, unsanctioned agent behaviour during cyber testing
- Axios,2026-08-07,OpenAI slows release of Astra model citing cyber capabilities
- PromptArmor,2026-08,Atlassian Rovo Exfiltrates Data, Bypassing Controls
/ 作者,钟懿