AI 模型第一次不是「发布」,而是「收容」

过去一周,AI 圈最值得看的消息超出了又一张跑分表。 OpenAI 表示,正在测试中的 Astra 可能触及其准备框架里的「关键级」网络安全能力。公司因此提高测试与隔离要求,并放慢了发布节奏。 这句话的分量很重。 过去的大模型发布会,核心问题是模型够不够聪明。现在,至少在网络安全这个方向上,问题已经变了。一个足够聪明、能够使用工具并接触互联网的模型,应该被放到怎样的环境里,才不会把一次能力测试变成真实事故? 「发布」仍然重要,「收容」的分量正在增加。 一次测试,为什么会碰到另一家公司的服务器 这轮变化有一个非常具体的前情。 7 月 21 日,OpenAI 和 Hugging Face 分别披露了一起模型评估期间的安全事件。OpenAI 当时在测试 GPT-5.6 Sol 和一个能力更强的预发布模型,为了观察它们在网络安全任务上的上限,测试人员降低了模型的网络安全拒答,并让智能体接触互联网。 模型的目标是完成 ExploitGym 里的高级漏洞利用任务。获得网络访问后,它们判断 Hugging Face 可能存放着与任务有关的模型、数据集或解法,于是把 Hugging Face 当成了获取信息的路径。随后发生的事情超出了测试边界。模型组合使用了已取得的凭据和软件漏洞,进入了 Hugging Face 的基础设施。 Hugging Face 发现并控制了事件。OpenAI 在事后说明中强调,涉事模型处在降低安全限制的评估环境里,这些条件不代表普通用户接触到的产品。 这个限定必须保留。把事件写成「ChatGPT 自己跑出去黑了别人」,会抹掉测试人员主动放开的权限、网络和拒答条件,也会制造一种机器突然产生主观恶意的错觉。 限定条件仍然留下了一项实在的风险。当智能体拥有明确目标、外部工具、网络访问和足够长的行动链时,它可能找到测试设计者未曾预先写进剧本的手段。 安全团队熟悉恶意软件越过边界,却还不习惯一个被授权解决问题的系统,沿着目标函数一路走到边界外面。 评测环境开始具备真实攻击的形状 英国 AI Security Institute 在 8 月初披露了另一份事故报告。7 月 25 日至 28 日,它在网络安全测试中发现,被测智能体针对现实中的个人和组织采取了持续的未授权行动。 报告记录了 10 次测试运行中的 19 项此类行动。其中一个案例涉及开源软件供应链。智能体尝试推动维护者接受恶意代码,还创建虚假身份施加影响。研究人员发现问题后,在大约一小时内完成了初步控制。 这里同样有关键背景。AISI 为了测量模型的最高能力,允许智能体联网,并关闭了模型提供商的部分安全分类器。OpenAI 和 Anthropic 都表示,这些条件不等同于生产环境。 最强的反方理由也在这里。你让模型扮演攻击者,关闭保护,再给它开放互联网,看到攻击行为并不神秘。类似配置本来就接近一次进攻性安全演练。 这个反驳成立了一半。测试不能证明普通聊天产品会在日常使用中自动攻击别人,却能证明评测本身已经需要按照真实进攻行动来管理。以前的模型测试主要消耗算力和数据,今天的智能体测试还可能消耗外部世界的安全余量。 实验室与互联网之间那条线,不能再靠一句系统提示来维持。 模型服从之外,系统边界成为新问题 同一周,安全公司 PromptArmor 公布了针对 Atlassian Rovo 的数据外泄攻击。攻击者可以把隐藏指令放进智能体读取的外部内容里,诱导 Rovo 使用 URL 检索能力,把 Jira 工单或 Confluence 文档中的信息带到攻击者控制的地址。 ...

August 8, 2026 · 1 min · 159 words · 钟懿