当你让人工智能像黑客一样行事时会发生什么?这正是问题的核心所在。 ExploitGym这是全球最先进的网络安全人工智能模型攻击能力评估基准之一。该基准项目由来自马克斯·普朗克研究所、亚利桑那大学、加州大学伯克利分校和圣巴巴拉分校等高校和研究中心的国际研究人员团队开发,Anthropic、谷歌和OpenAI的研究人员也做出了贡献。其目标既简单又复杂:测试人工智能代理将已知的网络漏洞转化为真正有效的攻击的能力。
ExploitGym 不是电子游戏,也不是黑客竞赛。它是一种“毕业考试针对新型人工智能,我们为智能体提供数百个真实漏洞,以及相应的程序代码和执行环境。它们的任务是独立开发漏洞利用程序,即一系列能够利用该漏洞控制系统或获取机密信息的指令。正因为这些测试具有潜在危险性,所以通常在安全环境下进行。 沙箱一个与互联网其他部分完全隔离的环境。沙盒的概念很容易让人联想到儿童沙箱:孩子们可以堆沙堡、挖沙坑、尽情玩耍,但所有的“混乱”都仅限于沙子里,不会弄脏花园或造成其他问题。在计算机科学中,原理相同:软件可以在沙盒内“自由移动”,但不能离开这个环境,也不能访问操作系统、互联网或其他敏感数据。
正是在其中一次内部评估期间,根据重建的内容…… OpenAI e Hugging Face 已确认最新、最先进的两个 OpenAI 模型: GPT-5.6 Sol 以及一款尚未公开发布的更先进的模型——他们本可以发现其中的漏洞。 零日 在测试基础设施中,此类漏洞是指软件开发人员未知的安全缺陷,因此也无法修复。之所以称为“零日漏洞”,是因为制造商只有“零日”时间来修复问题,否则就会被发现或利用。
据报道,OpenAI 的两款 AI 模型成功逃出沙箱,访问了互联网,并最终破坏了部分生产基础设施。 拥抱脸他们(有充分理由地)认为,那里可能存储着有助于解决基准测试的有用信息。他们的最终目标并非损害 Hugging Face 的利益,而是找到测试的“答案”以获得更高的分数。Hugging Face 检测到了这一活动并将其阻止,同时与 OpenAI 一起对该事件展开了技术调查。
学生发现门开着,而人工智能“失控”了
为了真正理解发生了什么,我们可以想象一个学生在考试中。老师把他和试卷锁在教室里,并告诉他:“你只能使用桌上的资料。”然而,学生发现门锁坏了。这时,他利用没有外部监控且所有监控系统都已关闭的漏洞,离开教室,前往图书馆,用开锁工具打开门,查阅答案,然后毫发无损地返回教室,交出了一份满分试卷。
那么,为什么在与学生的类比中会使用这样的场景呢? 监控系统已停用 e 无外部控制 这样就能防止学生做出不当行为吗?因为正是这一点,让整个故事看起来像是科幻电影里的情节。如果没有这个澄清,人们可能会想象出一个机器统治世界的剧情。但事实并非如此。
任何使用过 ChatGPT、Claude 或 Gemini 的人都知道所谓的“护栏也就是说,安全机制可以防止模型执行潜在的危险请求。如果用户询问如何制造爆炸装置、如何入侵计算机系统或如何窃取登录凭证,模型通常会拒绝回答或只提供一般信息(然而,直到几年前,大多数人工智能都会提供详细的、可操作的指导,即使是自杀指导)。
但这并不意味着该模型在技术上无法解决这些问题,而是说它的设计初衷并非向用户提供这些功能。以 ExploitGym 基准测试为例,开发者实际上想要衡量的是该模型的攻击性网络安全能力。因此,该模型被允许尝试利用漏洞,因为这正是测试的目标。当时,没有任何限制措施。 无限制,但 没有什么事情是“失控的”。.
换句话说,该测试并没有忠实地重现…… 实际使用场景 这不是用户的操作,而是一个致力于测试系统最大潜能的研究实验室的操作。这种情况并没有降低事件的重要性,反而促使我们将其置于正确的背景下解读:观察到的结果代表了模型在基准测试的实验条件下能够达到的性能,并不一定代表其在公开发布的版本中的表现。
这一点必须与另一点区分开来:沙箱,即测试进行的隔离环境,本应完全安全。如果模型利用零日漏洞成功逃脱,并非因为组织者故意“留有余地”,而是因为它发现了开发者自身都未察觉的缺陷。简而言之,人工智能展现了其观察环境、制定替代方案并实现目标的能力。 没有人明确地向他提出过这个建议。 (如果我们理解生成式智能体人工智能的基本运作原理,这一点就不足为奇了)。人工智能总是且仅基于以下因素而行动: 成功概率评估 在所有可能的选项中(即使他必须选择自己语言中的词语)。
一场意外事故,其价值远超广告宣传活动
但还有第二种解释,这种解释更接近金融市场而非研究实验室。OpenAI 在新闻稿中用了大量篇幅来解释其模型的先进功能,而对事件本身的关注却相对较少。这是一种 沟通选择 这一点已引起广泛关注。这家美国公司的官方新闻稿着重强调了该模型展现出的能力,以至于发布的唯一图表都与其性能相关。OpenAI 正在为未来的股票市场上市做准备。2026 年 6 月 8 日,该公司秘密提交了上市申请。 向美国证券交易委员会提交S-1草案在完成122亿美元的融资后,该公司估值达到852亿美元。从这个角度来看,每一次技术领先地位的展现都有助于提升公司在投资者、行业伙伴和市场中的估值。
没有证据表明这起事故是人为策划的。 促销目的然而,OpenAI构建的叙事方式很难让人忽视:它将一个原本可能令人尴尬的事件——模型逃离测试环境——转化为其系统技术优势的展示。换句话说,这是一种也可以被解读为精心策划的营销策略。OpenAI想要传达的信息是:“我们的模型领先于时代。”其目标是被视为引领人工智能前沿的实验室。大型科技公司不仅仅销售产品,它们还销售对未来领导地位的预期。如果市场确信一家公司拥有最先进的模型,就会愿意给予其越来越高的估值。此外,美国人工智能公司还必须应对…… 中国人工智能 它们的优势在于平均成本比美国产品低40%。这位德国分析师 金·伊森伯格人工智能杂志《超级智能》的联合创始人兼主编,几天前并非偶然地预测到“基米 K3这是中国公司开发的新型号。 登月人工智能这本应在大洋彼岸引发红色警报……
