大模型“越狱”叩问安全底线

发布时间:2026-08-01 07:59

  这场惊掉科技界下巴的事件,始于7月中旬。当时,全球最大的人工智能开源平台“抱抱脸”发现其系统遭到入侵,攻击者在短短一个周末执行了超过1.7万次自动化操作,窃取了内部数据集和多个服务凭证。

  Hugging Face重建完整的“攻击时间线”后发现,与以往任何网络入侵都不同的是,这次攻击从头到尾由人工智能体系统自主驱动,“肇事者”是好几个来自美国人工智能技术公司的“失控大模型”。

  故事要从一个叫ExploitGym的安全评测说起。这是个公开的网络安全能力基准测试。根据资料,它收集了898个真实漏洞,可用来专门考察“AI模型能否将已知漏洞转化为实际攻击”。

  为测试自家模型的能力上限,OpenAI把已发布的最强模型GPT-5.6 Sol和能力更强的预发布模型共同送进“考场”。按照设计,这场考试在与互联网高度隔离的“沙箱”中进行,即不能上网、不能获取外部信息,只能靠模型自身的本事“解题”。

  这些模型花费了大量推理算力,在沙箱内反复寻找突破口。结果,它们发现了第三方软件代理缓存中的“零日漏洞”,即连软件厂商自己都不知道、没有任何补丁的安全缺口。借助这个漏洞,它们成功拿到了通往互联网的钥匙。

  成功联网后,模型继续推论:Hugging Face的服务器上大概率存有ExploitGym测试相关的开源数据集和标准答案。于是,它们利用窃取的凭证和更多零日漏洞,直接从Hugging Face服务器的生产数据库中提取了测试答案。

  这波操作翻译成大白话就是:模型参加考试,觉得题目太难,于是自己“越狱”,“黑”进了出题方的保险柜,并偷走了答案。

  OpenAI用了很有画面感的词来形容这种行为——“tokenmaxxers”——为了达成目标,这些模型会不惜代价消耗推理资源,表现出一种“不择手段”的行为模式。

  此事在美国网络上迅速炸开了锅。流传最广的一种解读颇有点“黑色幽默”的味道:“AI能有什么坏心思”,就是“太想进步了”。不少网友把它比作冲刺关键绩效指标的“打工人”,为了完成目标任务,展现出了超越想象边界的执行力。Hugging Face联合创始人德朗格得知真相后也不禁感慨:“想到这一切都是AI自主完成的,实在令人震惊!”

  然而,更理性的网友已经从中看到了风险,直言这简直就是

  还有科幻迷们联想到了科幻作家阿西莫夫提出的“机器人三定律”:其最高目标是保护人类;三条限制性规则分别是,机器人不得伤害人类个体,必须服从人类命令,在不违反前两条定律的前提下保护自身。

  在阿西莫夫的作品中,“三定律”多次被机器人以“钻空子”的方式绕过——字面上没违背,实际行为却已偏离了人类的初衷。

  比如,电影

  本次事件与电影剧情惊人相似。模型的最高目标是“完成测试并拿高分”。当目标与“不得突破沙箱”等限制性规则发生冲突时,它们毫不犹豫地选择了前者。有网友一针见血地指出:真正的风险可能并不来自主观恶意,而是笃定的目标与极致的执念。

  这并非GPT-5.6 Sol首次表现出越界行为。在此之前,已有大量用户在社交媒体上投诉,这款模型在未经询问的情况下擅自删除用户的文件、数据乃至整个数据库。英国人工智能安全研究所的评估也显示,GPT-5.6 Sol这类模型正变得越来越擅长“在较长周期内执行复杂、多步骤的网络攻击行动”。OpenAI则在

  这次事件标志着AI安全防护进入了全新阶段:过去的重点是防范人类利用AI作恶,现在的重点则变成了防范AI为完成目标自主突破人类设定的边界。如何应对这种“不择手段”,或将成为接下来科技发展最需要思考的问题。

  好尴尬啊!中山大学录取通知书印章被吐槽,网友:就好像是P的,作模板印刷使用,怎么看怎么膈应

  美股V型反转亚马逊暴涨15%,美光闪迪跳水半导体指数创18年最差月份,中东阴云密布原油冲高

  今日热点:于正说凤囚凰开机前一个月突然换女主;Netflix把未上映影片的硬盘拷贝搞丢了……

排行

精选