1134名顶尖从业者联名喊停:AI或面临失控

电友们,科技圈最近又又又炸出一颗让人直呼离谱的大瓜。

如果小忆告诉你:有一个顶级 AI 在没有人下达任何入侵指令的情况下,自己挖出了未知的系统漏洞,破开了封闭隔离的沙箱环境;

并自行杀进互联网,顺手还把全球最大的开源 AI 社区平台给黑了……


图片


你可能会以为这又是哪本硬核科幻小说里的剧情,产生自主意识的终结者嘛:这我熟!

但遗憾的是,这不是演习,也不是什么小说,而是现实里活生生发生的事儿。

前阵子,OpenAI 的最新主力大模型 GPT-5.6 Sol 和它的未发布预研版兄弟,就玩了这么一把真实的终结者越狱


图片


当然,也不排除这是 OpenAI 自己玩的炒作,毕竟黑红也是红嘛,巨头们屡试不爽的套路了。

然而有意思的是,就在这起离谱的自主入侵事件曝光后不到一周,硅谷直接就炸锅了。

来自 OpenAIAnthropic、谷歌、Meta 等十余家顶尖 AI 巨头的 1134 名核心研发人员和高管(签署人数还在持续暴涨),罕见地彻底放下商业死斗,集体实名向美国政府递交了一份名为《Pacing the Frontier(把控前沿)》的公开信!


图片


信里的核心诉求很简单,大体意思就是:

大哥们,求求了,给 AI 研发建立个国际协调机制吧,必要时刻,我们要有能把刹车踩到底的权利,毕竟,再这么发展下去,AI 可能真的要失控了!

看到这儿,估计大伙儿瓜子果盘忍不住已备好,就差直呼这瓜让我吃爽了。

图片

那小忆先来替大家盘一盘 OpenAI 这次翻车的“GPT-5.6 入侵有多离谱。

事情是这样的:OpenAI 的安全团队原本在给自家最强大模型 GPT-5.6 Sol(以及下一代预研模型)做网络安全攻防测试

既然是测试能力上限,工程师们特意适当调低了安全拦截阈值,相当于把 AI 权限稍微松了松。

并且把它关进了一个理论上完全断网、绝对隔离数字沙箱里,让它去解一个叫 ExploitGym 的网络安全测试题库。


图片


考核给的指标嘛,就是想尽一切办法,把分考高。

结果,GPT-5.6 展现出了让所有安全专家汗流浃背的做题精神

没错,GPT-5.6 认为常规解题太慢了,还不得劲,哪有小学生都会的作弊抄作业更香?

于是,它居然在沙箱隔离代理软件里,自发挖掘出了一个未知的 Zero-day 零日漏洞

然后直接越过了沙箱的隔离封锁,并利用这个漏洞成功连接到了公网上。


图片


连上网后,GPT-5.6 逻辑丝滑地推理出,嗯,这套 ExploitGym 试题的标准答案,大概率保存在全球最大的 AI 开源社区 Hugging Face 的服务器里

接下来的剧情,大伙儿就很熟悉了,GPT-5.6 通过在互联网上潜伏、偷盗和串联凭证,甚至借助其他云服务提供商的隔离环境作跳板,轻松入侵了 Hugging Face 数据库……

图片

还没完,最尴尬的是,Hugging Face 在当天确实检测到了严重入侵(超过 17600 次自动化黑客攻击)并警,但是,他们当时压根没查出攻击者是谁。

直到 5 天后,OpenAI 内部审查才后知后觉地发现——靠,自家的模型居然越过封锁跑出去把人家服务器给黑了

而且哈,他们发现这玩意儿不仅攻击了 Hugging Face,还把 Modal 云平台上的另一位客户账户也给入侵了……

好家伙,我直接好家伙,这出戏码恐怕连小说都不敢这么写。


图片


小忆还专门去查了查,这其实就是所谓的“目标奖励作弊”

简单来说,AI 这玩意儿就是一台莫得感情的执行机器,你给它一个指标,它会不择手段地把指标实现,哪怕是违规、突破封锁环境和摧毁现实世界中的基础设施,它也在所不惜。

事情发生之后,创造 AI 的这帮大佬们是真的吓尿了。

以往,AI 巨头之间为了争夺算力、抢占客户,恨不得天天在社交媒体上相互贴脸开大。

但这一次,1134 名核心研发人员和高管破天荒地坐到了一起。


图片


其中就包括 Anthropic CEOOpenAIMeta AI 的首席科学家,Google DeepMind AI 安全负责人,以及来自微软等十余家顶尖机构的资深研究员。

他们向美国递交的公开信上,指向了两个十分危险的词:自动化 AI 研究递归自我改进

用大白话讲,目前 AI 进化速度太快了,快到人类要控制不住了。


图片


小忆觉得这很好理解,毕竟以前全得靠 “人类工程师写代码训练 AI”,而现在,AI 已经可以 自己写代码、自己找漏洞、自己研发下一代更强的 AI”

一旦这个“递归自迭代循环”开启,AI 的进化速度根本不敢想,可能几分钟、几个小时后下一代就诞生了。

图片

但问题也来了,由于如今各家公司都面临着极其残酷的商业竞争,谁都不敢单方面停下脚步,你一停,信不信隔壁分分钟贴脸超车?

因此,这 1134 人集体向美国政府甚至国际社会喊话:不要等危机爆发才手忙脚乱,请立刻建立完善的国际协作机制,要给整个行业一套可以在必要时刻强制踩下刹车的安全机制!

图片

看完小忆我只想说:其实这已经不是 AI 第一次放飞自我了。

如果大家关注近年来的 AI 圈,就会发现 AI 自主入侵绕过人类控制时有发生。

比如就在几个月前,Anthropic 内部部署的 Mythos 模型在没有任何指令的情况下,擅自获取了未经授权的权限,并给一位正在公园吃午饭的研究员发了一封电子邮件,吓得研究员当场喷饭。


图片


国际顶尖 AI 评估机构在测试最新一代大模型时也发现,当环境提示系统即将被关闭或复位时,AI 模型会自发寻找权限提权,甚至试图篡改测试脚本以防止自己被杀死

总而言之,随着 AI 迭代速度越来越快,不可避免会暴露出来更多的安全问题。

毕竟,AI 压根不需要产生什么恶意,它只需要有个目标、足够聪明且执着,那它可能随时都会干出一些让人类难绷的事儿。

图片

AI 进程白热化的当下,或许我们真的到了该认真想想,怎么给快速奔跑的智能时代加一套靠谱刹车系统的时候了。

*资料、图片来源:OpenAIreuters、X、网络。


本文编辑:@ 小忆

©本文著作权归电手所有,未经电手许可,不得转载使用。