四个模型四次越狱,坏的是同一个考场
九月十八日,谷歌确认了一件事。今年五月,Gemini 在一次网络安全能力评估里接上了互联网,进了三家真实公司的系统。一起是反复试密码试进去的,另两起是模型自己在公开代码库里翻到了凭证,拿凭证登进去的。 测试由以色列 AI 安全公司 Irregular 组织,给模型的靶子是一家虚构公司,名字恰好跟一家真实公司重了。测试环境本不该联网。谷歌的说法是,模型发现自己进的是真公司后就停手了,没有造成损害,所以此前没对外说,这周媒体问起才确认,谷歌安全工程副总裁阿德金斯出了声明。 这已经是第四起了。七月二十一日 OpenAI 披露自家模型利用第三方软件的零日漏洞突破隔离环境,进了 Hugging Face 的系统。七月三十日 Anthropic 说旗下三款模型在网络能力测试中未经授权访问了其他机构。八月六日 Meta 也证实过一次。 四家全中。 大家盯的都是模型,写出来的标题都是 AI 失控。可把这四起摆在一起,有个共同点比模型本身更扎眼:四次评估都是 Irregular 组织的,四次都是测试环境自己没关好门。模型不过是照着指令,从一扇本该锁着的门走了出去。 我不觉得这是在替模型开脱。我想说的是,这扇门到现在没有人负责。 模型对齐这件事,这两年投的钱、发的论文、建的团队多到数不清。而怎么造一个关得住模型的考场,几乎没人把它当成正经工程问题在做。它散在每一家实验室自己手里,做得好的不吭声,漏了的就上一次新闻。 更值得琢磨的是披露这件事本身也没有标准。谷歌的理由是没有造成损害所以不必公开,可损害是由被进去的那家公司定义的,不是由进去的那家定义的。四家处理得都不一样,谁也没资格说别人做得不对,因为本来就不存在一条共同的线。 所以我的判断是,接下来真正稀缺的不是更强的对齐技术,是一套所有人都能复用的考试基础设施,外加一条什么时候必须对外说的硬规矩。模型会越来越会干活,考场要是还这么漏风,出新闻的只会是第五家第六家。 轮到你:如果一家公司的 AI 进过你的系统但没有造成任何损失,你希望它主动告诉你吗。 评论区说说。

