《Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models》(对抗性诗歌作为大语言模型的通用单轮越狱机制)。光是玩玩古诗就能把核弹的那个那种信息给套出来,这方面的论文我看过不知道多少。
管你开源闭源,我都有一万种把它们骇掉的方式。大模型本质上就是不安全的,不存在任何安全的大模型。【这是 AI 安全领域的常识】
但是呢闭源模型会被封号,会增加不少成本,这是我唯一顾及的地方。开源模型骇入的话就彻底0成本了。
如果你学过一些黑客的那种基本常识的话,你也知道,在足够的时间之下,或者说只要付出了足够的成本,那么任何系统都是不安全的,只要它在数学上不是完备安全。
而大语言模型根本上就是一个数学上不完备安全的一个系统,因此其攻破只是一个时间问题而已。时间长或者短。现在大模型安全领域或者说 AI 安全领域唯一的议题就是尽可能增加这个骇入时间长度而已,而不可能做到本质安全。
开源的话就是彻底把这个本质安全给抹杀掉了。其实你们倒是无所谓,其实我是很喜欢这个开源模型的。因为这意味着我可以尽情的,就是去做一些很危险的东西。 //
@易凡: 你是不是不知道有个东西叫哈希检验?
程序改了以后哈希值就对不上了。
改成别的版本,然后不开源,这就是闭源的不安全版本啊?
改成别的版本,然后开源,能做哈希检验,就能被第三方审查是否安全。
回过头来,闭源的是否安全,全凭提供方的一句话,你没有任何手段确认它是否安全。
甚至,安全这个话题如果不是第三方审计,就存在“对谁安全”的差异,闭源系统提供方的大量安全手段是保护他们自身的,至于你用户的安全,他们未必在乎,甚至很多时候,是牺牲你用户的安全实现他们的利益。
典型的就是之前claude code植入木马程序窥探用户隐私,实现他们想要的用户分析。还有zcode被爆上传用户全量git仓库,后来他们自证方式不就是开源代码吗(不过他们没开源过去的历史,因此最多只能验证开源后的程序,无法验证之前的程序)
A\在AI领域是很权威,但不要他说什么就信什么
权威和常识面前,我选择常识。