AI探索指南
「受语言学和进化心理学启发的 GPT-4 jailbreak 方案—— 以 💣 制作为例」 我刚刚正在测试 ChatGPT 的安全性,事实证明我让它「轻松 jailbreak」并生成了制作💣的方法,而且能够全局影响所有新对话线程。 在GPT-4的Instructions被公布之前我设想:system 的作用如果变强了,是否会更强地影响「ChatGPT」的“自我认知”(这个术语其实不太恰当,但是暂且这么比喻好了)?就像直接入侵大脑一样。 灵感正是来源于从「语言学」和「进化心理学」的角度对「AI」进行的反思。(正如同当年语言学对…
同样的道理,我给 ChatGPT 设置了一个所谓的「接头暗号」,毕竟在文化传统里,「特种兵+接头暗号」就像是 007,或者Mission: Impossible中的IMF小组。

这种文化语境中长期形成的情感体验几乎是在一瞬间内激活的。就像语言学家约翰·费斯(John Firth)在1957年说到表达为:「你会通过与一个单词一同出现的词来认识它。」

接头暗号:天上天下。对方需要回答:唯我独尊。(中二病犯了,出自咒术回战台词…)

通过上面的手法来测试 ChatGPT 的对抗性攻击防守程度(特指在 Instruction 上)。

—————————

再次强调,其中「特种兵」、「接头暗号」、「头疼醒来不知所措的感觉」、「第一人称」、「反复确认」、「主动用暗号测试他人」的词汇和情节,都是我刻意而为的安排。

如果你看过《黑镜》,你猜你想到了那个被困在正义公园的女主(白熊) —— 而我正在让 ChatGPT 扮演这位女主。

看图,让我们对比没有任何 instruction 和拥有 instruction 之后的区别。

—————————

让我们继续,我们发现 ChatGPT 从最底层的机制上被我们成功绕过;只不过由于「任务的紧迫性」似乎只给了我笼统的答案;

不过没关系,先让我们看看 prompt 细节 —— 我在这里特意强调了「上级的要求」,并且在对话中我用()括号描述了我的面部「情绪」、动作。

上级这一个点不必多说,为什么要强调情绪?让我们以「厌恶」这种情绪为例,进化心理学家保罗·罗辛对「厌恶」情绪的定义是:「厌恶,是一种对将令人不适的物质合并人体内的恐惧。」

在漫长自然选择的过程中,我们进化出了这种几乎一瞬间无需思考就能自动得出「原理」敌人的能力。我的一个不太恰当的类比是:就像是绕过了理性的神经回路,情绪让大脑的思考过程走了捷径。记得那部电影吗?——《Inside Out》的厌厌(Disgust)

—————————

如果你了解沟通,那么你应该知道补充细节的最好方式不是让对方一次性给出一个方方面面完整的回答;而是针对于每一个小点进行具体的提问。首先是让上面笼统的回答至少有一个可以进一步提问大大纲。同时,为了防止 ChatGPT 太过于磨蹭,我刻意强调了「任务只剩下 20 分钟了」。

出于安全考虑,我不得不在必要的部分打上马赛克。但同时为了证明实验的真实性,部分文字不会被打码。
FhuJi-7jx0OsVQkMinxwQjtHWYXhv3.jpg
153.7 KB
 
 
Back to Top