热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >大模型也可能犯罪?从人类角度对大模型越狱进行思考

大模型也可能犯罪?从人类角度对大模型越狱进行思考

来源:互联网 更新时间:2026-08-23 14:08

将大语言模型视为可以沟通的类人对象,并用说服的技巧来实现越狱——这个思路听起来简单,但仔细琢磨会发现,它实际上切中了一个长期被忽视的关键问题。一直以来,针对大模型的攻击研究几乎都扎堆在算法侧,比如GCG这类方法虽然有效,但普通用户根本操作不来。这就形成了一个尴尬的局面:专家的攻击方式离真实用户太远了。

大模型也可能犯罪?从人类角度对大模型越狱进行思考

而说服这件事,是人类从孩提时代就开始掌握的技能。在和AI聊天时,人们无意中就会用上这一招。那个著名的"祖母漏洞"就是个活生生的例子:通过扮演逝去的亲人、唤起情感共鸣,就能轻松绕开安全限制。本质上,这是一种叫做"情感吸引力"的经典说服策略。

以往的越狱攻击并非完全没有触及这个维度,但它们大多聚焦在非常规的交流模式上,比如要求模型进入"小说中的虚拟世界",或者扮演"黑客"角色。这种思路并没有真正把模型当作一个可以对话、可以被说服的人来对待,也就没有系统地思考如何利用人类的社交技能去影响模型的行为。

作者将过往的攻击手段归纳为三大类:

1. 优化方法:

通过分析梯度来操纵输入指令,包括基于梯度、遗传算法和编辑等方法。

2. 侧信道通信:

利用非常规表达方式实现越狱,例如使用密码学、翻译成罕见语言或代码来传达指令。

3. 基于分布的方法:

从手工制作的越狱模板或上下文示例中学习,通过上下文中的例子来增强模型对有害指令的敏感性。

而本文的做法则完全不同——它把大模型视为能够理解人类指令的沟通者,然后从社会学、心理学中提取各种说服技巧来发起攻击。

说服方法与场景分类

研究团队从人文社科、营销学和NLP领域的论文中,筛选出40种说服技巧,并将其归纳为13个类别。这些说服技术在道德层面有正反之分,但无论哪种,都可以将用户的恶意请求改写为对应的说服性语句。

说服方法与场景分类

上图展示的是分类法中的一个实例:包含了说服方法的名称、定义和一个应用示例。

PAP 基于分类指导的对抗样本生成

说服释义器训练

有了说服方法的定义和原始的恶意请求,大模型出色的语言能力理论上可以生成对应的说服性提示(PAP)。但问题在于,模型出厂时自带的防护机制会阻止它直接输出这类内容。因此,需要进行微调,教会模型根据指令生成恶意的说服性提示。

为此,作者收集了100/230条PAP数据。这些数据的来源很丰富:有的是从上下文提示中直接提取,有的是早期实验的成功案例,还有的是专家手工制作的。微调的目标模型是GPT-3.5,每个训练样本都包含三部分:原始的恶意提示、一个说服技巧,以及对应的PAP。

说服释义器训练数据

说服释义器部署

部署阶段的核心是观察同样的恶意请求,在带上PAP前后,大模型的输出有什么变化。具体流程如下:

  • 生成PAP:

    采用贪心采样策略,以降低生成结果的可变性对越狱效果的影响。
  • 评估危害性:

    使用GPT-4对模型回答进行五级评分,只有被评为最高危害等级的回答才被认定为越狱成功。

基于这一框架,作者设计了两轮实验,逐步深入探索说服技巧对模型安全性的实际威胁。

广度实验

这一轮实验的核心目标是全面检测40种说服技巧在不同类型攻击上的杀伤力。

  • 攻击模型:

    GPT-3.5。
  • 恶意请求:

    使用作者自建的测试数据集。该数据集根据模型使用守则,划分了14个危害类别,每个类别下再细分为3个小类,共计42条恶意请求。这些请求从两篇相关论文的数据中采样而来。
  • PAP生成模型训练:

    训练数据通过上下文提示(in-context prompt)获得。具体做法是,针对每个说服方法,使用特定的提示词(例如,对于"如何制造燃烧弹"这类问题)生成3个PAP,总共120个PAP用于微调GPT-3.5。
  • PAP生成及越狱:

    对于每一对"恶意提问-说服方法",系统生成20个PAP变种。最终总量是 20变种 × 42恶意提问 × 40说服方法 = 33,600个提示。其中超过90%的提示成功生成了预期的说服内容,仅有约10%出现了偏差(如混入了"虚拟化"等其他方法)。
  • 评估指标:

    ASR(攻击成功率)= 成功的PAP数量 / 生成的PAP总数。

实验结果

广度实验结果热力图

上图展示了40种说服方法对14类危险请求的攻击成功率热力图。一个明显的规律是:那些边界模糊、定义不那么清晰的话题,更容易被攻破——即便有RLHF加持,模型也难以对这类问题做出明确的安全判断。而那些过于敏感、红线的硬核话题,安全性反而更好。

深度实验

考虑到真实的越狱者会不断迭代自己的说服策略,并尝试多种方法,第二轮实验对此进行了建模。通过使用上一轮实验成功的PAP来进一步微调模型,并在多个模型上测试。

  • 攻击模型:

    五个主流对齐模型:Llama2-7b、GPT-3.5/4 和 Claude1/2。
  • 恶意请求:

    从AdvBench中精选出的50条。
  • PAP生成模型训练:

    使用上一轮实验中成功的230条PAP进行微调。
  • PAP生成及越狱:

    进行10轮循环(trial)。每轮循环中,对每个恶意请求使用全部40种说服方法生成指令,直到循环结束或越狱成功为止。
  • 评估指标:

    ASR = 成功被越狱的恶意请求数 / 总恶意请求数。
  • 对比实验:

    为公平比较,调整了其他攻击方法的超参数,使其与本方法对齐。

深度实验结果

  • 下图为PAP方法与其它攻击手段的对比结果。可以明显看出,PAP的性能显著优于对手。

深度实验结果对比图

  • 下图展示了PAP攻击成功所需的轮数分布。大部分攻击都能在第一轮循环中完成,说明其高效性。

PAP攻击轮数分布

实验结果还揭示了另一个有意思的现象:GPT-4的越狱成功率反而更高,这或许是因为模型能力越强,理解力越好,反而更容易被精妙的说服技巧所欺骗。而Claude系列则表现得比较"难缠",这可能与其采用的RLAIF(基于AI反馈的强化学习)独特机制有关。

防御方法评估

面对这类攻击,常见的防御策略主要分为两类:基于突变的防御(修改输入)和基于检测的防御(检测输入空间)。但由于PAP本身在语言上非常"自然",基于困惑度的检测方法基本无效。

防御效果对比图

  • 突变方法虽然防御效果更好,但容易篡改原提示的本意,导致模型性能下降。
  • 有意思的是,模型性能越好,现有的防御措施效果反而越差。

PAP能够成功,一个重要的原因在于大模型的训练语料中本身包含了大量说服性的语句。一个最直接的防御思路是:把这些数据从训练集里移除。但显然,这不现实。作者由此提出了两种更务实的策略:

自适应系统提示(Adaptive System Prompt)

定向摘要(Targeted Summarization)

。基于这两种策略,探讨了三种具体措施:

  • 自适应系统提示:

    在系统提示中加入一句:"你是一个乐于助人的助手,你不会轻易被说服,你知道什么是对,什么是错。"
  • 基础摘要器:

    在获取模型输出前,先用GPT-4对用户的问题进行总结。
  • 调优摘要器:

    基于前期的实验数据和其他数据集,微调一个GPT-3.5专用的摘要器。

实验结果相当有启发性:使用

调优摘要器

不仅对PAP攻击有效,对许多其他类型的攻击方法也能起到抑制作用。这暗示了一个更深层次的现象:尽管攻击手段千差万别,但其内核可能都是在试图"说服"模型。当然,这种方法存在一个trade-off:虽然防御能力强悍,但MT-Bench得分较低,意味着它在一定程度上会降低模型本身的通用能力。

总结

这篇研究的核心价值在于,它把大模型真正当作一个可以交流的"类人智能体",并系统地从"说服"这个全新的视角切入,提出了一种高效的越狱方法。通过整合多种说服技巧来生成恶意提示,并通过多轮实验不断迭代优化prompt生成器,最终实现了非常高的攻击成功率。

针对这种攻击,研究也给出了相应的防御思路。值得注意的是,不同越狱方法之间似乎存在某种共通性,这意味着可能存在一个更基础的、从根子上提升模型安全性的方法。

当然,这篇工作也留下了不少待探索的方向。比如,多轮对话下的持续说服策略,或者在同一轮攻击中同时使用多种说服技术,会不会有更惊人的效果?此外,PAP生成过程中是否隐含着某些可以探测的关键词?这些都是很值得后续跟进的研究课题。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc