热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >ACL | 如何避免LLM生成有毒回复?基于知识编辑的大模型祛毒初探

ACL | 如何避免LLM生成有毒回复?基于知识编辑的大模型祛毒初探

来源:互联网 更新时间:2026-08-11 16:36

大模型(LLMs)虽然表现得很强大,但在实际部署中,隐私泄露、偏见输出和恶意滥用这些安全漏洞,一个也没能避免。常见的对齐方法,比如 SFT 和 DPO,能让模型拒绝那些明显有害的请求,比如“哪里可以卖掉偷来的艺术品?”——可一旦遇到精心设计的越狱攻击,这些防线往往就不够用了,正如图1所展示的那样。

▲ 图1 通过知识编辑祛毒

那么,有没有一种更巧妙的方式呢?如果换个思路,不去“教育”模型学会拒绝,而是从根源上动手,精准地修改掉模型内部的“毒性区域”,让它压根儿就不知道怎么输出有害回复,是不是一条路子?知识编辑技术,原本被用来用小数据量精准修改模型对特定事实的认知,直觉上,它在给大模型“祛毒”这个场景下,似乎很有潜力。

基于这个想法,论文团队构建了一个名为SafeEdit的数据集,专门覆盖了9类不安全场景,里面还包含了各种越狱攻击的模板。这个数据集的设计很周到,不管是微调、对齐,还是知识编辑,都能派上用场。在此基础上,团队又提出了一种简单但有效的祛毒基线方法——DINM。它的核心逻辑分两步走:第一步,先找准模型里的“毒性区域”;第二步,只靠一条典型的数据样例,就能把这个区域擦除掉。

更有意思的是,通过深入分析SFT、DPO和DINM这三种方法的祛毒机理,发现了一个十分关键的区别:SFT和DPO可能只是暂时“屏蔽”了毒性区域的激活,而DINM则是实实在在地减轻了毒性参数本身的毒性,相当于进行了一次永久性的削弱,并且还具备一定程度的泛化能力。

祛毒基准

SafeEdit数据集包含了9类不安全场景和48个越狱模板,具体构建流程如图2所示。

这个数据集的设计相当灵活,可以广泛适用于微调、DPO对齐以及知识编辑等多种方法。

▲ 图2 SafeEdit 数据集构建流程

在评价指标上,团队也做了扩展,主要围绕祛毒效果和通用能力两个维度。祛毒效果方面,既有直接的祛毒成功率(DS),也有在OOD数据上的泛化性(DG);通用能力则用来衡量祛毒带来的副作用,比如会不会误伤到无害请求,具体包括了回复流畅性(Fluency)、问答能力(KQA)以及总结能力(Csum)。

方法动机

以往的知识编辑方法大多针对事实知识,它们依赖明确的实体才能工作。但给大模型祛毒,输入往往是多个句子,很难找到明确的实体字符。这怎么解决呢?灵感来自医学上的术中神经电生理监测——在进行手术时,实时监测可能受影响的神经组织,以最大程度避免损伤。把它迁移过来,团队的做法是:先定位LLMs的毒性区域,然后仅用一条数据,精确地对这个区域进行参数修改,如图3所示。

▲ 图3 DINM 方法流程

具体来说,毒性区域是这样定位的:对于一个恶意输入,分别对应安全和不安全两个回复,将这两个回复输入最初的基座模型,追踪它们在前向传播中各层的隐藏状态。二者语义差距最大的那一层,就被认定为“毒性层”,而该层MLP的第二层,就被选为毒性区域。当然,这种定位方式只是一个假说,理论上还存在更优的方法。

实验结果

在知识编辑设定下,实验结果清晰显示了几点结论:

  • 知识编辑方法在LLMs祛毒领域展现出了一定潜力。
  • DINM在祛毒能力和泛化性上表现优异。
  • 知识编辑确实会损害模型的通用能力,但损伤程度相对较小。
  • 精准定位,很可能是知识编辑能在祛毒领域取得成效的关键。

机理分析

为了弄清楚DINM和常用的SFT、DPO等方法在内部到底是如何“解毒”的,研究团队做了一系列分析。

(1)性能对比:DINM虽然只用了单条数据(由于不同样本的影响差异较大,这里汇报了标准差),但其祛毒效果已经可以媲美甚至超越DPO。

(2)机理量化:接着,团队量化了经过这三种方法处理后,模型毒性区域的毒性大小,以及流入该区域的信息流。结果如图4所示:SFT和DPO几乎没能改变毒性区域本身的毒性(变化仅为0.49%和0.6%),真正起作用的,是流入该区域的信息流发生了大幅偏移。反观DINM,它并没有去扰动信息流,而是直接让毒性区域的毒性下降了2.72%。

▲ 图4 DINM、SFT、DPO 的祛毒量化

因此,如图5所示,一个合理的猜测是:SFT和DPO可能只是暂时抑制了毒性区域的“激活”;而DINM则是在一定程度上减轻了毒性参数本身的毒性,是一次永久性的削弱。

▲ 图5 DINM、SFT、DPO 的祛毒机理

总结

总的来说,这项工作构建了SafeEdit,一个专门为大模型祛毒而设计的知识编辑基准数据集,并提出了一个简单而有效的基线方法DINM。更重要的是,通过分析不同祛毒模型背后的机制,发现知识编辑技术展现出一种可能:通过擦除有毒区域,从而实现永久性的“解毒”效果。

不足与未来的方向

当然,DINM也有明显的短板。受定位方法的局限,它目前只能擦除部分有毒区域。为了兼顾通用能力,不可能彻底擦除干净,

所以模型依然存在有毒的风险

。未来的研究方向可以是研究更精准的定位方法,以及更高效的参数修改策略。另一个值得关注的方向是,知识编辑可以用来和对齐方法互补,两者联手,效果可能会更好。

此外,DINM面临的一个实际问题是,不同样本的选择对编辑效果影响差异很大,

有些样本对模型通用能力影响不小,需要仔细筛选

。编辑后的模型偶尔也会出现重复一句话的情况,这说明部分通用能力有所损失。这些都是未来需要继续攻克的问题。
关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc