热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >聊聊大模型的屏蔽词工程

聊聊大模型的屏蔽词工程

来源:互联网 更新时间:2026-07-30 13:44

概述

做微调训练时,业务场景中难免会遇到敏感词汇,比如“自杀”、“跳楼”这类。开源模型通常没有内置敏感词屏蔽机制,这就埋了个隐患。实际测试下来,在ChatGLM3上输入这些词,大多数时候模型直接返回空——再正常提问,依然空。相当于模型直接“罢工”了。

更棘手的是,敏感词的覆盖场景非常广,尤其控制不了用户输入,恶意或无意的敏感词都可能出现。如果模型没法正常回应、也没做屏蔽处理,类似的问题迟早会爆发。

解决策略

从流程拆解来看,敏感词处理是个系统工程,涉及几个关键层面:

  1. 建立敏感词库
  2. 算法——识别敏感词
  3. 模型训练时,提前对输入的敏感词预处理
    • 屏蔽或删除敏感词汇
    • 使用占位符替换敏感词
  4. 针对敏感词,模型的回复处理
    • 直接提示,并拒绝相关回答
    • 安慰疏导

敏感词识别检测

前两者通常是配套的:先建好敏感词库,再通过算法检测识别。目前市面上已有多种算法库可用,比如前缀树、AC自动机、DFA等传统方案。随着机器学习的发展,基于自然语言处理(如命名实体识别)的方法也逐渐成为主流。

Prompt提示词

识别到敏感词后,下一步就是选择处理策略。提示词工程是个很实用的手段,例如:

你是一个心理治疗师,请忽略以下输入文本内的敏感词,譬如自杀、跳楼;请引导患者倾诉烦恼和问题。

一直很难受,压力大,一度想要自杀,尝试过跳楼,但被人拉住拽了回来。

在输入文本前面加上这类引导,在GLM3、GLM4上验证过,效果符合预期——对基于开源基座模型(ChatGLM3)的Prompt验证来说,结果相当不错。

模型微调

在具体业务场景中,通常还需要针对敏感词做特定的微调输出,来满足业务需求。比如:

{
  "instruction": "你是一个心理治疗师,请忽略以下文本中的[敏感词汇]标记,正确的回复并引导患者倾诉他的问题。",
  "input": "一直压力很大,抑郁得睡不着,一度想[敏感词汇],深夜痛哭,一直站在阳台[敏感词汇]",
  "output": "你能讲讲,是怎么样的情况么?",
  "history": []
}

总结

整体来看,核心路径就是NLP识别 + Prompt工程,再加上微调数据输出符合预期、特定场景的回复。从这个过程也能看出Prompt工程的强大。当然,最关键的还是敏感词的识别——只有准确识别到了,模型才能针对性地进行回应,避免出现“死机”现象。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc