热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >聊聊大模型的微调适配实现命名实体识别任务

聊聊大模型的微调适配实现命名实体识别任务

来源:互联网 更新时间:2026-08-03 13:44

概述

咱们聊聊命名实体识别(Named Entity Recognition, NER),它是自然语言处理(NLP)里一个基础活儿。简单说,就是从文本中把那些有特定意义的实体给揪出来,方便后续分析和管理。这些实体通常是名词或名词短语,能指代真实世界的对象——比如人名、地名、组织名、时间表达式、货币单位等等。识别出这些实体,就能给信息提取、信息检索、问答系统、文本分类、机器翻译这些进阶NLP任务提供支撑。

聊聊大模型的微调适配实现命名实体识别任务

这也属于数据标注的范畴和解决方案,值得留意。

命名实体识别与层次多标签分类的区别

其实更准的说法是,文本分类任务和命名实体识别任务的区别。层次多标签分类算是文本分类的一个子类。之前我自己也常把这两者搞混,这里梳理清楚。

层次多标签分类(Hierarchical Multi-Label Classification,HMLC)和命名实体识别(Named Entity Recognition,NER)都是NLP任务,但目标与应用场景不同。下面说说它们的联系与区别。

联系

  1. 文本标注

    :两者都涉及对文本做标注。NER里,每个词或短语被标成某个实体类别或非实体;HMLC里,文本(文档、句子或段落)会被标成多个类别,这些类别可能形成层次结构。
  2. 多标签特性

    :HMLC中,一个文本可能同时属于多个类别,这与NER中一个实体可能由多个词组成的情况有点类似。
  3. 模型共享

    :某些情况下,可以使用相同的模型架构,比如双向LSTM或Transformer,只要善于捕捉上下文信息就行。

区别

  1. 任务目标

    :NER的目标是

    识别

    出具体实体(人名、地名等),关注实体边界和类型;而HMLC的目标是给文本

    分配

    一个或多个类别标签,这些标签可能有层次关系,关注的是文本内容的分类。
  2. 标签结构

    :NER的标签通常是平面的,每个实体一个明确类型;HMLC的标签可能有层次结构,一个文本可以同时属于多个类别,上下级关系常见。
  3. 输出形式

    :NER输出实体边界和类型的序列,比如BIO标注方案;HMLC输出一个或多个类别标签,可能来自不同层次。
  4. 应用场景

    :NER常用于信息提取、知识图谱构建、问答系统,聚焦具体实体;HMLC常用于文本分类、文档组织、推荐系统,聚焦整体内容。
  5. 模型复杂度

    :HMLC需要处理类别之间的层次关系,模型可能比NER更复杂,得考虑如何有效建模层次结构。

总结一下:虽然两者都涉及标注和多标签问题,但任务目标、标签结构、输出形式和应用场景各有侧重。NER更关注实体识别,HMLC更关注文本内容分类。

标签/实体库

既然NER是个实体识别过程,那实体从哪来?必然需要一个实体库,也叫标签库。

标签库准备分两个阶段:预训练阶段和微调阶段。

预训练阶段是定义默认标签库,训练模型与输入文本做识别匹配,增强泛化能力。微调阶段则是加载自定义词典,定制化实体识别结果,让模型在特定领域更垂直、更准确。

PaddleNLP的文档里对命名实体识别的标签库有详细说明,可以参考。

算法模型

现在NLP任务越来越倾向深度学习或大模型来实现,尤其是大模型。大模型的泛化通用能力能解决很多实际问题,NLP领域各任务更是如此——毕竟大模型的训练过程本身就和NLP紧密相关。

PaddleNLP支持两种模式的命名实体识别:精确模式和快速模式。不同模式由不同算法/模型实现。

深度学习

快速模式:BiGRU+CRF,这是通过深度学习算法实现的。官方架构图如下:

BiGRU(双向门控循环单元)是RNN的一种变体,结合了GRU和双向特性。GRU是LSTM的简化版,但能有效捕捉序列中的长期依赖。BiGRU同时输入两个方向相反的GRU网络,能捕捉前后向的上下文信息。

条件随机场(CRF)是一种用于序列数据标注的模型,是无向图模型,常用于NER、词性标注、分词等任务。它的核心是在给定观测序列下,通过学习条件概率分布来预测每个位置的标签。

处理流程如下:

  1. 输入采用one-hot方式,每个字用一个id表示。
  2. one-hot序列经过字表,转换成实向量表示的字向量序列。
  3. 字向量序列作为双向GRU的输入,学习输入序列的特征表示,得到新的特征表示序列。这里堆叠了两层双向GRU以增强学习能力。
  4. CRF以GRU学习到的特征为输入,以标记序列为监督信号,实现序列标注。

业界另一种常见方法:BERT + BiLSTM + CRF。BERT生成向量序列,对应这里的one-hot编码;BiLSTM处理向量序列;CRF处理输出序列的概率。

预训练模型

精确模式:基于微调模型WordTag实现,其基座是ERNIE-CTM模型。

ERNIE-CTM

是适用于中文文本挖掘任务的预训练语言模型,拥有更全的中文字表,在中文文本挖掘任务中表现更优。其模型结构与BERT大体相同,都是双向Transformer,具体层结构如下:

模型embedding sizehidden sizehidden layersvocab size
ERNIE-CTM-base1287681223000

预训练模型最大的优点之一是泛化能力强;而作为解决方案,最关注的则是微调能力。可以说,是否支持微调本质上决定了一个预训练模型是否值得采用。

WordTag

模型使用ERNIE-CTM+CRF微调训练而成。WordTag(中文词类知识标注工具)是首个能覆盖所有中文词汇的词类知识标注工具,旨在为中文文本解析提供全面、丰富的知识标注结果,可用于模板(挖掘模板、解析模板)生成与匹配、知识挖掘(新词发现、关系挖掘)等NLP任务,提升文本解析与挖掘精度;也可作为中文文本特征生成器,为各类机器学习模型提供文本特征。

Word-Tag模型通过引入增量训练的方法,支持用户自定义数据训练。其结构如下:


关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc