热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >AI产品经理必须知道的技术 之 【微调】

AI产品经理必须知道的技术 之 【微调】

来源:互联网 更新时间:2026-08-03 13:47

对于很多AI产品经理,或者考虑转行入局的朋友,一个核心困惑绕不开:技术底子薄,看不懂那些技术名词,甚至不是科班出身,到底能不能干这行?

先说结论——AI技术是加分项,但从来不是门槛。在这个领域多年的产品人,从C端到B端再到数据产品,都经历过类似的阶段。核心心得就一句话:从底层原理去抽象技术,用自己的语言、最通俗的例子去理解它。真正掏细节的事,交给技术伙伴就好。过去这很难,但现在互联网上信息铺天盖地,加上GPT的能力,难度已经大幅下降了。

眼下AI还在起步,底层模型能力构建是主角,所以初期需要较多技术背景的产品经理来驱动,甚至由技术专家、科学家直接担任。但可以判断,不超过3年,AI产品经理的门槛会快速降低。到时候,每个产品经理都需要理解AI。现在岗位少、门槛高,是必经阶段;等AI产品普及化、基础设施完善了,门槛自然会降下来。

所以这篇文章,就是从一个技术不太熟的产品经理角度,来梳理和拆解“微调”这个关键技术。之前聊过RAG,今天继续。

01 什么是微调

微调(Fine-tuning)是大模型预训练之后,几乎必做的一步。简单说:预训练时喂大量语料,模型学到基础知识、推理能力,拿到一个基础模型。然后在这个模型上做微调,让它更适配具体任务。

举个例子:ChatGPT-4就是在GPT-4基础模型上微调,变成更适合聊天的版本。还有GPT-4-32K长上下文模型,以及每次小版本更新,都是微调的结果。

为什么非要微调?从头训练一个模型,动辄几个月,算力、时间、人力成本高得吓人。而微调只要很小的代价,就能在原有模型上迭代更新,有时几小时就能搞定。很多开源大模型都公开了基础模型,方便大家微调。

微调能带来什么?它能让模型更擅长某个任务或某个领域的知识输出,但不会改变模型本身的推理能力(推理能力主要由参数大小、算法、结构决定)。不过微调可以补充新知识,让模型按特定风格回答。原理后面细说。

02 微调的基本原理

要理解微调,先大致看看大模型的整体架构。

如图就是一个LLM的基本架构:输入嵌入层把用户输入转成向量序列(Embedding),解码器是核心,预测要输出的向量序列,最后输出层再把向量转成文本。

微调,就是通过改变这些层的输入或权重矩阵,来影响最终输出。

用过GPT的人都知道,写好Prompt有多重要。同一个问题,更好的表达能让模型输出质量更高。写好的Prompt就是输入层的内容,如果通过微调对输入嵌入层做干预,那么用户输入一个简单的Prompt也可能得到好结果。

举个典型的例子:提示词里写“请你扮演一名XX角色,做一件什么事”,效果会好很多。原理就是“XX角色”这几个词通过输入嵌入层转化,向量序列变了,同时解码器里的自注意力机制让模型更关注这些词,最终更倾向生成相关领域的内容。

当然,微调不是简单改Prompt,而是通过改变模型权重,让输入嵌入层转化的向量序列有所倾向。但思路是一样的。

除了改变输入嵌入层的权重矩阵,也可以改变解码器、输出层的权重,效果不同。后面会介绍不同类型微调的区别。

03 微调的分类

微调有很多分类方式,下面从两个角度梳理。

按参数规模划分

参数规模上分为:全参数微调(FFT)和部分参数微调(PEFT)。

参数大小是大模型的关键指标。比如开源的ChatGLM3有6B、13B两个版本(60亿、130亿参数),马斯克开源的Gork-1有314B(3140亿参数),ChatGPT-3.5是175B(1750亿参数)。参数越多,推理能力越强。

模型训练完会保存一个包含所有参数权重的文件(如.bin文件)。

全参数微调

就是调整所有参数权重,成本高、风险也大——改变了全部权重,原始模型效果可能受影响。虽然没有从头训练复杂,但算力和时间需求仍然不小。

部分参数微调(PEFT)

只调整一部分权重,成本小很多,能保留基础模型的大部分能力,只更新特定领域。比如最简单的“套壳大模型”只改名字:微调后问它是谁,它回答“我是XX”,但其他回答还是基础模型原来的能力。

按训练方式划分

训练方式上分为:监督式微调(SFT)、基于人类反馈的强化学习微调(RLHF)、基于AI反馈的强化学习微调(RLAIF)。

监督式微调(SFT)

:用人工标注的数据,按传统监督学习方法微调。比如解函数y=f(x),通过标注{x, y}数据集训练模型,预测时给定x,模型输出y。实践中,如果有行业知识数据,构造成数据集进行微调,就能得到行业大模型。它既弥补了基础模型对行业知识的不足,又让模型回复更偏向该领域。

基于人类反馈的强化学习微调(RLHF)

:这也是ChatGPT背后的技术。区别在哪?监督式微调好比让模型背很多题,问题和答案都告诉它;RLHF则是让模型先做题,做对了给奖励,通过训练让模型自己学会判断对错。人类反馈就是人类对不同生成答案的评分和排名。

具体分两步:第一步训练一个奖励模型,让它学习人类偏好,遵循“HHH”原则(helpful, honest, harmless)。训练奖励模型需要人工标注数据集,比如一个表格:问题(question)、好的回答(response_chosen)、不好的回答(response_rejected)。

由这个奖励模型判断哪些内容符合人类偏好。第二步,用训练好的奖励模型对大模型进行强化学习:对生成结果评分,让模型知道哪些回答更符合偏好,不断迭代提升效果。这和人类、动物的学习方式一样——在试错中找到规律。

基于AI反馈的强化学习微调(RLAIF)

:与RLHF类似,只是把人类反馈换成AI反馈。这个方法最早由Google在2022年提出,用AI偏好来训练奖励模型。实际上,国内很多做大模型的团队也在用这种方式:用GPT生成的内容来训练自己的模型。

RLHF和RLAIF也可以称为“对齐微调”。大语言模型在生成内容时可能出现意外,比如虚假、有害、有偏见的内容。本质是模型只预测下一个token,没有价值观。为了让模型更可控,需要人类对齐,使其行为符合人类期望。

04 主流的微调方法

下面介绍几种主流方法:Prompt Tuning、P-Tuning、LoRA、Adapter Tuning、Freeze。

Prompt Tuning、P-Tuning、Prefix Tuning

这三种方法都作用于输入嵌入层,改变输入本身。

Prompt Tuning

:通过提示微调的形式,让模型针对特定任务生成特定输出。本质是改变任务格式。可以训练模型做情感判定、摘要、翻译等。给定训练数据,让模型学会生成任务的模式。通常不改变模型架构和参数,只靠设计任务相关的提示词引导输出。

Prefix Tuning

:对任务增加特定前缀。有两种说法:一是在输入文本前加前缀,二是在输入文本Embedding之后加前缀,且会在Transformer的每一层都加入这个前缀。

P-Tuning

:通过一个额外模型动态生成虚拟标记嵌入(Embedding)。Prompt Tuning需要针对每个任务构建不同模板,且对提示词设计敏感,不同提示词结果不同。P-Tuning是对生成的Prompt Embedding做动态改变。还有P-Tuning v2,结合了Prefix Tuning的做法,对Transformer每一层都增加连续提示。

这三种方法都不改变模型权重,只改输入或输入Embedding,从而影响生成结果。

LoRA、Adapter Tuning

LoRA

:在基础模型之外添加一个小模型,训练这个小模型成本很低。训练完后,把这个小模型的权重与大模型权重合并,得到新权重。LoRA在图像生成领域特别流行,比如Stable Diffusion有丰富的LoRA模型库,只要几十张图片就能训练一个特定风格的LoRA模型。原理上它通过改变最终模型权重影响结果,主要作用在解码层。

Adapter Tuning

:同样在不改变基础模型原始参数的前提下,让模型适应新任务。在模型每个层或某些层之间插入适配器(adapters)——一些参数很少的小神经网络模块。这些adapter是可训练的,而原始模型参数保持不变。

Freeze(参数冻结)

Freeze方法就是对原始模型部分参数进行冻结,只训练一部分参数。在语言模型微调中,通常只微调Transformer后面几层的全连接层参数,冻结其他所有参数。这种方法适合不需要大范围修改,只对少量数据样本训练的情况。

05 微调的应用场景

前面提过一些例子,这里总结一下微调的具体应用场景:

  • 补充行业知识

    :比如医疗大模型、法律大模型、代码生成大模型等。
  • 服务于特定任务

    :文本分类、情感判定、翻译、摘要生成等。
  • 模型能力增强

    :适应新数据和任务、提高对噪声和干扰的抵抗能力(鲁棒性)、让决策过程更可解释。

关于微调的分享就到这里,有不当之处欢迎指正。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc