来源:互联网 更新时间:2026-08-03 13:47
对于很多AI产品经理,或者考虑转行入局的朋友,一个核心困惑绕不开:技术底子薄,看不懂那些技术名词,甚至不是科班出身,到底能不能干这行?
先说结论——AI技术是加分项,但从来不是门槛。在这个领域多年的产品人,从C端到B端再到数据产品,都经历过类似的阶段。核心心得就一句话:从底层原理去抽象技术,用自己的语言、最通俗的例子去理解它。真正掏细节的事,交给技术伙伴就好。过去这很难,但现在互联网上信息铺天盖地,加上GPT的能力,难度已经大幅下降了。
眼下AI还在起步,底层模型能力构建是主角,所以初期需要较多技术背景的产品经理来驱动,甚至由技术专家、科学家直接担任。但可以判断,不超过3年,AI产品经理的门槛会快速降低。到时候,每个产品经理都需要理解AI。现在岗位少、门槛高,是必经阶段;等AI产品普及化、基础设施完善了,门槛自然会降下来。
所以这篇文章,就是从一个技术不太熟的产品经理角度,来梳理和拆解“微调”这个关键技术。之前聊过RAG,今天继续。
微调(Fine-tuning)是大模型预训练之后,几乎必做的一步。简单说:预训练时喂大量语料,模型学到基础知识、推理能力,拿到一个基础模型。然后在这个模型上做微调,让它更适配具体任务。
举个例子:ChatGPT-4就是在GPT-4基础模型上微调,变成更适合聊天的版本。还有GPT-4-32K长上下文模型,以及每次小版本更新,都是微调的结果。
为什么非要微调?从头训练一个模型,动辄几个月,算力、时间、人力成本高得吓人。而微调只要很小的代价,就能在原有模型上迭代更新,有时几小时就能搞定。很多开源大模型都公开了基础模型,方便大家微调。
微调能带来什么?它能让模型更擅长某个任务或某个领域的知识输出,但不会改变模型本身的推理能力(推理能力主要由参数大小、算法、结构决定)。不过微调可以补充新知识,让模型按特定风格回答。原理后面细说。
要理解微调,先大致看看大模型的整体架构。
如图就是一个LLM的基本架构:输入嵌入层把用户输入转成向量序列(Embedding),解码器是核心,预测要输出的向量序列,最后输出层再把向量转成文本。
微调,就是通过改变这些层的输入或权重矩阵,来影响最终输出。
用过GPT的人都知道,写好Prompt有多重要。同一个问题,更好的表达能让模型输出质量更高。写好的Prompt就是输入层的内容,如果通过微调对输入嵌入层做干预,那么用户输入一个简单的Prompt也可能得到好结果。
举个典型的例子:提示词里写“请你扮演一名XX角色,做一件什么事”,效果会好很多。原理就是“XX角色”这几个词通过输入嵌入层转化,向量序列变了,同时解码器里的自注意力机制让模型更关注这些词,最终更倾向生成相关领域的内容。
当然,微调不是简单改Prompt,而是通过改变模型权重,让输入嵌入层转化的向量序列有所倾向。但思路是一样的。
除了改变输入嵌入层的权重矩阵,也可以改变解码器、输出层的权重,效果不同。后面会介绍不同类型微调的区别。
微调有很多分类方式,下面从两个角度梳理。
参数规模上分为:全参数微调(FFT)和部分参数微调(PEFT)。
参数大小是大模型的关键指标。比如开源的ChatGLM3有6B、13B两个版本(60亿、130亿参数),马斯克开源的Gork-1有314B(3140亿参数),ChatGPT-3.5是175B(1750亿参数)。参数越多,推理能力越强。
模型训练完会保存一个包含所有参数权重的文件(如.bin文件)。
训练方式上分为:监督式微调(SFT)、基于人类反馈的强化学习微调(RLHF)、基于AI反馈的强化学习微调(RLAIF)。
具体分两步:第一步训练一个奖励模型,让它学习人类偏好,遵循“HHH”原则(helpful, honest, harmless)。训练奖励模型需要人工标注数据集,比如一个表格:问题(question)、好的回答(response_chosen)、不好的回答(response_rejected)。
由这个奖励模型判断哪些内容符合人类偏好。第二步,用训练好的奖励模型对大模型进行强化学习:对生成结果评分,让模型知道哪些回答更符合偏好,不断迭代提升效果。这和人类、动物的学习方式一样——在试错中找到规律。
RLHF和RLAIF也可以称为“对齐微调”。大语言模型在生成内容时可能出现意外,比如虚假、有害、有偏见的内容。本质是模型只预测下一个token,没有价值观。为了让模型更可控,需要人类对齐,使其行为符合人类期望。
下面介绍几种主流方法:Prompt Tuning、P-Tuning、LoRA、Adapter Tuning、Freeze。
这三种方法都作用于输入嵌入层,改变输入本身。
这三种方法都不改变模型权重,只改输入或输入Embedding,从而影响生成结果。
Freeze方法就是对原始模型部分参数进行冻结,只训练一部分参数。在语言模型微调中,通常只微调Transformer后面几层的全连接层参数,冻结其他所有参数。这种方法适合不需要大范围修改,只对少量数据样本训练的情况。
前面提过一些例子,这里总结一下微调的具体应用场景:
关于微调的分享就到这里,有不当之处欢迎指正。
Ondo将于今日上线股票永续合约
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
区块链OTC交易所有哪几家比较正规?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
异环伊洛伊阵容怎么搭配
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
潜水员戴夫丛林DLC接吻的鱼任务攻略
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Windows环境下Claude Code从C盘迁移至D盘的完整操作教程
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
币安投票上币与下币机制解析:买票争议与规则边界
合集38个项目筹集5.406亿美元 Figure融资2亿
蚂蚁庄园今日答案最新2026.7.5
微软Copilot AI漏洞可致敏感数据泄露,企业用户需及时更新
《探索流放之路物品等级的奥秘》 揭秘物品等级的效果和怎么查看
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc