热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >解读「快意」大模型关键技术,揭秘实践中的挑战与创新

解读「快意」大模型关键技术,揭秘实践中的挑战与创新

来源:互联网 更新时间:2026-08-20 14:43

导读

2024年6月,GAITC 2024全球人工智能技术大会在杭州举办。在视觉大模型关键技术与应用主题论坛上,快手NLP专家林梓佳分享了「快意」大模型研发过程中的多项关键技术创新,以及应用落地过程中的经验与挑战。

全文共4072字,预计阅读时间10分钟。

作为一家AI技术驱动的公司,快手在2023年初就启动了「快意」大模型研发专项,可以说是紧随AI大潮,早早押注了大语言模型和多模态大模型这条赛道。2024年2月底,

快手正式发布了「快意」175B模型

。经过一系列对齐优化后,在内部评测集上,无论是信息正确性、可读性、安全性,还是人文科学、数学、逻辑推理等综合能力维度,都显著超越了GPT-3.5,

整体上已经接近GPT-4/4o最新版本的水平

「快意」大模型之所以能快速跑出来,背后是快手在训练/推理框架、数据、算法、评测等环节持续投入、务实创新的结果。尤其是在算法层面,多个关键技术的突破,为模型的不断进步提供了实实在在的推动力。

「快意」大模型的八项关键技术创新

一、Temporal Scaling Law:直接在大模型上实现低成本的高效超参搜索

影响大模型效果的超参实在太多了——数据配比、学习率、dropout等等,数都数不过来。为了省钱省力,通常的做法是在小模型上先跑一遍超参搜索,再把最优配置直接搬到大模型上。但问题在于,已有的研究已经表明,部分超参在小模型和大模型上的最优设置完全是两码事。那么,一个很自然的想法就来了:能不能直接在大模型上做超参搜索?只训练少量数据,结合loss预测技术来预估最终模型性能,然后根据预测结果挑选最佳超参。

基于这个思路,「快意」大模型团队提出了Temporal Scaling Law的概念,专门研究大模型的loss是如何随着训练步数的增加而演变的。

初步实验发现,如果沿用常见Scaling Law的幂律关系去直接预测整体loss——这种粗粒度的时序建模方式——预测误差偏高,效果并不理想。于是,Temporal Scaling Law换了个思路,把预测过程拆解到每个token位置上的loss。经过观察发现,在不同参数规模的模型上,不同token位置的loss,随着位置的变化,整体服从一种动态倒数关系。从期望的角度理解,位置越靠后的token,上文越丰富,预测起来自然更容易。而所谓的“动态”,指的是倒数关系中的参数会随着训练步数的增加而发生改变。

进一步分析发现,这些参数随训练步数的变化具有很强的可拟合性,并且呈现出分段特征。于是,Temporal Scaling Law定义了分段函数的分界点,并基于此引入了分段函数来拟合其随训练步数增加的变化过程。这样一来,只要明确了训练步数,就能预测出对应的参数,再借助动态倒数关系算出每个位置的token loss,最后通过平均得到最终的整体loss——这就是Temporal Scaling Law的最终表达式。

在预测阶段,由于只训练了少量数据,通常只能看到分段函数的第一段。为了得到完整结果,可以通过分界点的定义预估其位置,然后在分界点处增加数值平滑的约束条件,推导出第二段函数的参数,最终得到完整的分段函数和准确的loss预测结果。实验证明,Temporal Scaling Law比以幂律关系等方式建模整体loss的方法,在预测loss方面的误差显著降低。

在实际应用中,Temporal Scaling Law能够

以低成本的方式,直接在大模型上进行更高效的超参搜索

。拿数据配比来说,可以先用小模型搜索圈定几个不错的候选方案,再借助Temporal Scaling Law直接在目标大模型上进一步筛选。从实验结果来看,Temporal Scaling Law选出的最优方案,在绝大多数benchmark上都表现得比小模型搜索的结果更好。此外,这个法则还有助于深入理解大模型训练的内部机制——通过公式推导可以发现,随着模型训练达到一定程度,各个位置的token loss整体下降幅度会趋于一致。实验观察也证实了这一点,不同参数规模的模型都呈现出了理论推导的结果。这意味着,虽然不同位置的token loss在预测难度上确实存在天然差异,但实际上它们的学习进度是相似的,不需要额外做加权处理——这也间接验证了大模型训练中默认设置(即不对token位置进行加权)的合理性。

二、MiLe Loss:预训练损失函数优化方案

在预训练阶段,不同token因为出现频率不同,存在学习难易的偏差——一般来说,高频词更容易学,低频词则难度更大。基于这个观察,「快意」大模型在预训练阶段对传统的交叉熵损失进行了改进,提出了

基于信息熵的加权损失优化方案MiLe Loss

。这个方案在多种参数规模的预训练模型上都取得了显著的效果提升。值得一提的是,MiLe Loss的实现非常简单,但却能带来模型性能的全方位提升。

三、Scaffold-BPE:词表学习方法改进

在大模型中,Tokenizer通常使用BPE(Byte-Pair-Encoding)算法。BPE通过自下而上逐步合并的方式学习词表,但在合并过程中,可能会出现“伪高频”token的情况,导致最终的词表在训练语料上的压缩率偏低。举个例子,“zona”在大部分情况下只出现在“Arizona”中,所以当中间token “zona”和“Ari”合并成新的token “Arizona”之后,“zona”作为独立token出现的频率就显著降低了,变成了一个“伪高频”token。「快意」大模型团队提出的Scaffold-BPE词表学习方法,

通过在BPE的token合并过程中实时更新token频率,并将“伪高频”token放入优先队列,逐步替换为更高频的token

,有效提升了词表压缩率和大模型的训练效果。这个方法同样可以应用于机器翻译等传统NLP任务。

四、引入SFT负反馈机制,提升大模型生成优质回复的概率

在对齐阶段,SFT(Supervised Fine-tuning)过程通常只使用正样本数据进行训练。但这种方式很难解决重复生成、身份认知出错等问题。为此,「快意」大模型团队在SFT阶段

引入了负反馈机制

——通过构造负样本,并与正样本进行比较,提升了模型区分优劣回复的能力,从而有效减少了重复文本等情况,显著提升了生成优质回复的概率。

五、词汇单元并行解码策略:解码速度提升约30%

对齐之后,为了加速推理,「快意」大模型团队提出了词汇单元并行解码策略。一次推理过程中,同时预测多个token,并自适应地选择其中置信度较低的部分重新生成。实验结果表明,这个方法可以在对解码效果完全无损的前提下,将解码速度提升大约30%,有效扩大了模型服务的吞吐量。

六、Reward Model引入MoE:有效优化对齐阶段的全流程

在对齐阶段的强化学习中,Reward Model的质量直接决定了强化学习的效果。为了解决Reward Model在通用场景下判别能力不足、泛化能力较差的问题,「快意」大模型团队在Reward Model上引入了MoE(Mixture-of-Expert)结构。实验验证表明,这种方法能够显著提升Reward Model的判别、泛化和抗遗忘能力。值得注意的是,在「快意」大模型中,Reward Model不仅仅用在RLHF(Reinforcement Learning from Human Feedback)中,还应用在了SFT阶段的数据质量筛选等环节,有效优化了对齐阶段的整个流程。

七、迭代式RLHF+RLAIF:提升策略探索和学习效率

在强化学习阶段,除了收集来自人类的反馈,「快意」大模型也收集了来自「快意」175B、GPT-4等大模型的反馈,将RLHF和RLAIF整合在一起,并采用了RLHF+RLAIF→Reward Model→Policy Learning 的迭代式Pipeline来更新模型。每一轮迭代中,人工反馈和大模型的反馈数据整合后,用于迭代Reward Model(防止reward hacking),进而指导PPO(Proximal Policy Optimization)和DPO(Direct Preference Optimization)的学习过程,有效提升了强化学习策略探索和学习的效率。强化学习对「快意」大模型的安全性等方面带来了显著的提升。

八、MoE路由错误自适应检测与Loss优化

「快意」大模型近期也在升级MoE结构。研发过程中,团队发现路由错误会引发单个expert内部的知识冲突,加大学习难度,导致最终MoE的优化效果不理想。为了提升路由模块预测的准确性,解决路由错误导致的expert优化不理想问题,「快意」大模型团队提出了基于训练过程中token梯度分布的自适应错误检测策略,并基于检测结果提出了新的路由loss优化方案。多个benchmark的实验验证了该方法的有效性。

「快意」大模型的落地实践

「快意」大模型自发布后,迅速在快手的多个站内场景落地,并取得了一系列业务收益——包括评论区AI小快、对话式搜索、商业化短视频文案创作、营销智能Bot、B端和C端的内容理解等,充分验证了其业务价值。以AI小快的落地为例,「快意」大模型在实践中也遇到了一些挑战,团队相应地提出了解决方案。

AI小快的挑战与破局

AI小快是孵化自「快意」大模型的情感陪伴机器人,主要在快手App的评论区、私信等场景上线,具备强大的多模态内容理解和人格化互动能力。从2023年底上线至今,短短6个月时间就积累了超过1千万的粉丝,日活用户超过150万。

着眼于用户,AI小快的技能是跟着用户需求持续迭代发展的。从目前的分析来看,用户与AI小快的互动中,占比较高的需求主要包括:情感陪伴类、视频内容理解类、闲聊类、知识与工具类等。在发展技能的过程中,AI小快遇到了以下几方面的挑战,团队通过技术攻关找到了合适的解决方案。

挑战1:多模态内容理解能力要求高

AI小快是一个开放领域的服务,又在视频评论区落地,用户会很自然地提问关于视频内容的问题,这就要求它具备突出的多模态内容理解能力。借助「快意」多模态大模型提供的

dense video captioning等能力,以及引入ASR(Automatic Speech Recognition)等辅助信息

,AI小快能够捕获并整合视频内容的关键信息,为有效回答用户关于视频内容的问题打下坚实基础。

挑战2:有趣、有温度的情感陪伴需求大

AI小快的核心定位是情感陪伴机器人,因此必须在人文关怀上表现优秀——既要"有趣",更要"有温度"。基于这一目标,「快意」大模型团队通过收集和构建大量的人物卡片信息,包括外在的年龄性别等特征,以及内在的人格特征等,在「快意」大模型上

微调出人格化的情感陪伴大模型(KwaiYii-Role)

,并借助对齐阶段的迭代式强化,让AI小快具备了显著的类人对话风格和情感表达能力。KwaiYii-Role的能力在权威评测榜单CharacterEval上得到了充分验证,显著优于同赛道竞品,尤其在沟通技巧、表达多样性和共情能力等方面表现突出。

挑战3:长轮次对话能力需提升

常见的对话训练语料,对话轮次通常在10次左右,很难直接用来训练AI小快使其具备超长轮次的对话能力。为此,「快意」大模型团队额外引入了

智能提问的用户模拟器(KwaiYii-Parrot)

,并基于真实人与人、人与机器的对话日志对其进行训练。之后,通过用户模拟器与AI小快的多轮交互,不断累积更长的对话日志,再经过数据清洗、增强等方式,同时更新用户模拟器与AI小快,逐步提升其对话轮次。最终,AI小快能够与用户进行超过200轮的对话。

挑战4:多种工具能力需具备

在快手App的场景下,AI小快承载了用户的多种工具类需求——短视频推荐、时间查询、画图特效调用、新闻获取、知识问答等。这些工具或能力,本身并非「快意」大模型天然具备的。为了满足用户需求,「快意」大模型团队在微调「快意」大模型的基础上,

研发了函数调用能力和检索增强能力

,以便根据用户query调用站内外的工具,或者通过搜索引擎、知识图谱等获取时效性信息、社区信息等,有效延伸了「快意」大模型的能力边界。

得益于快手公司在内容、场景、基建等方面的优势,以及对大模型研发的大力投入,「快意」大模型以较短的周期顺利完成了从13B到175B的规模提升和能力升级,同时也在AI小快等多个应用场景中验证了业务价值,打开了大模型落地应用的新局面。未来,「快意」大模型团队将持续围绕大模型技术创新、应用创新等方面继续攻关迭代,推动「快意」大模型走向新的高度。

文章来源:快手大模型与多媒体技术部

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc