来源:互联网 更新时间:2026-08-20 14:43
2024年6月,GAITC 2024全球人工智能技术大会在杭州举办。在视觉大模型关键技术与应用主题论坛上,快手NLP专家林梓佳分享了「快意」大模型研发过程中的多项关键技术创新,以及应用落地过程中的经验与挑战。
全文共4072字,预计阅读时间10分钟。
作为一家AI技术驱动的公司,快手在2023年初就启动了「快意」大模型研发专项,可以说是紧随AI大潮,早早押注了大语言模型和多模态大模型这条赛道。2024年2月底,
「快意」大模型之所以能快速跑出来,背后是快手在训练/推理框架、数据、算法、评测等环节持续投入、务实创新的结果。尤其是在算法层面,多个关键技术的突破,为模型的不断进步提供了实实在在的推动力。
影响大模型效果的超参实在太多了——数据配比、学习率、dropout等等,数都数不过来。为了省钱省力,通常的做法是在小模型上先跑一遍超参搜索,再把最优配置直接搬到大模型上。但问题在于,已有的研究已经表明,部分超参在小模型和大模型上的最优设置完全是两码事。那么,一个很自然的想法就来了:能不能直接在大模型上做超参搜索?只训练少量数据,结合loss预测技术来预估最终模型性能,然后根据预测结果挑选最佳超参。
基于这个思路,「快意」大模型团队提出了Temporal Scaling Law的概念,专门研究大模型的loss是如何随着训练步数的增加而演变的。
初步实验发现,如果沿用常见Scaling Law的幂律关系去直接预测整体loss——这种粗粒度的时序建模方式——预测误差偏高,效果并不理想。于是,Temporal Scaling Law换了个思路,把预测过程拆解到每个token位置上的loss。经过观察发现,在不同参数规模的模型上,不同token位置的loss,随着位置的变化,整体服从一种动态倒数关系。从期望的角度理解,位置越靠后的token,上文越丰富,预测起来自然更容易。而所谓的“动态”,指的是倒数关系中的参数会随着训练步数的增加而发生改变。
进一步分析发现,这些参数随训练步数的变化具有很强的可拟合性,并且呈现出分段特征。于是,Temporal Scaling Law定义了分段函数的分界点,并基于此引入了分段函数来拟合其随训练步数增加的变化过程。这样一来,只要明确了训练步数,就能预测出对应的参数,再借助动态倒数关系算出每个位置的token loss,最后通过平均得到最终的整体loss——这就是Temporal Scaling Law的最终表达式。
在预测阶段,由于只训练了少量数据,通常只能看到分段函数的第一段。为了得到完整结果,可以通过分界点的定义预估其位置,然后在分界点处增加数值平滑的约束条件,推导出第二段函数的参数,最终得到完整的分段函数和准确的loss预测结果。实验证明,Temporal Scaling Law比以幂律关系等方式建模整体loss的方法,在预测loss方面的误差显著降低。
在实际应用中,Temporal Scaling Law能够
在预训练阶段,不同token因为出现频率不同,存在学习难易的偏差——一般来说,高频词更容易学,低频词则难度更大。基于这个观察,「快意」大模型在预训练阶段对传统的交叉熵损失进行了改进,提出了
在大模型中,Tokenizer通常使用BPE(Byte-Pair-Encoding)算法。BPE通过自下而上逐步合并的方式学习词表,但在合并过程中,可能会出现“伪高频”token的情况,导致最终的词表在训练语料上的压缩率偏低。举个例子,“zona”在大部分情况下只出现在“Arizona”中,所以当中间token “zona”和“Ari”合并成新的token “Arizona”之后,“zona”作为独立token出现的频率就显著降低了,变成了一个“伪高频”token。「快意」大模型团队提出的Scaffold-BPE词表学习方法,
在对齐阶段,SFT(Supervised Fine-tuning)过程通常只使用正样本数据进行训练。但这种方式很难解决重复生成、身份认知出错等问题。为此,「快意」大模型团队在SFT阶段
对齐之后,为了加速推理,「快意」大模型团队提出了词汇单元并行解码策略。一次推理过程中,同时预测多个token,并自适应地选择其中置信度较低的部分重新生成。实验结果表明,这个方法可以在对解码效果完全无损的前提下,将解码速度提升大约30%,有效扩大了模型服务的吞吐量。
在对齐阶段的强化学习中,Reward Model的质量直接决定了强化学习的效果。为了解决Reward Model在通用场景下判别能力不足、泛化能力较差的问题,「快意」大模型团队在Reward Model上引入了MoE(Mixture-of-Expert)结构。实验验证表明,这种方法能够显著提升Reward Model的判别、泛化和抗遗忘能力。值得注意的是,在「快意」大模型中,Reward Model不仅仅用在RLHF(Reinforcement Learning from Human Feedback)中,还应用在了SFT阶段的数据质量筛选等环节,有效优化了对齐阶段的整个流程。
在强化学习阶段,除了收集来自人类的反馈,「快意」大模型也收集了来自「快意」175B、GPT-4等大模型的反馈,将RLHF和RLAIF整合在一起,并采用了RLHF+RLAIF→Reward Model→Policy Learning 的迭代式Pipeline来更新模型。每一轮迭代中,人工反馈和大模型的反馈数据整合后,用于迭代Reward Model(防止reward hacking),进而指导PPO(Proximal Policy Optimization)和DPO(Direct Preference Optimization)的学习过程,有效提升了强化学习策略探索和学习的效率。强化学习对「快意」大模型的安全性等方面带来了显著的提升。
「快意」大模型近期也在升级MoE结构。研发过程中,团队发现路由错误会引发单个expert内部的知识冲突,加大学习难度,导致最终MoE的优化效果不理想。为了提升路由模块预测的准确性,解决路由错误导致的expert优化不理想问题,「快意」大模型团队提出了基于训练过程中token梯度分布的自适应错误检测策略,并基于检测结果提出了新的路由loss优化方案。多个benchmark的实验验证了该方法的有效性。
「快意」大模型自发布后,迅速在快手的多个站内场景落地,并取得了一系列业务收益——包括评论区AI小快、对话式搜索、商业化短视频文案创作、营销智能Bot、B端和C端的内容理解等,充分验证了其业务价值。以AI小快的落地为例,「快意」大模型在实践中也遇到了一些挑战,团队相应地提出了解决方案。
AI小快是孵化自「快意」大模型的情感陪伴机器人,主要在快手App的评论区、私信等场景上线,具备强大的多模态内容理解和人格化互动能力。从2023年底上线至今,短短6个月时间就积累了超过1千万的粉丝,日活用户超过150万。
着眼于用户,AI小快的技能是跟着用户需求持续迭代发展的。从目前的分析来看,用户与AI小快的互动中,占比较高的需求主要包括:情感陪伴类、视频内容理解类、闲聊类、知识与工具类等。在发展技能的过程中,AI小快遇到了以下几方面的挑战,团队通过技术攻关找到了合适的解决方案。
AI小快是一个开放领域的服务,又在视频评论区落地,用户会很自然地提问关于视频内容的问题,这就要求它具备突出的多模态内容理解能力。借助「快意」多模态大模型提供的
AI小快的核心定位是情感陪伴机器人,因此必须在人文关怀上表现优秀——既要"有趣",更要"有温度"。基于这一目标,「快意」大模型团队通过收集和构建大量的人物卡片信息,包括外在的年龄性别等特征,以及内在的人格特征等,在「快意」大模型上
常见的对话训练语料,对话轮次通常在10次左右,很难直接用来训练AI小快使其具备超长轮次的对话能力。为此,「快意」大模型团队额外引入了
在快手App的场景下,AI小快承载了用户的多种工具类需求——短视频推荐、时间查询、画图特效调用、新闻获取、知识问答等。这些工具或能力,本身并非「快意」大模型天然具备的。为了满足用户需求,「快意」大模型团队在微调「快意」大模型的基础上,
得益于快手公司在内容、场景、基建等方面的优势,以及对大模型研发的大力投入,「快意」大模型以较短的周期顺利完成了从13B到175B的规模提升和能力升级,同时也在AI小快等多个应用场景中验证了业务价值,打开了大模型落地应用的新局面。未来,「快意」大模型团队将持续围绕大模型技术创新、应用创新等方面继续攻关迭代,推动「快意」大模型走向新的高度。
文章来源:快手大模型与多媒体技术部
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
WorkBuddy微信版怎么获得积分?
车载冰箱重置到出厂设置几步?
短剧《史上最强洪荒修为》剧情介绍
TRUMP价格走势与WEPE预售进展解析
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
腾讯ima知识库怎么分类管理?
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
短剧《仙人跳获透视,古玩玉器我全拿捏》剧情介绍
Windy卫星云图怎么看?云层变化识别技巧
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc