来源:互联网 更新时间:2026-08-25 14:35
腾讯最近开源了一款向量模型,名为Conan-embedding,直接拿下了CMTEB(中文大规模文本嵌入基准)排行榜的第一名。嵌入模型作为RAG和Agent的关键组件,竞争早已白热化——谁能让向量更精准地理解语义,谁就能在检索和生成中占据先机。
这篇论文的标题是《Conan-embedding: General Text Embedding with More and Better Negative Samples》。核心思路很直接:对比学习中负样本的质量和数量至关重要,但以往的做法往往把负样本挖掘当成一个预处理步骤,一旦挖好就固定不动了。Conan-embedding针对这个问题给出了两个新解法——动态硬负样本挖掘和跨GPU批次平衡损失(CBB Loss),同时还发现用LLM生成的提示-响应对也能用来训练嵌入模型,让模型对文本的理解更聪明。
模型已经开源,地址在Hugging Face上(https://huggingface.co/TencentBAC/Conan-embedding-v1),可以直接拿去用。
传统做法是在训练前选好一堆难负例,然后丢进模型里。但问题在于,模型在训练过程中会不断进步,原先那些“难”的负例可能很快就不难了。Conan-embedding的做法是在训练中每100步检查一次:如果某个负例的分数乘上1.15仍然小于初始分数,并且绝对值小于0.8,说明这个负例已经不够困难,那就用新的难负例把它替换掉。这样模型在整个训练过程中都能持续面对有挑战性的样本,效果自然更好。

对比学习有个潜在需求:负样本越多越好。但GPU显存是硬约束,单卡能放的批次大小有限。Conan-embedding的思路是把多个GPU上的负样本“拼”到一起——利用跨GPU通信,让每张卡都能看到其他卡上的样本,从而突破单卡显存的限制。同时,它还通过一种平衡策略来协调不同任务之间的批次大小,避免某些任务因为样本数量悬殊而影响整体训练效果。这个方法简单直接,但非常实用。

除此之外,论文还提到一个有趣的发现:用LLM生成的prompt-response对来训练嵌入模型,可以让模型更好地理解指令和回答之间的关系。这相当于给模型补充了一类天然的高质量正负样本,尤其是在语义匹配任务上效果显著。
在CMTEB的六个任务上,Conan-embedding全面超越了此前所有模型。消融实验也证实了动态硬负样本挖掘和CBB Loss各自都贡献了显著的提升。整体来看,这套方案在工程和算法层面都做得非常扎实,值得关注。

腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
WorkBuddy微信版怎么获得积分?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
短剧《史上最强洪荒修为》剧情介绍
海尔消毒柜自动消毒如何中止
5000元起的鼠标哪个最值得入手?
男生高性价比充电头?
博世壁挂炉关闭暖气怎么操作
腾讯ima知识库怎么分类管理?
车载冰箱重置到出厂设置几步?
Windy卫星云图怎么看?云层变化识别技巧
5000-6000元鼠标有什么推荐?
管线机怎么接云米净水器
笔记本移动电源推荐哪款?
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc