您的位置:首页 > > 教程攻略 > ai资讯 >VibeThinker-3B - 微博开源的 30 亿参数密集推理模型
VibeThinker-3B - 微博开源的 30 亿参数密集推理模型
来源:互联网
更新时间:2026-06-30 15:47
VibeThinker-3B是什么
新浪微博团队最近放出了一个有点意思的东西——VibeThinker-3B,一个仅30亿参数的密集推理模型。它基于Qwen2.5-Coder-3B构建,但核心看点在于其全新的Spectrum-to-Signal后训练流程。结果呢?在数学、编程这类可验证推理任务上,这个小家伙居然能和Gemini 3 Pro、Claude Opus 4.5这些动辄千亿参数的大家伙掰手腕。说白了,这就是一次关于“小模型能力天花板”的极致探索,顺便也给传统的Scaling Law提供了另一条思路。
VibeThinker-3B的主要功能
别看它体型小,手里握着的硬实力可不少:
- :在AIME’26上拿下了94.3分,HMMT’25达到89.3分,BruMO’25也有93.8分。这个成绩放到任何一场数学竞赛里都足够亮眼。
- :LiveCodeBench v6上的Pass@1达到了80.2,LeetCode最新周赛/双周赛的通过率更是高达96.1%。刷题利器没跑了。
- :在IMO-AnswerBench上得分76.4,如果配合CLR策略还能进一步提升到80.6。复杂科学问题的求解也难不倒它。
- :IFBench得分74.5,说明它对格式敏感和约束检查的能力同样在线。
- :引入了一种叫Claim-Level可靠性评估策略,简单说就是在推理阶段还能再给答案的准确率加一道保险。
VibeThinker-3B的技术原理
性能从哪来?并不是改了基座模型本身,而是后训练技术栈做到了极致。来拆开看看:
- :基于Qwen2.5-Coder-3B,30亿参数的密集架构完全保留,所有提升都来自训练流程的优化。
- :名字听着玄乎,但核心逻辑很清晰——先通过SFT阶段把能力覆盖面“扩”出来(这叫频谱阶段),再通过RLVR阶段在可验证任务上“精准打磨”(这叫信号阶段)。
- :第一阶段广泛覆盖数学、编程、STEM和对话能力,到了第二阶段就专攻高难度长推理样本。层层递进,不走弯路。
- :不再追求“唯一最优解”那条窄路,而是保留多条有效的推理路径。这让模型在面对复杂问题时泛化能力更强。
- :在GRPO基础上加了额外权重,专门挑那些对当前策略来说“既不太容易也不太困难”的样本来优化,训练效率自然更高。
- :严格按照Math → Code → STEM的顺序进行强化学习。别小看这个顺序,实验证明它就是最优解。
如何使用VibeThinker-3B
上手的路径非常直接,门槛也不高:
- :去HuggingFace或GitHub仓库把模型权重拉下来就行。
- :基于transformers等框架加载这个3B参数模型,消费级硬件跑起来完全无压力。
- :直接输入数学、编程或STEM类问题,模型会输出带完整推理链(CoT)的答案。
- :如果是数学类任务,建议开启Claim-Level可靠性评估,准确率还能再上一个台阶。
VibeThinker-3B的核心优势
- :3B参数对标千亿级模型,这本身就是一句很有分量的话。
- :从广泛覆盖到高难度特训,层层深入,效果立竿见影。
- :按Math → Code → STEM的顺序依次强化,而且保留了完整的64K长上下文推理轨迹。
- :筛选高质量轨迹进行统一蒸馏,重点学习学生模型尚未掌握的那些正确路径。
VibeThinker-3B的项目地址
- :https://github.com/WeiboAI/VibeThinker
- :https://huggingface.co/WeiboAI/VibeThinker-3B
- :https://arxiv.org/pdf/2606.16140
VibeThinker-3B的同类竞品对比
拿它和Claude Opus 4.5放在一起看,差异相当直观:
维度 | VibeThinker-3B | Claude Opus 4.5 |
开发方新浪微博 AI 团队 vs Anthropic
参数规模3B(密集模型) vs 未公开(推测数百B~千亿级)
开源程度完全开源(论文+代码+权重) vs 闭源(仅API/产品)
部署方式本地消费级GPU可运行 vs 仅云端API
定位可验证推理专用引擎 vs 通用智能助手
VibeThinker-3B的应用场景
从学术竞赛到边缘设备,它的落地场景其实比想象中更广:
- :辅助解答AIME、HMMT、IMO等数学竞赛题目,还能提供多路径推理作为参考。
- :刷LeetCode、LiveCodeBench这些编程题库时,它能给出带详细解释的正确解法。
- :物理、化学、生物等理科问题的逐步推导,它都能搞定。
- :因为只有3B参数,手机、IoT设备这种低算力环境也能跑得很顺畅。
- :作为小模型推理上限的探索基准,为学术界研究Scaling Law的替代路径提供了很好的参考。