热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >VibeThinker-3B - 微博开源的 30 亿参数密集推理模型

VibeThinker-3B - 微博开源的 30 亿参数密集推理模型

来源:互联网 更新时间:2026-06-30 15:47

VibeThinker-3B是什么

新浪微博团队最近放出了一个有点意思的东西——VibeThinker-3B,一个仅30亿参数的密集推理模型。它基于Qwen2.5-Coder-3B构建,但核心看点在于其全新的Spectrum-to-Signal后训练流程。结果呢?在数学、编程这类可验证推理任务上,这个小家伙居然能和Gemini 3 Pro、Claude Opus 4.5这些动辄千亿参数的大家伙掰手腕。说白了,这就是一次关于“小模型能力天花板”的极致探索,顺便也给传统的Scaling Law提供了另一条思路。

VibeThinker-3B的主要功能

别看它体型小,手里握着的硬实力可不少:

  • 高难度数学推理

    :在AIME’26上拿下了94.3分,HMMT’25达到89.3分,BruMO’25也有93.8分。这个成绩放到任何一场数学竞赛里都足够亮眼。
  • 竞技编程

    :LiveCodeBench v6上的Pass@1达到了80.2,LeetCode最新周赛/双周赛的通过率更是高达96.1%。刷题利器没跑了。
  • STEM推理

    :在IMO-AnswerBench上得分76.4,如果配合CLR策略还能进一步提升到80.6。复杂科学问题的求解也难不倒它。
  • 指令遵循

    :IFBench得分74.5,说明它对格式敏感和约束检查的能力同样在线。
  • 测试时缩放(CLR)

    :引入了一种叫Claim-Level可靠性评估策略,简单说就是在推理阶段还能再给答案的准确率加一道保险。

VibeThinker-3B的技术原理

性能从哪来?并不是改了基座模型本身,而是后训练技术栈做到了极致。来拆开看看:

  • 基座模型

    :基于Qwen2.5-Coder-3B,30亿参数的密集架构完全保留,所有提升都来自训练流程的优化。
  • Spectrum-to-Signal 范式

    :名字听着玄乎,但核心逻辑很清晰——先通过SFT阶段把能力覆盖面“扩”出来(这叫频谱阶段),再通过RLVR阶段在可验证任务上“精准打磨”(这叫信号阶段)。
  • 两阶段课程SFT

    :第一阶段广泛覆盖数学、编程、STEM和对话能力,到了第二阶段就专攻高难度长推理样本。层层递进,不走弯路。
  • 多样性探索蒸馏

    :不再追求“唯一最优解”那条窄路,而是保留多条有效的推理路径。这让模型在面对复杂问题时泛化能力更强。
  • MGPO强化学习

    :在GRPO基础上加了额外权重,专门挑那些对当前策略来说“既不太容易也不太困难”的样本来优化,训练效率自然更高。
  • 多领域顺序RL

    :严格按照Math → Code → STEM的顺序进行强化学习。别小看这个顺序,实验证明它就是最优解。

如何使用VibeThinker-3B

上手的路径非常直接,门槛也不高:

  • 下载模型

    :去HuggingFace或GitHub仓库把模型权重拉下来就行。
  • 本地部署

    :基于transformers等框架加载这个3B参数模型,消费级硬件跑起来完全无压力。
  • 调用推理

    :直接输入数学、编程或STEM类问题,模型会输出带完整推理链(CoT)的答案。
  • 启用CLR(可选)

    :如果是数学类任务,建议开启Claim-Level可靠性评估,准确率还能再上一个台阶。

VibeThinker-3B的核心优势

  • 极小参数,前沿性能

    :3B参数对标千亿级模型,这本身就是一句很有分量的话。
  • 课程式两阶段SFT

    :从广泛覆盖到高难度特训,层层深入,效果立竿见影。
  • 多领域RL强化

    :按Math → Code → STEM的顺序依次强化,而且保留了完整的64K长上下文推理轨迹。
  • 离线自蒸馏

    :筛选高质量轨迹进行统一蒸馏,重点学习学生模型尚未掌握的那些正确路径。

VibeThinker-3B的项目地址

  • GitHub仓库

    :https://github.com/WeiboAI/VibeThinker
  • HuggingFace模型库

    :https://huggingface.co/WeiboAI/VibeThinker-3B
  • arXiv技术论文

    :https://arxiv.org/pdf/2606.16140

VibeThinker-3B的同类竞品对比

拿它和Claude Opus 4.5放在一起看,差异相当直观:

维度VibeThinker-3BClaude Opus 4.5 开发方新浪微博 AI 团队 vs Anthropic
参数规模3B(密集模型) vs 未公开(推测数百B~千亿级)
开源程度完全开源(论文+代码+权重) vs 闭源(仅API/产品)
部署方式本地消费级GPU可运行 vs 仅云端API
定位可验证推理专用引擎 vs 通用智能助手

VibeThinker-3B的应用场景

从学术竞赛到边缘设备,它的落地场景其实比想象中更广:

  • 算法竞赛备赛

    :辅助解答AIME、HMMT、IMO等数学竞赛题目,还能提供多路径推理作为参考。
  • 编程面试训练

    :刷LeetCode、LiveCodeBench这些编程题库时,它能给出带详细解释的正确解法。
  • STEM教育辅导

    :物理、化学、生物等理科问题的逐步推导,它都能搞定。
  • 边缘端推理部署

    :因为只有3B参数,手机、IoT设备这种低算力环境也能跑得很顺畅。
  • 推理能力研究

    :作为小模型推理上限的探索基准,为学术界研究Scaling Law的替代路径提供了很好的参考。

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc