热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >Nanbeige4.2-3B - 南北阁实验室推出的通用Agent小模型

Nanbeige4.2-3B - 南北阁实验室推出的通用Agent小模型

来源:互联网 更新时间:2026-07-27 14:26

Nanbeige4.2-3B是什么

先说几个关键点:Nanbeige4.2-3B是BOSS直聘南北阁实验室推出的一款通用Agent小模型。别看它只有3B参数,在代码智能体、办公工作流、复杂工具调用这类Agent任务上,它直接超越了Qwen3.5-9B和Gemma4-12B这样的大模型。

这背后靠的是Looped Transformer架构,用来提升有效容量。同时,团队还构建了一套代码、工具、办公三类Agent数据的闭环合成管线,配合三阶段课程SFT和多阶段RL训练。最终结果就是:推理成本降下来了,但Agent能力依然很强。目前模型已经开源,并且适配了多种推理引擎。

Nanbeige4.2-3B的主要功能

  • 代码智能体

    :能在真实代码仓库里浏览、定位问题、完成修改并运行验证,覆盖软件工程全流程。
  • 办公智能体

    :能处理文档、表格、幻灯片、PDF等跨格式文件,支持多文件依赖和长流程办公工作流。
  • 复杂工具调用

    :支持MCP在线服务、本地Python工具及虚拟工具的链式调用与参数推断。
  • 通用推理

    :覆盖数学、代码与科学推理,在GPQA Diamond、HMMT等评测上,拿下了同规模最佳成绩。
  • 本地个人助手

    :具备多轮规划、文件处理与错误恢复能力,可以低门槛部署为本地Agent助手。

Nanbeige4.2-3B的技术原理

为什么能做到这一点?核心在于几个关键设计:

  • Looped Transformer架构

    :模型的隐藏状态在通过全部Transformer层后,会再次回送到同一组层进行第二遍计算。这意味着在不增加参数量的前提下,有效计算深度提升了。实验证明,循环两遍在效果与稳定性之间能取得最佳平衡,而且不共享KV Cache,以效果优先。
  • 预训练数据上采样

    :语料从23T扩展到了28T tokens,对数学、代码和合成QA数据采取了激进的上采样策略。这让小模型在推理和知识评测上,全面领先同规模基座。
  • Agent数据闭环合成

    :针对代码智能体,构建了“训练—失败分析—数据补充”的飞轮;针对工具调用,设计了真实MCP、本地Python与虚拟工具三类环境,并随模型能力演化而调整难度;针对办公智能体,则建立了素材聚类、任务生成、产出回收的闭环反馈。
  • 三阶段课程SFT

    :按64K→128K→256K逐步提升Agent数据占比。对错误轮次设置Loss Mask,保留错误上下文但不学习错误动作,让模型学会在真实错误历史上修正任务。
  • 多阶段RL配方

    :先通过Think/Non-Think两阶段RLHF稳定生成质量;再进行带长度控制的Reasoning RL,减少简单问题上的无效Token;最后结合Outcome Reward与Action-Centric Rubric进行Agentic RL,选择轨迹较短且已有成功率的任务进行训练,提升稳定性。

如何使用Nanbeige4.2-3B

  • 获取模型权重

    :从Hugging Face下载Agent模型(Nanbeige4.2-3B)或Base模型(Nanbeige4.2-3B-Base)的权重文件。
  • 选择推理引擎

    :用已适配的Transformers、SGLang、vLLM、llama.cpp或Ollama等引擎加载模型。3B参数对硬件要求很低,适合本地PC或边缘设备部署。
  • 切换推理模式

    :根据任务复杂度选择思考模式(Think)进行深度推理,或选择非思考模式(Non-Think)进行快速响应,两种模式可以灵活切换。
  • 接入Agent框架

    :将模型接入OpenClaw等Agent框架,配置外部工具和Scaffold,就可以执行多步代码、办公或研究任务。

Nanbeige4.2-3B的核心优势

  • 小参数大能力

    :3B参数在Agent任务上稳定超越9B/12B级模型,大幅降低高频调用场景的推理成本。
  • 架构创新

    :Looped Transformer在固定参数下压榨出有效容量,相比标准Transformer获得了约75%的token efficiency收益。
  • 数据飞轮

    :三类Agent数据都构建了闭环反馈与难度演化机制,训练数据随模型能力同步提升,而不是停滞不前。
  • 训练精细

    :SFT错误掩码保留错误上下文但不学习错误动作,RL多阶段配方兼顾了准确率提升与输出长度下降。
  • 低门槛部署

    :已适配主流推理引擎,支持Think/Non-Think双模式,适合本地部署与成本敏感场景。

Nanbeige4.2-3B的项目地址

  • HuggingFace模型库

    • https://huggingface.co/Nanbeige/Nanbeige4.2-3B
    • https://huggingface.co/Nanbeige/Nanbeige4.2-3B-Base
  • 技术论文

    :https://huggingface.co/Nanbeige/Nanbeige4.2-3B/blob/main/Nanbeige42_report.pdf

Nanbeige4.2-3B的同类竞品对比

对比维度 Nanbeige4.2-3B Qwen3.5-4B
非Embedding参数量 3B 4B
General Agent(PinchBench-V2) 74.7 63.9
Code Agent(SWE-Bench Verified) 63.6 38.8
办公任务(GDPval) 68.8 37.0
推理能力(GPQA) 53.3 43.1
架构特色 Looped Transformer 标准Transformer
部署门槛 更低,适配多引擎 标准部署

Nanbeige4.2-3B的应用场景

  • 本地代码开发

    :在开发者本地环境执行代码仓库浏览、Bug修复、补丁验证等软件工程任务。
  • 办公工作流自动化

    :自动处理跨格式文档、表格与幻灯片,完成数据整理、报告生成及格式转换。
  • 智能工具编排服务

    :通过MCP协议调用在线服务与本地工具,实现信息检索、数据分析与多步骤任务编排。
  • 边缘设备个人助手

    :部署在PC或NAS等本地设备,作为低延迟、隐私可控的通用Agent助手。
  • 高频Agent系统核心引擎

    :在需要数十到上百次模型调用的复杂Agent系统中,替代大模型,显著降低运营成本。

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc