热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >BigMac:小红书开源的多模态流水并行大模型训练工具

BigMac:小红书开源的多模态流水并行大模型训练工具

来源:互联网 更新时间:2026-07-27 12:37

一、BigMac是什么

说起来,BigMac 这个名字,其实是小红书内部基础设施团队 Dots-Infra 最近开源的一个

多模态大模型专用流水并行训练工具套件

。它基于 Megatron-Core 框架做了二次开发,采用 MIT 开源协议发布,算是给业界送来了一份相当实用的礼物。

传统多模态大模型训练里,一直有个让人头疼的固有矛盾——算力吞吐和显存占用,这两者就像鱼和熊掌,没法同时优化,形成了一个经典的帕累托权衡关系。你提升了训练速度,显存开销就跟着暴涨;你想压缩显存占用,流水线里又会出现大量空泡,训练效率直线下降。

BigMac 这次提出的

依赖安全嵌套流水线

核心调度算法,算是找到了一个突破口。它能在不破坏模型计算依赖、不新增流水线空闲空泡的前提下,把视觉编码器、图像生成模块这些组件,巧妙地嵌入到大语言模型的流水线执行链路里。这样一来,多模态训练中显存与算力的权衡边界就被打破了。更贴心的是,它配套了调度、执行、仿真三大完整工具链,支持仿真调试、可视化排程,以及大规模分布式训练落地。目前,这套方案已经在小红书内部的多模态大模型生产训练任务中全面落地,效果相当不错。

四、应用场景

那么,BigMac 到底能用在哪些地方?我们来看看几个典型场景:

  1. 企业多模态大模型大规模预训练


    图文、视频多模态LLM的长周期预训练场景,是它的主战场。它专门解决多卡分布式训练中显存不足、吞吐低下的问题,非常适合互联网企业自研多模态大模型的生产训练。

  2. 多模态模型微调任务


    图文对话、视觉问答VL微调、文生图大模型微调,这些任务在小批量迭代的场景下,BigMac能稳定控制显存占用,并且有效提升微调速度。

  3. 并行策略研发与调优


    算法工程师和分布式训练研发人员,可以利用它进行离线仿真,快速对比各类流水并行方案,迭代出最优的PP/VPP分段策略,从而节省宝贵的GPU测试资源。

  4. 高校实验室大模型训练教学


    它的轻量化仿真工具可以直观展示流水线并行的运行逻辑,非常适合作为分布式AI训练课程的实验演示材料。

  5. 显存受限集群低成本训练


    对于那些GPU显存规格较低的老旧算力集群,使用BigMac可以在不升级硬件的前提下,提升多模态模型训练的批次大小与整体吞吐。

五、使用方法

5.1 环境安装

第一步,先把项目仓库克隆下来:

git clone https://github.com/Dots-Infra/BigMac.git
cd BigMac

然后,以本地可编辑模式安装依赖:

pip install -e .

5.2 基础功能使用流程

安装完成后,你可以按以下步骤快速上手:

  1. 流水线可视化调试


    运行调度可视化Demo,自定义并行参数,系统会自动导出流水线排布图表,帮你验证分段逻辑是否合理。

  2. 离线并行性能仿真


    调用 pp_simulator 模块,输入模型和硬件参数,就能生成多套并行方案的量化对比报告,方便你筛选出最优策略。

  3. 多模态模型分布式训练


    参考 examples 目录下的内置示例,加载 Qwen3 / Qwen3-VL 模型配置,并对接 Megatron 分布式训练启动脚本,就可以执行大规模多卡训练。

  4. 性能瓶颈分析


    开启训练轨迹日志导出,然后使用内置的剖面工具解析算子耗时、显存峰值,精准定位训练性能的短板。

5.3 快速验证示例

仓库里内置了开箱即用的 Qwen3 纯文本、Qwen3-VL 多模态最小训练样例。这些样例在单卡上就能运行,用来测试调度逻辑,完全不需要多机分布式集群,对新手非常友好。

六、竞品对比

为了让大伙儿看得更清楚,我们把 BigMac 和行业主流的几个多模态分布式训练框架——Megatron-LM、DeepSpeed-MII 和 Colossal-AI——放在一起做个核心维度对比:

对比维度 BigMac Megatron-LM DeepSpeed-MII
核心定位 多模态专用嵌套流水并行工具 通用LLM基础流水并行框架 通用大模型混合精度/ZeRO优化套件
显存优化方案 嵌套流水线,模态激活O(1)显存 基础PP流水,多模态显存开销高 ZeRO系列参数优化,无法优化模态激活缓存
流水线空泡控制 无新增空泡,算力利用率不变 多模态穿插训练产生大量空泡 不优化流水线时序,仅优化参数存储
配套仿真可视化工具 内置调度仿真+可视化面板 无原生仿真工具,需自行开发 仅提供性能日志,无流水线可视化
多模态适配友好度 原生适配Qwen-VL,专门优化图文模型 仅基础文本LLM,多模态改造工作量大 适配多模态,但无流水线专属优化
底层依赖 Megatron-Core 原生Megatron PyTorch原生训练链路

BigMac(图3)

七、常见问题解答

下面整理了几个大家最常问到的问题,直接给出答案:

Q:BigMac是否支持除Qwen以外的其他多模态大模型?

A:支持的。BigMac基于Megatron-Core标准抽象层开发,只要模型能基于Megatron框架完成封装,就可以接入BigMac的嵌套调度逻辑。你只需要花少量代码适配一下视觉编码器的张量流转逻辑即可。

Q:使用BigMac训练是否必须多机多卡分布式集群?

A:不需要。调度仿真模块和可视化Demo在单机CPU上就能运行;最小训练样例也支持单GPU本地测试。只有大规模预训练任务才需要多卡分布式环境。

Q:BigMac相比原生Megatron训练速度提升幅度是多少?

A:根据官方论文的实验数据,在同等硬件条件下,多模态训练吞吐较传统PP基线提升了1.08~1.9倍,显存峰值显著下降,模型全局批次也可以进一步放大。

Q:BigMac开源协议是什么,是否可商用?

A:项目采用MIT开源协议,允许企业商用、二次修改,甚至闭源商业化改造,没有强制开源约束,只需保留原始版权声明。

Q:仿真器模块能否替代真实集群训练测试?

A:不能完全替代。仿真器主要用于快速筛选并行策略、预估理论吞吐与显存峰值。真实分布式集群存在NCCL通信、硬件损耗等变量,最终性能还是要在真实GPU集群上验证。

Q:BigMac能否和ZeRO、张量并行TP、数据并行DP组合使用?

A:可以。嵌套流水线PP调度可以与ZeRO优化、张量并行TP、数据并行DP、虚拟并行VPP无缝叠加,兼容Megatron的全部主流并行策略。

八、相关链接

  1. GitHub开源仓库:https://github.com/Dots-Infra/BigMac/

  2. BigMac配套学术论文arXiv地址:https://arxiv.org/abs/2605.25451

  3. 官方博客:https://dots-infra.github.io/BigMac/

九、总结

最后做个总结。BigMac作为小红书Dots-Infra团队推出的多模态大模型流水并行专用开源工具,它的核心价值在于用原创的嵌套流水线调度算法,解决了行业长期存在的显存与算力权衡难题。它整合了调度、执行、离线仿真三大一体化工具链,基于成熟的Megatron-Core框架,大大降低了开发适配成本。原生适配主流Qwen多模态模型,兼顾了离线并行方案预调优和企业级大规模分布式训练落地的需求。可以说,它为科研机构和AI企业提供了一套低成本、高效率的多模态大模型分布式训练完整工程解决方案。

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc