烽火望长安火烧弓阵容如何搭配-烽火望长安火烧弓阵容推荐搭配
2026-07-24 3421609
2026-07-24 0
多模态大语言模型正在成为新一代 AI 的地基,但它的训练系统却被一个老问题卡了很久——算得快的,显存撑不住;显存省着的,速度又掉下去。小红书 dots infra 团队把这个两难叫做多模态流水训练的帕累托前沿,而现在他们把这个前沿撕开了一道口子。7月22日,团队正式开源了名为 BigMac 的流水并行训练新范式,专门针对原生多模态场景,开源地址已挂在 GitHub 的 Dots-Infra 之下。
多模态模型从来不是一块规整的 transformer。一个典型的 MLLM 由三块拼成:把图像、音频转成 embedding 的模态编码器,在其上做推理的 LLM 主干,以及把 LLM 输出映射回图像、语音等目标模态的生成器。这三块形态差异巨大,把它们塞进同一条流水线,麻烦就来了。

从能设计 schedule 到真正训得起来,中间还隔着系统集成、接口定义和性能排查这一整套工程关卡,BigMac 正是冲着这些环节去的。它给了三件东西。第一是把全局 schedule 摆到明面上:运行时的 Scheduler 会生成一张覆盖所有 pipeline rank、microbatch 和模块类型的全局 operator 表,Executor 再把它拆成每个 rank 上的本地序列,分发给 Megatron Core 等 LLM 后端、模态 runtime 和通信后端。调度策略从此可见、可检查,又对后端友好。
第二是对算法工程师无感的流水并行接口:工程师只需描述每个模块生产什么、消费什么,剩下的 stage 划分、activation 与 gradient 交接、跨设备通信全由 BigMac 在底层料理,让一个在单卡上验证过的多模态实验,能更自然地扩展到流水并行。第三是一套理解 schedule 结构的 profiler、simulator 和可视化工具链,把一次训练迭代拆回 operator 级别,看清每个 rank 在每个时间点究竟在算什么、在哪里空转、哪条依赖卡住了后续;simulator 还能在花大钱启动训练前,先试不同的 PP 配置和 microbatch 组合,预估对空泡和吞吐的影响。
效果在两类代表性负载上得到了验证。MLLM-Understanding 用 Qwen3-30B-A3B 当主干、配一个1.3B 的 ViT 编码器,相比计算高效基线 Optimus,BigMac 提速1.08到1.1倍,相比显存高效基线 Megatron-DistTrain 提速1.6到1.9倍;更关键的是显存,随着 per-GPU batch size 增大,BigMac 的峰值显存保持平稳,而 Optimus 因为要保留编码器激活,显存一路飙升并最终在更大 batch 下直接 OOM。MLLM-Generation 更复杂,加上了一个20B 的 MMDiT 生成器,差异被放大:Optimus 在所有测试 batch size 上全部 OOM,BigMac 则靠及时跑 generator backward、快速释放生成器侧激活躲过了这一劫,相比 Megatron-DistTrain 仍取得1.5到1.9倍加速,显存依旧稳定。这正是嵌套流水线最值钱的场景——系统必须同时伺候编码器和生成器的依赖,又没法承受大量激活驻留或严重空泡。
目前,BigMac 已经作为 dots 多模态模型训练的核心组件之一,跑在了小红书的生产环境里。相关论文 BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training 已挂在 arXiv 上,团队也同步放出了交互式 PP Profiler 的 trace 示例。对正在被多模态训练显存与速度两头夹击的研究者和工程师来说,这份带着生产验证的开源,或许能省下不少重新造轮子的时间。