LoongForge 龙锻
百度智能云百舸团队开源的高性能训练框架,面向 LLM、VLM、扩散模型与具身模型,兼容 NVIDIA GPU 与昆仑 XPU,支持预训练、中训、SFT 与 LoRA,生产环境已验证 5000+ 加速卡规模。
爱鲜报评分
0 人评分
641
星数
是
中文
Python
主语言
是
活跃
36
贡献者
人工分析
EDITORIAL推荐理由
由百度百舸团队从企业级训练套件 AIAK-Training-LLM 开源而来,工程成熟度和生产验证度都较高。采用 Megatron 与 torch-native 双后端架构,覆盖语言、多模态、扩散与具身模型全谱系,并提供开箱即用的配置与启动示例。对需要在大规模集群上做训练加速、又不想从零调优并行策略的团队来说,是一个值得评估的国产方案。
适用场景
- 大语言模型预训练与继续预训练
- 多模态 VLM 与扩散模型微调
- 具身智能 VLA / WAM 模型训练
- LoRA 等参数高效微调
- 国产昆仑 XPU 集群训练适配
- MoE 专家并行负载均衡优化
优点
- 双后端架构,LLM/VLM/扩散与具身模型各有针对性优化
- 提供各模型可直接运行的配置与启动脚本,上手成本低
- 训练加速明显,官方称具身模型最高 4.38 倍吞吐提升且 loss 对齐
- 生产环境验证充分,支持 5000+ 加速卡规模训练
- 同时支持 NVIDIA GPU 与昆仑 XPU,国产硬件适配友好
- Apache-2.0 协议,社区活跃,有中文文档与微信群
缺点
- 依赖 Megatron-LM 等重型组件,环境搭建与版本匹配较繁琐
- 面向大规模分布式训练,单卡或小规模场景收益有限
- 部分新模型支持仍在快速迭代,文档与示例可能滞后
- 需要一定的分布式训练与并行策略经验才能调优
LoongForge 龙锻是什么
LoongForge 是由百度智能云百舸团队开源的高性能训练框架,目标是为主流大语言模型(LLM)、视觉语言模型(VLM)、扩散模型以及具身模型提供更快的训练能力。它同时支持 NVIDIA GPU 与昆仑 XPU,并覆盖预训练、继续预训练、SFT 与 LoRA 等完整训练阶段。
该框架源自企业级训练套件 AIAK-Training-LLM,已在生产环境中服务客户自有模型训练,单次运行规模可达 5000+ 加速卡。
架构设计
由于不同模型族与参数规模的最优训练策略差异很大,LoongForge 采用多后端架构:
- Megatron 栈:面向 LLM、VLM 与扩散模型,基于打过补丁的 Megatron-LM,扩展了 MoE 并行、按组件异构并行、长序列优化等能力。
- Torch-Native 栈:面向具身模型(VLA 与 WAM),是一个独立的 torch 原生子系统,支持 DDP / ZeRO-1 / FSDP / HSDP,并针对代表性模型在 I/O、通信策略、算子效率等方面做了深度优化。
主要特性
- 易用:为每个支持的模型提供可直接运行的配置与启动示例,覆盖预训练、继续预训练、SFT、LoRA。
- 高性能:多后端 + 深度训练加速优化,同时保持训练 loss 与基线对齐。
- 生产验证:来自真实企业训练场景,支持超大规模集群。
官方给出的示例中,具身模型 DreamZero 达到基线 4.38 倍的吞吐,且 loss 曲线保持一致。
支持的模型
框架持续跟进主流与前沿模型,包括但不限于:
- 语言与多模态:DeepSeek-V4 系列、GLM-5.x 系列、Kimi-K3、Qwen 系列、MiniCPM-V 等
- 扩散与图像:Wan 2.2、Qwen-Image-Edit 等
- 具身模型:Pi0.5、GR00T-N1.6/N1.7、xVLA、FastWAM、DreamZero、Cosmos3 等
快速开始
仓库提供了统一的预构建 Docker 镜像,各模型族(LLM / VLM / VLA / Diffusion)共用同一镜像,降低了环境准备成本。典型流程为:
- 拉取官方 Docker 镜像并启动容器;
- 在
configs/models/中选择对应模型的配置; - 参考
examples/下的启动脚本,按需修改数据路径与并行参数后提交训练任务。
具体命令与参数请以仓库文档和示例脚本为准。
适用建议
LoongForge 更适合具备分布式训练经验、需要在多卡或多机集群上训练大模型的团队。如果只是单卡跑小模型微调,收益可能有限;而如果需要在国产 XPU 上落地训练,或希望直接复用经过生产验证的并行与加速策略,这个项目值得重点评估。
评论
- 暂无评论,来写第一条吧。