slime — GLM 系列模型背后的开源 RL 后训练框架

slime — GLM 系列模型背后的开源 RL 后训练框架

slime — GLM 系列模型背后的开源 RL 后训练框架 截图

简介

slime 是由智谱 AI 旗下 THUDM 团队开发的开源 LLM 后训练强化学习框架,是 GLM 系列模型(GLM-4.5 到 GLM-5.2)背后使用的 RL 训练基础设施。slime 的设计核心是将 Megatron 训练引擎与 SGLang 推理框架无缝连接,使训练、推理、数据生成、奖励计算和环境交互同享一条管线。

slime 的关键理念是「不要把系统变成一堆独立的训练器、推理服务和 Agent 框架的沉重堆叠」——所有组件通过统一的训练/推理/数据缓冲区路径协作,保持系统的简洁性和可扩展性。

核心特性

  • 前沿模型验证:slime 是 GLM-5.2、GLM-5.1、GLM-5、GLM-4.7、GLM-4.6、GLM-4.5 等 SOTA 级模型背后的 RL 训练框架,经过完整训练循环的充分验证。
  • Megatron + SGLang 原生集成:直接透传 Megatron 参数,SGLang 参数以 --sglang- 前缀暴露,上游训练和推理优化无需额外包装层。
  • BF16 训练 + FP8 推理:大 MoE 模型使用 Megatron BF16 训练 + SGLang FP8 推理,支持 FP8 KV Cache 以增加有效缓存容量。
  • Agent 工作流作为数据生成:工具调用、沙箱交互、验证器奖励、多 Agent 循环等均可接入同一训练管线。
  • 灵活的 Agentic RL:支持 Agentic 强化学习训练,代码生成与验证奖励,以及长链推理场景。

适用场景

  • LLM 后训练:对预训练模型进行 RL 对齐训练。
  • Agentic RL 研究:探索工具调用、多步推理的强化学习训练。
  • 模型微调与压缩:利用 FP8 推理和 BF16 训练的组合降低资源需求。
滚动至顶部