核心特性
- **前沿模型验证:**slime 是 GLM-5.2、GLM-5.1、GLM-5、GLM-4.7、GLM-4.6、GLM-4.5 等 SOTA 级模型背后的 RL 训练框架,经过完整训练循环的充分验证。
- **Megatron + SGLang 原生集成:**直接透传 Megatron 参数,SGLang 参数以 --sglang- 前缀暴露,上游训练和推理优化无需额外包装层。
- **BF16 训练 + FP8 推理:**大 MoE 模型使用 Megatron BF16 训练 + SGLang FP8 推理,支持 FP8 KV Cache 以增加有效缓存容量。
- **Agent 工作流作为数据生成:**工具调用、沙箱交互、验证器奖励、多 Agent 循环等均可接入同一训练管线。
- **灵活的 Agentic RL:**支持 Agentic 强化学习训练,代码生成与验证奖励,以及长链推理场景。