Prhub

THUDM/slime

slime is an LLM post-training framework for RL Scaling.

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-05-06

#1882 fix ppo value offload bugs

原始 PR · 作者 lilei199908 · 合并时间 2026-05-06 12:39

缺陷修复 重要性 7.64 洞察度 6.00

修复PPO使用critic时的offload训练bug

建议精读。本PR修复了PPO多角色offload训练中的关键状态管理问题,展示了异步训练中actor与rollout引擎连接维护的典型解决方案:sleep前断开、wake后重建。design_pattern值得参考,特别是disconnect/connect的显式化。另外参数强制绑定的策略也值得讨论——究竟是缺陷修复还是约束收紧,不同团队可能有不同偏好。

缺陷修复 重要性 4.89 洞察度 3.00

修复 offload_train 时 checkpoint 保存崩溃问题

建议阅读本 PR 以了解 offload 训练中 checkpoint 保存的生命周期管理。设计上使用统一封装(`wake_up`/`sleep`)管理进程组和显存状态是良好实践,值得在其他类似场景复用。

2026-04-30
功能 重要性 5.53 洞察度 3.00

更新 Megatron-Bridge 并新增 Qwen3.6 测试

建议关注 Bridge 版本切换后的集成测试结果,并验证 Qwen3.6 模型的训练收敛性。该 PR 的测试文件可作为模板,供开发者快速编写新模型的 PD Mooncake 测试。

#1874 [docker] upgrade sglang to v0.5.10.post1

原始 PR · 作者 zhuzilin · 合并时间 2026-04-30 14:53

功能 重要性 8.59 洞察度 6.00

升级 sglang 至 v0.5.10.post1,新增 PD Mooncake 测试与 HF 配置修补

建议重点关注 `megatron_bridge_utils.py` 的新增函数,它们简化了模型加载配置;验证 PD Mooncake 测试的稳定性;升级后建议进行回归测试覆盖现有模型。

2026-04-29

#1878 fix ppo value head load bugs

原始 PR · 作者 lilei199908 · 合并时间 2026-04-29 15:35

缺陷修复 重要性 8.35 洞察度 6.00

修复 PPO 价值头权重加载 bug

建议精读本 PR:它修复了 PPO 训练流程中一个关键的隐蔽 bug,涉及模型 checkpoint 加载、动态结构检测与自动修复的设计模式。同时需关注 Copilot 提出的性能优化和测试覆盖建议,建议在后续迭代中补充。

2026-04-28

#1867 [docker] upgrade megatron to 1dcf0dafa

原始 PR · 作者 zhuzilin · 合并时间 2026-04-28 14:07

基础设施 重要性 8.10 洞察度 5.00

升级 Megatron 依赖至 1dcf0dafa,适配 API 变更

建议关注 `model_provider.py` 中的新 `get_model_provider_func` 设计,它解耦了模型提供和 freeze 包装,使调用更简洁。同时,`wrap_model_provider_with_freeze` 的 `**kwargs` 改造值得学习,可提高对上游签名变化的适应性。此外,确认所有使用 `wrap_model_provider_with_freeze` 的地方均已替换为新入口。

缺陷修复 重要性 5.69 洞察度 5.00

移除分布式POST的线程池瓶颈,直接await Ray ObjectRef

该 PR 虽改动极小,但值得所有使用分布式 POST 的团队关注。建议精读以理解 asyncio 与 Ray 集成的正确用法,并可作为后续异步化其他阻塞调用的参考。

参与讨论