修复 sglang v0.5.12 中 mooncake offload 的 deregister 逻辑
建议精读补丁文件中 `deregister_buffer_to_engine` 的改动,理解嵌套列表的处理方式。对于 mooncake offload 的维护者,可考虑后续统一规范 `state_data_ptrs` 的数据结构以避免类似问题。
slime is an LLM post-training framework for RL Scaling.
修复 sglang v0.5.12 中 mooncake offload 的 deregister 逻辑
建议精读补丁文件中 `deregister_buffer_to_engine` 的改动,理解嵌套列表的处理方式。对于 mooncake offload 的维护者,可考虑后续统一规范 `state_data_ptrs` 的数据结构以避免类似问题。
新增 raw mode 下 --save-hf 直接保存 HF 权重
建议阅读 hf_checkpoint_saver.py 中的 save_hf_model_direct 和 _SafetensorShardWriter 实现,这是典型的 Megatron → HF 权重重排和分片模式。如果团队有自定义 checkpoint 需求,可参考此设计。测试文件 test_hf_checkpoint_saver.py 也有助于理解预期行为。
新增 CI 检查 train_rollout_logprob_abs_diff
该 PR 变更极小且直观,无需精读。但可关注后续 CI 中该断言是否稳定,若频繁误报需调整阈值或检查根源。
原始 PR · 作者 hxy771126-design · 合并时间 2026-05-28 13:56
添加 FlashQLA 后端并跳过通信内存检查
值得精读,尤其是 `reloadable_process_group.py` 中基于 profiling 数据选择性跳过内存检查的设计决策,以及 `qwen_gdn_backend.py` 中严格的运行时校验模式。后续在添加新模型后端时可以参考此抽象。
修复默认 rollout_id 使用 sample.index 的问题
该 PR 修复了一个影响训练正确性的隐蔽 bug,值得精读。关注点在于 `_convert_samples_to_train_data` 中 `rollout_ids` 的生成逻辑变化,以及 `sample_indices` 与 `rollout_ids` 的分离设计。建议合入,并添加对应测试以覆盖 compact 路径。
修复轨迹合并逻辑,简化 middleware 损失掩码计算
建议精读 `slime/agent/trajectory.py` 中 `merge_turns` 的 common_prefix 对齐设计,该模式可推广至其他序列拼接场景。注意检查下游代码对 `output_loss_mask` 的依赖,并及时适配 `output_log_probs`。新增测试用例可作为后续修改的回归保障。
修复 forge_load.py 的 lint 风格问题
可直接合入。对仓库贡献者有一定参考价值在于展示了该仓库期望的代码风格规范。
原始 PR · 作者 jingshenghang · 合并时间 2026-05-27 16:02
修复 SWE RL rollout 关闭时的竞态崩溃
该 PR 值得精读,尤其对于需要在异步服务中实现优雅关闭的场景。其设计模式(模块级 inflight 追踪 + 墓碑 + 多层 drain)可以复用。建议关注 _handle_request 中的 try/finally 结构,确保异常安全。此外,考虑在未来将 settle_sec 和 flush_cache 的超时参数化,便于调优。
参与讨论