Prhub

THUDM/slime

slime is an LLM post-training framework for RL Scaling.

监控状态:已开启 最近同步:2026-09-01 15:21 同步状态:空闲 下次计划:2026-09-01 16:21

PR 列表

更多筛选
2026-08-21
缺陷修复 重要性 6.25 洞察度 5.00

eval-only 跳过优化器与调度器构建

该 PR 值得精读,尤其是“为什么不用 train_iters=1”的设计权衡。建议在合入后补一条 CPU 侧测试:断言 num_rollout == 0 时 setup_model_and_optimizer 返回 (model, None, None)、create_training_models 不分配 critic,并验证正常训练路径仍构造 optimizer 与 scheduler。

2026-08-20

#2294 cleanup

原始 PR · 作者 zhuzilin · 合并时间 2026-08-20 16:21

重构 重要性 3.79 洞察度 2.00

整理 GLM-5 逐层比较脚本并移除冗余依赖

该 PR 值得快速浏览,核心价值在于目录职责划分与依赖精简。阅读重点:(1) `tests/glm52_layerwise_comparator.py` 与 `test_glm52_6layer_deterministic_e2e.py` 中调用方式的变化;(2) 确认 `ring_flash_attn` 是否确无引用。不建议深入学习,因为不涉及算法或架构改动。

#2216 feat: add backend-aware MUSA support

原始 PR · 作者 ForAxel · 合并时间 2026-08-20 15:11

功能 重要性 9.36 洞察度 7.00

新增加速器抽象层,支持 MUSA 后端并保持 CUDA 兼容

值得精读,尤其 `slime/utils/accelerator/__init__.py` 的选择编排与 `musa_patch` 引导时序、`base.py` 的 `resolve_visible_device_id`(可见设备映射是厂商差异核心)、`reloadable_process_group.py` 的 backend 归一化。建议后续补充“后端接入指南”文档,并规划 MUSA/MCCL 端到端验证(至少一条 SMOKE 路径),以确认 `musa_patch` 引导、权重更新组 `cpu:gloo,musa:mccl` 与 teardown 顺序在真实硬件上的正确性。关注 `is_accelerator_backend` 与 `process_group_backend` 对复合 backend 字符串的处理。

缺陷修复 重要性 5.77 洞察度 4.00

修复旧版 SGLang 参数别名与 router 选项兼容性

值得快速阅读的小型兼容性修复。核心可借鉴点是:跨版本依赖适配时用 `hasattr` 做能力探测并降级为 warning,而不是硬假设 API 恒存在。同时建议关注两个遗留点:`validate_args` 在跳过别名归一化后仍直接访问 `args.sglang_pp_size` 的潜在 `AttributeError`,以及缺失 `disable_health_check` 时 router 健康检查语义变化;若团队需长期支持旧版 SGLang,应补充一个 mock 旧版属性的回归测试。

2026-08-16

#2276 Add args check for --save-debug-train-data

原始 PR · 作者 zhuzilin · 合并时间 2026-08-16 17:46

缺陷修复 重要性 4.94 洞察度 3.00

新增 --save-debug-train-data 与 rollout 路径冲突校验

该 PR 值得快速 review,逻辑简单清晰,测试覆盖到位。可关注点:校验位置是否覆盖所有设置路径(如 `--dump-details` 间接设置),以及是否需要在文档中提及该限制。

#2267 Fix model convert when use latest megatron

原始 PR · 作者 alexqdh · 合并时间 2026-08-16 17:45

缺陷修复 重要性 6.21 洞察度 6.00

修复最新 Megatron 下模型转换兼容性问题

本 PR 值得精读,因为它展示了如何通过小范围的兼容性修复来适配 Megatron 新版本,特别是参数默认值、导入路径和构造签名的处理方式,可作为后续适配其他模型插件时的参考。

#2274 [ROCm] Support the INT4 QAT kernel on ROCm

原始 PR · 作者 LZ-QWQ · 合并时间 2026-08-16 17:44

功能 重要性 5.81 洞察度 5.00

为 ROCm 构建 INT4 QAT 内核并修复 hipcc 兼容性

值得精读。该 PR 展示了如何通过条件编译适配不同 GPU 编译器(nvcc vs hipcc),但改动量较小。关注点在于 ROCm 构建配置的通用性和未来维护成本。

2026-08-14

#2271 fix transform_ue8m0 in fp8 convert

原始 PR · 作者 lilei199908 · 合并时间 2026-08-14 11:25

缺陷修复 重要性 6.75 洞察度 5.00

修复 FP8 转换中 ue8m0 变换开关导致的不一致问题

该 PR 值得精读,虽然改动不大,但涉及 FP8 量化转换的关键参数透传,可学习如何通过参数默认值控制行为并保持调用链一致性。建议关注后续是否存在统一的 `transform_ue8m0` 配置入口,以及是否补充对应测试以确保两种路径行为一致。

参与讨论