eval-only 跳过优化器与调度器构建
该 PR 值得精读,尤其是“为什么不用 train_iters=1”的设计权衡。建议在合入后补一条 CPU 侧测试:断言 num_rollout == 0 时 setup_model_and_optimizer 返回 (model, None, None)、create_training_models 不分配 critic,并验证正常训练路径仍构造 optimizer 与 scheduler。
slime is an LLM post-training framework for RL Scaling.
eval-only 跳过优化器与调度器构建
该 PR 值得精读,尤其是“为什么不用 train_iters=1”的设计权衡。建议在合入后补一条 CPU 侧测试:断言 num_rollout == 0 时 setup_model_and_optimizer 返回 (model, None, None)、create_training_models 不分配 critic,并验证正常训练路径仍构造 optimizer 与 scheduler。
整理 GLM-5 逐层比较脚本并移除冗余依赖
该 PR 值得快速浏览,核心价值在于目录职责划分与依赖精简。阅读重点:(1) `tests/glm52_layerwise_comparator.py` 与 `test_glm52_6layer_deterministic_e2e.py` 中调用方式的变化;(2) 确认 `ring_flash_attn` 是否确无引用。不建议深入学习,因为不涉及算法或架构改动。
新增加速器抽象层,支持 MUSA 后端并保持 CUDA 兼容
值得精读,尤其 `slime/utils/accelerator/__init__.py` 的选择编排与 `musa_patch` 引导时序、`base.py` 的 `resolve_visible_device_id`(可见设备映射是厂商差异核心)、`reloadable_process_group.py` 的 backend 归一化。建议后续补充“后端接入指南”文档,并规划 MUSA/MCCL 端到端验证(至少一条 SMOKE 路径),以确认 `musa_patch` 引导、权重更新组 `cpu:gloo,musa:mccl` 与 teardown 顺序在真实硬件上的正确性。关注 `is_accelerator_backend` 与 `process_group_backend` 对复合 backend 字符串的处理。
修复旧版 SGLang 参数别名与 router 选项兼容性
值得快速阅读的小型兼容性修复。核心可借鉴点是:跨版本依赖适配时用 `hasattr` 做能力探测并降级为 warning,而不是硬假设 API 恒存在。同时建议关注两个遗留点:`validate_args` 在跳过别名归一化后仍直接访问 `args.sglang_pp_size` 的潜在 `AttributeError`,以及缺失 `disable_health_check` 时 router 健康检查语义变化;若团队需长期支持旧版 SGLang,应补充一个 mock 旧版属性的回归测试。
新增 --save-debug-train-data 与 rollout 路径冲突校验
该 PR 值得快速 review,逻辑简单清晰,测试覆盖到位。可关注点:校验位置是否覆盖所有设置路径(如 `--dump-details` 间接设置),以及是否需要在文档中提及该限制。
修复最新 Megatron 下模型转换兼容性问题
本 PR 值得精读,因为它展示了如何通过小范围的兼容性修复来适配 Megatron 新版本,特别是参数默认值、导入路径和构造签名的处理方式,可作为后续适配其他模型插件时的参考。
为 ROCm 构建 INT4 QAT 内核并修复 hipcc 兼容性
值得精读。该 PR 展示了如何通过条件编译适配不同 GPU 编译器(nvcc vs hipcc),但改动量较小。关注点在于 ROCm 构建配置的通用性和未来维护成本。
原始 PR · 作者 lilei199908 · 合并时间 2026-08-14 11:25
修复 FP8 转换中 ue8m0 变换开关导致的不一致问题
该 PR 值得精读,虽然改动不大,但涉及 FP8 量化转换的关键参数透传,可学习如何通过参数默认值控制行为并保持调用链一致性。建议关注后续是否存在统一的 `transform_ue8m0` 配置入口,以及是否补充对应测试以确保两种路径行为一致。
参与讨论