Prhub

THUDM/slime · 标签视图

标签列表

聚合结果

configuration 相关 PR

2026-08-28

#2334 [release] bump to v0.3.2

原始 PR · 作者 zhuzilin · 合并时间 2026-08-28 10:17

基础设施 重要性 8.78 洞察度 5.00

发布 v0.3.2,新增 SGLang 确定性补丁与发布校验脚本

建议负责构建与发布的同学精读 `check_release.py` 与 `build_conda.sh`:前者用 AST/正则做交叉校验的思路简洁可靠,可直接作为发布门禁;后者集中体现了 conda/Docker 双路径对齐的维护成本。对于关心 FP8 推理的工程师,`sglang-deterministic.patch` 中 UE8M0 scale 与 SiLU 舍入的处理与近期 PR#2327 的 FP8 开关联动,值得深入研究。该 PR 无需逐行审查补丁,但应确认补丁与上游 commit 固定一致。

2026-08-26

#2327 feat: allow forcing UE8M0 FP8 scales

原始 PR · 作者 zhuzilin · 合并时间 2026-08-26 14:39

功能 重要性 6.88 洞察度 5.00

新增 --force-fp8-ue8m0-scale 开关,强制 UE8M0 量化

值得精读。重点学习如何将运行时依赖与用户强制开关解耦,以及如何在参数层提供灵活性。建议补充文档并增加对 `_quantize_param` 分支的测试。

2026-08-24

#2318 [ci] move fanout_test_helpers to tests/

原始 PR · 作者 zhuzilin · 合并时间 2026-08-24 16:03

重构 重要性 4.62 洞察度 4.00

将 fanout 测试辅助模块迁至 tests/ 并改用 PYTHONPATH 注入

值得花两三分钟快速阅读,作为测试基础设施组织的样例,不建议精读。核心关注点是两点:一是 importlib.import_module 无法解析文件名带点的模块路径,导致测试辅助代码被迫寻找「无点模块名 + 可导入」的位置;二是通过 extra_env_vars 注入 PYTHONPATH 让 Ray driver 与 worker 都能看到 tests/ 目录的做法,这是 slime 仓库 E2E 测试中一个可复用的模式。该 PR 展示了作者在包边界上的审慎:避免测试代码渗入运行库。

#2316 Remove megatron_patch for memory optimization

原始 PR · 作者 zhuzilin · 合并时间 2026-08-24 15:07

重构 重要性 7.73 洞察度 4.00

删除 megatron_patch 梯度合并补丁,简化 Megatron 适配层。

值得快速精读,重点在于理解 Slime 如何通过移除运行时 monkeypatch 来收敛对上游框架的侵入。合并前建议确认目标 Megatron 版本已具备等效的分块梯度同步机制,并在大模型 TP 场景做一次 OOM 回归验证;若无法确认,可先保留补丁并仅注释导入以避免直接行为回退。

#2312 docs: remove stale delta NCCL recommendation

原始 PR · 作者 liuhao-labs · 合并时间 2026-08-24 11:20

文档 重要性 2.03 洞察度 2.00

删除过时 delta+NCCL 建议,明确 delta 仅支持 disk

PR 改动很小,不需要精读。值得留意的设计决策是:当代码功能被移除(#2089)而文档未同步时,决策表会继续推荐一条不存在的路径;本次通过“明确说明当前契约 + 声明不修复历史问题”的方式完成对齐。若关注 external rollout engine 的权重同步演进(#1806 引入 → #2089 移除 → #2209 报告 NaN → #2312 清理文档),可以顺着这条链路做复盘。

2026-08-21
缺陷修复 重要性 5.59 洞察度 4.00

参数解析阶段拒绝非正 rollout 温度,拦截非法 RL 采样配置

值得快速浏览。改动虽小,但体现了“非法配置在参数解析阶段拒绝,而不是在训练逻辑里隐式兜底”的工程决策,PR body 对 greedy 温度为什么不是合法 RL 策略的解释清晰;配合 #2236、#2276 可看到 slime 在参数校验层持续加固的趋势。

缺陷修复 重要性 4.18 洞察度 5.00

修复 OPD 教师温度硬编码为 0 的问题

该 PR 不建议精读,但其讨论过程值得关注,特别是关于 SGLang 温度对 input logprob 影响的澄清,以及最终引导至 PR#2325 的正确修复。

缺陷修复 重要性 6.25 洞察度 5.00

eval-only 跳过优化器与调度器构建

该 PR 值得精读,尤其是“为什么不用 train_iters=1”的设计权衡。建议在合入后补一条 CPU 侧测试:断言 num_rollout == 0 时 setup_model_and_optimizer 返回 (model, None, None)、create_training_models 不分配 critic,并验证正常训练路径仍构造 optimizer 与 scheduler。