Prhub

THUDM/slime · 标签视图

标签列表

聚合结果

performance 相关 PR

2026-08-24

#2316 Remove megatron_patch for memory optimization

原始 PR · 作者 zhuzilin · 合并时间 2026-08-24 15:07

重构 重要性 7.73 洞察度 4.00

删除 megatron_patch 梯度合并补丁,简化 Megatron 适配层。

值得快速精读,重点在于理解 Slime 如何通过移除运行时 monkeypatch 来收敛对上游框架的侵入。合并前建议确认目标 Megatron 版本已具备等效的分块梯度同步机制,并在大模型 TP 场景做一次 OOM 回归验证;若无法确认,可先保留补丁并仅注释导入以避免直接行为回退。

2026-08-12
缺陷修复 重要性 7.56 洞察度 6.00

修复全异步 rollout 丢弃已完成组并解除事件循环阻塞

值得精读。该 PR 是典型的“两个缺陷相互耦合、需联动修复”的案例,其背压转移设计(将有界队列改为无界、在生产者侧用 qsize 门控)是一个可复用的异步队列模式。建议关注 `get_completed_groups` 的 limit 语义与 `_loop` 门控条件,理解为何“无界队列 + 显式门控”优于“有界队列 + 阻塞 put”在事件循环线程中的表现。

#2205 perf: vectorize REINFORCE++ discounted returns

原始 PR · 作者 morluto · 合并时间 2026-08-12 13:36

性能优化 重要性 7.73 洞察度 6.00

向量化 REINFORCE++ 折扣回报计算并复用 GAE 扫描

值得精读。该 PR 展示了如何把 O(T) 串行递归安全地替换为分块并行扫描,并通过“提取通用 helper + 参考实现对照测试”控制重构风险。重点关注 `chunked_discounted_returns` 的 chunk 内扫描与跨 chunk 状态传播设计、右 padding/trim 的数值正确性论证,以及 `chunked_gae` 复用后行为是否保持。合并评审时建议补充一个真实的 context-parallel 集成测试或 GPU 冒烟测试。

缺陷修复 重要性 6.63 洞察度 5.00

修复 block_fp8 全零块产生 NaN 权重的问题

该 PR 值得精读,尤其是对于使用 `block_fp8` 进行模型量化的团队。它展示了一个典型边界条件的修复,并通过引入针对性的单元测试强化了代码契约。建议关注测试的编写方式(动态加载模块、CPU 运行)以及钳制值选择的一致性。

2026-08-11
功能 重要性 9.36 洞察度 8.00

对齐 Megatron 训练与 SGLang rollouts,新增确定性 GLM-5 对齐路径

值得精读。该 PR 展示了如何系统性对齐训练与推理引擎的数值行为,包含大量可借鉴的设计:自定义 autograd 函数封装外部 kernel、通过 Triton 内核实现确定性路由重排、使用直通估计器(STE)处理对齐权重、基于 cache key 的权重对齐缓存、以及通过 layerwise dump 精确验证对齐效果。对从事多后端一致性、MoE 训练、FP8 量化的工程师有很高参考价值。建议关注点:1)routing_replay 对非 GLM-5 模型的潜在影响;2)DeepEP 成为唯一对齐后端的回退策略;3)CI 门禁的 fixture 依赖管理。

2026-08-04
功能 重要性 8.60 洞察度 6.00

新增 rollout 采样钩子与动态采样回退,保留 DeepEP TMS 状态

值得精读:`slime/rollout/sample_hooks.py` 的 hook 机制设计(签名过滤 + 同步/异步统一 + no-op 默认)、`slime/backends/megatron_utils/__init__.py` 的 TMS 状态 try/finally 恢复模式,以及 `should_drop_dynamic_filter_output` 的回退阈值判定。建议未来在真实多卡环境验证 TMS patch,并观察动态采样回退对训练数据分布的实际影响。

2026-08-03

#2248 Support PYTORCH_ALLOC_CONF

原始 PR · 作者 zhuzilin · 合并时间 2026-08-03 19:38

功能 重要性 4.35 洞察度 3.00

PYTORCH_ALLOC_CONF 支持,隔离 SGLang

改动小但有针对性,结合 colocation 显存优化线(#2180 等)值得快速阅读。关注点:环境变量隔离位置是否合理,以及 Dockerfile 依赖锁定策略——建议后续改为固定 commit 或构建产物校验,避免构建漂移。

2026-07-19

#2220 Optimize update weight

原始 PR · 作者 zhuzilin · 合并时间 2026-07-19 10:16

性能优化 重要性 9.00 洞察度 6.00

优化 MoE 权重更新,引入专家路由跳过非专家转换

建议架构师和训练引擎维护者仔细阅读 `expert_routing.py` 中的拓扑差分检测和路由规划逻辑,以及 `update_weight_from_tensor.py` 中如何组合选择性转换。测试部分仍可加强,特别是多节点异构拓扑场景。