Prhub

radixark/miles

Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.

监控状态:已开启 最近同步:2026-09-02 20:37 同步状态:空闲 下次计划:2026-09-02 21:37

PR 列表

更多筛选
2026-07-29

#1827 fix: run PPO GAE over trainable tokens only

原始 PR · 作者 Shi-Dong · 合并时间 2026-07-29 09:25

缺陷修复 重要性 7.96 洞察度 5.00

修复 PPO GAE 仅在可训练 token 上计算

值得精读。这是 PPO 在 agentic / 多轮场景下训练正确性的关键修复:"压缩子序列再跑 batched GAE" 的设计让 FLA 风格 chunked kernel 零改动复用,属于可迁移的模式;docstring 对 masked 位置 0 值、下游 whitening / OPD 偏移、mask-weighted 统计量的边界界定也很值得学习。建议与 PR#1916(多轮样本语义)、PR#1759(session server 样本组装)一起阅读,理解 loss_mask 从 rollout 到 loss 的完整链路。

缺陷修复 重要性 4.69 洞察度 4.00

LoRA 桥接路径透传 attention-backend

值得快速浏览,无需精读。这是一次教科书式的参数透传遗漏修复:通过对比 model_provider.py 与 bridge 路径的差异定位根因,并同步修正了 CI 中不可能成功的参数请求。可关注的设计点是"一行修复 + 测试语义对齐"的最小 diff 实践,以及作者自我 review 移除注释保持提交简洁的做法。若团队有类似"批量复制参数到 provider"的代码,建议考虑加参数透传完整性校验或对照测试。

2026-07-14
缺陷修复 重要性 3.95 洞察度 4.00

禁用 DSV4 稀疏 MLA 后向 aggressive smem merge,修复 NaN 梯度

值得精读,重点看 PR body 的根因分析与验证设计,以及 Issue #1571 的 bisect 过程。设计决策上,“用 2% 内核性能换取确定性正确性”是合理权衡;更值得借鉴的是其基于实验排除干扰项(fp8、DSA-indexer、坏节点)的方法。建议团队为所有 sparse-MLA 内核(glm5、DSV4 等)建立共享的 pass_configs 基线,并增加编译配置的回归测试,避免同类 bug 在不同内核副本间重复出现。

参与讨论