Prhub

radixark/miles

Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.

监控状态:已开启 最近同步:2026-09-01 16:32 同步状态:空闲 下次计划:2026-09-01 17:32

PR 列表

更多筛选
2026-07-29

#1920 fix(ci): stabilize SGLang and FSDP E2E

原始 PR · 作者 guapisolo · 合并时间 2026-07-29 09:46

基础设施 重要性 5.60 洞察度 5.00

修复 SGLang E2E 失败不可见与 FSDP 长任务误入 nightly

值得精读。PR body 的 root cause 编号分析质量高,把「失败为什么不可见」拆成 6 个独立根因并逐一修复,是排查 CI 假性红绿的范本;resolve_policy 的「减法不是否决、显式请求并集兜底」语义值得作为 CI 策略设计参考。对需要在仓库中注册长时间 E2E 用例的工程师,本 PR 的标签分类与 est_time 预算规则有直接指导意义。建议顺带确认 run-ci-fsdp 标签当前是否仍有归属用例。

缺陷修复 重要性 6.68 洞察度 4.00

强制异步 PPO 显式选择 off-policy 校正,防止静默错训

值得精读。该 PR 以极小改动(48 行)解决了一个隐蔽且影响训练正确性的问题,设计上选择了快速失败而非自动默认,避免替用户做可能错误的策略选择。重点关注三点:一是错误信息直接列出三个可选方案的可操作性;二是将校验放在 `train_async.py::train` 最前而非参数解析阶段,确保 GPU 等资源分配前失败;三是用 `use_critic` 简单判别 PPO 估计器的取舍。建议同时审查仓库内所有异步 PPO 示例是否有显式配置这三个 flag,以免被新契约打断。

#1827 fix: run PPO GAE over trainable tokens only

原始 PR · 作者 Shi-Dong · 合并时间 2026-07-29 09:25

缺陷修复 重要性 7.96 洞察度 5.00

修复 PPO GAE 仅在可训练 token 上计算

值得精读。这是 PPO 在 agentic / 多轮场景下训练正确性的关键修复:"压缩子序列再跑 batched GAE" 的设计让 FLA 风格 chunked kernel 零改动复用,属于可迁移的模式;docstring 对 masked 位置 0 值、下游 whitening / OPD 偏移、mask-weighted 统计量的边界界定也很值得学习。建议与 PR#1916(多轮样本语义)、PR#1759(session server 样本组装)一起阅读,理解 loss_mask 从 rollout 到 loss 的完整链路。

缺陷修复 重要性 4.69 洞察度 4.00

LoRA 桥接路径透传 attention-backend

值得快速浏览,无需精读。这是一次教科书式的参数透传遗漏修复:通过对比 model_provider.py 与 bridge 路径的差异定位根因,并同步修正了 CI 中不可能成功的参数请求。可关注的设计点是"一行修复 + 测试语义对齐"的最小 diff 实践,以及作者自我 review 移除注释保持提交简洁的做法。若团队有类似"批量复制参数到 provider"的代码,建议考虑加参数透传完整性校验或对照测试。

2026-07-14
缺陷修复 重要性 3.95 洞察度 4.00

禁用 DSV4 稀疏 MLA 后向 aggressive smem merge,修复 NaN 梯度

值得精读,重点看 PR body 的根因分析与验证设计,以及 Issue #1571 的 bisect 过程。设计决策上,“用 2% 内核性能换取确定性正确性”是合理权衡;更值得借鉴的是其基于实验排除干扰项(fp8、DSA-indexer、坏节点)的方法。建议团队为所有 sparse-MLA 内核(glm5、DSV4 等)建立共享的 pass_configs 基线,并增加编译配置的回归测试,避免同类 bug 在不同内核副本间重复出现。

参与讨论