修复 VLM 处理器回合分隔符探测崩溃
建议合并。该 PR 精准修复了由上游 PR#6921 引入的回归问题,设计巧妙(通过循环尝试两种格式),测试充分(包含模拟处理器桩和回归验证),且作者已对真实模型进行了额外验证。值得关注的设计决策:使用 `for...break` 形式而非 if-else 能保持两种探针形式对称,确保推导逻辑一致。
verl: Volcano Engine Reinforcement Learning for LLMs
修复 VLM 处理器回合分隔符探测崩溃
建议合并。该 PR 精准修复了由上游 PR#6921 引入的回归问题,设计巧妙(通过循环尝试两种格式),测试充分(包含模拟处理器桩和回归验证),且作者已对真实模型进行了额外验证。值得关注的设计决策:使用 `for...break` 形式而非 if-else 能保持两种探针形式对称,确保推导逻辑一致。
修复 FSDP logits 温度缩放 in-place 操作崩溃
值得跟随阅读,了解 FSDP 引擎中温度缩放的实现细节以及 in-place 操作对视图张量的潜在问题。PR 提交者可以关注是否为类似场景添加测试覆盖。
原始 PR · 作者 chengminhua · 合并时间 2026-07-06 17:26
Ascend PPO 脚本启用 cudagraph 模式
该 PR 是一个简单的性能优化配置变更,技术理解价值有限。如果关注 Ascend NPU 训练性能优化,可参考该配置启用方式;但应留意 Gemini 评论中提到的序列化风险,建议在目标环境中测试验证。
原始 PR · 作者 Mecoli1219 · 合并时间 2026-07-06 11:07
修复非连续张量在分桶权重传输中的崩溃
值得所有使用 Megatron-Bridge 或自定义权重导出器的用户更新。代码变更简洁,设计决策清晰(利用 PyTorch 原生能力而非手动压缩),可作为小范围 bugfix 的范例。
修复多轮 AgentLoop 中回合分隔符 token 丢失
值得精读。核心 bugfix 设计优雅:使用 user turn 而非 assistant turn 推导分隔符,避免捕获 think 标签;充分处理 eos_token_id 的 list/tuple 兼容性;测试编写全面。建议关注后续 #6804 多模态 CT PR。
原始 PR · 作者 acisseJZhong · 合并时间 2026-07-06 10:11
更新 TorchTitan 引擎并添加端到端测试脚本
建议团队确认默认值变更后通知用户更新 torchtitan 版本;尽快修复测试脚本中的 Shell 问题以提高稳健性;后续可基于 spmd_types 做进一步的性能调优,并跟进 CI 集成。
原始 PR · 作者 chengcuiping · 合并时间 2026-07-06 09:47
兼容 Megatron-Core 0.18 移除的枚举成员
值得快速集成。变更简洁,逻辑清晰,兼容性好。适合作为 Megatron-Core 版本升级的先行补丁。
原始 PR · 作者 zhouhengan1211 · 合并时间 2026-07-06 09:44
降低 vLLM NPU 补丁版本下限至 0.18
该 PR 改动极小且逻辑清晰,无需精读。对于 NPU + vLLM 0.18.x 的用户,建议关注后续是否会有针对该版本的进一步修复。
参与讨论