Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-07-06
缺陷修复 重要性 6.90 洞察度 6.00

修复 VLM 处理器回合分隔符探测崩溃

建议合并。该 PR 精准修复了由上游 PR#6921 引入的回归问题,设计巧妙(通过循环尝试两种格式),测试充分(包含模拟处理器桩和回归验证),且作者已对真实模型进行了额外验证。值得关注的设计决策:使用 `for...break` 形式而非 if-else 能保持两种探针形式对称,确保推导逻辑一致。

缺陷修复 重要性 5.78 洞察度 5.00

修复 FSDP logits 温度缩放 in-place 操作崩溃

值得跟随阅读,了解 FSDP 引擎中温度缩放的实现细节以及 in-place 操作对视图张量的潜在问题。PR 提交者可以关注是否为类似场景添加测试覆盖。

config 重要性 2.00 洞察度 1.00

Ascend PPO 脚本启用 cudagraph 模式

该 PR 是一个简单的性能优化配置变更,技术理解价值有限。如果关注 Ascend NPU 训练性能优化,可参考该配置启用方式;但应留意 Gemini 评论中提到的序列化风险,建议在目标环境中测试验证。

缺陷修复 重要性 6.46 洞察度 6.00

修复非连续张量在分桶权重传输中的崩溃

值得所有使用 Megatron-Bridge 或自定义权重导出器的用户更新。代码变更简洁,设计决策清晰(利用 PyTorch 原生能力而非手动压缩),可作为小范围 bugfix 的范例。

缺陷修复 重要性 7.90 洞察度 6.00

修复多轮 AgentLoop 中回合分隔符 token 丢失

值得精读。核心 bugfix 设计优雅:使用 user turn 而非 assistant turn 推导分隔符,避免捕获 think 标签;充分处理 eos_token_id 的 list/tuple 兼容性;测试编写全面。建议关注后续 #6804 多模态 CT PR。

重构 重要性 7.16 洞察度 5.00

更新 TorchTitan 引擎并添加端到端测试脚本

建议团队确认默认值变更后通知用户更新 torchtitan 版本;尽快修复测试脚本中的 Shell 问题以提高稳健性;后续可基于 spmd_types 做进一步的性能调优,并跟进 CI 集成。

参与讨论