Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 18:49 同步状态:空闲 下次计划:2026-09-01 19:49

PR 列表

更多筛选
2026-05-15
缺陷修复 重要性 7.17 洞察度 3.00

回退 distillation 在 use_remove_padding=False 的修复

此 PR 值得关注其背后的设计权衡:在分布式蒸馏输出修复中,如何同时保证两个 padding 分支的对称性与序列并行兼容性。建议阅读 #6350 和相关讨论以理解完整上下文。短期内,受影响用户可切换至 `use_remove_padding=True` 作为临时规避。

#6359 [doc] chore: fix ascend doc link

原始 PR · 作者 hustmf · 合并时间 2026-05-15 10:23

文档 重要性 2.25 洞察度 2.00

修复 Ascend 教程文档的链接错误

该 PR 是常规文档维护,合并已通过审核,无需进一步操作。对于 review 中提出的路径疑似重复问题,建议后续验证 `parameter_and_metrics.md` 是否确实承载了 `verl特性支持` 的内容,若不然可另开 PR 修正。

2026-05-14

#6330 [doc] chore: NPU model migration guidance

原始 PR · 作者 Mind-s · 合并时间 2026-05-14 23:41

文档 重要性 5.25 洞察度 5.00

新增 NPU 模型迁移指南

建议如下: - **NPU 适配开发人员**:精读全文,重点关注训推一致性对齐、性能优化和 DSA 定制化适配章节。 - **文档维护者**:关注后续更新,确保配置和链接不过时。 - **其他开发者**:可快速浏览结构,了解 NPU 迁移全貌。

#6353 [doc] chore: verl Ascend doc refactor

原始 PR · 作者 hustmf · 合并时间 2026-05-14 22:02

文档 重要性 5.09 洞察度 4.00

Ascend 文档目录重构与内容优化

建议阅读本 PR 的文档结构变化以了解当前 Ascend 文档的组织方式,但不建议直接引用其中的路径和配置示例(因存在已知错误)。后续应追踪修复评论中提出的问题,并为删除的文档设置重定向或通知。

缺陷修复 重要性 6.22 洞察度 6.00

修复向量化 GRPO 低方差组的缩放异常

该 PR 值得精读,尤其是 `groupwise.py` 中方差计算的数值稳定性改进,以及 `core_algos.py` 中 `eps` 传递的设计权衡。建议熟悉 GRPO 实现细节的工程师关注。变更小而精确,测试覆盖充分,可以快速合并。

#6313 [tool] fix: tool response truncate side

原始 PR · 作者 haoyang9804 · 合并时间 2026-05-14 21:45

缺陷修复 重要性 6.55 洞察度 5.00

修复 tool 响应截断方向错误

建议精读此 PR,特别是测试用例的设计方式,其清晰展示了如何通过 Mock 模拟复杂的 agent loop 行为并进行断言。核心逻辑变更虽小,但体现了对配置语义一致性的细致追求,值得借鉴。后续可考虑补充 `max_tool_response_length=0` 边界情况的测试和修复。

缺陷修复 重要性 7.17 洞察度 5.00

修复 no-rmpad 下 distillation top-k 输出缺失

该 PR 值得精读,原因有两点:1)展示了如何处理主干分支之间的对称性 bug,以及对 review 反馈的快速响应;2)通过添加一个简洁的 CPU 单元测试有效地捕获了回归,测试设计(使用桩引擎、fake processor、两种 padding 输入构造)可作为同类测试的参考。

参与讨论