移除废弃工具、课程采样器和动态数据集
该 PR 是值得参考的代码清理范例:它大规模移除了废弃代码并扁平化目录,附带全面的引用更新和测试清理。建议内部开发者检查自己的分支是否依赖了被删除的组件,并及时调整。对于仓库维护者,这次重构为进一步解耦和标准化工具注册机制铺平了道路。
verl: Volcano Engine Reinforcement Learning for LLMs
移除废弃工具、课程采样器和动态数据集
该 PR 是值得参考的代码清理范例:它大规模移除了废弃代码并扁平化目录,附带全面的引用更新和测试清理。建议内部开发者检查自己的分支是否依赖了被删除的组件,并及时调整。对于仓库维护者,这次重构为进一步解耦和标准化工具注册机制铺平了道路。
支持多输出轨迹异步奖励评分
此 PR 值得精读,尤其是设计权衡部分(修改 reward manager 接口 vs 调用 score_batch)。它展示了如何在保持向后兼容的同时引入灵活的多输出支持,对理解异步奖励架构有帮助。
工具初始化集中化并移除MCP支持
建议阅读该 PR 以了解工具统一加载的设计模式,重点考察 `load_all_tools` 函数的接口和碰撞处理逻辑。同时应关注两个遗留问题并考虑修复。设计上值得学习的是将工具初始化提升到 worker 层,使 dataset 和 agent loop 共享同一视图。
OPD teacher 跳过 tokenizer 初始化
建议精读该 PR 用于了解 OPD teacher 的配置要求。值得关注的设计决策是将 `skip_tokenizer_init` 设为硬编码默认值而非从外部配置传递,简化用户使用。
为 NPU nightly CI 添加 GSPO Qwen3-30B 测试脚本
建议开发者仔细阅读 gemini-code-assist 的评论,并在后续 PR 中补充 ref 的 `override_transformer_config`。本 PR 本身作为 CI 增强是合理的,但配置一致性值得跟进。
修复 Megatron CP 中 position_ids 计算错误
建议精读本 PR,尤其是 position_ids 计算公式的推导(PR body 中有详细对比)。对于代码审查者,重点关注 `model_forward.py` 中条件修改的潜在影响,建议后续添加 VLM+MTP 的 CI 测试。已获 wuxibin89 approve,可合入。
修复全异步策略文档中的模块路径错误
该 PR 为纯文档修复,价值较低但必要,可快速合并。无特殊设计决策值得深究。
精简 TRT-LLM CI,合并测试任务并移除冗余 job
值得快速合并,属于基础 CI 清理工作,无功能性变更。建议后续关注 FSDP + TRT-LLM 的测试覆盖是否需单独补充,以及观察拆分后的单元测试是否仍有稳定性问题。
参与讨论