更新 DeepSeek-V3 支持文档
简单文档更新,无需深入审查。
verl: Volcano Engine Reinforcement Learning for LLMs
更新 DeepSeek-V3 支持文档
简单文档更新,无需深入审查。
原始 PR · 作者 chengminhua · 合并时间 2026-07-03 17:55
更新 Ascend 三份最佳实践文档的版本兼容性
建议在后续 PR 中修复 DAPO 和 GSPO 文档中 `git checkout main` 与文本建议 commit ID 的矛盾,确保用户操作与说明一致。此外,可考虑增加自动化检查来验证文档中的版本引用。
更新 Ascend Quickstart 文档结构与链接
本次 PR 为简单的文档维护,无需深入审查,但可作为文档协作与 review 流程的良好实践示例。
新增 NPU 单元测试/系统测试及 CI 配置
建议合并。该 PR 填补了 NPU 平台测试空白,是基础设施的重要完善。值得关注的设计决策是使用 `get_device_name` 工具函数统一设备抽象,该模式值得在后续测试和核心代码中推广。
新增 SGLang FP8 忽略层文档
值得合并,是对已有功能的必要文档补充。无需精读,但可作为 FP8 使用参考。
修复 Qwen3 MoE FSDP-vLLM 权重同步兼容性
建议合并并同步考虑添加单元测试(至少验证 `_iter_vllm_compatible_moe_params` 的输入输出等价性),以及添加后端配置选项让用户可以手动覆盖版本阈值。
SGLang rollout FP8 忽略层配置集中化并支持正则匹配
值得精读。设计上通过工具函数将多种配置源融合为统一忽略列表,并支持正则匹配以兼容 `llm-compressor` 等工业工具生成的规则。这种模式可以推广到其他推理引擎(如 vLLM)的相似场景。但需注意测试的边界条件(如重叠规则、空字符串、None 等)已被覆盖,可以放心依赖。
Megatron BSHD 统一 micro-batch 序列长度避免 cuDNN 重复编译
值得精读。该 PR 精准定位了 cuDNN Graph Build 与 micro-batch 填充策略的交互问题,设计简洁有效。建议关注空 batch 安全性的后续修正,并考虑将此类优化扩展至更通用的 THD 路径。
参与讨论