Prhub

verl-project/verl · 标签视图

标签列表

聚合结果

quantization 相关 PR

2026-08-19
缺陷修复 重要性 5.99 洞察度 6.00

修复 fused-MoE 专家权重被 fp8 量化过滤遗漏的问题

值得精读,尤其关注 `is_fp8_weight()` 的白名单设计。这是一个典型的“注释意图与实际实现不一致”导致的静默 bug:注释写的是过滤 bias,实际却把所有非 `.weight` 结尾的参数都排除了。修复引入 `_FP8_CANDIDATE_LEAVES` 白名单作为快速路径,同时把真实的 fp8 资格判定留给模块 dtype 检查,设计思路清晰。但建议后续补充:1) 针对 fused-MoE fp8 模型的单元测试(即使只能 mock 模块层级);2) 将 `w13_weight`/`w2_weight` 的属性名也纳入统一的映射常量,避免白名单与属性访问逻辑漂移。

缺陷修复 重要性 5.40 洞察度 5.00

识别 is_shuffled 标志,修复 AITER FP8 权重 refit

值得快速精读。虽然改动只有 10 行,但蕴含两个有价值的工程模式:一是当设备端变换不改变 tensor 元数据时,需要额外的信号位(`is_shuffled`)来追踪布局状态;二是 `vllm_fp8_utils.py` 的 docstring 对 vLLM 权重内存池(discard-and-rezero、NaN 哨兵填充)有深入解释,适合作为 FP8 / refit 相关开发的必读材料。建议 FP8 与 ROCm 支持组的成员关注,并推动补齐 ROCm AITER 的端到端回归测试。

缺陷修复 重要性 7.03 洞察度 5.00

修复 ROCm 图回放下注意力缓存地址失效问题

值得精读。这个 PR 展示了处理“CUDA graph 持有 buffer 地址”这一经典问题的设计模式:不删除缓存而是原地刷新保持地址稳定,并用 `torch.inference_mode()` 解决推理期 tensor 的可变性约束。对理解量化权重加载、图捕获与动态权重更新之间的交互很有价值。

2026-08-04

#7242 [veomni] feat: add DeepSeek V4 support

原始 PR · 作者 wuxibin89 · 合并时间 2026-08-04 21:45

功能 重要性 8.73 洞察度 7.00

VeOmni 引擎新增 DeepSeek V4 支持与 MXFP4 多后端回灌

值得精读。三个设计点有复用价值:一是 `_build_ops_implementation_config` 的「按已安装依赖字段动态过滤 + 显式设置即报错」版本解耦范式;二是 `_mxfp4_staging_data` 通过字节数等价的 view/dtype 重解释复用 live storage,把回灌的额外内存从「整份 MoE」降到「1/16 的 scale 缓冲」;三是回灌流程结束后用 leftover 检查兜底,任何不经过 `replace_parameter` 的路径都会显式失败。需要跟进的事项:为 Marlin 回灌与 converter 路径补专项测试、评估 `max_num_seqs` 全局默认调整、补充与 Megatron 的性能对比数据。

2026-07-14

#6473 [megatron] feat: support DeepSeek V4 GRPO

原始 PR · 作者 HollowMan6 · 合并时间 2026-07-14 16:29

功能 重要性 9.18 洞察度 7.00

支持 DeepSeek V4 Flash GRPO 训练

此 PR 值得精读,特别是: 1. 如何为一个全新的 MoE 模型添加端到端 GRPO 训练支持,包括量化权重同步和路由重放。 2. 审查中关于 API 设计(DSV4 工具分离)和安全编码(getattr、异常处理)的讨论是很好的实践参考。 3. 二进制传输中对齐(_align_offset)和异步 ZMQ 的优化思路。 建议重点关注 MTP drafter 覆盖率缺失的问题,在后续迭代中解决。

2026-04-03

#5861 [doc] feat: add NVFP4 QAT documentation

原始 PR · 作者 zhangyimi · 合并时间 2026-04-03 14:10

文档 重要性 3.00 洞察度 2.00

新增NVFP4量化感知训练文档,涵盖FSDP和Megatron后端的配置说明。

该PR值得快速浏览以了解NVFP4 QAT的配置概览,但文档中的两个未解决问题需要后续跟进。建议关注quantization_config_path参数的实际使用情况和模型名称的准确性,以确保文档与代码实现一致。

2026-03-27
功能 重要性 6.00 洞察度 5.00

在 Ascend 950 设备上启用 MXFP8 量化 rollout 支持。

建议关注硬件特定的量化实现细节,如 `restore_mxfp8_weights_for_loading` 和 `apply_mxfp8_transformation_after_loading` 函数的逻辑,这些设计有助于处理权重加载后的转换。对于使用 Ascend 设备的开发者,此 PR 值得精读以了解 MXFP8 量化集成的完整流程。同时,留意 review 中解决的兼容性问题,可作为类似硬件适配的参考。

2026-03-24
缺陷修复 重要性 4.00 洞察度 5.00

修复 SGLang rollout 在完全异步模式下启用 FP8 量化时的异步生成器错误和配置初始化问题。

该 PR 值得精读,重点关注异步编程模式和配置初始化顺序的设计决策,对于处理混合同步/异步场景有借鉴意义。