修复 NVFP4 MoE 路由精度与 correction bias 类型错误
值得精读,尤其是关注 NVFP4 量化精度的工程师。该 PR 展示了在不改变计算 dtype 下通过输出 dtype 控制数值稳定性的典型做法,以及简化条件分支的 refactor 思路。建议后续补充精度回归测试。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 NVFP4 MoE 路由精度与 correction bias 类型错误
值得精读,尤其是关注 NVFP4 量化精度的工程师。该 PR 展示了在不改变计算 dtype 下通过输出 dtype 控制数值稳定性的典型做法,以及简化条件分支的 refactor 思路。建议后续补充精度回归测试。
原始 PR · 作者 LijuanTang94 · 合并时间 2026-07-07 04:43
修复 MLX 测试桩因 forward_ct 缺失而崩溃
值得阅读以了解测试桩的维护模式,特别是当 mixin 基类新增属性时,需要同步更新所有子类桩。
Nemotron-H Mamba/Attention 层 AllReduce 融合优化
建议精读:该 PR 展示了如何通过逐层传递融合标志实现 all-reduce 延迟,是 Flashinfer 融合能力在 Hybrid 模型上的应用案例。值得关注 `should_fuse_mlp_allreduce_with_next_layer` 的接口设计,可作为后续其他模型融合优化的参考模式。
原始 PR · 作者 sushildubey171 · 合并时间 2026-07-07 02:15
修复 ROCm 上 LayerNorm torch.compile 崩溃
该 PR 值得快速合入,属于必要 bugfix。建议关注后续是否有更通用的方案(如全局 disable compile 开关),但当前修复已足够。
原始 PR · 作者 TallMessiWu · 合并时间 2026-07-07 00:23
为Ascend NPU Qwen3 Dense添加W4A8 MXFP量化和离线方案
该 PR 是 Ascend NPU 量化路线中的重要里程碑,值得所有 NPU 用户和关注硬件后端量化的开发者精读。重点关注: - 在线与离线量化路径的设计区别及复用模式。 - `npu_format_cast` 的扩展方式(FP4 参数传递与 ND 回退跳过逻辑)。 - 性能测试中 `.contiguous()` vs strided view 的实测决策,体现了硬件相关的优化取舍。 - 建议后续作者或团队补充 E2E 测试用例,并跟踪统一基类的重构进展。
原始 PR · 作者 hhhh1252023 · 合并时间 2026-07-06 22:41
NPU 夜间测试增强:重试、协调、参数调优
值得关注的设计决策: - 数据集感知的阈值计算方法:通过定义题目数量和波动容忍度,为不同评估集设置差异化的准确率门槛,减少误报。 - 多次运行取平均的设计:在测试基类中提供 `n_runs` 和 `run_accuracy_multiple`,方便快速实现多次评估。 - 环境变量注入和 CI 标志移除:为性能基准测试提供更精确的环境控制。 建议阅读 `test_npu_accuracy_utils.py` 和 `test_npu_performance_utils.py` 中的工具函数设计。注意 review 中未解决的配置问题(tp-size 不匹配、推理解析器缺少值等),建议在后续 PR 中修复。
在 HIP 上强制禁用 FlashMLA Sparse Prefill
该 PR 值得关注其设计决策:在 AMD GPU 上因精度问题强制禁用某个特性,同时保留警告消息暗示可覆盖。建议团队在评论中指出该矛盾,并考虑更新警告消息或注释以反映实际行为,或添加 future todo 项以便问题修复后恢复。合并后验证(issue comment)确认了变更生效,并帮助隔离了另一个无关的 MORI/RDMA 问题。
为 DeepSeek-OCR-2 新增 olmOCR-bench 准确度基准测试与 HTML 报告
建议合并。该 PR 提供了有价值的基准测试框架和必要的 bug 修复,设计上考虑了可扩展性(from_cli_args 模式、异步并发、灵活报告生成)。review 中的改进已全部落实。
参与讨论