Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58

PR 列表

更多筛选
2026-07-07
缺陷修复 重要性 6.65 洞察度 5.00

修复 NVFP4 MoE 路由精度与 correction bias 类型错误

值得精读,尤其是关注 NVFP4 量化精度的工程师。该 PR 展示了在不改变计算 dtype 下通过输出 dtype 控制数值稳定性的典型做法,以及简化条件分支的 refactor 思路。建议后续补充精度回归测试。

性能优化 重要性 6.66 洞察度 5.00

Nemotron-H Mamba/Attention 层 AllReduce 融合优化

建议精读:该 PR 展示了如何通过逐层传递融合标志实现 all-reduce 延迟,是 Flashinfer 融合能力在 Hybrid 模型上的应用案例。值得关注 `should_fuse_mlp_allreduce_with_next_layer` 的接口设计,可作为后续其他模型融合优化的参考模式。

功能 重要性 9.18 洞察度 7.00

为Ascend NPU Qwen3 Dense添加W4A8 MXFP量化和离线方案

该 PR 是 Ascend NPU 量化路线中的重要里程碑,值得所有 NPU 用户和关注硬件后端量化的开发者精读。重点关注: - 在线与离线量化路径的设计区别及复用模式。 - `npu_format_cast` 的扩展方式(FP4 参数传递与 ND 回退跳过逻辑)。 - 性能测试中 `.contiguous()` vs strided view 的实测决策,体现了硬件相关的优化取舍。 - 建议后续作者或团队补充 E2E 测试用例,并跟踪统一基类的重构进展。

2026-07-06
功能 重要性 7.34 洞察度 4.00

NPU 夜间测试增强:重试、协调、参数调优

值得关注的设计决策: - 数据集感知的阈值计算方法:通过定义题目数量和波动容忍度,为不同评估集设置差异化的准确率门槛,减少误报。 - 多次运行取平均的设计:在测试基类中提供 `n_runs` 和 `run_accuracy_multiple`,方便快速实现多次评估。 - 环境变量注入和 CI 标志移除:为性能基准测试提供更精确的环境控制。 建议阅读 `test_npu_accuracy_utils.py` 和 `test_npu_performance_utils.py` 中的工具函数设计。注意 review 中未解决的配置问题(tp-size 不匹配、推理解析器缺少值等),建议在后续 PR 中修复。

缺陷修复 重要性 4.72 洞察度 3.00

在 HIP 上强制禁用 FlashMLA Sparse Prefill

该 PR 值得关注其设计决策:在 AMD GPU 上因精度问题强制禁用某个特性,同时保留警告消息暗示可覆盖。建议团队在评论中指出该矛盾,并考虑更新警告消息或注释以反映实际行为,或添加 future todo 项以便问题修复后恢复。合并后验证(issue comment)确认了变更生效,并帮助隔离了另一个无关的 MORI/RDMA 问题。

#25364 Add Accuracy Benchmark for OCR models

原始 PR · 作者 ckvermaAI · 合并时间 2026-07-06 16:18

功能 重要性 9.00 洞察度 5.00

为 DeepSeek-OCR-2 新增 olmOCR-bench 准确度基准测试与 HTML 报告

建议合并。该 PR 提供了有价值的基准测试框架和必要的 bug 修复,设计上考虑了可扩展性(from_cli_args 模式、异步并发、灵活报告生成)。review 中的改进已全部落实。

参与讨论