Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 21:57 同步状态:空闲 下次计划:2026-09-02 22:57

PR 列表

更多筛选
2026-06-18

#28617 Fix bench serving base-url-only runs

原始 PR · 作者 mmangkad · 合并时间 2026-06-18 15:34

缺陷修复 重要性 5.77 洞察度 3.00

修复 bench_serving 仅传 --base-url 时的崩溃

该 PR 是小型回归修复,值得关注其体现的设计原则:将相似逻辑集中到共享函数中以避免重复和条件分支。值得快速合并。

功能 重要性 9.36 洞察度 7.00

为 DeepSeek-V4 模型添加 Ascend NPU 完整推理支持

该 PR 值得仔细阅读,特别是对以下方面感兴趣的人: - 如何将复杂的注意力机制(混合 SWA + 压缩索引)移植到新硬件后端。 - 如何通过工厂方法和钩子模式最小化对现有 CUDA 代码的侵入。 - NPU 分页内存池与 CUDA 环缓冲在管理上的设计差异。 建议重点关注 `ascend_dsv4_backend.py` 中 Walsh-Hadamard 变换的实现、`dsv4_memory_pool.py` 中的 NPU 分页状态池大小计算、以及 `dsv4_common_hooks.py` 中的预写钩子模式。

缺陷修复 重要性 5.70 洞察度 6.00

修复 SWA 模型 L3 缓存预取与匹配长度不一致问题

建议阅读本 PR 以理解 HiCache 预取与 SWA correction 的交互,以及 `_compute_max_prefix_len` 在缓存一致性中的关键作用。相关测试配置方式也可作为后续架构适配的参考。

测试 重要性 6.96 洞察度 3.00

为FA3 only_qv (NoPE)解码路径添加单元测试

结构清晰,适合需要了解 FA3 only_qv 测试方法的开发者阅读。合并后可增强注意力内核的可靠性。建议在后续 FA3 架构扩展时更新跳过条件。

修复 AMD HIP 上 MoE topk 填充区域掩码被错误跳过导致精度崩溃

此 PR 值得重点关注,尤其是: 1. **条件逻辑正确放置的重要性**:一个看似无害的移动(将 mask 放入 EPLB 条件)足以摧毁模型的端到端精度,凸显了在复杂代码中对条件守卫进行严格审查的必要性。 2. **回归修复的范式**:PR 以最小 diff(+9/-8)解决了重大回归,并附有清晰的动机、根因分析和交叉验证,是高质量 bugfix 的范例。 3. **跨 PR 依赖管理**:作者在 PR body 中明确标识了 MTP 失败为独立问题(#28410),避免了归因混淆。

#28546 [diffusion] Fix FP8 fused TP scale loading

原始 PR · 作者 mickqian · 合并时间 2026-06-18 14:38

缺陷修复 重要性 7.04 洞察度 6.00

修复融合 FP8 per-tensor scale 在 TP 下加载错误

值得精读,特别是权重加载器处理特殊参数(`PerTensorScaleParameter`)的设计模式。为类似量化参数的加载提供了可参考的标量广播实现。

基础设施 重要性 5.02 洞察度 4.00

新增AMD CI extra-a 1-gpu-large测试层

该PR展示了良好的CI分层设计:将测试按硬件平台和资源需求分层,并通过标签控制触发。其跨平台测试注册方式(register_cuda_ci / register_amd_ci)值得其他后端参考。建议关注后续可能将更多通过验证的测试从CUDA extra-a移植到AMD。

参与讨论