Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 00:39 同步状态:空闲 下次计划:2026-09-04 01:39

PR 列表

更多筛选
2026-05-29

#26628 Revert "Fix FA DRAFT_EXTEND_V2 cache extent"

原始 PR · 作者 ch-wan · 合并时间 2026-05-29 09:45

缺陷修复 重要性 6.41 洞察度 4.00

回滚 DRAFT_EXTEND_V2 cache extent 修复并推迟 CUDA graph 测试

建议读者重点关注此回滚的背景:当前 `DRAFT_EXTEND_V2` 的 cache extent 问题尚未解决,团队选择了暂时回退。如果使用相关特性,应切换到其他 attention 后端(如 Triton)或等待后续修复。同时值得阅读 `KNOWN_FAILURES.md` 中的详细记录,了解根因和所需变更。

#26257 [XPU] Fix Device Assignment

原始 PR · 作者 SKRohit · 合并时间 2026-05-29 09:38

缺陷修复 重要性 6.56 洞察度 5.00

修复 XPU 设备分配,适配多模型

建议合并。该 PR 解决了 XPU 上的关键阻塞问题,设计简洁,改动量小。但建议作者或团队后续补充针对这些模型的 XPU 单元测试,并跟进 `_match_cos_sin_cache_dtype` 是否有更优实现(如初始化时就匹配 dtype)。

缺陷修复 重要性 5.90 洞察度 4.00

修复 --decrypted-draft-config-file 未生效的问题

本 PR 修改简单但定位准确,值得阅读的要点包括:如何通过 `kwargs` 机制向配置加载过程注入额外参数;以及可变默认参数的实际取舍方式。建议在类似功能中统一使用 `None` 默认值以提升安全性。

缺陷修复 重要性 6.21 洞察度 5.00

修复 NPU 上 DeepSeek 模型加载时 quant_config.packed_modules_mapping 被覆盖

该 PR 是一个精确的 bugfix,值得精读以理解量化配置的契约。设计上引入多态方法而非条件判断,是良好的重构方向。建议为新增方法补充单元测试。

#26625 Update Step-3.7-Flash Docker image tag

原始 PR · 作者 yhyang201 · 合并时间 2026-05-29 08:40

其他 重要性 1.99 洞察度 1.00

更新 Step-3.7-Flash Docker 镜像标签

该 PR 是常规的文档维护,无需深入审查。对于关注 Step-3.7-Flash 部署的读者,可了解镜像标签的演进。

测试 重要性 8.22 洞察度 7.00

为注意力后端添加模块级单元测试套件

建议所有关注注意力后端的开发者仔细阅读本 PR 的测试架构,特别是参考实现的设计和 SWA decode 规则分类。后续新增后端时,务必在 dense_attention.py 中注册 SWA decode 规则,并按照已有模式添加测试文件。KNOWN_FAILURES.md 也是必读文档,用于理解当前后端限制。

#26565 model: Step-3.7-Flash Support

原始 PR · 作者 yhyang201 · 合并时间 2026-05-29 08:00

功能 重要性 9.18 洞察度 5.00

新增 Step-3.7-Flash 多模态 MoE 模型支持

值得精读,特别是模型组合方式(视觉编码器 + MoE 语言模型)以及多模态特征提取的实现。建议关注 review 中提到的批处理问题,并优先补全单元测试和修复文档中的镜像版本。

参与讨论