Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 21:57 同步状态:空闲 下次计划:2026-09-02 22:57

PR 列表

更多筛选
2026-06-09

#27517 docs: sync LMSYS SGLang blog cards

原始 PR · 作者 sglang-bot · 合并时间 2026-06-09 04:31

文档 重要性 3.43 洞察度 2.00

同步 LMSYS 博客卡片列表,轮换最新博文

简单文档同步 PR,无需精读。但可关注自动化脚本是否后续修复了 unicode 转义问题。

#27528 Fix GPT-OSS MXFP4 hidden size reshape on SM10X

原始 PR · 作者 mmangkad · 合并时间 2026-06-09 04:26

缺陷修复 重要性 5.95 洞察度 4.00

修复 GPT-OSS MXFP4 在 SM10X 上的 hidden size 对齐问题

该 PR 值得合并,是一个定位清晰、修复精准的 bugfix。虽然没有新增测试,但手动验证已覆盖关键场景。建议合并后关注是否有其他使用 `self.experts.hidden_size` 的模型也存在类似问题。

#25464 [Spec] Deprecate Spec V1

原始 PR · 作者 hnyls2002 · 合并时间 2026-06-09 04:10

重构 重要性 9.36 洞察度 6.00

废弃 Spec V1 单体 Worker,统一使用 V2 Worker

值得精读。该 PR 展示了在达到功能对等后安全删除大量旧代码的典型模式:先逐步补齐 V2 功能,确认 CI 覆盖后一次性清除 V1。`scheduler.py` 中 `_forward_isolation` 的泛化设计也值得借鉴——将 overlap 特定逻辑参数化,保持同步/异步路径的统一。建议团队在类似技术债务清理时参考此流程。

性能优化 重要性 6.22 洞察度 6.00

消除 ROCm decode 中冗余的 fp8 scale 转置拷贝,TPOT 降低约 2%

本 PR 是一个非常典型的『消除不必要内存拷贝』的性能优化案例,值得学习其中的 `torch.as_strided` 零拷贝视图技巧,以及通过条件编译保护跨平台兼容性的设计思想。建议所有参与 ROCm 或底层性能优化工作的工程师精读。

缺陷修复 重要性 7.27 洞察度 6.00

修复 EAGLE draft worker 的 SWA KV 池解析错误

该 PR 值得精读,特别是涉及 TRTLLM、SWA 和 speculative decoding 交互的开发者。设计上清晰区分了 EAGLE 和 FROZEN_KV_MTP 的 SWA 池使用策略。后续若新增 speculative 算法,需注意此处逻辑。

#27495 Fix TRTLLM target verify query metadata

原始 PR · 作者 merrymercy · 合并时间 2026-06-09 01:58

缺陷修复 重要性 4.73 洞察度 3.00

删除 TRTLLM target verify 中错误的 max_seq_len_q 覆盖

该 PR 为单行 bugfix,逻辑清晰,建议合并。对于好奇原 bug 细节的开发者,可参考 #27473 和 #27494 了解回滚原因。

#27577 [NPU] Fix CI

原始 PR · 作者 e-martirosian · 合并时间 2026-06-09 01:44

缺陷修复 重要性 3.30 洞察度 2.00

修复 NPU W4A4 测试中缺失的并行配置

该 PR 属于常规的 CI 修复,可快速合并。建议关注后续 NPU 测试套件的稳定性,确保类似配置缺失问题不再出现。

功能 重要性 9.36 洞察度 7.00

为 SANA-WM 世界模型添加扩散、流式与实时推理支持

建议精读。该 PR 设计具有较高参考价值:自强迫去噪的流式框架、GDN/Softmax 混合注意力实现、实时链式状态管理。重点关注 `streaming.py`、`self_forcing.py` 和 `realtime_chain.py` 中的模式,便于后续集成其他世界模型。

参与讨论