Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 02:49 同步状态:空闲 下次计划:2026-09-04 03:49

PR 列表

更多筛选
2026-06-09

将 1.3MB 的 tokenizer 测试 fixture 缩小为几 KB

这个 PR 是测试基础设施的清理工作,值得所有关注仓库健康度的开发者了解。它展示了如何在不影响测试覆盖的前提下,通过细心分析测试依赖来安全地移除大型二进制/JSON 文件。

缺陷修复 重要性 5.47 洞察度 4.00

修复 FA3 EAGLE draft decode 的 page_table scatter OOB

本 PR 已合并,无需额外操作。建议开发者在涉及 FA3 后端和 speculative decoding 时,关注 #27360 的修复逻辑,并确保类似场景在其他后端也得到测试。

重构 重要性 7.01 洞察度 3.00

规范 Spec V2 代码命名,accepted→accept,page_size_1→contiguous

此 PR 是代码规范化的良好实践,值得精读以理解团队命名约定。对于关注 speculative decoding 的实现细节的工程师,重命名后的函数名更易理解其语义(accept 而非 accepted)。

性能优化 重要性 7.88 洞察度 6.00

融合 Spec 中 4 个 gather 算子,TPOT 提升 1-2%

值得精读,展示了如何用 Triton 手动融合 gather 操作绕过 torch.compile 融合限制,并附有高质量的测试设计,可作为 Triton kernel 开发的范例。

功能 重要性 9.36 洞察度 6.00

支持 DSV4 DP Attention 可断点 CUDA 图

建议所有 DeepSeek V4 相关开发者精读此 PR,重点关注: 1. `DSV4AttnMetadata.refresh_for_breakable_cuda_graph_replay_` 中的字段分类设计,这是图捕获地址稳定的核心。 2. BCG 运行器中 DP rank 同步保护的模式,可复用于其他分布式后端。 3. 注意力后端接口的扩展方式,后续为其他模型添加 BCG 支持时可参考 `DeepseekV4AttnBackend` 的 opt-in 实现。 对于运维团队,建议先在低风险预发布环境进行 A/B 性能对比,确认工作负载符合预期后再推广。

#27517 docs: sync LMSYS SGLang blog cards

原始 PR · 作者 sglang-bot · 合并时间 2026-06-09 04:31

文档 重要性 3.43 洞察度 2.00

同步 LMSYS 博客卡片列表,轮换最新博文

简单文档同步 PR,无需精读。但可关注自动化脚本是否后续修复了 unicode 转义问题。

#27528 Fix GPT-OSS MXFP4 hidden size reshape on SM10X

原始 PR · 作者 mmangkad · 合并时间 2026-06-09 04:26

缺陷修复 重要性 5.95 洞察度 4.00

修复 GPT-OSS MXFP4 在 SM10X 上的 hidden size 对齐问题

该 PR 值得合并,是一个定位清晰、修复精准的 bugfix。虽然没有新增测试,但手动验证已覆盖关键场景。建议合并后关注是否有其他使用 `self.experts.hidden_size` 的模型也存在类似问题。

参与讨论