Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 00:08 同步状态:空闲 下次计划:2026-09-03 01:08

PR 列表

更多筛选
2026-06-30
缺陷修复 重要性 6.01 洞察度 6.00

修复 EAGLE MTP 草稿步中 indexer 重用失效 bug

该 PR 修复了一个隐蔽但性能影响显著的问题,核心设计(将跨步状态移动到引用共享的 spec_info 对象)值得精读。对于维护 EAGLE 草稿或类似跨步共享状态的场景具有参考价值。建议合并。

功能 重要性 9.18 洞察度 6.00

新增可选的页面主序 KV 布局,为页面粒度操作奠基

此 PR 是 KV 缓存架构调整的基石,推荐精读。关键设计决策包括:利用 constexpr 折叠实现零开销切换;使用子类化替代条件分支来区分布局;对不兼容方法主动抛出 `NotImplementedError` 防止误用。`build_page_major_mha_views` 的 strided view 构建值得学习。

缺陷修复 重要性 8.27 洞察度 5.00

修复 checkpoint prefetch 并发控制和 drop-cache 逻辑

本 PR 展示了如何将异步并发逻辑改造成有界线程池并编写可测试的代码,适合精读。尤其是 `_InlineThread`/`_InlineExecutor` 的 mock 模式值得借鉴。设计决策方面,选择 `concurrent.futures` 而非 asyncio 以简化依赖,并确保与 weight_utils 其余部分线程模型一致。

缺陷修复 重要性 6.80 洞察度 5.00

新增 STANDALONE 模式词汇表兼容性验证

该 PR 值得快速合并,因为它修复了一个静默输出损坏的严重 bug(虽然仅在特定配置下出现),且影响面小、风险低。review 中关于性能与兼容性的讨论具有通用参考价值。

文档 重要性 5.97 洞察度 3.00

GLM-5.2 NVFP4 B300 配置与基准更新

该 PR 为纯文档更新,内容清晰,已验证通过。建议合并。对于使用 GLM-5.2 NVFP4 的团队,值得参考 balanced 策略中的 `--speculative-attention-mode decode` 和 `--max-running-requests` 调整经验。

#29470 [GLM-5] Tune the threshold of router GEMM

原始 PR · 作者 b8zhong · 合并时间 2026-06-30 05:19

性能优化 重要性 5.61 洞察度 6.00

调优 GLM-5 MoE 路由 GEMM 阈值以提升性能

该 PR 值得精读,尤其适合关注 GPU kernel 调度和性能调优的工程师。其展示了如何通过微基准测试和 E2E 吞吐对比,平衡 micro-benchmark 与实际负载的差异。设计决策(架构感知阈值)简洁有效。

其他 重要性 2.29 洞察度 2.00

文档中 uv 安装添加 --prerelease=allow 参数

该 PR 内容简单直接,属于常规文档维护。无需精读。值得注意的设计决策是选择 `--prerelease=allow` 而非 `--prerelease=if-necessary` 或 `--prerelease=explicit`,因为 flash-attn-4 是传递依赖,后两者无法生效。

文档 重要性 6.49 洞察度 4.00

为 GLM-5.2 cookbook 添加 B200 NVFP4 部署配方与基准数据

此 PR 适合有 GLM-5.2 在 B200 NVFP4 上部署需求的工程师精读,配置参数和性能数据可作为 baseline 参考。其他角色可快速浏览了解新硬件覆盖情况。

参与讨论