Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-08-21
重构 重要性 6.46 洞察度 5.00

清理 srt/managers 冗余注释,重写评论风格规则

值得精读 .claude/rules/comment-style.md 与提交序列。规则中“成本恢复”测试(删掉注释后,熟悉仓库的人能否从周围代码加 grep 恢复该事实)和“写作 vs 编辑”的决策不对称,是注释管理的实用框架;提交序列展示了“先删后补”的收敛过程,对评审者判断注释清理 PR 的边界有参考价值。若团队计划继续推广该风格,建议参照本 PR 的亮线规则,避免在后续清理中误删承载跨文件契约的注释。

功能 重要性 5.02 洞察度 3.00

Kimi-K3 自动 MoE 选择扩展到 SM107,防止显存耗尽

建议在 FlashInfer 官方 artifact 验证通过后合并。合并前应补充针对 SM107 的单元测试和集成测试,确保后端正确选择。此变更逻辑简单,但硬件依赖性强,需谨慎验证。

文档 重要性 5.00 洞察度 4.00

为 Qwen3.8-27B cookbook 新增 DFlash2 推理选项,含平台验证条件。

该 PR 值得精读,特别是对于需要在 Qwen3.8-27B 上部署 DFlash2 的用户。文档提供了详细的参数说明和验证状态,是很好的参考。对于其他开发者,也可了解如何为 cookbook 增加新选项。

缺陷修复 重要性 7.10 洞察度 6.00

修复 DCP 下 decode mamba checkpoint 深度落空树页网格的静默错误

值得精读。核心看点:用 lcm 派生网格同时满足 chunk、树页、用户间隔三个约束且不污染 ServerArgs 原始值;对检查点深度(checkpoint depth)与 flush 节奏(flush/write cadence)两类读者做刻意区分;以及“缓存复用结构完全不变、只改变挂载 state”的静态论证方法。建议与 #34808 一起阅读,理解同一不变量在 extend 与 decode 两侧的实现差异;同时关注 PR 遗留的解码半程精度验证缺失,后续应有跟进 PR 补齐。

#34829 📝 [NPU] Clean up quantization comments

原始 PR · 作者 TallMessiWu · 合并时间 2026-08-21 03:03

重构 重要性 5.05 洞察度 2.00

清理 NPU 量化注释中的外部归属引用

值得快速回顾,作为文档清理的示例,但无需深入阅读。可参考其清理外部归属的方法,保持代码注释自包含。

功能 重要性 4.46 洞察度 3.00

gRPC GetServerInfo 暴露 KV 事件发现元数据

值得快速阅读,以了解如何在不改变协议的情况下向 gRPC 接口添加元数据。设计决策是复用现有方法而非重复实现,值得关注。

#34406 TP/PP Consensus checker

原始 PR · 作者 stepinto · 合并时间 2026-08-21 01:36

功能 重要性 9.00 洞察度 6.00

新增 PP/TP 秩间共识检查器,提前定位分歧根因

值得精读,重点看 `rank_consensus_checker.py` 的装饰器设计:选择器归一化、`self` / `cls` 跳过、关闭时 import 阶段短路实现零开销、后台线程 + 专用 gloo 组的比对模型。建议与 #27010(HiCache PP 一致性修复)一起阅读,理解 PP 分歧的根因与验证链路。后续可关注 hzh0425 提出的 e2e 测试 follow-up。

缺陷修复 重要性 7.73 洞察度 5.00

LLaVA 图像加载移出 CPU 超时预算,修复 flaky 500

建议精读 `llava.py` 中 `_process_single_image`、`_fetch_remote_image_bytes`、`_preprocess_image_task` 的拆分方式,这是异步超时预算与执行器池结合设计的典型案例;修复有量化证据但缺少固化测试,可关注后续是否补测,并在文档中补充 `SGLANG_MM_LOAD_MAX_RETRIES` 说明。

参与讨论