Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-08-26
基础设施 重要性 6.18 洞察度 4.00

为 M3 新增 MI35x 夜间性能基准,替换 M2.5 槽位

值得关注的是其 CI 门控与资源配置设计:精度与性能共用 job、复用已验证 recipe、perf 步骤容错运行,这种模式适合在资源受限的 nightly 矩阵中扩展覆盖。对于关注 AMD 或 MiniMax-M 系列的工程师可精读测试文件与 workflow 变更;对一般开发者,可作为 CI 基准组织方式的参考。

缺陷修复 重要性 5.07 洞察度 6.00

锁外迭代前快照 affected rooms 修复竞态

值得精读,尤其是对 `CommonKVManager` 和节点故障处理机制感兴趣的工程师。该 PR 展示了如何通过简单的快照修复隐患,并详细分析了各后端的访问模式,对理解锁内外数据一致性有启发。

缺陷修复 重要性 7.81 洞察度 6.00

修复 prefill 重启后解码端复用旧端口,缓存代际按对象身份失效

值得精读。该 PR 展示了一个典型的“缓存失效需精确到对象身份”的并发设计:通过记录谁引用了哪一代缓存、在失效时用 `is` 比较避免误删并发替换,是处理分布式/多接收者缓存失效的佳例。同时,将 `_connect_to_bootstrap_server` 移入 `try` 块并在发送失败时同步失效,体现了错误恢复与缓存一致性联动的思路。建议重点关注 `_setup_bootstrap_infos` 中 `setdefault` 与对象身份判断的组合用法。

2026-08-25
性能优化 重要性 7.22 洞察度 5.00

EXTEND 调优按实际调度器缓冲预热,DP prefill 吞吐提升约 6%

建议精读 `flashinfer_autotune.py` 中 token 预算来源与 `base_runner.py` 断言放宽两处改动,重点学习「预热形状必须对应生产负载的真实 per-rank 缓冲」这一性能分析思路。如果部署并启用 `SGLANG_FLASHINFER_AUTOTUNE_EXTEND`,建议先在小流量验证多模态与投机组合,再逐步扩大。

文档 重要性 7.19 洞察度 2.00

新增 IBM Granite 4.2 cookbook 文档与基准配置

值得快速翻阅,作为新增 cookbook 的示例,了解配置脚本与基准数据的组织方式。无需深入阅读。

缺陷修复 重要性 7.16 洞察度 5.00

修复非 gated MoE 的 MXFP8 权重尺寸分配

值得精读。该 PR 展示了如何从层配置推导张量形状而非硬编码,是量化模块中一种可复用的模式;同时覆盖了模型结构差异导致的隐蔽 bug,具有教学意义。

参与讨论