Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 20:16 同步状态:空闲 下次计划:2026-09-01 21:16

PR 列表

更多筛选
2026-06-18
缺陷修复 重要性 5.97 洞察度 4.00

bench_one_batch_server 复用已有服务器,避免孤儿进程

虽然变更不大,但后续若有人扩展基准测试框架,可以借鉴 `server_is_up` 的复用模式。建议在复用已有服务器时增加模型/参数校验(如比较 model name),避免无意识跑错模型。

重构 重要性 6.33 洞察度 5.00

移除输出热路径中过时的负载收集

建议在合并前优先解决 `WatchLoadUpdateReq` 被外部包导入的兼容性问题,可以为 `smg-grpc-servicer` 提供兼容性 shim 或标记为弃用。PR 本身逻辑正确,但缺少测试覆盖,建议补充单元测试验证移除后不影响核心路径。值得关注的设计决策是清理旧 API 时需充分评估外部依赖。

#28556 chore: bump sgl-kernel version to 0.4.4

原始 PR · 作者 sglang-bot · 合并时间 2026-06-18 04:38

基础设施 重要性 3.97 洞察度 2.00

sgl-kernel 版本号从 0.4.3 升至 0.4.4

变更简单明确,可直接合并。建议在合并前确认 sgl-kernel 0.4.4 版本包已成功构建并上传到相关仓库。

#28394 Upgrade fa3 hash

原始 PR · 作者 Fridge003 · 合并时间 2026-06-18 04:32

功能 重要性 6.84 洞察度 5.00

升级 FA3 hash 并支持 only_qv 模式

推荐阅读 `sgl-kernel/python/sgl_kernel/flash_attn.py` 中 `only_qv` 的实现,了解如何在不改变内核 API 的情况下通过填充空张量跳过计算路径。该设计模式在类似场景(如条件性跳过某些 matmul)中有参考价值。同时,构建配置的智能化(根据平台开关 FA3)值得在其他 CUDA 特性中推广。

缺陷修复 重要性 6.42 洞察度 5.00

修复 draft-extend 阶段 mrope_positions 崩溃

建议精读。该 PR 修正了一个明确的运行时崩溃,修复逻辑清晰,通过新增分支复用已有方法,设计简洁。值得关注的是如何通过函数签名扩展(添加可选参数)来统一不同阶段的 mrope 位置计算。

功能 重要性 8.76 洞察度 6.00

新增 Apple Silicon Metal 性能分析后端

值得精读。该 PR 展示了如何通过 backend patch 模式在 SGLang 中为新型硬件添加 profiling 支持,设计思路清晰,与已有 NPU 后端一致,可作为跨后端扩展的参考模板。对于 Apple Silicon 开发人员,还提供了详细的用法和验证结果。

缺陷修复 重要性 7.21 洞察度 7.00

修复 EAGLE3 aux 捕获在 AR 融合下的 per-rank 碎片问题

值得精读,特别是 `_post_attn_residual_is_read_only` 的设计模式可作为类似 fusion-pass 中捕获正确状态的范例。建议合并前确认是否有针对 TP>1 的集成测试覆盖,后续可考虑添加。

参与讨论