Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 00:08 同步状态:空闲 下次计划:2026-09-03 01:08

PR 列表

更多筛选
2026-08-02
功能 重要性 7.94 洞察度 6.00

NPU 多模态注意力默认选 ascend_attn,图执行同步生效

值得精读。该 PR 是理解 SGLang 多模态后端选择机制的良好示例:它展现了“单一解析点 + 结果传播”如何避免组件间重新读取原始配置的脆弱性,并演示了硬件优化实现必须与安全默认(mask 回退)配套的设计权衡。关注 NPU 或多模态推理的工程师建议仔细阅读 vision.py 中 backend 解析与 `VisionAscendAttention` 的 mask 回退逻辑。

#30177 [Feature] Support return_hidden_states="last"

原始 PR · 作者 ltaodream · 合并时间 2026-08-02 15:09

功能 重要性 9.06 洞察度 7.00

新增 return_hidden_states="last",仅返回末 token 向量以降低载荷

值得精读,是 hidden-states 服务化能力的关键演进。重点关注三处设计决策:(1) 固定 server 级 capture ceiling 取代按需重捕获,避免图重建抖动;(2) radix cache 语义对 prefill 切片偏移步长的约束(`extend_input_len_per_req` 而非 `len(origin_input_ids)`);(3) EAGLE `tc_piecewise` 与 FP4/TRTLLM-MoE 死图前科(#28870)对 skip guard 的要求。测试文件 `test_batch_result_processor_hidden_states.py` 与 `test_hidden_state_graph_recapture.py` 是理解边界条件的最佳入口。

缺陷修复 重要性 7.12 洞察度 6.00

修复 DSV4 fused-RMS FP8 scale 错位,gfx950 精度回归消除

值得精读。核心看点:1) 布局契约(logical vs physical stride)在跨算子调用链中如何被破坏与修复;2) producer 端修复优于 consumer 端修复的设计判断,有 #31617 失败案例佐证;3) torch.as_strided 零拷贝修复技巧与配套的存储别名断言测试。对 AMD 量化和多拓扑部署团队有直接参考价值。

文档 重要性 3.72 洞察度 2.00

删除不可达的 inkling LoRA 基准条目

无需精读。若关注 docs 侧基准配置的数据契约,可留意 PR body 对 `findBenchmark` 与 `findCell` 匹配逻辑的说明,理解这类配置文件必须与单元格声明保持一致。

性能优化 重要性 7.74 洞察度 6.00

AMD MoE 权重加载提速:H2D 前紧凑化 mmap view,加载快 5.6x

值得精读。核心是理解 mmap-backed storage 与 torch view 对 H2D 拷贝性能的影响,以及如何用最小侵入的开关 + 针对性单测验证。关注 `_copy_weight_view_before_h2d` 的判断条件设计(storage_offset、untyped_storage().nbytes())和 CI 分层验证策略。

缺陷修复 重要性 5.87 洞察度 5.00

FP4 MoE 对齐降到 128,权重减约 40 GiB

值得精读:对于在 AMD 平台上部署 DeepSeek-V4 的团队,值得理解这个 padding 对齐与 kernel tile 大小的关系;对于一般读者,这是一个"一行常量修改 + 外部依赖联动"的典型案例,可学习如何在量化路径中通过 kernel 能力约束来压缩权重内存。关注点:aiter 版本升级的落地状态;若后续要推广到其他模型,注意不同 MoE kernel 的 tile_k 支持差异;建议补充参数化单测。

功能 重要性 9.36 洞察度 7.00

会话感知驱逐的 Unified Radix Cache,提升 agentic 多轮命中率

值得精读。重点学习:UnifiedLRUList 的 mid/cursor 分区哨兵设计(O(1) 未引用优先驱逐)、软保护(soft-protected)与硬 pin 的语义区别、SWA 按窗口长度精确记账避免重复引用、跨组件原子驱逐保护(`_can_evict_leaf_atomically`)、以及用 session generation + closed tombstone 解决 in-flight 竞态的手法。同时留意两个已承认的 follow-up:会话引用 TTL、close 后分区切换导致的 recency 失真。

功能 重要性 6.38 洞察度 7.00

Gemma 4 MTP draft 后端支持 trtllm_mha,修复 topk>1 图尺寸越界

值得精读。核心价值不在改动量(4 文件 +19/-10),而在两处洞察:(1) 为什么 triton 一直掩盖 topk 展开后的序列数问题——`TritonAttnBackend` 从 `max_num_tokens` 推导一切,只有 trtllm_mha 把 `max_bs` 当序列数读;(2) SM100 守卫缺失导致整类测试在目标 runner 上静默跳过——测试守卫覆盖不足比没有测试更危险。建议跟进三件事:为 trtllm_mha + topk>1 补 paged tree-draft 夹具或参数化注册测试;修复 test_model_overrides.py 回归并加固属性访问;把 pyc96 提出的 server_args 层 gap 校验闭环。

参与讨论