Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-08-02

#33277 [CI] Fix stale CPU test fixtures

原始 PR · 作者 mmangkad · 合并时间 2026-08-02 22:38

缺陷修复 重要性 3.86 洞察度 3.00

修复两个过期 CPU 测试夹具,字段对齐新配置

不值得精读,但值得作为「跨 PR fixture 漂移」案例被记录:它和 #33254 一起展示了当多个功能 PR 并行演进配置结构时,手写测试桩需要及时同步。若后续有梳理测试基建的计划,可考虑把这类 `SimpleNamespace` 桩替换为真实配置工厂方法,从根上避免同类 CI 失败。

#33275 [diffusion] model: support minimax-h3

原始 PR · 作者 mickqian · 合并时间 2026-08-02 22:32

功能 重要性 9.36 洞察度 7.00

新增 MiniMax-H3 原生音视频生成管线与部署支持

值得精读。该 PR 展示了大型多模态生成模型在 SGLang 中落地的完整工程范式,尤其是 `video_adapter.py` 的 fail-closed 请求校验、`packed_sequence.py` 的布局构造、`denoise_loop.py` 的静态分支预计算与避免热点循环 gather/scatter 的优化思路,以及 VAE 的 tiling/blend 机制,都是高质量的设计参考。建议重点阅读 `minimax_h3.py`、`klvae.py`、`denoise_loop.py` 与 `material_io.py`。

缺陷修复 重要性 3.88 洞察度 3.00

测试桩补全字段,修复 base-a-test-cpu CI 失败

## 建议 - 值得快速浏览即可,不必精读;核心价值在于理解测试桩与真实配置对象的字段同步问题。 - 值得关注的设计点:`ResolvedView.__getattr__` 的隐式转发会让桩缺失字段在运行时才暴露;更健壮的做法是让桩直接基于 `ServerArgs` 的字段集生成默认值,或在测试中引入字段覆盖检查,避免手工维护。 - 若后续 `_mla_backend_page_constraints` 继续演进,建议在同一 PR 中同步更新该测试桩。

测试 重要性 7.44 洞察度 5.00

基准数据集采样支持 --seed 确定性,新增图像前缀缓存复用测试

值得精读:可学习如何用“排序 + RNG 重置”让基于全局随机状态的采样在跨 tokenizer 版本时保持确定性,以及如何通过端到端贪心请求校验图片前缀缓存正确性。断言修复的 caution 说明体现了对隐性坏味道的复盘,建议关注后续 VLM 套件的失败信号。

缺陷修复 重要性 6.57 洞察度 2.00

回滚 #33026 TCP 层 TTFT 修复,恢复旧 socket 绑定

值得快速了解回滚背景,若依赖 rust-server 性能,请关注后续重新修复的 PR。不必精读源码。

测试 重要性 5.46 洞察度 6.00

测试夹具改优雅关闭,消除 GPU 残留误报

值得精读。这是一个罕见的"机制导向"CI 修复案例:作者没有止步于表面修好,而是用定量 A/B 证伪自己的初次结论,最终给出"减少 38% 但不消除"的诚实评估。对维护大型 GPU 测试集群的团队,terminate_and_kill_process_tree 加静态反汇编扫描的方法论可借鉴;同时它揭示了 SIGKILL 关停 CUDA 服务器时 pinned host 内存回收的耗时机制,对理解测试隔离设计有参考价值。

功能 重要性 7.94 洞察度 6.00

NPU 多模态注意力默认选 ascend_attn,图执行同步生效

值得精读。该 PR 是理解 SGLang 多模态后端选择机制的良好示例:它展现了“单一解析点 + 结果传播”如何避免组件间重新读取原始配置的脆弱性,并演示了硬件优化实现必须与安全默认(mask 回退)配套的设计权衡。关注 NPU 或多模态推理的工程师建议仔细阅读 vision.py 中 backend 解析与 `VisionAscendAttention` 的 mask 回退逻辑。

#30177 [Feature] Support return_hidden_states="last"

原始 PR · 作者 ltaodream · 合并时间 2026-08-02 15:09

功能 重要性 9.06 洞察度 7.00

新增 return_hidden_states="last",仅返回末 token 向量以降低载荷

值得精读,是 hidden-states 服务化能力的关键演进。重点关注三处设计决策:(1) 固定 server 级 capture ceiling 取代按需重捕获,避免图重建抖动;(2) radix cache 语义对 prefill 切片偏移步长的约束(`extend_input_len_per_req` 而非 `len(origin_input_ids)`);(3) EAGLE `tc_piecewise` 与 FP4/TRTLLM-MoE 死图前科(#28870)对 skip guard 的要求。测试文件 `test_batch_result_processor_hidden_states.py` 与 `test_hidden_state_graph_recapture.py` 是理解边界条件的最佳入口。

参与讨论