Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 21:09 同步状态:空闲 下次计划:2026-09-03 22:09

PR 列表

更多筛选
2026-04-30

#21062 Use spec v2 by default

原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-04-30 04:40

功能 重要性 8.34 洞察度 5.00

默认启用 spec v2 推测解码

该 PR 值得仔细阅读,特别是 `server_args.py` 中默认逻辑的设计和测试用例的配套调整。展示了如何将一个实验性特性平稳切换为默认,同时保留回退路径。对于使用推测解码的开发者,应了解新的默认行为和降级条件。推荐关注后续是否有针对 topk>1 支持的 PR。

#23105 feat: Support modelexpress p2p RDMA transfer

原始 PR · 作者 AndyDai-nv · 合并时间 2026-04-30 03:57

功能 重要性 8.66 洞察度 7.00

为 ModelExpress 添加 NIXL RDMA 传输后端

值得精读:展示了传输层抽象(通过 `transport` 配置分支)和数据契约(`WorkerMetadata` 的 oneof 设计)。建议合并后尽快补充 NIXL 路径的 CI 集成测试,以及验证不同量化模型的张量布局一致性。

功能 重要性 9.18 洞察度 7.00

MLX 后端实现解码异步重叠调度

**值得精读**。该 PR 展示了如何利用 MLX 的 lazy evaluation 特性设计高效的 GPU 流水线,是 Apple Silicon 推理性能优化的核心里程碑。`SchedulerMlxOverlapMixin` 中的链式调度设计(两图链、链中断条件、`async_eval` 与 `finalize` 分离)具有较高参考价值。后续可以考虑扩展到 prefill/extend 链以及更鲁棒的 KV 缓存管理。

基础设施 重要性 3.13 洞察度 3.00

扩增 CI 测试 runner 池至 H100 和 H200

推荐合并前与运维确认 `1-gpu-h100-h200` 标签已正确添加到对应 runner 池。本 PR 逻辑简单,不涉及代码逻辑变更,但引用了 #23505 的模式,值得团队在后续扩池时参考。

参与讨论