Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 00:39 同步状态:空闲 下次计划:2026-09-04 01:39

PR 列表

更多筛选
2026-04-30

#23105 feat: Support modelexpress p2p RDMA transfer

原始 PR · 作者 AndyDai-nv · 合并时间 2026-04-30 03:57

功能 重要性 8.66 洞察度 7.00

为 ModelExpress 添加 NIXL RDMA 传输后端

值得精读:展示了传输层抽象(通过 `transport` 配置分支)和数据契约(`WorkerMetadata` 的 oneof 设计)。建议合并后尽快补充 NIXL 路径的 CI 集成测试,以及验证不同量化模型的张量布局一致性。

功能 重要性 9.18 洞察度 7.00

MLX 后端实现解码异步重叠调度

**值得精读**。该 PR 展示了如何利用 MLX 的 lazy evaluation 特性设计高效的 GPU 流水线,是 Apple Silicon 推理性能优化的核心里程碑。`SchedulerMlxOverlapMixin` 中的链式调度设计(两图链、链中断条件、`async_eval` 与 `finalize` 分离)具有较高参考价值。后续可以考虑扩展到 prefill/extend 链以及更鲁棒的 KV 缓存管理。

基础设施 重要性 3.13 洞察度 3.00

扩增 CI 测试 runner 池至 H100 和 H200

推荐合并前与运维确认 `1-gpu-h100-h200` 标签已正确添加到对应 runner 池。本 PR 逻辑简单,不涉及代码逻辑变更,但引用了 #23505 的模式,值得团队在后续扩池时参考。

参与讨论