统一 CI 中 Rust 与 protoc 安装流程
建议合并,该 PR 通过集中化脚本和版本锁定显著提升 CI 可维护性,值得作为 CI 标准化参考。
SGLang is a high-performance serving framework for large language models and multimodal models.
统一 CI 中 Rust 与 protoc 安装流程
建议合并,该 PR 通过集中化脚本和版本锁定显著提升 CI 可维护性,值得作为 CI 标准化参考。
移除 DeepSeek V4 文档中过时提示
该 PR 无需深入阅读。作为常规文档清理,可以快速合并。
原始 PR · 作者 AndyDai-nv · 合并时间 2026-04-30 03:57
为 ModelExpress 添加 NIXL RDMA 传输后端
值得精读:展示了传输层抽象(通过 `transport` 配置分支)和数据契约(`WorkerMetadata` 的 oneof 设计)。建议合并后尽快补充 NIXL 路径的 CI 集成测试,以及验证不同量化模型的张量布局一致性。
原始 PR · 作者 fortunecookiee · 合并时间 2026-04-30 03:25
修复 Qwen3PooledOutput 缺少 get_input_embeddings
推荐合并,这是一个简单的修复,应尽快合入以解除 score API 对 Qwen3 分类模型的阻塞。
原始 PR · 作者 changminbark · 合并时间 2026-04-30 03:21
MLX 后端实现解码异步重叠调度
**值得精读**。该 PR 展示了如何利用 MLX 的 lazy evaluation 特性设计高效的 GPU 流水线,是 Apple Silicon 推理性能优化的核心里程碑。`SchedulerMlxOverlapMixin` 中的链式调度设计(两图链、链中断条件、`async_eval` 与 `finalize` 分离)具有较高参考价值。后续可以考虑扩展到 prefill/extend 链以及更鲁棒的 KV 缓存管理。
原始 PR · 作者 Kangyan-Zhou · 合并时间 2026-04-30 03:18
扩增 CI 测试 runner 池至 H100 和 H200
推荐合并前与运维确认 `1-gpu-h100-h200` 标签已正确添加到对应 runner 池。本 PR 逻辑简单,不涉及代码逻辑变更,但引用了 #23505 的模式,值得团队在后续扩池时参考。
原始 PR · 作者 AgainstEntropy · 合并时间 2026-04-30 02:43
修复 bench_hf.py KeyError 并添加 --limit 参数
建议合并,变更小且明确修复 bug 并提升开发效率。对于关注 MMMU 评测流程的开发者可快速浏览变更。
原始 PR · 作者 JustinTong0323 · 合并时间 2026-04-30 02:14
修复 fused_moe_native 死导入
值得合并,修复了一个导致服务器启动崩溃的关键 bug。建议阅读 PR 中 `fused_moe_native.py` 的导入修复方式,可作为后续重构时避免死导入的参考。
参与讨论