Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-06-16

自适应推测解码支持step=0与draft KV缓存更新

建议所有使用自适应推测解码(`--speculative-adaptive`)的用户阅读此 PR,特别是 `_build_trivial_verify_input` 的实现和 `SGLANG_SPEC_SKIP_ZERO_STEP_DRAFT_EXTEND` 的语义。该 PR 设计上保留了 draft KV 更新路径作为默认行为,是一个谨慎的权衡。测试覆盖完整,可直接合并。

缺陷修复 重要性 5.64 洞察度 4.00

NPU 回退 fused Triton 门控内核

此 PR 是标准的平台兼容性修复,设计简洁,风险低。值得精读以了解 NPU 硬件限制(coreDim)对 Triton kernel launch 的影响,以及如何通过条件分支优雅回退。

功能 重要性 9.14 洞察度 7.00

重新启用 MNNVL 后端并新增后端选择标志

建议精读此 PR,尤其是 backend 解析逻辑和 PCG 交互的处理。设计决策(后端自动选择、架构感知降级)值得在其他类似场景借鉴。

功能 重要性 5.76 洞察度 4.00

bench_serving 自动推断 tokenizer 路径

该 PR 改动虽小但实用,推荐阅读代码以了解基准测试工具的改进方向。review 中的防御性编程建议值得在其他类似场景中采纳。

功能 重要性 9.18 洞察度 7.00

在线压缩支持 MTP 推测解码,吞吐提升约 280%

值得精读。重点关注 `OnlineC128MTPController` 如何与推测解码 verify 流程交互,以及 CUDA 内核的 ILP 优化技巧。对于需要 DeepSeek-V4 高性能推理的团队有重要参考价值。

重构 重要性 9.18 洞察度 7.00

重构 HiCache 写回内核,引入分阶段 page_first 写回路径

值得精读。核心设计模式(staging buffer + relayout kernel + batched async copy)是 GPU 到 CPU 传输优化的典型方案。注释中说明了 layout 转换的必要性和性能权衡。建议关注 `staged_write_back.cuh` 中的 batch copy 调度逻辑和 `memory_pool_host.py` 中的 `_init_write_back_staging_buffers` 初始化时机。

参与讨论