Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-07-07
重构 重要性 5.24 洞察度 1.00

重命名测试变量 tree → cache,为拆分准备

该 PR 是典型的重构准备提交,适合快速合入。代码审查时可重点关注重命名是否一致,特别是 TreeCore 相关变量是否正确保留了 'tree_core' 子串。

#30324 [DOCS][NPU]update npu support features

原始 PR · 作者 loading66 · 合并时间 2026-07-07 11:37

文档 重要性 2.16 洞察度 1.00

更新 NPU 文档中 --use-ray 参数支持状态

可快速合并。建议同步检查文档中其他参数的支持描述是否准确,避免类似问题。

性能优化 重要性 7.97 洞察度 5.00

将 DSA top-k 种子锚定至 draft-extend 阶段以提升接受长度

值得精读,尤其关注 seed 传递在 eager、CUDA graph、overlap 三种路径下的处理方式。设计决策明确(使用门控开关确保兼容性),展示了如何通过调整缓存锚定点优化推测解码。对于从事推测解码或 MOE 模型性能优化的工程师有参考价值。

测试 重要性 8.05 洞察度 7.00

为 MLX 后端 Qwen MoE 模型添加正确性测试

建议精读 `test_mlx_reference_correctness.py` 的设计:内存安全策略、模型释放顺序、batched 隔离性测试等思路值得其他后端参考。烟雾测试的框架简单可靠,适合作为更多 MLX 模型测试的起点。

缺陷修复 重要性 7.09 洞察度 5.00

修正 MLX 量化模型 KV 池 dtype 为计算精度

建议合并。该 PR 修复了一个明确的正确性/性能 bug,测试覆盖充分,设计清晰(利用 scales 携带计算 dtype)。值得关注的设计决策是:通过 scales 推断 dtype 而非为每个量化格式适配,保持了通用性。

缺陷修复 重要性 7.81 洞察度 6.00

修正MLX后端单token分块预填充延续误路由为decode

建议阅读此PR,以理解状态驱动路由(check decoding_reqs)相比长度启发式的优势,以及通过抽取共享方法同步双路径的设计模式。对于参与MLX后端的开发者,合并后可消除隐式数据损坏风险。

功能 重要性 8.05 洞察度 4.00

为 bench_serving 新增 agentic-trace 多轮数据集加载

建议阅读 `AgenticTraceDataset` 的实现,这是为 `bench_serving` 添加新数据集的参考范例。重点关注 `from_args` 工厂方法和 `load` 方法中偏移量取模、最大轮数截断等逻辑。

#30117 Support Cutedsl BF16 GEMM JIT kernel

原始 PR · 作者 b8zhong · 合并时间 2026-07-07 10:16

功能 重要性 9.18 洞察度 6.00

支持 Blackwell CuTe DSL BF16 GEMM JIT 内核

建议重点阅读以下设计: - CuTe DSL warp 专业化模式(7 warp 分工)如何降低延迟。 - 静态战术表的设计流程:离线 autotune + Claude 启发式优化生成 29 种配置。 - 后端注册与配置下发模式(`server_args` -> `initialize_bf16_gemm_config` -> 运行时分发)。 此 PR 展示了完整的 JIT 内核集成范例,适合关注 Blackwell 优化的读者精读。

参与讨论