Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 21:57 同步状态:空闲 下次计划:2026-09-02 22:57

PR 列表

更多筛选
2026-06-19
性能优化 重要性 6.25 洞察度 5.00

混合线性注意力后端推测解码完全重叠

建议阅读以了解如何在 CUDA Graph 捕获与 replay 时高效传递 padding 信息。`hybrid_linear_attn_backend.py` 中的 `_replay_metadata` 函数修改展示了如何通过可选的 `num_padding` 参数避免冗余计算,这种模式可推广到其他后端。

#28642 [FA]Add lost params in fa varlen func

原始 PR · 作者 DovenImp · 合并时间 2026-06-19 04:30

缺陷修复 重要性 4.53 洞察度 3.00

为 flash_attn_varlen_func 补充缺失的 only_qv 参数

建议精读该 PR 的讨论,特别是 gemini-code-assist[bot] 关于 v4 下静默忽略的风险提醒。该 PR 本身原子性良好,但后续应跟进在 v4 分支中显式检测 `only_qv` 并抛出 `NotImplementedError`,以及补充参数传递的单元测试。

重构 重要性 7.75 洞察度 7.00

重构 Mamba radix cache 配置并重命名参数

值得精读,尤其是 `_handle_mamba_radix_cache` 的扁平化重构和 DeprecatedAction 使用。注意后续跟进将 assert 替换为 ValueError 以保证生产环境健壮性。

缺陷修复 重要性 4.88 洞察度 3.00

修复 JIT EP 激活缺失的尺寸校验

建议尽快合并以修复 Qwen 3.5 35B 在 DEP2 模式下的 CUDA 崩溃问题。后续需跟进 `swiglu_limit` 相关冲突,避免从 CUDA crash 转为 Python assertion。可考虑添加针对不同专家数、分组尺寸组合的回归测试。

文档 重要性 6.07 洞察度 5.00

Laguna-M.1: 启用 Blackwell FP8 并移除 AIME 25 数据

建议使用 Blackwell + FP8 的用户精读本 PR 的注释和配置说明,特别是临时 flag 的用法。同时关注 #28662 的进展,以移除 workaround。AIME 数据移除是合理的短期决策。

2026-06-18

#28661 Add Laguna-M.1 cookbook

原始 PR · 作者 Jiminator · 合并时间 2026-06-18 23:23

文档 重要性 7.25 洞察度 4.00

为 Laguna-M.1 添加配置驱动 cookbook 页面

值得精读,尤其是配置驱动 cookbook 的实现模式(JSX 分离配置、MDX 承载内容),以及如何组织可验证的基准测试数据。对希望贡献类似文档的开发者有参考价值。

参与讨论