避免FLA L2-norm按token数重编译
该 PR 值得精读,展示了 Triton 内核性能优化中避免过度特化的经典技巧(`do_not_specialize`)。对于维护 Triton 内核的团队,应评估是否有其他编译时常量(如序列长度、批次大小)可转为动态参数以降低编译开销。
SGLang is a high-performance serving framework for large language models and multimodal models.
避免FLA L2-norm按token数重编译
该 PR 值得精读,展示了 Triton 内核性能优化中避免过度特化的经典技巧(`do_not_specialize`)。对于维护 Triton 内核的团队,应评估是否有其他编译时常量(如序列长度、批次大小)可转为动态参数以降低编译开销。
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-07-18 07:58
用原生算子替换 torch.multinomial
值得精读,尤其是对 CUDA graph 兼容性和 Gumbel-max 采样技巧感兴趣的工程师。此 PR 展示了一个简单而有效的优化模式:用原生算子组合替代黑盒算子,以支持 graph 捕获。
回退 FlashInfer 0.6.15 升级
该 PR 是紧急回退,值得关注的是它揭示了 FlashInfer 版本升级需要更充分的性能回归测试。设计决策上,直接传递 activation 字符串而非枚举的方式降低了对 FlashInfer API 的耦合。
将cookbook中固定的nightly/dev镜像替换为:latest
建议合并该PR,因为它修复了读者操作失败的问题,清理了过时文档内容。但需要关注PR body中提到的验证清单,确保相关模型在:latest上可以加载。对于设计决策,值得关注的是统一标签策略和明确保留哪些范围,以及处理Nemotron3-Ultra时的权衡过程。
原始 PR · 作者 merrymercy · 合并时间 2026-07-18 07:31
升级llguidance依赖至1.7.6并适配API
该 PR 值得精读,尤其是 `llguidance_backend.py` 中的适配模式:如何应对上游 API 删除单一属性改用集合属性的变化。对于维护依赖升级的开发者有参考价值。
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-07-18 07:28
提取 InputLogprobProcessor 并迁移 logprob 处理逻辑
推荐阅读该 PR,特别是: - 如何通过依赖注入(`get_logits_fn`)解耦 lm_head 的调用。 - 如何在不改变行为的前提下安全地从大类别中提取职责。 - 机械验证方法(AST 等价性检查)可作为重构的参考实践。
原始 PR · 作者 sglang-bot · 合并时间 2026-07-18 06:58
同步 sglang-kernel 版本至 0.4.5
建议关注 CI 结果,确认所有测试通过后再合并。本身无需精读,可作为自动化依赖更新的参考案例。
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-07-18 06:18
修复 rotate_input_ids kernel 注册名
建议精读。该 PR 虽小但涉及 kernel 注册的正确性,值得快速合并。
参与讨论