Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-07-18
性能优化 重要性 4.12 洞察度 5.00

避免FLA L2-norm按token数重编译

该 PR 值得精读,展示了 Triton 内核性能优化中避免过度特化的经典技巧(`do_not_specialize`)。对于维护 Triton 内核的团队,应评估是否有其他编译时常量(如序列长度、批次大小)可转为动态参数以降低编译开销。

性能优化 重要性 6.19 洞察度 6.00

用原生算子替换 torch.multinomial

值得精读,尤其是对 CUDA graph 兼容性和 Gumbel-max 采样技巧感兴趣的工程师。此 PR 展示了一个简单而有效的优化模式:用原生算子组合替代黑盒算子,以支持 graph 捕获。

基础设施 重要性 7.11 洞察度 5.00

回退 FlashInfer 0.6.15 升级

该 PR 是紧急回退,值得关注的是它揭示了 FlashInfer 版本升级需要更充分的性能回归测试。设计决策上,直接传递 activation 字符串而非枚举的方式降低了对 FlashInfer API 的耦合。

文档 重要性 5.92 洞察度 3.00

将cookbook中固定的nightly/dev镜像替换为:latest

建议合并该PR,因为它修复了读者操作失败的问题,清理了过时文档内容。但需要关注PR body中提到的验证清单,确保相关模型在:latest上可以加载。对于设计决策,值得关注的是统一标签策略和明确保留哪些范围,以及处理Nemotron3-Ultra时的权衡过程。

#31484 Upgrade llguidance to 1.7.6

原始 PR · 作者 merrymercy · 合并时间 2026-07-18 07:31

基础设施 重要性 6.62 洞察度 4.00

升级llguidance依赖至1.7.6并适配API

该 PR 值得精读,尤其是 `llguidance_backend.py` 中的适配模式:如何应对上游 API 删除单一属性改用集合属性的变化。对于维护依赖升级的开发者有参考价值。

#20071 refactor logprob processor layer

原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-07-18 07:28

重构 重要性 8.62 洞察度 6.00

提取 InputLogprobProcessor 并迁移 logprob 处理逻辑

推荐阅读该 PR,特别是: - 如何通过依赖注入(`get_logits_fn`)解耦 lm_head 的调用。 - 如何在不改变行为的前提下安全地从大类别中提取职责。 - 机械验证方法(AST 等价性检查)可作为重构的参考实践。

#31618 chore: bump sglang-kernel version to 0.4.5

原始 PR · 作者 sglang-bot · 合并时间 2026-07-18 06:58

基础设施 重要性 4.40 洞察度 1.00

同步 sglang-kernel 版本至 0.4.5

建议关注 CI 结果,确认所有测试通过后再合并。本身无需精读,可作为自动化依赖更新的参考案例。

参与讨论