Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58

PR 列表

更多筛选
2026-07-08
性能优化 重要性 6.36 洞察度 5.00

融合 sigmoid 和类型转换到 append 内核

值得阅读。该 PR 展示了如何通过内核融合消除小内核启动开销,设计思路清晰,且通过条件编译确保 CUDA 路径不受影响。对于理解 AMD 共享专家融合路径的优化方向有参考价值。

功能 重要性 9.36 洞察度 7.00

为扩散DiT模型启用Breakable CUDA Graph

该PR是扩散推理性能优化的关键里程碑,核心架构设计(BCG Runner + Prompt Padding)具有较高参考价值。建议团队阅读 `runner.py`、`breakable_cuda_graph.py` 和 `prompt_padding.py` 理解整体机制。未来添加新模型时务必参考已有padder实现,并在CI中添加对应BCG回归测试。

缺陷修复 重要性 6.70 洞察度 5.00

修复解码崩溃,清除 pending_reqs 并防御空 receiver

值得快速合入。修复明确且测试充分,使用 `id()` 进行身份比较的设计决策值得类似场景参考。

重构 重要性 8.56 洞察度 6.00

集中进程级资源单例到 ctx.resources,引入命名槽位和租约

该 PR 值得精读,尤其关注如何通过数据类 + _FlagGroupBase 将散落的运行时状态集中管理,并实现测试友好的 override 机制。对于构建大型推理引擎的资源管理层有很好的参考价值。

重构 重要性 7.93 洞察度 6.00

迁移 MoE/DP 运行时状态到类型化标志组

值得仔细阅读 runtime_context.py 和 test_module_state_ratchet.py,了解如何通过类型化标志组和 AST 回归测试管理运行时状态。这是清理遗留技术债的典范,类似模块(如 speculative decoding 中的状态)可借鉴此模式。

参与讨论