Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-07-04
功能 重要性 9.01 洞察度 6.00

为 diffusion VAE decode 添加 torch.compile 预热机制

该 PR 值得精读,特别是 `torch_compile.py` 中的 `ActiveTargetCompiledCallable` 和 `CompiledModuleRegistry` 设计模式,以及 warmup 策略中“内部预热请求”的权衡。对于扩散模型开发者,可作为 torch.compile 集成的参考实现。

缺陷修复 重要性 6.20 洞察度 4.00

禁用跨节点 TP 的 logits multimem all-gather

该 PR 修复了多节点 TP 部署的阻塞性问题,代码简洁,审查充分,建议快速合入。无需精读,但设计模式(在构造函数中禁用跨节点路径)值得在类似场景中复用。

性能优化 重要性 8.69 洞察度 6.00

融合 TRTLLM MHA 图元数据为单 Triton 核

此 PR 值得精读,特别是融合 kernel 的设计模式(一次启动完成全部元数据更新、q_mode 抽象、SWA 翻译集成)。测试代码采用 monkeypatch 验证 graph 钩子行为,对类似 CUDA graph 优化有参考价值。建议团队关注 multi_layer_eagle 的测试补充。

功能 重要性 7.75 洞察度 5.00

优先使用官方一致性 GT,缺失时回退到 sglang 版本

建议开发者阅读 `test_utils.py` 中的 `_load_official_consistency_gt_outputs` 和 `_remote_consistency_gt_base_urls` 实现,这是一个优雅的多源 GT 优先级策略。测试编写者也值得学习如何用 monkeypatch 模拟远程依赖来覆盖复杂分支。

参与讨论