Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 01:23 同步状态:空闲 下次计划:2026-09-05 02:23

PR 列表

更多筛选
2026-06-02
功能 重要性 9.18 洞察度 7.00

为 PD 分解 decode 端添加 HiCache 预取与增量传输

PR 核心设计合理,性能收益显著。但需在后续迭代中优化 all_reduce 批量化、支持并发加载,并加强错误处理。值得学习的是如何通过 `DecodePrefixMatch` 抽象缓存层次,以及 Mixin 方式组织代码。建议在合并前至少解决高优先级性能问题,但根据讨论已有折中,可以合并后优化。

#26209 Add FP4 Indexer for DeepSeek V4

原始 PR · 作者 liz-badada · 合并时间 2026-06-02 15:14

功能 重要性 9.18 洞察度 7.00

为 DeepSeek V4 添加可选 FP4 索引器路径

建议精读此 PR,特别是 `fp4_indexer.py` 中的分组量化策略和 `memory_pool.py` 中按标志调整布局的设计。Review 中对 kernel 中间精度的讨论也值得学习。该 PR 体现了 SGLang 在模型推理中通过量化技术进行性能-精度权衡的典型实践。

文档 重要性 4.62 洞察度 3.00

新增 LingBot World 实时 diffusion cookbook

建议读者阅读 LingBot World cookbook 了解实时 world model 的部署流程。文档的实时模型分类定义也值得关注,反映了 SGLang-diffusion 中离线与实时模型的架构区分。

#26973 [diffusion] reduce Cosmos3 denoise overhead

原始 PR · 作者 mickqian · 合并时间 2026-06-02 14:23

性能优化 重要性 7.54 洞察度 6.00

Cosmos3 去噪性能优化,降低 7% 峰值内存

建议开发者关注注意力层 `forward_with_replicated_kv_prefix` 的设计模式,它为序列并行中处理复制前缀提供了一种低内存的拆分方案。此外,`view` 替代 `split+contiguous` 是常见的计算图优化技巧,可推广到其他类似场景。

#26959 [diffusion] add WebUI

原始 PR · 作者 mickqian · 合并时间 2026-06-02 14:13

功能 重要性 9.00 洞察度 4.00

新增 LingBot 实时 WebUI 前端,支持实时视频流交互

该 PR 展示了前端 WebUI 的良好架构设计,特别是 decoder_worker 使用 Web Worker 分离解码逻辑,以及丰富的预设数据管理。值得前端和后端开发者阅读,理解多模态生成场景下的实时视频流交互模式。

#26954 [diffusion] misc

原始 PR · 作者 mickqian · 合并时间 2026-06-02 13:52

功能 重要性 9.36 洞察度 6.00

新增 LingBot World 实时扩散管道与 WebUI 支持

此 PR 属于里程碑级功能合并,架构设计值得精读:特别是 `CausalSelfAttentionKVCache` 的抽象和 `CausalDMDDenoisingStage` 的通用化处理。对于参与 diffusion 或实时推理的开发者,建议重点阅读 `causal_denoising.py`、`causal_attention_cache.py` 和 `lingbot_world.py`,了解因果视频生成的流水线设计。对于仅使用批处理推理的用户,此 PR 无直接影响,但未来可复用其基础架构。

参与讨论