为 PD 分解 decode 端添加 HiCache 预取与增量传输
PR 核心设计合理,性能收益显著。但需在后续迭代中优化 all_reduce 批量化、支持并发加载,并加强错误处理。值得学习的是如何通过 `DecodePrefixMatch` 抽象缓存层次,以及 Mixin 方式组织代码。建议在合并前至少解决高优先级性能问题,但根据讨论已有折中,可以合并后优化。
SGLang is a high-performance serving framework for large language models and multimodal models.
为 PD 分解 decode 端添加 HiCache 预取与增量传输
PR 核心设计合理,性能收益显著。但需在后续迭代中优化 all_reduce 批量化、支持并发加载,并加强错误处理。值得学习的是如何通过 `DecodePrefixMatch` 抽象缓存层次,以及 Mixin 方式组织代码。建议在合并前至少解决高优先级性能问题,但根据讨论已有折中,可以合并后优化。
原始 PR · 作者 Emmanuel0612 · 合并时间 2026-06-02 15:24
为 AMD CI 注册 mamba 状态分散测试
该 PR 是标准的测试套件扩展,可快速合并。
原始 PR · 作者 liz-badada · 合并时间 2026-06-02 15:14
为 DeepSeek V4 添加可选 FP4 索引器路径
建议精读此 PR,特别是 `fp4_indexer.py` 中的分组量化策略和 `memory_pool.py` 中按标志调整布局的设计。Review 中对 kernel 中间精度的讨论也值得学习。该 PR 体现了 SGLang 在模型推理中通过量化技术进行性能-精度权衡的典型实践。
原始 PR · 作者 alisonshao · 合并时间 2026-06-02 14:40
从 nightly 测试中删除冗余的多模态 server 作业
此 PR 是一个健康的 CI 清理,建议快速合并。对于关注 CI 效率的团队有参考价值。
新增 LingBot World 实时 diffusion cookbook
建议读者阅读 LingBot World cookbook 了解实时 world model 的部署流程。文档的实时模型分类定义也值得关注,反映了 SGLang-diffusion 中离线与实时模型的架构区分。
Cosmos3 去噪性能优化,降低 7% 峰值内存
建议开发者关注注意力层 `forward_with_replicated_kv_prefix` 的设计模式,它为序列并行中处理复制前缀提供了一种低内存的拆分方案。此外,`view` 替代 `split+contiguous` 是常见的计算图优化技巧,可推广到其他类似场景。
新增 LingBot 实时 WebUI 前端,支持实时视频流交互
该 PR 展示了前端 WebUI 的良好架构设计,特别是 decoder_worker 使用 Web Worker 分离解码逻辑,以及丰富的预设数据管理。值得前端和后端开发者阅读,理解多模态生成场景下的实时视频流交互模式。
新增 LingBot World 实时扩散管道与 WebUI 支持
此 PR 属于里程碑级功能合并,架构设计值得精读:特别是 `CausalSelfAttentionKVCache` 的抽象和 `CausalDMDDenoisingStage` 的通用化处理。对于参与 diffusion 或实时推理的开发者,建议重点阅读 `causal_denoising.py`、`causal_attention_cache.py` 和 `lingbot_world.py`,了解因果视频生成的流水线设计。对于仅使用批处理推理的用户,此 PR 无直接影响,但未来可复用其基础架构。
参与讨论