#27046 [HiCache] fix PD L3 cache hit details from decode responses
原始 PR · 作者 huangtingwei9988 · 合并时间 2026-06-04 18:01
修复 PD 模式下 decode 响应中 L3 缓存命中报告的缺失问题
建议快速合并。变更逻辑清晰、改动量小、风险低,且解决了一个实际观测到的监控数据缺失问题。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 huangtingwei9988 · 合并时间 2026-06-04 18:01
修复 PD 模式下 decode 响应中 L3 缓存命中报告的缺失问题
建议快速合并。变更逻辑清晰、改动量小、风险低,且解决了一个实际观测到的监控数据缺失问题。
gzip压缩级别从1降为0,加速RGB传输
该PR变更简洁高效,性能收益显著且风险可控。值得精读以了解实时传输场景下的性能优化思路。
为繁忙时内存检查添加安静模式,减少日志噪声
该 PR 设计简洁,改动集中,风险低,值得合并。建议在文档中备注级别 1 的缓冲区容量说明,以便用户了解极限场景下的日志覆盖能力。
原始 PR · 作者 alisonshao · 合并时间 2026-06-04 16:25
为 CPU CI 添加 HuggingFace 缓存
建议合入。该 PR 采用了一致且成熟的 `actions/cache` 模式(与仓库其他 job 类似),可显著提高 CI 稳定性。值得关注的是其 cache key 设计:使用 `github.run_id` 做滚动 key,每次新 run 都会创建新 cache,同时使用 `restore-keys` 回退到旧 cache,既保证了增量更新又提供了回退路径。
移除 AMD 上 compressor GEMM 的 BF16→FP32 类型转换
该 PR 值得精读,特别是对于在 AMD 平台上部署 DeepSeek-V4 模型的团队。核心设计决策(在 HIP 路径绕过昂贵的类型转换,同时在 Triton kernel 中添加显式类型处理)展示了平台特定优化的典型方法。性能数据详实,aiter 库的使用也值得关注。
原始 PR · 作者 liz-badada · 合并时间 2026-06-04 15:44
新增 DeepSeek V4 FP4 Indexer 文档
文档清晰简洁,可以直接合并。无需精读。
原始 PR · 作者 yctseng0211 · 合并时间 2026-06-04 15:41
为 ROCm 7.0/gfx950 新增 CK fp8 块量化 GEMM 回退
值得合入。变更精炼、风险低,性能收益明确。关注后续 ROCm 7.2+ 上 bpreshuffle 路径与 CK 路径的调度优先级可再评估。
重新组织 Nemotron 文档侧边栏顺序
此 PR 为纯粹的文档调整,无需深入阅读源码,可以快速合并。
参与讨论