PD 预填提前发送缓存 KV,降低首 Token 延迟
建议细致阅读 `maybe_send_cached_prefix_chunk` 的实现逻辑和 `run_batch` 中的调用时机。设计上采用非最终 KV 块提前发送以重叠传输与计算,是一种典型的延迟隐藏优化,值得学习。对于使用 PD 分离部署的团队,建议在长前缀场景下验证 TTFT 改善。
SGLang is a high-performance serving framework for large language models and multimodal models.
PD 预填提前发送缓存 KV,降低首 Token 延迟
建议细致阅读 `maybe_send_cached_prefix_chunk` 的实现逻辑和 `run_batch` 中的调用时机。设计上采用非最终 KV 块提前发送以重叠传输与计算,是一种典型的延迟隐藏优化,值得学习。对于使用 PD 分离部署的团队,建议在长前缀场景下验证 TTFT 改善。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-06-26 04:12
为5个JIT单元测试注册AMD夜间CI
建议精读PR body中的验证表格和CI运行链接,了解哪些测试被确认兼容及资源消耗。这对于AMD平台开发者或有AMD部署需求的用户有参考价值。
原始 PR · 作者 merrymercy · 合并时间 2026-06-26 03:51
提取样式和类型注释改进,无行为变更
建议开发者快速浏览以了解代码库的样式约定和类型注释模式,尤其关注 io_struct.py 中字段排序和 SessionParams 的文档风格,可作为后续新增 IPC 结构体的参考。
新增 DeepSeek V4 Pro GB300 夜间测试并扩展 Kimi K25
该 PR 是测试基础设施的重要补充,展示了如何为新硬件(GB300)系统化地添加夜间测试,并通过拆分子套件提高 CI 效率。建议团队关注其套件拆分模式,在后续添加更多模型时复用。
原始 PR · 作者 weireweire · 合并时间 2026-06-26 02:40
避免在非空闲批次中发送空输出
值得合入的微优化,逻辑清晰且风险低。可学习其将判定逻辑从外部参数内聚到内部状态的设计思路。
修复 #28450 引入的 CI 测试断言错误
该 PR 是常规的 CI 修复,无需精读。值得注意的点:原始 PR #28450 在合并前应确保 CI 通过,此修复提醒团队加强合并前检查。
同步 Gemma4 硬件表与 Blackwell 配方
该 PR 是常规文档维护,变更简单直接,无需精读数码细节。值得关注的是团队在维护文档与代码配方一致性上的规范做法:先验证配方功能,再同步文档。
为 Qwen-Image 添加 ModelOpt NVFP4 量化支持
该 PR 设计清晰,特别是调制层名称规范化函数值得作为其他量化集成范本。建议后续为 Edit 系列添加 CI 覆盖,并考虑将 NVFP4 支持扩展到其他 diffusion 模型。
参与讨论