回滚 DRAFT_EXTEND_V2 cache extent 修复并推迟 CUDA graph 测试
建议读者重点关注此回滚的背景:当前 `DRAFT_EXTEND_V2` 的 cache extent 问题尚未解决,团队选择了暂时回退。如果使用相关特性,应切换到其他 attention 后端(如 Triton)或等待后续修复。同时值得阅读 `KNOWN_FAILURES.md` 中的详细记录,了解根因和所需变更。
SGLang is a high-performance serving framework for large language models and multimodal models.
回滚 DRAFT_EXTEND_V2 cache extent 修复并推迟 CUDA graph 测试
建议读者重点关注此回滚的背景:当前 `DRAFT_EXTEND_V2` 的 cache extent 问题尚未解决,团队选择了暂时回退。如果使用相关特性,应切换到其他 attention 后端(如 Triton)或等待后续修复。同时值得阅读 `KNOWN_FAILURES.md` 中的详细记录,了解根因和所需变更。
修复 XPU 设备分配,适配多模型
建议合并。该 PR 解决了 XPU 上的关键阻塞问题,设计简洁,改动量小。但建议作者或团队后续补充针对这些模型的 XPU 单元测试,并跟进 `_match_cos_sin_cache_dtype` 是否有更优实现(如初始化时就匹配 dtype)。
原始 PR · 作者 liuxianglong17 · 合并时间 2026-05-29 09:29
恢复并适配 NPU Nightly 跳过的测试用例
建议合并。该 PR 恢复了重要的 nightly 测试覆盖,且针对环境变化做了适配,review 中提出的问题均已解决。后续可考虑增加内存监控或资源限制来防止潜在 OOM。
修复 --decrypted-draft-config-file 未生效的问题
本 PR 修改简单但定位准确,值得阅读的要点包括:如何通过 `kwargs` 机制向配置加载过程注入额外参数;以及可变默认参数的实际取舍方式。建议在类似功能中统一使用 `None` 默认值以提升安全性。
修复 NPU 上 DeepSeek 模型加载时 quant_config.packed_modules_mapping 被覆盖
该 PR 是一个精确的 bugfix,值得精读以理解量化配置的契约。设计上引入多态方法而非条件判断,是良好的重构方向。建议为新增方法补充单元测试。
更新 Step-3.7-Flash Docker 镜像标签
该 PR 是常规的文档维护,无需深入审查。对于关注 Step-3.7-Flash 部署的读者,可了解镜像标签的演进。
为注意力后端添加模块级单元测试套件
建议所有关注注意力后端的开发者仔细阅读本 PR 的测试架构,特别是参考实现的设计和 SWA decode 规则分类。后续新增后端时,务必在 dense_attention.py 中注册 SWA decode 规则,并按照已有模式添加测试文件。KNOWN_FAILURES.md 也是必读文档,用于理解当前后端限制。
新增 Step-3.7-Flash 多模态 MoE 模型支持
值得精读,特别是模型组合方式(视觉编码器 + MoE 语言模型)以及多模态特征提取的实现。建议关注 review 中提到的批处理问题,并优先补全单元测试和修复文档中的镜像版本。
参与讨论