新增混合前缀 GSM8K 评估及 CPU 单元测试
值得精读。该 PR 展示了如何通过提取虚方法(`_setup_prefix_pool` / `_build_prefix`)在测试框架中实现模板方法模式,使得扩展不同前缀策略变得简单。单元测试也写得清晰全面,可作为测试驱动开发的范例。
SGLang is a high-performance serving framework for large language models and multimodal models.
新增混合前缀 GSM8K 评估及 CPU 单元测试
值得精读。该 PR 展示了如何通过提取虚方法(`_setup_prefix_pool` / `_build_prefix`)在测试框架中实现模板方法模式,使得扩展不同前缀策略变得简单。单元测试也写得清晰全面,可作为测试驱动开发的范例。
原始 PR · 作者 e-martirosian · 合并时间 2026-06-09 20:01
为NPU扩散测试启用一致性检查并回退旋转嵌入优化
该PR展示了如何为特定硬件平台(NPU)配置测试基础设施,包括根据平台选择实现和测试配置,值得测试和基础设施团队关注。建议后续持续监控NPU旋转嵌入性能。
添加 NPU 上 MoE 权重更新时形状恢复逻辑
建议阅读此 PR 的 patch,理解 NPU 上 MoE 权重布局的特殊处理。对于维护 NPU 后端的开发者,这是一个重要的参考。
修复 NPU MTP 精度回归,涉及三个底层 bug
值得精读,特别是 `update_mamba_state_after_mtp_verify` 中 NPU 特有的 conv 状态重建与回滚策略,体现了硬件差异下的适配设计。建议关注后续 PR 是否在 CUDA 与 NPU 间推进公共抽象层。
修复 spec v2 停止边界,确保多 token 接受时输出正确截断
值得精读。展示了如何在推测解码中精确处理 stop 边界,以及如何通过精细化测试覆盖多种边界情况。特别关注 `_locate_str_stop_finished_len` 的扫描算法和 `trim_matched_stop` 中 `no_stop_trim` 的处理。
修复 CUDA Graph 输入缓冲区注册在非 CUDA 设备上的兼容性问题
本 PR 作为快速修复紧急 CI 故障是可接受的,但长期建议采纳 review 中的建议,使用更通用的设备检查以覆盖更多平台。
修复 Gemma4 NVFP4 MoE 默认 attention 后端为 triton
建议精读此 PR,特别是条件化默认后端的设计模式。值得关注的决策:使用 `getattr` 安全检测配置属性,以及缓存 `model_config` 对象减少重复调用。建议后续添加一个简单的回归测试,验证 NVFP4 MoE 模型默认使用 triton。
修复推测解码中 stop-string 检查漏掉早期匹配
值得精读。展示了在推测解码多 token 接受场景下保持停止条件正确性的通用设计模式:通过传播接受长度参数,使尾部字符串窗口能够覆盖整个接受 chunk。关注点在于使用默认参数保持向后兼容,这一实践值得在类似修复中借鉴。
参与讨论