修复 spec v2 停止边界,确保多 token 接受时输出正确截断
值得精读。展示了如何在推测解码中精确处理 stop 边界,以及如何通过精细化测试覆盖多种边界情况。特别关注 `_locate_str_stop_finished_len` 的扫描算法和 `trim_matched_stop` 中 `no_stop_trim` 的处理。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 spec v2 停止边界,确保多 token 接受时输出正确截断
值得精读。展示了如何在推测解码中精确处理 stop 边界,以及如何通过精细化测试覆盖多种边界情况。特别关注 `_locate_str_stop_finished_len` 的扫描算法和 `trim_matched_stop` 中 `no_stop_trim` 的处理。
修复 CUDA Graph 输入缓冲区注册在非 CUDA 设备上的兼容性问题
本 PR 作为快速修复紧急 CI 故障是可接受的,但长期建议采纳 review 中的建议,使用更通用的设备检查以覆盖更多平台。
修复 Gemma4 NVFP4 MoE 默认 attention 后端为 triton
建议精读此 PR,特别是条件化默认后端的设计模式。值得关注的决策:使用 `getattr` 安全检测配置属性,以及缓存 `model_config` 对象减少重复调用。建议后续添加一个简单的回归测试,验证 NVFP4 MoE 模型默认使用 triton。
修复推测解码中 stop-string 检查漏掉早期匹配
值得精读。展示了在推测解码多 token 接受场景下保持停止条件正确性的通用设计模式:通过传播接受长度参数,使尾部字符串窗口能够覆盖整个接受 chunk。关注点在于使用默认参数保持向后兼容,这一实践值得在类似修复中借鉴。
修复 HiRadix 预取中额外池 IO 未完成的竞态条件
### 建议 - 推荐阅读该 PR,特别是 `can_terminate_prefetch` 中针对分布式缓存竞态条件的处理方式。 - 可以对比 `unified_radix_cache` 和 `hi_mamba_radix_cache` 中对应的实现,了解代码对齐策略。 - 建议后续补充针对 extra pool 场景的单元或集成测试。
原始 PR · 作者 erikwijmans · 合并时间 2026-06-09 14:05
修复 LoRA 调度中已结束请求残留导致崩溃
值得合并,修复逻辑清晰、风险极低。建议后续添加单元测试,覆盖“请求结束但尚未被 filter_batch”时 LoRA 调度的正确性。
为推测解码各阶段添加 NVTX profiler span
建议合并。该 PR 规模小、逻辑清晰,属于低风险的可观测性改进。虽无专项测试,但工具函数设计合理(profiler 开启时生效,关闭时无开销),可直接合并。
提取扩散后训练权重API到mixins并添加Tensor更新/检查路径
值得精读。该PR展示了如何通过mixin模式将分散的治理逻辑解耦到独立模块,同时为后续扩展后训练特性提供了清晰的架构参考。
参与讨论