为 DFlash 草稿模型添加滑动窗口注意力层支持
值得精读,尤其是 flashinfer_backend.py 中处理 prefix_lens 为 None 的逻辑设计,以及 DFlash verify 路径直接裁剪 kv_start_idx 的权衡。测试覆盖了基本场景,但建议后续补充非 FlashInfer 后端验证。
SGLang is a high-performance serving framework for large language models and multimodal models.
为 DFlash 草稿模型添加滑动窗口注意力层支持
值得精读,尤其是 flashinfer_backend.py 中处理 prefix_lens 为 None 的逻辑设计,以及 DFlash verify 路径直接裁剪 kv_start_idx 的权衡。测试覆盖了基本场景,但建议后续补充非 FlashInfer 后端验证。
统一 profiler 注释,按子系统拆分 NVTX 门控
值得所有关注 SGLang 性能分析能力的开发者精读。本 PR 展示了一个优秀的重构案例:如何通过定义统一原语(profile_range/profile_method)并利用偏函数预绑定子系统门控,将分散的 profiling 逻辑集中化。对于希望扩展 SGLang profiling 的开发者,这是必读的基础设施变更。
原始 PR · 作者 whybeyoung · 合并时间 2026-06-14 15:01
修复健康检查 ID 跨进程重复 bug
值得立即合并。改动小、风险低、针对一个已复现的生产 bug。可以作为多 worker 部署的最佳实践参考——始终使用 uuid 或 `pid + counter` 保证请求 ID 跨进程唯一。
原始 PR · 作者 zRzRzRzRzRzRzR · 合并时间 2026-06-14 14:57
为GLM-4.7启用结构标签指导的函数调用
值得精读。该 PR 展示了如何为特定模型接入 xgrammar 原生结构标签的完整流程,包括运行时探测、thinking 模式处理、以及优雅降级。其中的设计决策(例如通过 `lru_cache` 缓存探测结果、在 `get_structural_tag` 中调用父类方法避免重复实现)值得在其他模型检测器中借鉴。
聚合注意力后端选择日志,降低噪音
推荐合并。这是一次无争议的 UX 改进,代码简洁清晰,没有引入破坏性变更。值得关注的点是:`_record_component_attn_backend` 和 `_log_component_attn_backend_summary` 的设计方式可以作为其他模块日志聚合的参考模式。
原始 PR · 作者 DarkSharpness · 合并时间 2026-06-14 14:47
修复 JIT 内核技能中的过时 benchmark API
此 PR 是纯文档更新,维护技能教程与 API 的一致性。建议合并,无其他关注点。
修复非有限温度导致服务拒绝访问漏洞
值得精读,因为它展示了一个容易被忽视的安全漏洞(IEEE-754 特性导致单侧比较失效)以及简单的修复方法。代码改动极小但影响安全,适合作为输入验证的最佳实践示例。
原始 PR · 作者 zyzshishui · 合并时间 2026-06-14 14:23
修复 Qwen3.5 确定性推理 logprobs 受 batch 大小影响的问题
值得精读,尤其是对数值一致性和 kernel 级别回归控制感兴趣的工程师。设计模式:用统一门控函数 `is_batch_invariant_mode_enabled()` 条件性禁用依赖 batch 大小的性能优化,是控制确定性推断数值一致性的好方法。建议将来类似的 batch size 敏感 kernel 也采用同样的门控。
参与讨论