#31835 Negotiate PrefillDelayer only after KV-budget admission checks
原始 PR · 作者 hanming-lu · 合并时间 2026-07-22 03:07
修复 PrefillDelayer 协商时机,避免混合转发 bug
值得精读,特别是调度调度代码的审阅者。该 PR 展示了如何正确放置跨进程协商点,并提供了完整的测试覆盖,设计决策清晰,适合作为耦合组件的参考。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 hanming-lu · 合并时间 2026-07-22 03:07
修复 PrefillDelayer 协商时机,避免混合转发 bug
值得精读,特别是调度调度代码的审阅者。该 PR 展示了如何正确放置跨进程协商点,并提供了完整的测试覆盖,设计决策清晰,适合作为耦合组件的参考。
原始 PR · 作者 hanming-lu · 合并时间 2026-07-22 02:49
修复 custom routing 下 pad-row mask 缺失及 prefill replay 中 num_token_non_padded 计算错误
值得精读:展示了在 CUDA-graph 动态形状与 MoE 路由交互时的边界处理,尤其是 `post_fill` 钩子的运用方式以及如何利用 host int 避免 replay 时 host-to-device copy。设计决策清晰,代码注释详细,是学习 SGLang MoE + 图执行系统的良好案例。
新增 Laguna-S-2.1 模型 cookbook 文档
值得快速浏览以了解 SGLang cookbook 的文档结构和配置模型的方法。团队可参考 `laguna-s21.jsx` 的配置模式来添加其他模型,注意保持验证状态、版本号和数字的一致性。
修复 LoRA 钩子冲突导致 TMA 路径错乱的问题
值得精读。该 PR 是一个极佳的 bug 根因分析示例,展示了如何从用户报告追溯到跨多个提交的回归点,并通过最小改动修复。同时,它也揭示了 TMA 布局与路由主序布局不兼容这一架构层面的设计约束,未来在处理类似缓冲区布局问题时值得参考。
新增 Inkling-NVFP4 模型夜间测试
值得精读:该 PR 展示了如何为大型 MoE 模型(975B)添加端到端夜间测试,包括启动参数配置、误差基线设定和硬件条件跳过。可作为类似测试的模板。
增强编码器健康检查,被驱逐URL自动复活
值得精读。该 PR 展示了如何优雅处理分布式组件健康检查中的瞬态故障,其“驱逐-探测-复活”模式可复用于其他需要自动恢复的服务发现场景。注意 TTL 的默认值应根据实际环境调整。
原始 PR · 作者 OrangeRedeng · 合并时间 2026-07-21 21:47
修复非CUDA平台上的CUDA导入失败问题
建议合并。这是一个简洁有效的兼容性修复,解决了阻止非 CUDA 平台用户使用 SGLang 的关键问题。值得关注的设计决策是:将可选依赖的导入延迟到实际使用时,是避免顶层导入时引入硬依赖的标准做法,后续引入新功能时应参照此模式。
移除废弃的 auto-benchmark 代码 3000+ 行
安全且及时的清零操作,建议快速合并。对关注基准测试的开发者,可以确认自己的脚本不依赖被删除的接口。
参与讨论