Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-07-22
缺陷修复 重要性 7.27 洞察度 5.00

修复 PrefillDelayer 协商时机,避免混合转发 bug

值得精读,特别是调度调度代码的审阅者。该 PR 展示了如何正确放置跨进程协商点,并提供了完整的测试覆盖,设计决策清晰,适合作为耦合组件的参考。

缺陷修复 重要性 8.08 洞察度 6.00

修复 custom routing 下 pad-row mask 缺失及 prefill replay 中 num_token_non_padded 计算错误

值得精读:展示了在 CUDA-graph 动态形状与 MoE 路由交互时的边界处理,尤其是 `post_fill` 钩子的运用方式以及如何利用 host int 避免 replay 时 host-to-device copy。设计决策清晰,代码注释详细,是学习 SGLang MoE + 图执行系统的良好案例。

#31918 [Cookbook] Add Laguna-S-2.1

原始 PR · 作者 Jiminator · 合并时间 2026-07-22 01:01

documentation 重要性 7.36 洞察度 3.00

新增 Laguna-S-2.1 模型 cookbook 文档

值得快速浏览以了解 SGLang cookbook 的文档结构和配置模型的方法。团队可参考 `laguna-s21.jsx` 的配置模式来添加其他模型,注意保持验证状态、版本号和数字的一致性。

#31608 [LoRA] Guard TMA down path for LoRA hooks

原始 PR · 作者 jybsuper · 合并时间 2026-07-22 00:47

缺陷修复 重要性 5.99 洞察度 8.00

修复 LoRA 钩子冲突导致 TMA 路径错乱的问题

值得精读。该 PR 是一个极佳的 bug 根因分析示例,展示了如何从用户报告追溯到跨多个提交的回归点,并通过最小改动修复。同时,它也揭示了 TMA 布局与路由主序布局不兼容这一架构层面的设计约束,未来在处理类似缓冲区布局问题时值得参考。

2026-07-21

#31939 Add Inkling to nightly test

原始 PR · 作者 ispobock · 合并时间 2026-07-21 23:06

测试 重要性 6.29 洞察度 4.00

新增 Inkling-NVFP4 模型夜间测试

值得精读:该 PR 展示了如何为大型 MoE 模型(975B)添加端到端夜间测试,包括启动参数配置、误差基线设定和硬件条件跳过。可作为类似测试的模板。

缺陷修复 重要性 6.46 洞察度 6.00

增强编码器健康检查,被驱逐URL自动复活

值得精读。该 PR 展示了如何优雅处理分布式组件健康检查中的瞬态故障,其“驱逐-探测-复活”模式可复用于其他需要自动恢复的服务发现场景。注意 TTL 的默认值应根据实际环境调整。

缺陷修复 重要性 5.34 洞察度 3.00

修复非CUDA平台上的CUDA导入失败问题

建议合并。这是一个简洁有效的兼容性修复,解决了阻止非 CUDA 平台用户使用 SGLang 的关键问题。值得关注的设计决策是:将可选依赖的导入延迟到实际使用时,是避免顶层导入时引入硬依赖的标准做法,后续引入新功能时应参照此模式。

重构 重要性 8.50 洞察度 2.00

移除废弃的 auto-benchmark 代码 3000+ 行

安全且及时的清零操作,建议快速合并。对关注基准测试的开发者,可以确认自己的脚本不依赖被删除的接口。

参与讨论