为 diffusion 服务添加优雅关闭 worker 进程的机制
值得精读,尤其是 `launch_server.py` 中的层级式进程关闭模式(join → terminate → kill)设计和 `kill_itself_when_parent_died` 的强化实现。该 PR 为 diffusion 服务稳定性做出了重要改进。
SGLang is a high-performance serving framework for large language models and multimodal models.
为 diffusion 服务添加优雅关闭 worker 进程的机制
值得精读,尤其是 `launch_server.py` 中的层级式进程关闭模式(join → terminate → kill)设计和 `kill_itself_when_parent_died` 的强化实现。该 PR 为 diffusion 服务稳定性做出了重要改进。
修复 NeoX RoPE 下 DSA indexer fusion 精度回退
本 PR 值得阅读,展示了如何将全局开关细化为实例级开关以解决模型兼容性问题。代码改动简洁、测试阈值提升合理。
原始 PR · 作者 mattteochen · 合并时间 2026-07-04 17:50
GLM5.2 MHA 路径跳过 DSA indexer 实现索引共享
值得精读,展示了如何通过提取方法安全地跳过不必要的 indexer 调用,是一种常见的性能优化模式。需要注意 `should_run_indexer` 实现中的边界条件(如 `is_nextn` 回退)的合理性。
重命名 Arg.model_overridable 为 Arg.resolvable
值得快速审阅,因变更机械且已通过测试。但作为堆栈的最后一环,建议结合全局 PR #30062 理解整体配置解析重构的背景。
迁移 DeepSeek 配置到声明式系统
值得精读,特别是 `_deepseek_family_overrides` 的实现展示了如何将复杂条件分支组织为声明式函数,以及 post-process pass 的拆分模式。测试用例也很完整,可作为后续迁移的参考。
迁移 MoE 后端和量化分辨率链
此 PR 展示了如何将复杂条件逻辑迁移到声明式覆盖系统,值得学习其模式。建议与堆栈中的其他 PR 一起审查以全面理解架构变化。
将 page_size 解析迁移至声明式 override 系统
值得精读。此 PR 展示了如何将大段条件逻辑安全地重构为声明式 pass 链,是理解 SGLang 配置系统演进的关键 PR。特别关注 _qwen3_5_hybrid_overrides 中 attention_backend 与 page_size 的耦合声明,以及 _mla_backend_page_constraints 如何整合六个 MLA 族后端约束为单一 pass。
将 attention_backend 解析链迁移至声明式覆盖系统
建议架构师和关注配置分层的开发者精读 overrides.py 中各声明函数的实现,特别是 slot 保留机制和 refresh_declared_fields 的作用。一般开发者了解变更范围和测试覆盖即可。
参与讨论