让 mem_fraction_static 按分解模式智能预留
建议精读。该 PR 展示了一个小而精准的优化,在分解架构下通过条件化预留换取有效显存,设计清晰、改动集中。值得关注的是 DeepEP 预留的硬编码值,后续可能需要根据实际 Profiling 调整。由于无测试,建议在后续 PR 中添加分解模式的 mem_fraction 自动测试。
SGLang is a high-performance serving framework for large language models and multimodal models.
让 mem_fraction_static 按分解模式智能预留
建议精读。该 PR 展示了一个小而精准的优化,在分解架构下通过条件化预留换取有效显存,设计清晰、改动集中。值得关注的是 DeepEP 预留的硬编码值,后续可能需要根据实际 Profiling 调整。由于无测试,建议在后续 PR 中添加分解模式的 mem_fraction 自动测试。
跳过单节点跨节点探针,修复 EP 段错误
值得合并,修复了关键路径上的段错误。设计谨慎,采纳了 review 建议避免了遗留 accessor 增加和潜在的错误路径。建议阅读 MultimemAllGatherer.__init__ 的修改,可作为在分布式组件中安全添加条件探测的范例。
修复测试入口未传递退出码导致 CI 检查失败
该 PR 变更虽小但有必要,建议合并。它修复了因 #30107 引入的 CI 阻塞问题。值得注意的设计细节:仓库通过自动化测试 `test_no_bare_pytest_main` 强制执行代码规范(`__main__` 中必须使用 `sys.exit` 包裹 `pytest.main`),这种做法有助于保持测试脚本质量,值得推广。
原始 PR · 作者 whybeyoung · 合并时间 2026-07-05 03:09
修复 multi-tokenizer 模式下 batch input_ids 路由 hang 住
该 PR 修复了一个重要回归,且实现简洁清晰,值得所有涉及 IPC 路由的开发者阅读。特别是 `stamp_http_worker_ipc` 的设计和 schema 注释的澄清,展示了 batch 与单请求路由的差异。
原始 PR · 作者 JustinTong0323 · 合并时间 2026-07-05 00:13
运行时解析 Hunyuan 特殊 token 后缀以兼容带后缀的 tokenizer
推荐精读。此 PR 展示了一种灵活处理 tokenizer 后缀差异的模式:通过运行时词表解析替代硬编码,并通过 `inspect.signature` 实现条件参数注入,保持了模块的可扩展性。`resolve_hunyuan_tokens` 和 `has_vocab_pattern` 的设计值得在类似场景复用。同时,PR 在审核后及时修复了潜在崩溃和结构信息缺失问题,体现了良好的质量保障流程。
统一 diffusion SP 切分逻辑并引入零拷贝尾部填充注意力
值得精读的设计决策:通过布局不变性将 padding 开销消除在注意力之前,无需自定义 kernel,展示了如何利用现有 kernel(FlashAttention varlen)实现零成本 padding。适合有序列并行需求的团队参考。建议关注:`SpShard` 数据类、`tail_attn_meta` 的构造、`shard_like` 的 pad_mode 分支。
修复在线 FP8 量化与 DiT CPU offload 冲突导致崩溃
推荐所有人阅读,尤其是 diffusion 反量化加载路径的维护者。此 PR 展示了一个由隐式回退引发的隐蔽 bug 及其系统化修复方法:1) 在加载阶段对 `dit_cpu_offload` 进行约束,2) 移除静默回退,3) 在调用链末端增加防御性检查。三个层次环环相扣,体现了防御性工程实践。
恢复 B200 NVFP4 严格阈值并加固 CUDA 13 CI 依赖管理
此 PR 的核心价值在于**暴露真实环境问题而非放松阈值**,是 CI 可靠性加固的典型实践。值得关注 `remove_stale_cuda12_nvidia_wheels` 的批量查询实现方式和 `SGLANG_CI_EARLY_LD_LIBRARY_PATH` 的环境变量控制模式,可作为类似 CI 依赖治理的参考。建议精读 `ci_install_dependency.sh` 中的防护逻辑。
参与讨论