#31058 chore: bump docs install version to 0.5.15
原始 PR · 作者 sglang-bot · 合并时间 2026-07-14 02:58
文档版本号从 0.5.12 升到 0.5.15
无需精读,属于常规文档维护。值得注意的点是版本号提升跨度从 0.5.12 到 0.5.15,暗示中间有多个版本发布。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 sglang-bot · 合并时间 2026-07-14 02:58
文档版本号从 0.5.12 升到 0.5.15
无需精读,属于常规文档维护。值得注意的点是版本号提升跨度从 0.5.12 到 0.5.15,暗示中间有多个版本发布。
提取 speculative v2 Worker 公共代码至基类
值得精读。该 PR 展示了如何通过提取基类公共实现来消除大量重复代码,设计模式清晰,是 speculative 模块后续扩展的良好基础。对于需要实现新 speculative worker 的开发者具有直接参考价值。
机械重命名 num_tokens_per_bs 为 num_tokens_per_req
建议快速合并。该 PR 是纯命名改进,不引入行为变更,能提升 speculative 解码路径的代码一致性,值得合入。
原始 PR · 作者 sglang-bot · 合并时间 2026-07-14 02:44
自动化同步 LMSYS 博客卡片至首页
可直接合并,无需额外审查。对于关注文档准确性的维护人员,可快速浏览确认链接和内容正确性。
将固定内存可用性检查路由至平台抽象层
此 PR 值得精读,特别是涉及平台抽象接口设计的地方。设计决策(将钩子放在 DeviceMixin 而非 SRTPlatform)体现了单一职责和开闭原则,对后续 OOT 平台开发有参考价值。用例覆盖全面,测试边界清晰,可视为平台抽象层演进的良好范例。
原始 PR · 作者 JustinTong0323 · 合并时间 2026-07-14 02:34
新增 --default-chat-template-kwargs 服务级默认参数
值得精读。变更虽小(3 个文件、78 行),但完整展示了一个服务级默认配置的落地过程:单一共享入口注入 + setdefault 保证 per-request 优先级 + 对"字段被提前 pop"的时序陷阱做显式镜像。关注点包括:(a) _process_messages 作为唯一注入点的覆盖面;(b) reasoning_effort 被 _convert_to_internal_request 提前弹出的处理方式;(c) 配置校验放在 ServerArgs.__post_init__ 还是使用方 __init__ 的风格分歧(merrymercy 反对仍被合并);(d) 测试只覆盖函数层,未覆盖 CLI 解析。对需要实现"服务级默认参数"的开发者是很好的参照。
修复 FA4 与 full prefill CUDA graph 的 page_size 冲突
可合并,变更简单且正确。建议后续增加测试覆盖该组合场景。
HiCache NIXL 后端支持混合模型
此 PR 实现了 NIXL 后端对混合模型存储的关键支持,设计上考虑了零拷贝安全性、per-pool 上下文独立性和 sidecar 键命名规范。值得关注的设计决策包括对齐检测条件、持久 bounce buffer 方向分离和 v2 接口的池感知逻辑。建议相关开发者仔细阅读 `hicache_nixl.py` 中的 `register_mem_host_pool_v2` 和 `batch_get_v2` 实现,以及 `memory_pool_host.py` 中的 `is_stride_page_aligned` 模式。对于生产部署,注意 dtype 风险尚未在 PR 中明确修复,需要后续跟进。
参与讨论