#36897 Decouple speculative draft capacity from runtime state
原始 PR · 作者 merrymercy · 合并时间 2026-08-31 14:31
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 merrymercy · 合并时间 2026-08-31 14:31
新增后端无关外部缓存链路核心并接入缓存树
值得精读。重点看三处设计:① `_sync_restorable_prefix` 用 0/1 mask + MIN all-reduce 求跨 rank 稀疏集合交集,避免“取局部最大值”落点不可恢复;② `UnifiedCacheLinkerWrapper` 的「排队 + 异步完成」传输协议与锁 pin/unpin 机制,兼顾按层加载与异常回滚;③ `check_hicache_events` 的双轨事件轮询与卸载结果二次归约(任一 rank 失败整体回滚)。建议后续 backend PR 合入前补充一次真实多卡端到端验证(含 DMA 失败注入)。
原始 PR · 作者 arathi-hlab · 合并时间 2026-08-31 14:03
将四个 XPU prefill-only 测试迁至夜间网格并去掉显存门槛
不推荐精读,这是一次标准的 CI 网格分层调整,但有两个值得留意的实践:一是把"显存门槛"与"运行器规格"绑定而不是绑定到测试本身,迁移套件时门槛随之失效;二是用 `nightly=True` 显式区分触发频率,避免后续维护者误以为用例仍在 PR gate 上。对负责 XPU/Intel CI 的工程师可快速浏览。
从替换权重自身探测量化声明,修复预量化 transformer 覆盖加载
值得精读,尤其是 `_resolve_weight_override_quantization` 的“声明合并 + 张量级探测 + fails closed”三段式设计:以物化权重为唯一事实来源、多来源声明递归合并并拒绝冲突、无声明时通过 dtype 探测兜底并拒绝加载,这套模式对任何需要从 checkpoint 自描述量化格式的加载器都有借鉴价值。建议后续将 `assert metadata_spec is not None` 替换为显式错误,并为探测循环增加分片采样以控制启动开销。
参与讨论