修复 Quark 门禁漏判尾部 MTP 层,恢复 GLM-5.2-MXFP4 共享专家融合
值得精读:改动虽小,但触及量化门禁的核心判别逻辑,且性能收益显著、无测试配套是明确的改进点。关注两个设计决策:一是把 draft 层识别收敛为 _is_draft_layer() 单一入口,与既有 MTP 层区间遍历逻辑保持一致;二是用 int(getattr(..., 0) or 0) 在赋值处统一归一 None,避免在多个使用点重复防御。建议后续补 _is_draft_layer 的单元测试。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 Quark 门禁漏判尾部 MTP 层,恢复 GLM-5.2-MXFP4 共享专家融合
值得精读:改动虽小,但触及量化门禁的核心判别逻辑,且性能收益显著、无测试配套是明确的改进点。关注两个设计决策:一是把 draft 层识别收敛为 _is_draft_layer() 单一入口,与既有 MTP 层区间遍历逻辑保持一致;二是用 int(getattr(..., 0) or 0) 在赋值处统一归一 None,避免在多个使用点重复防御。建议后续补 _is_draft_layer 的单元测试。
原始 PR · 作者 ShangmingCai · 合并时间 2026-08-24 15:32
修复 mini-lb 转发 flush_cache 的 timeout 参数,恢复延迟排空路径
PR body 值得精读:对"参数丢弃 → scheduler 立即 flush → KV 释放 → Mooncake 单次失败永久拉黑"的跨层根因分析是高质量排障范例,量化数据(12 次真实失败放大为约 1465 个请求失败,吞吐 2,039→9,994 tok/s)很有说服力。作者主动更正 PR 归因的严谨做法也值得参考。代码本身仅 8 行改动、阅读成本极低;管理上应跟进三个遗留项:#36152 的真实修复、Rust router 同缺陷、Mooncake 黑名单与恢复探针策略。
修复 NPU 转置批量矩阵乘超限崩溃,迁移 K3 配置
值得精读。重点关注 forward_mla_core_npu 的回退分支设计以及 review 中如何把 K3 专属参数泛化为通用 ServerArgs 参数。建议后续补充针对大形状边界的单元测试或 NPU 回归测试。
NPU 单节点测试超时改为可配置,流水线显式传 180 分钟
这是一个简单且聚焦的 CI 配置改进,值得快速浏览以了解其输入传递与覆写模式;如果有 NPU 测试运行时间数据,可以进一步验证 180 分钟是否合理,并考虑将默认值也收敛到 180 以减少配置分歧。
新增 LoRA 合并权重文件缓存,峰值主机内存降 75%
值得精读。重点看三处设计:①用文件后备存储把合并结果放进 page cache 的思路(对任何大权重 merge 场景有普遍借鉴意义);②通过 `install_merged_weight` 把状态转换收归 layer 所有,避免查询带副作用;③零拷贝 view 与原地 merge 的语义边界划分(`_ensure_base_snapshot_owned`)。建议同时关注缓存 key 的哈希范围和并发写入保护是否足够。
LingBot 高质量请求 VAE 解码切 BF16,端到端提速约 3.7%
值得精读,尤其适合关注 diffusion 管线精度/性能权衡的工程师。重点看三点:`resolve_decode_precision` 的回退链设计如何保证向后兼容;「FP32 权重常驻 + 请求级 BF16 decode」如何同时满足 lossless byte-exact 与 high 提速;以及 ABBA + SSIM/PSNR + byte-exact 的三重验证方法,可作为同类精度类 PR 的验收模板。
模型overlay缓存路径改为优先服从XDG缓存目录
值得快速浏览,变更小而聚焦。重点理解get_diffusion_cache_root()为何改为从envs取值,以及为何默认路径改为XDG_CACHE_HOME。该改动体现了对Linux缓存规范的遵循。
参与讨论