修复 extra_buffer_lazy 防护绕过的 bug
建议合并。这是一个清晰且低风险的 bugfix,修复了启动时参数校验的遗漏,防止了此前可能被忽略的不安全配置组合。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 extra_buffer_lazy 防护绕过的 bug
建议合并。这是一个清晰且低风险的 bugfix,修复了启动时参数校验的遗漏,防止了此前可能被忽略的不安全配置组合。
用 HPC-Ops bf16xfp32 内核加速 LongCat-Flash 路由器 GEMM
值得精读,尤其是权重拆分缓存的设计、通过 min-M 阈值在性能与兼容性之间平衡的策略,以及外部核集成模式。同时关注后续 #31943 对缓存一致性的修复,以填补本 PR 遗留的安全缺口。
修复Qwen encoder DP空rank时embedding设备不匹配
建议精读该 PR:它是一个经典的多设备通信 bug fix,展示了分布式推理中张量设备一致性的重要性。同时体现了一行 device 指定错误的连锁反应。
Mamba 推测解码支持 extra_buffer_lazy
值得精读。重点理解 deferred slot swap 的设计:如何在 overlap 下通过 window 检测和状态记录保证正确性。对于维护 Mamba 相关模型的团队,此 PR 是减少显存浪费的关键改进。
优化 HiCache 预取收尾与可用前缀截断,修复 hybrid 模型乱码
值得精读。这是 HiCache 混合预取收尾逻辑的 canonical 实现,重点看三点:一是 helper 提取如何统一两套缓存树的收尾路径;二是 clampable 判定如何以 sidecar 的 hit_policy 与 source pool 属性区分 DSA 与 SWA/Mamba 场景;三是前导连续成功段统计(rs.index(False))对安全前缀长度的影响。建议后续跟进单卡跳过 all_reduce 的优化、统一 PrefetchOperation 属性契约,并补充覆盖中间 gap 场景的单测。
添加 NIXL 分解 E2E 功能测试
该 PR 值得精读,尤其对于需要为特定分解后端添加 E2E 测试的开发者。它展示了如何通过 fixture 类封装后端差异、如何注入故障并验证系统健壮性,以及如何在 CI 中注册此类多 GPU 测试。作者与 review 的讨论(默认值处理、异常包装)也体现了严谨的测试编写态度。
修复流式 delta 中多个 tool call 被丢弃的问题
值得快速合入并关注相关模块(其他 Detector 如 xgrammar 的流式解析是否存在类似模式)。提取 progress-flag 循环的设计可复用。
简化 HiCache 构建栈函数,移除冗余参数
值得精读,特别是如何通过引入参数对象(`CacheInitParams`)简化多参数函数的设计模式。对于维护 HiCache 模块的开发者具有参考意义。
参与讨论