#28446 [HiCache]Asymmetric pool support direct backend
原始 PR · 作者 huangtingwei9988 · 合并时间 2026-06-17 04:17
Asymmetric池新增 direct 后端支持,移除 kernel 强制限制
值得精读,特别是 Asymmetric 池的布局和 IO 后端设计,以及 K/V 独立传输的意图。审查者关注如何确保 stride 安全地由单独的 kernel 调用承载。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 huangtingwei9988 · 合并时间 2026-06-17 04:17
Asymmetric池新增 direct 后端支持,移除 kernel 强制限制
值得精读,特别是 Asymmetric 池的布局和 IO 后端设计,以及 K/V 独立传输的意图。审查者关注如何确保 stride 安全地由单独的 kernel 调用承载。
修复 runner_backend 循环导入导致的 CI 失败
建议所有涉及循环依赖修复的 PR 参考此模式:当符号仅用于类型注解时,利用 `TYPE_CHECKING` 和 `from __future__ import annotations` 延迟导入。此 PR 展示了清晰的诊断和最小化修复,值得精读。
取消 Marlin NVFP4 测试的 CI 跳过标记
建议合入。这是一个低风险、高回报的测试恢复变更,能增强 NVFP4 Marlin 后端的 CI 覆盖。未来可考虑将超时测试移到 nightly 以减少 PR 等待时间。
原始 PR · 作者 JustinTong0323 · 合并时间 2026-06-17 02:17
修复 GLM-5.2 cookbook 思考开关参数名并补充推理力度文档
此 PR 是典型的文档修正,逻辑简单,无需深入审查。但如果你的团队正在使用 GLM-5.2 模型,建议及时同步此文档更新,避免被错误示例误导。
原始 PR · 作者 JINO-ROHIT · 合并时间 2026-06-17 01:25
修复--tokenizer-path 缺少 config.json 时 get_processor 失败
该 PR 修复了一个实际问题,代码清晰且讨论中采纳了更好的设计(if-elif 替代 try-except)。值得精读,尤其是 `get_processor` 中的 fallback 模式可作为类似场景的参考。
原始 PR · 作者 feliang-git · 合并时间 2026-06-17 01:19
新增LPLB线性规划负载均衡,优化MoE专家路由
这是一个高质量的PR,核心IPM内核设计、空rank处理、性能优化(融合核、预分配、流同步)都值得精读。建议架构师和MoE开发者重点关注,了解如何通过小规模LP优化专家负载分配。
原始 PR · 作者 JustinTong0323 · 合并时间 2026-06-17 01:18
GLM-5.2 MTP 调优至 5-1-6 并简化部署参数
值得精读:本 PR 不仅更新了性能数据,更展示了如何通过共享组件条件渲染来简化模型配置。开发者可以学习 `_deployment.jsx` 中根据配置动态选择是否注入环境变量的模式,保持基础组件通用性的同时适应不同模型的需求。
清除 UnifiedTree 中三个未使用的死代码符号
建议快速合并。此类死代码清理有助于保持核心模块的可维护性,且风险经过 CI 验证。
参与讨论