修复 forward_batch_info 循环导入问题
值得快速合入并关注。这类细粒度导入治理能预防后续类似问题,建议团队在代码审查中持续关注导入层级。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 forward_batch_info 循环导入问题
值得快速合入并关注。这类细粒度导入治理能预防后续类似问题,建议团队在代码审查中持续关注导入层级。
DeepSeek V4 SWA 位置缓存优化
建议仔细审查缓存失效逻辑的鲁棒性,尤其是 `start_layer` 假设和并发场景。推荐在合并前补充单元测试,验证不同层执行顺序和并发情况下的缓存行为。作者不需要对 PR 做额外操作。
原始 PR · 作者 kkHuang-amd · 合并时间 2026-06-02 13:30
修复 AMD ROCm AITER 上 GPT-OSS MXFP4 精度错误
本 PR 展示了系统性的精度调试过程,涉及跨栈的权重布局、kernel dispatch 和属性传播问题。建议团队内对涉及 AITER MXFP4 的后续开发仔细审查 `is_shuffled` 标志的传播和 GateMode 配置。值得精读,尤其是在理解量化内核集成和平台适配方面。
将 Frozen-KV MTP 辅助种子步骤融合到捕获的草稿 CUDA 图中
该 PR 值得精读,特别是了解如何将 eager forward 步骤融合到现有的 CUDA 图中以减少 kernel launch 开销。设计思路(将第一轮迭代纳入循环)可推广到其他类似场景。
为 NPU 添加 Kimi-K2.5 最佳实践文档
建议阅读,尤其是计划在 Ascend NPU 上部署 Kimi-K2.5 的团队。文档中的配置参数虽有待验证,但整体框架有价值。
原始 PR · 作者 alphabetc1 · 合并时间 2026-06-02 13:07
更新 CODEOWNERS 添加内存分配器负责人
该 PR 为基础设施日常维护,无需精读。建议团队成员关注 CODEOWNERS 文件的更新,以了解最新的审查职责划分。
修复 HiCache 统一 radix 树缓存突变
值得精读。这是一个典型的多层抽象遗产 bug 修复:统一树从老树复制代码时复制了已被发现有害的装饰器。建议回顾 #26177 和 #26062 的演进历史,理解如何避免类似复制引发的二重 bug。
原始 PR · 作者 thanhhao98 · 合并时间 2026-06-02 11:47
GLM-4.7 文档新增 Blackwell GPU 和 NVFP4 量化支持
该 PR 值得精读,尤其是 `glm-47-deployment.jsx` 中 SUPPORT 矩阵驱动的约束逻辑,是一种将硬件兼容性规则集中管理、自动 fallback 的可复用文档组件设计模式。对于负责部署指南和交互式命令生成器的工程师具有参考价值。建议在类似文档场景中推广。
参与讨论