Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 01:23 同步状态:空闲 下次计划:2026-09-05 02:23

PR 列表

更多筛选
2026-06-02

#26931 [AMD] dpsk-v4 swa loc cache support

原始 PR · 作者 1am9trash · 合并时间 2026-06-02 13:37

性能优化 重要性 6.66 洞察度 5.00

DeepSeek V4 SWA 位置缓存优化

建议仔细审查缓存失效逻辑的鲁棒性,尤其是 `start_layer` 假设和并发场景。推荐在合并前补充单元测试,验证不同层执行顺序和并发情况下的缓存行为。作者不需要对 PR 做额外操作。

缺陷修复 重要性 6.93 洞察度 7.00

修复 AMD ROCm AITER 上 GPT-OSS MXFP4 精度错误

本 PR 展示了系统性的精度调试过程,涉及跨栈的权重布局、kernel dispatch 和属性传播问题。建议团队内对涉及 AITER MXFP4 的后续开发仔细审查 `is_shuffled` 标志的传播和 GateMode 配置。值得精读,尤其是在理解量化内核集成和平台适配方面。

性能优化 重要性 7.08 洞察度 6.00

将 Frozen-KV MTP 辅助种子步骤融合到捕获的草稿 CUDA 图中

该 PR 值得精读,特别是了解如何将 eager forward 步骤融合到现有的 CUDA 图中以减少 kernel launch 开销。设计思路(将第一轮迭代纳入循环)可推广到其他类似场景。

#26774 [NPU][Docs] Kimi-K2.5 best practice

原始 PR · 作者 litmei · 合并时间 2026-06-02 13:14

文档 重要性 4.24 洞察度 3.00

为 NPU 添加 Kimi-K2.5 最佳实践文档

建议阅读,尤其是计划在 Ascend NPU 上部署 Kimi-K2.5 的团队。文档中的配置参数虽有待验证,但整体框架有价值。

缺陷修复 重要性 5.82 洞察度 5.00

修复 HiCache 统一 radix 树缓存突变

值得精读。这是一个典型的多层抽象遗产 bug 修复:统一树从老树复制代码时复制了已被发现有害的装饰器。建议回顾 #26177 和 #26062 的演进历史,理解如何避免类似复制引发的二重 bug。

文档 重要性 7.18 洞察度 6.00

GLM-4.7 文档新增 Blackwell GPU 和 NVFP4 量化支持

该 PR 值得精读,尤其是 `glm-47-deployment.jsx` 中 SUPPORT 矩阵驱动的约束逻辑,是一种将硬件兼容性规则集中管理、自动 fallback 的可复用文档组件设计模式。对于负责部署指南和交互式命令生成器的工程师具有参考价值。建议在类似文档场景中推广。

参与讨论