更新 NPU 最佳实践文档,新增 V4-Flash 教程与 GLM-5.2 指南
值得精读其中两个新页面(DeepSeek-V4-Flash best-practices 与 tutorial),尤其适合负责昇腾部署的工程师与文档维护者。值得学习的设计决策:以实测数据为准修正文档、删除无法支撑的性能声称;把环境变量收敛为顶层导出并去掉调试开关;在教程里提供 8-die 最小验证配置降低入门门槛;以及用 bot 自动化合并的文档流水线。
SGLang is a high-performance serving framework for large language models and multimodal models.
更新 NPU 最佳实践文档,新增 V4-Flash 教程与 GLM-5.2 指南
值得精读其中两个新页面(DeepSeek-V4-Flash best-practices 与 tutorial),尤其适合负责昇腾部署的工程师与文档维护者。值得学习的设计决策:以实测数据为准修正文档、删除无法支撑的性能声称;把环境变量收敛为顶层导出并去掉调试开关;在教程里提供 8-die 最小验证配置降低入门门槛;以及用 bot 自动化合并的文档流水线。
修复 DSpark 重复采样,删除多余 sample_block 调用
该 PR 小而精,值得快速合入。它修复了一个隐蔽的逻辑错误,且通过相关测试验证。关注点在于测试覆盖,建议后续补充一个直接针对该路径的单元测试,以防回归。
修复 extra-kwargs 注意力路径丢弃 LSE 输出
值得关注,因为修复了一个图形路径下的功能缺陷,并提供了清晰的测试验证。设计决策上,通过检测 `return_lse` 键和 `mha_return_lse` 标志来决定是否处理 LSE,保持了向后兼容性。
更新 cu134 镜像依赖,修复 sgl- wheel 固定问题
该 PR 是基础设施调整,值得关注其解决 wheel 版本冲突的思路,以及如何通过环境变量和 sed 逻辑管理依赖版本。
更新 AMD DeepSeek-V4 cookbook 镜像与 MoRI EP 配置
该 PR 值得快速浏览,因为它体现了文档如何随功能演进同步更新,特别是为 AMD 用户提供了 MoRI 后端的实用配置。无需精读代码,但值得关注新增环境变量的实际效果。
修复 aiter ASM prefill 在 page_size>1 时 KV 索引错误
值得精读,尤其是对 AMD 注意力内核与 KV 元数据口径感兴趣的同学。核心收益有三点:一是识别出 kv_indptr/kv_indices 的 token 级语义并简化 gather;二是把不可测试的内联逻辑提取为模块级纯函数并补回退日志;三是用随机打乱页面的构造暴露 page_size=1 掩盖边界缺陷的测试设计。
新增 AMD 持久 CTA 工作窃取解码注意力内核
值得精读:WCA 的 persistent-CTA + work-stealing + capture-time 决策三个设计点对注意力 kernel 工程很有借鉴价值;建议重点看自动门控在 eager 与 CUDA graph 下的两套决策逻辑,以及 1xCU 网格在 MI300X/MI355X 上的 A/B 验证过程。若团队后续要支持更长上下文或引入更多 AMD 内核,本 PR 的分层(kernel / dispatch / gate / bench / test)是一个很好的模板。
重构 JIT 内核与专家打包目录布局
值得快速浏览,了解目录组织模式(ops 与 jit 分离、工具内嵌包)及延迟导入、Git 元数据回退等实用技巧。对于负责打包、部署或维护 JIT 内核的工程师,建议精读 `expert_pack_runtime.py` 和 `minicpm_sala/__init__.py` 的改动。
参与讨论