修复 EAGLE3 多模态 chunked-prefill crash
该 PR 是一个精准的定点 bugfix,改动量小,逻辑清晰,值得精读以理解多模态与 speculative decoding 交互时的边界情况。设计决策中值得关注的是:不对占位符 token 做硬编码过滤,而是依赖 `vocab_size` 作为通用判据——既简洁又与模型无关。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 EAGLE3 多模态 chunked-prefill crash
该 PR 是一个精准的定点 bugfix,改动量小,逻辑清晰,值得精读以理解多模态与 speculative decoding 交互时的边界情况。设计决策中值得关注的是:不对占位符 token 做硬编码过滤,而是依赖 `vocab_size` 作为通用判据——既简洁又与模型无关。
原始 PR · 作者 qinsir5522 · 合并时间 2026-06-15 21:12
修正 NPU 性能分析文档错误并补充约束
建议合并。该 PR 提升了 NPU 性能分析文档的准确性和可用性,对 NPU 用户很有价值。值得注意的设计决策是:将 Note 卡片移动到更合理的章节位置,以及明确参数优先级顺序,这些做法提升了文档的可读性和规范性。
原始 PR · 作者 Hide-on-bushsh · 合并时间 2026-06-15 21:11
更新 Ascend NPU 文档:移除 AISBench、升级依赖、修正命令
属于常规文档维护,值得快速通过。注意 review 中指出的 'two tools' 描述残留应确认已修复;若无,应在合并前补充修正。依赖版本升级建议在发布说明中同步标注。
更新 NPU 文档:新增算子性能优化指南并调整 PD 分离示例
建议 PR 阅读者关注 `ascend_npu_operator_performance_optimizing.mdx` 中 msprof 输出字段的解释,这对性能调优有直接帮助;同时注意 `send_request.mdx` 中的 import 问题尚未彻底修复,若直接复制代码需自行添加 `print_highlight` 的 import。PD 分离文档的 MIMO 环境配置可以作为 NPU 部署的参考。
融合因果 Conv3d 的 cat 与 pad 为 Triton 内核,加速 VAE 解码
建议团队阅读本 PR,尤其是如何通过 Triton 融合简单操作来消除小开销,以及设计回退和守护条件的方式。对于未来类似性能优化(如卷积前置处理),可复用此模式。另外,建议为 Triton 内核添加单元测试,提高回归覆盖。
补充 NPU 部署文档的细节说明
这是一个小范围的文档完善 PR,改动清晰且无争议。对于使用 Ascend NPU 的团队成员或用户,建议阅读更新后的文档以获取最新的配置建议。其他开发者可快速合并或忽略。
原始 PR · 作者 longxin9715 · 合并时间 2026-06-15 20:02
更新 Ascend NPU 文档:镜像版本、离线方案及参数修正
此 PR 为纯文档更新,建议部署 NPU 的用户阅读更新后的文档,特别是离线部署和参数配置部分。
修复 NPU 新模型支持文档格式与内容
该 PR 为纯文档修正,技术洞察价值有限。如果负责 NPU 相关开发或文档维护,可以快速浏览确认格式规范;其他工程师可忽略。
参与讨论