#29828 glm5.2 on ascend doc (new version)
原始 PR · 作者 stellaxcpeng · 合并时间 2026-07-03 10:19
新增 Ascend NPU 上 GLM-5.2 部署文档
建议维护者验证并确保文档中的命令示例已按 Review 建议修正。对于需要部署 GLM-5.2 的用户,此文档是必要参考,值得精读。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 stellaxcpeng · 合并时间 2026-07-03 10:19
新增 Ascend NPU 上 GLM-5.2 部署文档
建议维护者验证并确保文档中的命令示例已按 Review 建议修正。对于需要部署 GLM-5.2 的用户,此文档是必要参考,值得精读。
更新 Ascend NPU 文档,补充环境变量并删除旧 best practice
这是一次常规的文档维护更新,对于 Ascend NPU 用户和部署 DeepSeek 模型的团队有参考价值。建议部署 W8A8 量化的用户查看环境变量文档,了解 `DEEP_NORMAL_MODE_USE_INT8_QUANT` 的用法和弃用计划。对于代码贡献者,可观察 review 中关于 low_latency vs normal mode 的讨论,理解 DeepEP 的配置设计。
原始 PR · 作者 yctseng0211 · 合并时间 2026-07-03 09:18
修复ROCm 7.0上FP8 GEMM的NaN问题
该PR是一个针对特定硬件/软件组合的精准修复,设计思路清晰——按形状和M动态选择后端,而不是全局弃用CK。值得关注其**优雅的降级策略**,可作为后续同类硬件差异修复的参考模式。如果团队在生产AMD gfx950 + ROCm 7.0,建议立即合并。
原始 PR · 作者 sglang-bot · 合并时间 2026-07-03 09:01
同步 LMSYS SGLang 博客卡片链接到首页
可直接合并,无技术风险。
原始 PR · 作者 arathi-hlab · 合并时间 2026-07-03 08:30
为 Intel XPU CI 添加每日作业监控工作流
值得对工作流模式和速率限制策略进行参考。关注 XPU 后端的团队应了解此监控机制,并在上游 `query_job_status.py` 变更时及时 cherry-pick。
原始 PR · 作者 chenkaiyue · 合并时间 2026-07-03 08:03
PD 路由:prefill 失败时立即取消 decode 请求
值得精读,特别是 `tokio::select!` 在 PD 路由中的用法和断路器归属设计。merge 前建议补充测试覆盖 prefill 失败、decode 先完成、客户端断开等场景。
修复 draft 模型共享 logits buffer 形状不匹配
建议精读该 PR,特别是 `_copy_logits_to_buffer` 的最终实现,它展示了一种在性能优化与正确性之间平衡的实用模式:只在形状完全匹配时复用缓冲区,否则回退到安全路径。review 中关于条件切片的建议也值得学习。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-07-03 07:00
修复 AMD ROCm 下 DeepSeek-V4-Flash 默认启用稀疏 prefill 导致的崩溃
该 PR 值得快速了解设计思路:平台条件默认值、保留用户覆盖能力、与现有模式保持一致。但实现中的条件逻辑 bug 提醒需要仔细审查环境变量的解析时机。建议阅读 #30237 作为后续修正。
参与讨论