Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-07-03

#29828 glm5.2 on ascend doc (new version)

原始 PR · 作者 stellaxcpeng · 合并时间 2026-07-03 10:19

文档 重要性 5.14 洞察度 3.00

新增 Ascend NPU 上 GLM-5.2 部署文档

建议维护者验证并确保文档中的命令示例已按 Review 建议修正。对于需要部署 GLM-5.2 的用户,此文档是必要参考,值得精读。

文档 重要性 4.50 洞察度 2.00

更新 Ascend NPU 文档,补充环境变量并删除旧 best practice

这是一次常规的文档维护更新,对于 Ascend NPU 用户和部署 DeepSeek 模型的团队有参考价值。建议部署 W8A8 量化的用户查看环境变量文档,了解 `DEEP_NORMAL_MODE_USE_INT8_QUANT` 的用法和弃用计划。对于代码贡献者,可观察 review 中关于 low_latency vs normal mode 的讨论,理解 DeepEP 的配置设计。

缺陷修复 重要性 5.58 洞察度 6.00

修复ROCm 7.0上FP8 GEMM的NaN问题

该PR是一个针对特定硬件/软件组合的精准修复,设计思路清晰——按形状和M动态选择后端,而不是全局弃用CK。值得关注其**优雅的降级策略**,可作为后续同类硬件差异修复的参考模式。如果团队在生产AMD gfx950 + ROCm 7.0,建议立即合并。

#29807 Add XPU CI job monitor workflow

原始 PR · 作者 arathi-hlab · 合并时间 2026-07-03 08:30

基础设施 重要性 6.88 洞察度 5.00

为 Intel XPU CI 添加每日作业监控工作流

值得对工作流模式和速率限制策略进行参考。关注 XPU 后端的团队应了解此监控机制,并在上游 `query_job_status.py` 变更时及时 cherry-pick。

缺陷修复 重要性 7.24 洞察度 6.00

PD 路由:prefill 失败时立即取消 decode 请求

值得精读,特别是 `tokio::select!` 在 PD 路由中的用法和断路器归属设计。merge 前建议补充测试覆盖 prefill 失败、decode 先完成、客户端断开等场景。

缺陷修复 重要性 6.05 洞察度 5.00

修复 draft 模型共享 logits buffer 形状不匹配

建议精读该 PR,特别是 `_copy_logits_to_buffer` 的最终实现,它展示了一种在性能优化与正确性之间平衡的实用模式:只在形状完全匹配时复用缓冲区,否则回退到安全路径。review 中关于条件切片的建议也值得学习。

缺陷修复 重要性 5.99 洞察度 4.00

修复 AMD ROCm 下 DeepSeek-V4-Flash 默认启用稀疏 prefill 导致的崩溃

该 PR 值得快速了解设计思路:平台条件默认值、保留用户覆盖能力、与现有模式保持一致。但实现中的条件逻辑 bug 提醒需要仔细审查环境变量的解析时机。建议阅读 #30237 作为后续修正。

参与讨论