Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-08-28
性能优化 重要性 4.89 洞察度 5.00

在 AMD 上启用 DeepSeek-V4 topk v2 内核,长上下文核内提速约 2.7-3 倍

值得精读,尤其是 `topk_impl.cuh` 中 wave64 ballot 的修复和 `topk_v2.cuh` 中 cluster 路径的条件编译方式,属于典型的 CUDA 内核跨平台移植范本。若团队在 AMD 上运行 DeepSeek-V4 长上下文服务,建议先小流量灰度并留意 TTT 是否影响吞吐目标;E2E 收益主要体现在 TTFT/ITL 而非总耗时,选型时需结合业务指标。

性能优化 重要性 5.67 洞察度 5.00

提升 gfx950 topk_transform 内核占用率

建议精读。该 PR 虽然改动简单,但体现了通过精细控制共享内存预算来平衡性能与精度的工程实践。值得关注其决策过程:如何通过分析内核的 LDS 需求,在占用率和正确性之间找到平衡点。对于维护 AMD 内核的工程师,此调整提供了有用的参考。

缺陷修复 重要性 7.81 洞察度 6.00

修复顶层 anyOf/oneOf/allOf 工具参数解析,覆盖 13 个解析器

值得精读。建议关注三点:(1) get_schema_properties 的递归合并与 setdefault 首分支优先策略,可作为"兼容组合 schema"的通用样板;(2) glm 流式收尾从字符串启发式到状态判断的修复思路,类似的 endswith 误判在流式解析中很常见;(3) 测试裁剪策略——只保留未修复代码上必失败的用例,避免回归测试"假绿"。对正在维护工具调用解析器或接入新模型的工程师有直接参考价值。

缺陷修复 重要性 5.44 洞察度 6.00

修复 tail_attn_meta 在 CUDA graph 捕获中的 H2D 拷贝问题

值得精读。该 PR 是一个小而精确的修复,展示了在 CUDA graph 捕获中避免 host 到 device 拷贝的最佳实践,并提供了明确的回归测试。它对于理解 SP 分片与 CUDA graph 的交互以及潜在的性能陷阱很有参考价值。

缺陷修复 重要性 6.99 洞察度 5.00

修复 diffusion 五个单元测试,含两个 realtime 相机运行时 bug

值得精读。重点看 `ControlStateQueue` 的“无信号 vs 保持电平”状态建模(`_received_any` + `mark_received`),以及 CI glob 遗漏导致测试静默失效的根因修复方式;对 diffusion/realtime 模块的开发者是很好的参考。insight 主要来自语义设计与测试工程实践,而非算法创新。

性能优化 重要性 7.08 洞察度 6.00

去重 host-pool mmap 双重预填充,分配耗时降约 13%

值得精读。该 PR 展示了系统调用能力探测 + 回退的稳妥写法,用 mincore 直接验证不变式而非从 flags 反推,并通过 mock 强制覆盖 CI 上不可达的回退分支,避免未测试代码合入;同时修复了异常吞噬问题。对从事启动性能、共享内存分配或 HiCache 相关工作的同学有直接参考价值。

性能优化 重要性 7.63 洞察度 6.00

新增 MXFP8 MoRI dispatch,AMD DSV4 吞吐提升约 6-10%

值得精读。核心看点有三:一是“发送侧量化、按 live token 而非填充缓冲计数”的性能洞察,直击 AITER 量化网格按 padded 行数分配的开销来源;二是用 scale dtype(fp32 vs e8m0)而非 dispatch 枚举来区分输入格式,解耦了调度器与 runner 的枚举依赖;三是用启动期 inspect 签名探测 + bf16 回退管理跨仓库依赖,把“静默出错”的字节布局问题转化为显式警告。配套的契约测试思路(不依赖 GPU 却能钉住最容易静默回归的布局常量)也值得借鉴。

参与讨论