在 AMD 上启用 DeepSeek-V4 topk v2 内核,长上下文核内提速约 2.7-3 倍
值得精读,尤其是 `topk_impl.cuh` 中 wave64 ballot 的修复和 `topk_v2.cuh` 中 cluster 路径的条件编译方式,属于典型的 CUDA 内核跨平台移植范本。若团队在 AMD 上运行 DeepSeek-V4 长上下文服务,建议先小流量灰度并留意 TTT 是否影响吞吐目标;E2E 收益主要体现在 TTFT/ITL 而非总耗时,选型时需结合业务指标。
SGLang is a high-performance serving framework for large language models and multimodal models.
在 AMD 上启用 DeepSeek-V4 topk v2 内核,长上下文核内提速约 2.7-3 倍
值得精读,尤其是 `topk_impl.cuh` 中 wave64 ballot 的修复和 `topk_v2.cuh` 中 cluster 路径的条件编译方式,属于典型的 CUDA 内核跨平台移植范本。若团队在 AMD 上运行 DeepSeek-V4 长上下文服务,建议先小流量灰度并留意 TTT 是否影响吞吐目标;E2E 收益主要体现在 TTFT/ITL 而非总耗时,选型时需结合业务指标。
提升 gfx950 topk_transform 内核占用率
建议精读。该 PR 虽然改动简单,但体现了通过精细控制共享内存预算来平衡性能与精度的工程实践。值得关注其决策过程:如何通过分析内核的 LDS 需求,在占用率和正确性之间找到平衡点。对于维护 AMD 内核的工程师,此调整提供了有用的参考。
热门模型横幅加入 GLM-5.3-Flash 并移除 Inkling
无需精读,典型的文档维护 PR。可关注其文案与模型实际配置一致性。
原始 PR · 作者 JustinTong0323 · 合并时间 2026-08-28 12:50
修复顶层 anyOf/oneOf/allOf 工具参数解析,覆盖 13 个解析器
值得精读。建议关注三点:(1) get_schema_properties 的递归合并与 setdefault 首分支优先策略,可作为"兼容组合 schema"的通用样板;(2) glm 流式收尾从字符串启发式到状态判断的修复思路,类似的 endswith 误判在流式解析中很常见;(3) 测试裁剪策略——只保留未修复代码上必失败的用例,避免回归测试"假绿"。对正在维护工具调用解析器或接入新模型的工程师有直接参考价值。
原始 PR · 作者 AgainstEntropy · 合并时间 2026-08-28 12:22
修复 tail_attn_meta 在 CUDA graph 捕获中的 H2D 拷贝问题
值得精读。该 PR 是一个小而精确的修复,展示了在 CUDA graph 捕获中避免 host 到 device 拷贝的最佳实践,并提供了明确的回归测试。它对于理解 SP 分片与 CUDA graph 的交互以及潜在的性能陷阱很有参考价值。
修复 diffusion 五个单元测试,含两个 realtime 相机运行时 bug
值得精读。重点看 `ControlStateQueue` 的“无信号 vs 保持电平”状态建模(`_received_any` + `mark_received`),以及 CI glob 遗漏导致测试静默失效的根因修复方式;对 diffusion/realtime 模块的开发者是很好的参考。insight 主要来自语义设计与测试工程实践,而非算法创新。
原始 PR · 作者 alphabetc1 · 合并时间 2026-08-28 11:54
去重 host-pool mmap 双重预填充,分配耗时降约 13%
值得精读。该 PR 展示了系统调用能力探测 + 回退的稳妥写法,用 mincore 直接验证不变式而非从 flags 反推,并通过 mock 强制覆盖 CI 上不可达的回退分支,避免未测试代码合入;同时修复了异常吞噬问题。对从事启动性能、共享内存分配或 HiCache 相关工作的同学有直接参考价值。
原始 PR · 作者 karverma-amd · 合并时间 2026-08-28 11:45
新增 MXFP8 MoRI dispatch,AMD DSV4 吞吐提升约 6-10%
值得精读。核心看点有三:一是“发送侧量化、按 live token 而非填充缓冲计数”的性能洞察,直击 AITER 量化网格按 padded 行数分配的开销来源;二是用 scale dtype(fp32 vs e8m0)而非 dispatch 枚举来区分输入格式,解耦了调度器与 runner 的枚举依赖;三是用启动期 inspect 签名探测 + bf16 回退管理跨仓库依赖,把“静默出错”的字节布局问题转化为显式警告。配套的契约测试思路(不依赖 GPU 却能钉住最容易静默回归的布局常量)也值得借鉴。
参与讨论