更新 AMD ROCm AITER 依赖版本
建议合并。这是一个常规的依赖升级,属于日常维护范畴。但需先确认 CI 失败原因。
SGLang is a high-performance serving framework for large language models and multimodal models.
更新 AMD ROCm AITER 依赖版本
建议合并。这是一个常规的依赖升级,属于日常维护范畴。但需先确认 CI 失败原因。
修复 NPU 上 speculative decoding 的 shape 不匹配问题
该 PR 是典型的硬件后端 bugfix,逻辑清晰专注。建议相关 NPU 维护者关注,同时可考虑后续为 `actual_seq_lengths_q` 添加默认初始化以避免潜在的未定义行为。
将 AR 和 PE 指南加入 SGLang Diffusion 导航
该 PR 为纯文档变更,无需深入代码审查。建议合并,以消除文档漂移。
统一 diffusion 编码器并行策略,新增 DP 和 auto 模式
值得精读。该 PR 展示了如何在复杂分布式环境中做性能驱动的设计决策:基于实测数据设定阈值、拓扑感知、自动回退、细致处理默认值。对于维护 diffusion 流水线的工程师,理解 auto 决策逻辑和 dp 实现很有价值。
原始 PR · 作者 vincentzed · 合并时间 2026-07-30 18:15
修复 LFM2 工具解析器不支持带点函数名和 JSON 字面量
建议 LFM2 用户合入此修复。代码设计值得参考:通过字典映射统一处理多种字面量拼写,以及通过 ast.Attribute 遍历处理带点号函数名。
原始 PR · 作者 yctseng0211 · 合并时间 2026-07-30 17:56
MiniMax-M3 可选启用 custom/quick all-reduce
建议精读。此 PR 展示了如何通过一个简单的条件判断和 opt-in 环境变量,在不破坏现有兼容性的前提下,为特定硬件平台释放性能优化。值得关注的是其设计权衡(速度 vs 精度)和最小侵入式实现方式。
为 chain-style draft 添加快速路径,避免每次 decode 启动 kernel
建议精读,尤其是 `_rebuild_topk1_chain_buffers` 和 `draft_forward` 中快速路径的设计模式:将编译期可知的常量预分配并缓存,在推理热点处用简单的形状检查替换复杂内核。这一模式可推广到其他存在运行时不变量的推测解码路径。
原始 PR · 作者 yctseng0211 · 合并时间 2026-07-30 17:43
为 gfx950 添加 MXFP8 转 block-fp8 的 opt-in 开关
该 PR 是一个典型的 opt-in 性能优化变更,设计清晰、风险可控。建议合并后关注后续 cookbook 文档更新和 gfx950 原生 MXFP8 kernel 的进展。
参与讨论