#28280 Allow overriding tokenizer path in benchmark harness
原始 PR · 作者 merrymercy · 合并时间 2026-06-16 04:07
支持 benchmark 命令行指定本地 tokenizer 路径
本 PR 为实验性小功能增强,适合快速合并。建议后续考虑对 vllm 后端也支持该选项,以保持一致性。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 merrymercy · 合并时间 2026-06-16 04:07
支持 benchmark 命令行指定本地 tokenizer 路径
本 PR 为实验性小功能增强,适合快速合并。建议后续考虑对 vllm 后端也支持该选项,以保持一致性。
优化 PD decode 场景 SWA 分配路径与内存
本 PR 属于中等重要度的重构+小优化,代码结构清晰,改动量小,推荐相关维护者精读 `swa.py` 中的分配重构逻辑,可作为同类代码清理的参考模式。
原始 PR · 作者 yctseng0211 · 合并时间 2026-06-15 22:50
将 AMD AITER scout 工作流指向 amd/aiter-ci 分支
值得快速合并,以对齐 CI 测试策略。无需精读。
原始 PR · 作者 ShangmingCai · 合并时间 2026-06-15 22:36
移除 decode radix cache 后端白名单,仅拒绝 fake
建议合并。这是一个及时的清理性变更,消除过时限制,提升灵活性和正确性。变更简洁,测试充分,只需确认 ascend 后端确实完全支持即可。
修复 DSR1 fp8 gemm 回归:修正回退条件
建议阅读此 PR,尤其是 `fp8_utils.py` 中的回退逻辑变化和单元测试的设计。它展示了如何精细化控制 GEMM 后端选择,以及如何通过 benchmark 和测试验证性能回归修复。
修复 #25885 引入的 CUDA dual-stream overlap 性能回退
值得精读,尤其适合需要处理跨平台条件分支的开发者。PR 简洁地演示了如何修复因平台特定门控引入的回归,以及 Review 中建议的代码简化。
原始 PR · 作者 littleyellowbicycle · 合并时间 2026-06-15 21:31
修复 NPU 平台 DeepSeek 模型 is_nextn 特殊处理缺失
该 PR 值得精读,尤其是对 NPU 后端和 speculative decoding 感兴趣的开发者。它是一个典型的平台特定 bugfix,展示了如何处理不同硬件后端之间的行为差异。
修复 EAGLE3 多模态 chunked-prefill crash
该 PR 是一个精准的定点 bugfix,改动量小,逻辑清晰,值得精读以理解多模态与 speculative decoding 交互时的边界情况。设计决策中值得关注的是:不对占位符 token 做硬编码过滤,而是依赖 `vocab_size` 作为通用判据——既简洁又与模型无关。
参与讨论