为 jiayisunx 添加 CI 权限
该 PR 属于常规的权限管理操作,无需深入审查。建议关注 CI 权限配置的合规性,确保只有受信任的用户被授予此类权限。
SGLang is a high-performance serving framework for large language models and multimodal models.
为 jiayisunx 添加 CI 权限
该 PR 属于常规的权限管理操作,无需深入审查。建议关注 CI 权限配置的合规性,确保只有受信任的用户被授予此类权限。
修复 eager 模式 token 缓冲不足的问题
建议精读,这是一个典型的最小化修复案例:通过取 max 替代条件分支,安全地修复潜在的 under-allocation 问题。值得关注的是 reviewer 对测试覆盖的提问,后续可考虑补充单元测试。
原始 PR · 作者 Raiden-Makoto · 合并时间 2026-06-25 14:21
跳过冗余 -inf 预填充以加速 HIP DSA 预填充
该 PR 体现了通过参数对齐消除冗余计算的典型优化手段,且提供了详尽的基准测试和单元测试验证。对于关注 AMD 平台长上下文推理性能的开发者,值得精读。设计决策值得在其他类似场景中借鉴。
NPU GDN 预填充中预计算 mamba 跟踪索引
值得合并的优化,改动量小、收益明确、验证充分。可作为 NPU 后端预填充性能优化的参考模式。
为 MiMo V2.5 添加 Blackwell Vision FA4 配方
该 PR 是配置修复和文档更新,值得参考其处理多模态后端兼容性问题的方式。
支持BF16 LoRA快速路径并修复EP+CUDA图崩溃
建议团队关注 BF16 路径的性能差异,可考虑添加单元测试覆盖数值正确性。该 PR 的二流重叠设计决策(gate_up LoRA 并发的度、down LoRA 保持串行)值得学习,但需注意 CUDA graph 捕获期间的 event 管理。
原始 PR · 作者 wenxuewuhd · 合并时间 2026-06-25 11:44
修复 NPU 上 DLLM 启用 radix cache 时页面大小不同步问题
该 PR 改动极小但修复了关键的一致性问题,建议合并。可快速阅读理解,无需精读全部文件。
调低 Gemma4 26B-A4B 在 B200 上的内存比例
对于部署 Gemma4 26B-A4B 在 B200 上的用户,建议采用此配置;对于其他模型或硬件组合,无影响。
参与讨论