用 batch 携带的 attention plan marker 替换 skip_attn_backend_init
强烈建议阅读。PR 展示了如何用 batch 携带的状态替换控制耦合,以及如何通过 opt-in 的 plan record 安全地实现 staleness re-plan,是 speculative decoding 路径中一次重要的基础设施重构。设计思路(将断言从调用链远处转移到数据本身)值得其他类似场景借鉴。
SGLang is a high-performance serving framework for large language models and multimodal models.
用 batch 携带的 attention plan marker 替换 skip_attn_backend_init
强烈建议阅读。PR 展示了如何用 batch 携带的状态替换控制耦合,以及如何通过 opt-in 的 plan record 安全地实现 staleness re-plan,是 speculative decoding 路径中一次重要的基础设施重构。设计思路(将断言从调用链远处转移到数据本身)值得其他类似场景借鉴。
修复 LMSYS 博客同步 CI 工作流
建议合并。这是一个简单的 CI 修复,设计清晰,已通过 review。值得关注的是使用 `gh` CLI 替代第三方 action 的做法,可降低依赖风险。
原始 PR · 作者 merrymercy · 合并时间 2026-06-05 06:52
修复 CustomSpecAlgo 接口缺失并添加一致性守卫
值得精读,展示了如何通过运行时守卫维护鸭子类型接口一致性,可在类似插件系统中借鉴。同时体现了尽早失败(fail-fast)的设计原则。
SM120 NVFP4 性能与可用性优化
值得精读,该 PR 展示了针对特定硬件 (SM120) 进行系统性性能优化的典型方法:从后端选择、autotune 触发、kernel 配置到量化修复,覆盖了整个推理链路。设计权衡(如后端切换原因、配置一致性处理)有参考价值。建议重点关注 `_should_run_flashinfer_autotune` 和 `try_get_optimal_moe_config` 的变更逻辑。
修复多模态基准测试提示生成中特殊标记污染问题
建议合并。此PR修复了真实用户发现的多模态基准测试数据生成正确性问题,代码变更简洁,有单元测试覆盖,且通过了review的讨论和验证。
为 Qwen3.5 添加 H100 FP8 下的 --enable-symm-mem 支持
建议合并,属于有益的文档改进。无需深度审查。
支持 FlashInfer NVFP4 4over6 缩放模式
变更简洁清晰,适合快速精读。重点观察环境变量命名规范以及量化缩放因子的计算逻辑,后续维护时需注意与 FlashInfer 升级的同步。
默认启用 DeepGEMM PDL 优化
该 PR 值得精读,展示了如何通过环境变量默认启用底层库优化,并保持向后兼容性。但应注意 CUDA context 问题已在后续修复,建议阅读时一并参考 PR#27671。设计上采用了"安全导入 + 特性检测"模式,值得在其他类似场景复用。
参与讨论