将 1.3MB 的 tokenizer 测试 fixture 缩小为几 KB
这个 PR 是测试基础设施的清理工作,值得所有关注仓库健康度的开发者了解。它展示了如何在不影响测试覆盖的前提下,通过细心分析测试依赖来安全地移除大型二进制/JSON 文件。
SGLang is a high-performance serving framework for large language models and multimodal models.
将 1.3MB 的 tokenizer 测试 fixture 缩小为几 KB
这个 PR 是测试基础设施的清理工作,值得所有关注仓库健康度的开发者了解。它展示了如何在不影响测试覆盖的前提下,通过细心分析测试依赖来安全地移除大型二进制/JSON 文件。
原始 PR · 作者 Zhiy-Zhang · 合并时间 2026-06-09 08:14
修复 FA3 EAGLE draft decode 的 page_table scatter OOB
本 PR 已合并,无需额外操作。建议开发者在涉及 FA3 后端和 speculative decoding 时,关注 #27360 的修复逻辑,并确保类似场景在其他后端也得到测试。
规范 Spec V2 代码命名,accepted→accept,page_size_1→contiguous
此 PR 是代码规范化的良好实践,值得精读以理解团队命名约定。对于关注 speculative decoding 的实现细节的工程师,重命名后的函数名更易理解其语义(accept 而非 accepted)。
融合 Spec 中 4 个 gather 算子,TPOT 提升 1-2%
值得精读,展示了如何用 Triton 手动融合 gather 操作绕过 torch.compile 融合限制,并附有高质量的测试设计,可作为 Triton kernel 开发的范例。
重命名函数并删除废弃的 Spec V1 辅助代码
该 PR 为常规清理维护,值得简要了解其删除逻辑,确认无意外引用即可快速合并。不包含复杂设计决策,无需深入阅读。
支持 DSV4 DP Attention 可断点 CUDA 图
建议所有 DeepSeek V4 相关开发者精读此 PR,重点关注: 1. `DSV4AttnMetadata.refresh_for_breakable_cuda_graph_replay_` 中的字段分类设计,这是图捕获地址稳定的核心。 2. BCG 运行器中 DP rank 同步保护的模式,可复用于其他分布式后端。 3. 注意力后端接口的扩展方式,后续为其他模型添加 BCG 支持时可参考 `DeepseekV4AttnBackend` 的 opt-in 实现。 对于运维团队,建议先在低风险预发布环境进行 A/B 性能对比,确认工作负载符合预期后再推广。
原始 PR · 作者 sglang-bot · 合并时间 2026-06-09 04:31
同步 LMSYS 博客卡片列表,轮换最新博文
简单文档同步 PR,无需精读。但可关注自动化脚本是否后续修复了 unicode 转义问题。
修复 GPT-OSS MXFP4 在 SM10X 上的 hidden size 对齐问题
该 PR 值得合并,是一个定位清晰、修复精准的 bugfix。虽然没有新增测试,但手动验证已覆盖关键场景。建议合并后关注是否有其他使用 `self.experts.hidden_size` 的模型也存在类似问题。
参与讨论