#32127 docs: sync LMSYS SGLang blog cards
原始 PR · 作者 sglang-bot · 合并时间 2026-07-23 08:57
同步 LMSYS 博客卡片信息
此 PR 为自动化文档同步,无技术洞察价值,无需精读。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 sglang-bot · 合并时间 2026-07-23 08:57
同步 LMSYS 博客卡片信息
此 PR 为自动化文档同步,无技术洞察价值,无需精读。
删除 sglang.jit_kernel 包,完成统一内核命名空间迁移
- **值得精读**:本 PR 展示了如何逐步完成大规模包迁移的收尾工作,包括处理 shim、构建基础设施、打包配置、CI 触发器和文档同步。对于想了解 SGLang 内核组织模式的读者,这是必读 PR。 - **值得关注的决策**: 1. 采用“先保留 shim 逐步迁移,最后一次性删除”的策略,平衡了迁移进度与兼容性。 2. 将所有 JIT 构建资源(csrc/include)放在 `kernels/jit/` 下,而不是分散在算子模块中,保持了复用。 3. 在打包配置中灵活使用 glob 模式,确保新路径被包含在 wheel 中。 - **核心理念**:统一的 import 入口有助于降低贡献者认知负担,也为未来内核调度和缓存打下基础。
原始 PR · 作者 XinyuJiangCMU · 合并时间 2026-07-23 08:30
Miles ROCm 构建迁移至 docker/build.py,测试切换至 7.2
值得精读,尤其是关注 CI 安全实践(最小权限原则)和外部脚本集成的团队。设计权衡如测试覆盖与维护成本的取舍也值得参考。
原始 PR · 作者 danielafrimi · 合并时间 2026-07-23 06:09
Mamba chunked prefill 配置警告
值得快速合并。代码简洁清晰,定位准确,不引入运行时风险。可作为调试辅助工具帮助用户识别不合理的分块配置。
升级 FlashInfer 至 0.6.15.post1,修复 MLA 和 MoE 性能回归
该 PR 值得精读,尤其是 MLA decode host overhead 的优化思路(持久化 buffer 避免重复分配)以及 MoE dispatch 缓存的设计。对于考虑升级 FlashInfer 的团队具有参考价值。
原始 PR · 作者 ilyasher-harmonic · 合并时间 2026-07-23 05:14
支持 anyOf schema 解析 qwen3_coder 工具调用参数
值得精读。展示了如何通过复用通用 schema 推断函数扩展专用解析器的类型支持,代码改动简洁、测试充分,是低风险修复的范例。
SM100 上默认开启 CuteDSL BF16 GEMM
值得精读,尤其是关注内核自动选择策略的设计和梯度检查的添加。可作为后续其他后端默认启用的参考模式。
修复 Standard allocator 过度驱逐问题
值得快速合并。建议后续补充针对 `evict_from_tree_cache` Standard allocator 分支的单元测试,验证驱逐量正确性。
参与讨论