将 DSpark 密集草稿嵌入查询移入草稿图
这是一个小而精准的性能优化 PR,值得相关开发者阅读了解如何通过 forward_embed 机制消除 eager 阶段拷贝。建议精读 dspark.py 和 dflash.py 中的改动以理解设计模式。
SGLang is a high-performance serving framework for large language models and multimodal models.
将 DSpark 密集草稿嵌入查询移入草稿图
这是一个小而精准的性能优化 PR,值得相关开发者阅读了解如何通过 forward_embed 机制消除 eager 阶段拷贝。建议精读 dspark.py 和 dflash.py 中的改动以理解设计模式。
删除 sgl-kernel AOT bmm_fp8,统一使用 flashinfer 实现
值得一读,展示了如何安全地移除重复 AOT 实现并统一依赖,同时利用 `register_custom_op` 保持 torch.compile 兼容性。
原始 PR · 作者 alisonshao · 合并时间 2026-07-22 07:41
修复 /rerun-test 将 b200 多模态测试路由到 H100 池的问题
该 PR 价值虽小但及时修复了实际的 CI 故障。建议阅读者关注 `scripts/ci/utils/slash_command_handler.py` 中 `detect_multimodal_suite` 函数的匹配逻辑,未来若有更多硬件后缀测试文件加入,应考虑重构为更鲁棒的正则匹配或精确匹配机制,避免字典顺序依赖。
裁剪 DSA 草稿扩展元数据内核的页表列
值得精读。该 PR 展示了在 CUDA kernel 中进行轻量级条件跳转来裁剪无用工作的典型优化技巧。对于关注推测解码性能的工程师,这是一个很好的学习案例。测试中也展示了如何正确验证带有“未定义区域”的 kernel 输出。
DeepSeek-V4 基准测数更新至 v0.5.15,引擎支持 per-cell 百分位
值得精读(尤其是 review 评论中的审计思路,可作为团队性能测试的标准流程参考)。设计上关注 _deployment.jsx 中 per-cell 百分位覆盖的极简实现方式,以及如何通过注释明确数据契约。
原始 PR · 作者 vedularaghu · 合并时间 2026-07-22 06:28
Mamba slot donation 调试断言加 feature gate
建议合入。这是一个典型的性能优化与调试体验之间的权衡,通过环境变量开关实现了两全其美。值得关注的设计决策是:使用 `os.environ` 获取环境变量而非 `envs` 对象,保持简洁;模块级变量仅计算一次,零运行时开销。
AutoWeightLoader v2 demo: Qwen2/Llama 集中式权重加载
值得精读,因为这是 weight loader 重构的基石。重点关注 `StackedParamsDispatch` 的设计、`AutoWeightsLoader` walker 与子模块 `load_weights` 的协作模式,以及 `RemapRegistry` 的注册机制。对于计划参与模型迁移的工程师,建议深入理解该 PR 的接口契约。
SM120 FP8 GEMM 后端切换至 cuBLAS
值得合入,变更简单清晰,性能收益明确,同时降低了维护成本。建议关注未来 Torch 升级后 cuBLAS 对 SM120 的原生支持。
参与讨论