修复 DeepSeek V4 PP HiCache SWA 分配与层映射
面向阅读者的建议:该 PR 值得精读,尤其是关注流水线并行与缓存模块集成的开发者。其设计关键点在于:通过 PP 阶段本地层数分配资源,并通过间接方法封装索引转换,避免了全局层映射带来的状态不一致。讨论中关于近似算法精度的排查思路也值得借鉴。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 DeepSeek V4 PP HiCache SWA 分配与层映射
面向阅读者的建议:该 PR 值得精读,尤其是关注流水线并行与缓存模块集成的开发者。其设计关键点在于:通过 PP 阶段本地层数分配资源,并通过间接方法封装索引转换,避免了全局层映射带来的状态不一致。讨论中关于近似算法精度的排查思路也值得借鉴。
原始 PR · 作者 jonah-berman · 合并时间 2026-06-27 21:41
新增 Exa 原生 Web 搜索支持
值得精读,尤其是 ExaClient 的会话复用设计、配置验证和测试覆盖方法。此外,HarmonyBrowserTool 的重构展示了如何从外部库迁移到原生实现。
优化 LTX2.3 CFG/SP 路径与自动并行策略
值得精读,尤其是广播优化和自动并行策略的设计决策。注意 review 中未解决的 list batch 问题,若使用 grouped 执行需关注。
重构 diffusion CI,抽取公共 runner 并简化测试组织
值得精读,尤其关注如何通过抽取公共模块消除重复代码。测试基础设施重构的套路可以复用。建议团队在合并后密切监控 NPU/AMD CI,并确保文档更新反映新的文件组织结构。
修复 Ascend NPU 文档错误并更新特性
建议审阅者关注 accuracy_evaluation.mdx 中 SSL 解决方案的完整性,以及 environment_variables.mdx 中 DeepEP 描述的准确性。整体变更对用户友好,值得合并。
GLM-5.2 NVFP4 食谱与基准数据更新
该 PR 属于文档/配置更新,技术深度较低,但可作为 Cookbook 配置维护的参考案例。值得关注的设计决策包括:balanced 策略中根据并发度选择较短 MTP 序列(2-1-3 vs 5-1-6)的权衡依据,以及 DP-Attention 在高吞吐场景下的应用。
DSA draft-extend 支持 CUDA Graph,消除 host sync
推荐特别关注 `_apply_cuda_graph_metadata` 中 `draft_extend_v2` 分支的重写:如何用静态 `page_table_1` 宽度替代动态 `seq_lens_cpu` 计算,以及如何用设备上常量张量消除 `.tolist()` 同步。此模式可推广到其他后端的图捕获优化。同时讨论中 bot 的缓存建议可反向考虑,但当前实现已满足性能目标。
原始 PR · 作者 Raiden-Makoto · 合并时间 2026-06-27 14:29
修复 ROCm fused_metadata_copy 编译失败
推荐 AMD 用户和有 ROCm CI 的开发者关注。此 PR 是一个典型的平台兼容性修复案例,代码量小但收益显著,值得快速合并。
参与讨论