Wan2.2 T2V A14B 编译模式改为 default,提升 5% 性能
值得阅读,尤其是在扩散模型性能调优和配置抽象方面。此 PR 展示了如何将实验性优化(#28050 中的 default 模式)平滑推广到更多模型,并同时建立可扩展的配置机制。建议关注 `_maybe_enable_torch_compile` 的参数透传模式及 DiTConfig 的字段设计。
SGLang is a high-performance serving framework for large language models and multimodal models.
Wan2.2 T2V A14B 编译模式改为 default,提升 5% 性能
值得阅读,尤其是在扩散模型性能调优和配置抽象方面。此 PR 展示了如何将实验性优化(#28050 中的 default 模式)平滑推广到更多模型,并同时建立可扩展的配置机制。建议关注 `_maybe_enable_torch_compile` 的参数透传模式及 DiTConfig 的字段设计。
新增上下文并行策略抽象层
值得精读,尤其是 `ContextParallelStrategy` 抽象基类和包组织结构。该设计为后续模型无关的 CP 分片打下基础,是 CP 重构的核心抽象。关注后续的 #27314 等 PR 以了解逐步填充的实现。
用 NamedTuple 替换匿名元组,提升代码可读性
值得快速合并。这是一个纯粹的代码质量改进,无风险。对于关注 HiCache 实现的工程师,可以注意 NamedTuple 的字段定义,理解异步操作的数据结构。
原始 PR · 作者 stmatengss · 合并时间 2026-06-16 14:51
更新 Mooncake 存储代码所有者
常规维护变更,无需精读。但作为代码治理的一个良好实践,值得鼓励。
原始 PR · 作者 TallMessiWu · 合并时间 2026-06-16 14:45
为Ascend NPU Qwen3 Dense模型添加W8A8 MXFP8量化支持
值得精读,尤其`process_weights_after_loading`中对`.contiguous()`的差异化处理是NPU量化的关键设计决策,显示了平台硬件特性对软件实现的约束。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-06-16 14:44
修复 AMD JIT 内核编译与测试注册
建议所有参与跨平台内核开发的团队精读该 PR。它不仅解决了一个实际的编译问题,还展示了如何在不污染 CUDA 代码库的前提下适配 AMD ROCm 平台。关键设计决策(如使用非 `#ifdef` 的类型别名统一返回类型、分离而非替换 CUDA reduce 实现)值得作为最佳实践推广。
消除 min_new_tokens 惩罚的每步 host sync
值得精读,因为它是消除 decode 关键路径上 host sync 的一个好例子,展示了如何用元素级操作替代布尔索引以提升 GPU 推理性能。
原始 PR · 作者 jy-song-hub · 合并时间 2026-06-16 14:21
为 diffusion 引入统一的精度一致性层
建议精读,尤其是 `runtime/utils/precision.py` 的设计 —— 它提炼了扩散运行时中的共性精度模式(输入对齐、临时转换、autocast 策略),展示了如何用上下文管理器安全地临时修改模块 dtype。对于维护扩散相关模块的工程师,理解此层有助于避免未来 dtype 问题。此外,建议在后续 PR 中增加集成测试,验证各流水线在混合精度配置下的行为。
参与讨论