#42373 fix: MoE model using shared routed experts crashes on AMD GPUs
原始 PR · 作者 weizhoublue · 合并时间 2026-05-25 12:03
修复ROCm上MoE模型导入路径崩溃
值得合并。这是由上游重构引入的回归 bug,修复简洁且经过验证。建议通知 CI 加入对类似 import 路径的静态检查,防止未来重构再次遗漏。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 weizhoublue · 合并时间 2026-05-25 12:03
修复ROCm上MoE模型导入路径崩溃
值得合并。这是由上游重构引入的回归 bug,修复简洁且经过验证。建议通知 CI 加入对类似 import 路径的静态检查,防止未来重构再次遗漏。
融合 RMSNorm 的 MHC pre 内核与 DeepSeek V4 MoE 重构
值得精读,尤其关注 TileLang 内核如何实现算子融合,以及高层模型如何配合 kernel 接口传递额外参数。该 PR 展示了从 kernel 到模型层的完整融合优化链路。
新增纯 Python 文件系统 KV 二级卸载层
推荐精读 DualQueueThreadPool 和 JobState 的完成追踪设计,以及 FileSystemTierManager 对 SecondaryTierManager 接口的实现。合并后可在文档中添加 fs_python 配置说明。
为 Mamba SSU 内核添加自动调优框架与预配置,性能提升最高 1.6x
该 PR 值得精读,尤其是如何将硬编码调优参数优雅地替换为数据驱动的配置系统,包括配置生成、缓存、环境变量覆盖、fallback 和测试策略。设计模式可复用至其他 kernel 的调优。
为 DeepSeek V4 在 ROCm 上添加 MTP 推测解码支持
值得精读,特别是 MTP 实现(`mtp.py`)和稀疏注意力 prefill 优化(`rocm.py` 中的 `combine_topk_swa_indices_kernel`)。这些设计展示了如何在 vLLM 架构中为特定硬件定制模型和算子,对理解 vLLM 的推测解码和注意力机制实现有较高参考价值。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-05-24 18:06
修复无效输入逃逸为 500,统一返回 400 错误
值得精读。该 PR 展示了如何在 post-Pydantic 阶段捕获验证错误并映射到合适 HTTP 状态码,涉及 catch-all vs local exception handling 的设计权衡,对入口层开发者有参考价值。
为 offloading 连接器添加 DeepSeek V4 支持
本 PR 值得精读,特别是 `_alignment_block_count` 函数的实现,它展示了如何利用模型结构对齐特性降低 offloading 开销。同时,worker 中的空张量过滤和未填充页面大小修复也是重要的兼容性改进。
原始 PR · 作者 Dao007forever · 合并时间 2026-05-24 14:15
修复MooncakeStore全命中时块对齐问题
对于使用MooncakeStore的团队,此PR值得精读以理解块对齐的设计取舍和配置清理策略;对于其他开发者,可作为KV Connector调度器维护的参考案例。
参与讨论