ROCm 7.2.3 升级,移除 profiler hotfix
值得快速审阅并通过,该 PR 是常规的平台依赖升级,逻辑清晰、改动集中,且经过充分验证。
A high-throughput and memory-efficient inference and serving engine for LLMs
ROCm 7.2.3 升级,移除 profiler hotfix
值得快速审阅并通过,该 PR 是常规的平台依赖升级,逻辑清晰、改动集中,且经过充分验证。
原始 PR · 作者 jasonboukheir · 合并时间 2026-05-29 00:30
为Intel XPU添加W4A16 INT4 MoE支持
值得精读,尤其是WNA16 oracle的可扩展设计(通过枚举和优先队列选择后端)以及XPUExpertsWNA16如何以最小改动集成到现有FusedMoE框架。关注`_process_weights_xpu`的布局转换逻辑和`apply`中的assert条件设计。
原始 PR · 作者 mgehre-amd · 合并时间 2026-05-29 00:28
ROCm 瘦 GEMM 内核支持 N=5,加速推测解码验证
值得合并的针对性性能优化。建议未来考虑自动化特化更多 N 值的方法,以减少手动添加 case 的工作量和编译时间。同时可关注 custom op 的优化机会。
重命名 get_finished 为 get_finished_jobs
该 PR 值得精读以了解团队对命名规范的重视。其核心设计决策是明确的命名表达意图,这种做法值得在类似模糊命名的场景下效仿。
原始 PR · 作者 vadiklyutiy · 合并时间 2026-05-28 23:55
修复 Ray DP 多 API-server 场景因端口分配导致挂起的 bug
值得精读以理解不同后端对地址分配机制的限制。设计清晰:后续若增加新后端,需类似评估其对延迟分配的兼容性。测试设计精巧,避免 GPU 依赖,可重复运行。
原始 PR · 作者 Majid-Taheri · 合并时间 2026-05-28 23:40
移除 Mamba SSD 内核死参数,TTFT 降低 17%
建议仔细审查以确保所有内核的 `seqlen` 参数均已移除,并考虑在类似内核中检查其他可能引发重编译的整型参数。
原始 PR · 作者 yewentao256 · 合并时间 2026-05-28 23:00
修复 CpuGpuBuffer 在推理模式下不可变导致测试失败
建议快速合并,属于明确的单点修复。可作为 PyTorch inference mode 下 mutable buffer 使用模式的参考案例。
修复 DP 引擎结果仅取首个的 Bug,增加聚合检查
该 PR 值得精读,特别是其系统性地将“只取第一个”的不安全模式改为显式聚合检查,并通过错误类型丰富诊断信息。对于分布式系统中一致性和错误可见性的设计有借鉴意义。建议阅读 `client.rs` 中的 `is_sleeping` 和 `reset_prefix_cache` 实现,以及测试中的 mock 模式。
参与讨论