修复 ROCm Aiter MoE padding 对齐问题提升性能
值得合并。改动小而精,有明确的性能收益和充分的 benchmark 数据支持。建议关注后续对非标准形状模型的进一步验证。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复 ROCm Aiter MoE padding 对齐问题提升性能
值得合并。改动小而精,有明确的性能收益和充分的 benchmark 数据支持。建议关注后续对非标准形状模型的进一步验证。
原始 PR · 作者 zhenwei-intel · 合并时间 2026-05-14 13:13
跳过 XPU CI 中 offload connector 测试
该 PR 为小型 CI 配置修复,无需精读。但可关注关联 PR #36423 的进展,以便及时恢复测试。
原始 PR · 作者 Sarah-Salah · 合并时间 2026-05-14 10:49
修复 ParserManager 中 mypy 类型收窄错误
值得合并。虽然改动微小,但修复了类型检查的正确性,且遵循了项目中已有的惯用法。
原始 PR · 作者 hks-9697-v2 · 合并时间 2026-05-14 10:36
修复 Qwen3.5 权重加载参数传递问题
值得快速合并,修复明确,改动极小。
修复 VLM 包装模型上 EPLB 初始化崩溃
值得精读的 Bugfix PR,展示了如何处理协议接口与模型包装之间的兼容性问题。它同时修复了三条代码路径,模式清晰。gemini-code-assist 提出的重构建议(提取 helper)值得后续采纳。
原始 PR · 作者 jikunshang · 合并时间 2026-05-14 09:47
XPU 支持 MXFP8 MoE 模型推理
建议精读 `xpu_moe.py` 中的类设计,特别是 `_supports_quant_scheme` 的分层覆盖模式,可用于后续新增量化方案。其余文件修改较小,可快速浏览。
为 score/rerank 端点添加 instruction 与 chat_template_kwargs 支持
值得精读。该 PR 是 scoring API 功能补齐的重要一步,展示了如何通过 Pydantic validator 组合字段、如何在预处理管道中引入新参数,以及如何设计向后兼容的 chat 模板。特别推荐给负责 entrypoints 和维护定制化 rerank 服务的开发者。
修复 V1 speculative decoding 中 draft_probs 未传递使 probabilistic rejection 失效
值得精读。本 PR 虽然改动量中等,但修复了一个重要的正确性问题,展示了 speculative decoding 中 draft_probs 的完整生命周期:从 proposer 采样时捕获,跨模块缓存,到 GPUModelRunner 按请求重新排列,最终传递给 rejection sampler。设计模式清晰,配套测试完善。尤其推荐关注 _get_spec_decode_draft_probs 中的请求顺序对齐逻辑。
参与讨论