移除 feed_tokens 超时,修复 Voxtral 静默挂起
值得合并。修复逻辑清晰,改动极小,且经 E2E 测试验证。建议后续考虑为队列等待添加更长的超时或健康检查机制,但当前方案已满足需求。
A high-throughput and memory-efficient inference and serving engine for LLMs
移除 feed_tokens 超时,修复 Voxtral 静默挂起
值得合并。修复逻辑清晰,改动极小,且经 E2E 测试验证。建议后续考虑为队列等待添加更长的超时或健康检查机制,但当前方案已满足需求。
修复 Mamba2 无 architectures 字段加载崩溃
值得合入,改动小而精准,修复了一个明确的用户可见崩溃。
原始 PR · 作者 yewentao256 · 合并时间 2026-07-05 20:41
移除 SP 必须依赖 DP 的限制,提升 MoE 吞吐 1.9%-5%
建议关注并行配置的相关变更,特别是 DP=1 时启用 SP 的新能力。对于使用 MoE 且未开启 DP 的用户,推荐尝试本 PR 以获取性能提升。同时注意 LoRA 与 SP 的互斥约束。
原始 PR · 作者 LucasWilkinson · 合并时间 2026-07-05 16:20
修复 TurboQuant 的 KV cache dtype 为 auto 的问题
该 PR 值得快速合并,因为修复了明确的回归且风险极低。但建议后续添加单元测试,覆盖 `_reshape_kv_cache` 和 `_update_hybrid_attention_layout` 中 `TQFullAttentionSpec` 和 `AttentionSpec` 的 dtype 选择逻辑。
修复 Jina reranker 评分时 instruction 被忽略
值得精读的设计决策是将 `sanitize_input` 内联化以减少耦合;但需注意未解决的安全建议。开发者可关注后续是否引入循环清理。
原始 PR · 作者 lucianommartins · 合并时间 2026-07-05 08:46
修复 FA4 后端 Gemma4 长上下文乱码
建议合入该 PR,它修复了 Gemma4 在 FA4 后端上的严重输出错误。推荐注意力后端开发者详细阅读 `_make_mm_prefix_mask_mod` 的修改,学习如何正确地将滑动窗口与自定义 mask_mod 结合,以及绝对位置计算在分块预填充中的关键作用。对于使用 mm_prefix 特性的模型维护者,可参考其滑动窗口 clamp 的设计。
放宽 Run:ai memory_limit 验证以支持 -1/0 值
建议合并。该修复准确匹配上游文档语义,逻辑清晰,测试覆盖充分,无兼容性问题。
原始 PR · 作者 cpersson-amd · 合并时间 2026-07-05 04:59
修复 ROCm 内核测试因 prefill_backend 为 None 失败
低风险 bugfix,值得合并。测试修复确保了 CI 的可靠性,但需留意 MoE 测试的剩余失败。
参与讨论