#47989 Remove TeleChatForCausalLM
原始 PR · 作者 xianbaoqian · 合并时间 2026-07-09 15:34
移除 TeleChatForCausalLM 模型别名
该 PR 值得快速合并,属于低风险、高收益的清理变更。值得关注的设计决策是将弃用的模型以真实版本号添加到 `_PREVIOUSLY_SUPPORTED_MODELS` 中,这为未来进一步的清理工作(如 0.26.0 后完全移除相关代码)奠定了基础。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 xianbaoqian · 合并时间 2026-07-09 15:34
移除 TeleChatForCausalLM 模型别名
该 PR 值得快速合并,属于低风险、高收益的清理变更。值得关注的设计决策是将弃用的模型以真实版本号添加到 `_PREVIOUSLY_SUPPORTED_MODELS` 中,这为未来进一步的清理工作(如 0.26.0 后完全移除相关代码)奠定了基础。
修复 Qwen3-ASR 流式转录输出前缀泄漏
该 PR 已合并,值得精读以理解 vLLM 中音频流式后处理的设计模式。重点关注 `Qwen3ASRStreamingPostProcessor.process_delta` 的三态机逻辑和增量输出策略,以及 `serving.py` 中如何集成后处理器并调整分隔符。对于需要实现自定义 ASR 模型后处理的开发者,该 PR 提供了清晰的扩展点。
原始 PR · 作者 bigPYJ1151 · 合并时间 2026-07-09 15:09
CPU AMX GDN 强制 SSM cache 类型为 float32
值得合并,属于精准的 bugfix,逻辑清晰,无争议。建议后续补充测试覆盖 AMX 环境下 Mamba cache dtype 的自动切换行为。
原始 PR · 作者 chaunceyjiang · 合并时间 2026-07-09 14:59
为 CPU offload 调度添加 free block 迭代器
该 PR 设计简洁,是典型的抽象重构,值得阅读 `iter_blocks_after` 的实现方式。建议后续增加对 `iter_blocks_after` 的单元测试。
原始 PR · 作者 chaojun-zhang · 合并时间 2026-07-09 14:08
修复 XPU LoRA torch.compile 设备丢失崩溃
该 PR 是典型的 `torch.compile` 兼容性修复,展示了视图变异在编译图捕获下的陷阱。值得关注的点: 1. `auto_functionalize` 对视图副作用的限制与绕行方案。 2. 临时 buffer + `copy_` 模式在类似场景中的复用性。 3. 与 GPU wrapper 的行为对齐做法。
原始 PR · 作者 music-dino · 合并时间 2026-07-09 10:09
修复 TritonMLA CUDA Graph 支持声明错误
变更虽小,但修复了一个隐蔽的 CUDA Graph 断言崩溃问题,值得合并。建议后续增加覆盖该场景的回归测试,以防范类似属性不一致。
原始 PR · 作者 stefankoncarevic · 合并时间 2026-07-09 07:59
修复融合 MoE 专家权重 w3 双重转置崩溃
值得精读。这是一个典型的共享变量误用 bug,修复手法简洁高效,适合作为代码审查教学案例。建议开发者关注变量作用域和可变性对迭代逻辑的影响。
NIXL push 连接器新增 PP prefill 支持
值得精读。重点关注三类设计决策:notif-only 握手如何避免 D 端 descriptor 注册、P 端按层切片如何保持 region 列表同构、MLA 场景下如何把复制语义落到 `ReadSpec` fan-out。同时建议阅读 review 中关于 writer 轮询必要性的讨论,它展示了‘引擎保活机制 vs 额外轮询’的权衡取舍。HMA 支持请跟进 #47981。
参与讨论