Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15

PR 列表

更多筛选
2026-07-09

#47989 Remove TeleChatForCausalLM

原始 PR · 作者 xianbaoqian · 合并时间 2026-07-09 15:34

重构 重要性 4.69 洞察度 4.00

移除 TeleChatForCausalLM 模型别名

该 PR 值得快速合并,属于低风险、高收益的清理变更。值得关注的设计决策是将弃用的模型以真实版本号添加到 `_PREVIOUSLY_SUPPORTED_MODELS` 中,这为未来进一步的清理工作(如 0.26.0 后完全移除相关代码)奠定了基础。

缺陷修复 重要性 8.54 洞察度 6.00

修复 Qwen3-ASR 流式转录输出前缀泄漏

该 PR 已合并,值得精读以理解 vLLM 中音频流式后处理的设计模式。重点关注 `Qwen3ASRStreamingPostProcessor.process_delta` 的三态机逻辑和增量输出策略,以及 `serving.py` 中如何集成后处理器并调整分隔符。对于需要实现自定义 ASR 模型后处理的开发者,该 PR 提供了清晰的扩展点。

#48073 [CPU] Fix Qwen-Next SSM type for AMX GDN

原始 PR · 作者 bigPYJ1151 · 合并时间 2026-07-09 15:09

缺陷修复 重要性 5.47 洞察度 3.00

CPU AMX GDN 强制 SSM cache 类型为 float32

值得合并,属于精准的 bugfix,逻辑清晰,无争议。建议后续补充测试覆盖 AMX 环境下 Mamba cache dtype 的自动切换行为。

缺陷修复 重要性 5.74 洞察度 5.00

修复 XPU LoRA torch.compile 设备丢失崩溃

该 PR 是典型的 `torch.compile` 兼容性修复,展示了视图变异在编译图捕获下的陷阱。值得关注的点: 1. `auto_functionalize` 对视图副作用的限制与绕行方案。 2. 临时 buffer + `copy_` 模式在类似场景中的复用性。 3. 与 GPU wrapper 的行为对齐做法。

功能 重要性 8.46 洞察度 6.00

NIXL push 连接器新增 PP prefill 支持

值得精读。重点关注三类设计决策:notif-only 握手如何避免 D 端 descriptor 注册、P 端按层切片如何保持 region 列表同构、MLA 场景下如何把复制语义落到 `ReadSpec` fan-out。同时建议阅读 review 中关于 writer 轮询必要性的讨论,它展示了‘引擎保活机制 vs 额外轮询’的权衡取舍。HMA 支持请跟进 #47981。

参与讨论