#45153 [CI] Ping Mistral team for ministral/voxtral/mixtral/pixtral changes
原始 PR · 作者 juliendenize · 合并时间 2026-06-10 23:48
扩展 CI 通知路径,覆盖 Mistral 全系模型
该 PR 属于基础设施配置调整,审核简单,无技术争议。值得关注的是正则表达式统一采用非捕获组 `(?:...)`,符合最佳实践。建议在后续扩展类似规则时保持此风格。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 juliendenize · 合并时间 2026-06-10 23:48
扩展 CI 通知路径,覆盖 Mistral 全系模型
该 PR 属于基础设施配置调整,审核简单,无技术争议。值得关注的是正则表达式统一采用非捕获组 `(?:...)`,符合最佳实践。建议在后续扩展类似规则时保持此风格。
原始 PR · 作者 benchislett · 合并时间 2026-06-10 23:47
在 MRV2 中实现 DFlash 投机解码,支持 cudagraph
该 PR 值得精读,特别是对实现自定义投机解码器或 CUDA Graph 管理器有参考价值。关键设计决策包括:如何通过基类复用减少重复代码、如何为多查询 per-req 元数据构建注意力符号、以及如何动态切换因果/非因果注意力。建议关注 `_generate_draft` 中的上下文 KV 预计算与采样逻辑。
修复 DeepSeek V4 MTP prefix 缺失问题
建议合入。修复目标明确、改动量极小、风险低,且已获 maintainer 批准。对于关注 DeepSeek V4 模型量化部署的团队,值得了解该修复以正确配置 compressed-tensors 的 ignore/target 规则。
修复 AOT 编译缓存冲突,调整 normalize_value 分支顺序
值得精读。虽然改动极小(仅 12 行源码变更),但揭示了 Transformers 5.x 的 dataclass 变更与 AOT 编译缓存键生成之间的深层交互,对理解 vLLM 的编译缓存机制和依赖兼容性问题有参考价值。
原始 PR · 作者 divakar-amd · 合并时间 2026-06-10 23:04
跳过 conch kernel 处理 g_idx 重排
小而精准的 bugfix,值得合并。对于全量量化模型用户,避免潜在无声错误。
为KV缓存次级层添加异步批处理查找
值得精读该PR,尤其是AsyncLookupManager的线程安全模型(无锁通过所有权分离)和cleanup逻辑。可作为vLLM内部异步模式的参考。设计决策中使用SimpleQueue、None作为停止信号、NeedToDrain计数器等细节值得注意。
移除第一代 Qwen 和 QwenVL 模型代码及配套组件
此 PR 清理彻底,值得作为参考模板用于其他旧模型淘汰。建议阅读以理解 vLLM 的模型注册和组件解耦方式。如果用户仍依赖旧模型,不应升级到此版本。
原始 PR · 作者 appleparan · 合并时间 2026-06-10 22:44
修复 EXAONE-4.5 视觉编码器 missing sequence_lengths
建议快速合并,属于典型的数据契约同步修复。可关注类似模式——继承 Qwen2_5_VisionTransformer 的模型(如刚修复的 qwen3_omni_moe_thinker)是否也有遗漏。
参与讨论