#50266 [CI] KimiLinear PD in nightlies
原始 PR · 作者 NickLucche · 合并时间 2026-08-03 20:20
新增 Kimi-Linear 48B 的 P/D 夜间回归测试到 CI
值得 CI/可靠性团队精读,了解如何用较小模型(Kimi-Linear)作为大模型(K3)的回归代理,以及如何通过 TP/DP/EP 组合适配大权重显存限制。对普通功能开发者价值有限,核心 vLLM 逻辑无改动,不需要深读。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 NickLucche · 合并时间 2026-08-03 20:20
新增 Kimi-Linear 48B 的 P/D 夜间回归测试到 CI
值得 CI/可靠性团队精读,了解如何用较小模型(Kimi-Linear)作为大模型(K3)的回归代理,以及如何通过 TP/DP/EP 组合适配大权重显存限制。对普通功能开发者价值有限,核心 vLLM 逻辑无改动,不需要深读。
CPU-only 主机 torch.compile 崩溃修复:empty_cache 改用独立 no-op
值得精读的小型修复:改动仅 13 行,但完整展示了一个编译期崩溃 -> 最小复现 -> 根因定位(对象身份别名)-> 极简修复的调试链路。对维护 CPU worker 补丁与接触 torch.compile 图形捕获的同学有参考价值;也提示 Dynamo 对 torch 模块 API 的追踪可能依赖函数对象身份,写 monkey patch 时需避免别名共享。
修复 breakable cudagraph 下误导性的 torch.compile 警告
该 PR 值得快速阅读,但无需深究:它展示了如何在配置初始化阶段避免误导性日志,并把分散的开关判断收敛到单一函数。建议合并,但希望后续补一个简单的日志断言测试,避免该行为回归。
新增多模态生成模型 PPL 回归测试与 CI 任务
值得精读,重点看 ppl_utils.py 的双侧 PPL 对比口径(vLLM greedy logprob 累加 vs HF loss 平均)以及“HF 参考值可缓存为常量”的提速设计;对多模态模型维护者尤其有参考价值。后续扩展模型时需关注外部数据集依赖与 1% 容差是否适用,建议在扩展 PR 中同步评估。
原始 PR · 作者 bigPYJ1151 · 合并时间 2026-08-03 17:42
CPU 内核调度重构,移除 SGL 实验开关并修复选择条件
值得精读,尤其适合 CPU 后端维护者和关注 kernel oracle 机制的人。可学习的点:① 用 vendored 内核源码逐条验证选择条件,而不是靠文档假设;② 把「不支持」的判断前置到 `is_supported_config`,避免加载期/运行期才崩溃;③ 实验性开关在 benchmark 无副作用且范围收窄后做默认化的完整决策流程。注意其遗留的形状门控问题可作为后续 PR 的切入点。
LatentMoERunner 移入 KimiK3 模型目录
本 PR 属于纯代码移动,值得快速浏览以了解 vLLM 中模型特定 MoE 运行器的组织策略。它没有引入新逻辑,但展示了如何通过调整目录结构增强内聚。建议关注是否有遗漏的旧路径引用,并确认没有其他模块依赖该文件的通用性。
修复 serving 基准配置 JSON 并加校验 hook
该 PR 值得快速阅读,是一个典型的 CI 防御性改进案例。重点在于:pre-commit hook 的作用域设计(`files` 正则限定目录)以及将 `rev` 固定为 commit hash 的做法,对于其他类似配置校验场景有参考价值。
多模态占位符与 token 匹配扫描提速,E2E 阶段提升达 8-12 倍
值得精读。三个看点:(1) `_find_matches` 的 `id(target)` 身份缓存是 vLLM 热路径中“共享静态对象 + 免重扫描”的可复用模式,注释中对前提条件的显式说明值得作为范例;(2) 评审中“可读性 vs 收益”的交锋与 ablation 驱动的删减决定,是热路径优化权衡的好案例;(3) 差分模糊测试 + 变异测试校验 oracle 的验证方法论,对声称“输出一致”的重构/优化类 PR 很有参考价值。若只想快速了解结论,阅读 `get_first_match` 与 `_iter_placeholders` 两个符号即可。
参与讨论