Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-07-29
功能 重要性 9.18 洞察度 6.00

为 Kimi K3 添加 Python 前端支持

此 PR 值得精读,尤其是 XTML 格式的渲染和解析实现,以及如何在不破坏现有架构的前提下扩展新的对话格式。设计决策如 `_partial_tag_overlap`、`_subseq_index`、结构标签注册等有借鉴价值。Review 中关于 `tool_choice` 和 tokenizer 注册的讨论也展现了集成第三方模型前端时的典型权衡。

功能 重要性 7.27 洞察度 6.00

decode 端复用 prefill token ids 跳过重复 tokenization

值得阅读。PR 展示了在保持 chat 特性(工具调用、推理、流式)的同时,如何最小侵入性地实现 decode 端 token 复用的设计模式。安全讨论指出了未来改进方向(添加 server-side gate)。对于从事分离式部署或前端优化的人员有参考价值。

#50194 [CPU] Fix FP8 attention scratchpad sizing

原始 PR · 作者 tianmu-li · 合并时间 2026-07-29 15:34

缺陷修复 重要性 6.39 洞察度 6.00

修复 CPU FP8 注意力调度器临时缓冲区大小计算错误

该 PR 值得所有使用 CPU 后端的用户关注,尤其是启用 FP8 量化的场景。其核心设计决策——将 KV cache dtype 信息传递至调度器,确保 tile 大小计算与运行时一致——是值得借鉴的 bug 修复模式。建议阅读 `csrc/cpu/cpu_attn.cpp` 中的改动以理解调度器大小计算逻辑。

功能 重要性 9.36 洞察度 7.00

新增 Kimi K3 多模态模型推理支持(第一阶段)

建议核心架构师与模型组重点审阅:(1)`vllm/models/kimi_k3/` 的模块划分是否合适;(2)CuTe DSL 内核与现有 `custom_ops` 的边界;(3)Latent MoE 融合路径的正确性。对于一般开发者,该 PR 是学习 vLLM 模型扩展与高性能内核的绝佳案例。

功能 重要性 8.35 洞察度 7.00

fused_moe 新增 TD 路径,XPU 默认启用

值得精读。重点看三处设计:`resolve_moe_use_td` 的三态解析与硬件门控分离、`B_scale` 驱动的量化检测、以及 K 非对齐时对编译器 bug 的回退处理。这些模式对后续 Triton kernel 的 TD 化很有参考价值。

#49974 [Test] dynamic_shapes_compilation

原始 PR · 作者 JaredforReal · 合并时间 2026-07-29 12:54

测试 重要性 5.56 洞察度 2.00

测试改用 VllmRunner 确保引擎正确关闭

值得合并。该变更是对测试基础设施的改进,模式清晰,可推广至其他类似测试中。建议在后续 PR 中继续迁移剩余使用 `LLM` 手动管理的测试代码。

参与讨论