#39570 [Fix] Sync gemma4 chat template from hf
原始 PR · 作者 FredericOdermatt · 合并时间 2026-05-02 11:06
同步 Gemma4 聊天模板至 HF 最新版,修复格式与工具调用问题
建议合并此 PR,它使 vLLM 的 Gemma4 模板与官方保持同步,并修复了多个已知格式问题。对于大多数人无害,但应关注 turn 标签相关的讨论以防意外。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 FredericOdermatt · 合并时间 2026-05-02 11:06
同步 Gemma4 聊天模板至 HF 最新版,修复格式与工具调用问题
建议合并此 PR,它使 vLLM 的 Gemma4 模板与官方保持同步,并修复了多个已知格式问题。对于大多数人无害,但应关注 turn 标签相关的讨论以防意外。
重新启用 DP/PP 下 allreduce RMS 融合
建议使用 DP 或 PP 的用户仔细阅读本 PR 以了解融合启用条件。对于维护者,这是一个很好的参考案例,展示了如何追踪上游依赖修复并移除临时限制。设计决策上值得学习的是对风险-收益的权衡,未添加版本检查而是信任依赖版本管理。
DeepGEMM 轮子兼容多 Python 版本
值得精读但无需深入。设计简洁,重点关注:1) `USE_SABI` 与 `WITH_SOABI` 的差异;2) 如何通过编译选项隔离 `Py_LIMITED_API` 作用域。
修复 persistent_topk 跨 CTA 初始化竞态条件
值得合并。该 PR 修复了一个真实竞态条件,并且采用了正确的 CUDA 模式(stream-ordered memset)。设计决策清晰,值得参考。
基于 token 数量动态决定 GEMM 多流并行
值得精读,尤其是对 CUDA 多流并行的性能陷阱感兴趣的工程师。核心设计模式——用 token 阈值动态关闭并行叠加——与已有的 `VLLM_SHARED_EXPERTS_STREAM_TOKEN_THRESHOLD`(PR#41443 附近)一致,体现了 vLLM 团队对 GPU 饱和度的工程洞察。建议关注 reviewer 关于一致性覆盖和 `enable` 默认值的讨论。
集成 TileLang 融合核优化 DeepSeek-V4 的 hc_head 计算,减少内存开销,提升吞吐。
值得精读,尤其适合希望了解 TileLang 内核集成流程和写融合核替换 PyTorch 多步操作的工程师。该 PR 展示了设计权衡(参数调优、与现有代码对齐)和性能验证方法。
原始 PR · 作者 MatthewBonanni · 合并时间 2026-05-02 01:36
抽象 MLA prefill 后端,引入选择机制并移除 cuDNN
建议精读 `vllm/v1/attention/backends/mla/prefill/selector.py` 和 `base.py`,理解后端的注册与选择模式。整个设计值得在 vLLM 其他 attention 层推广。由于可能存在的 regression,更新后需在生产环境充分验证 MLA 模型推理。
原始 PR · 作者 yewentao256 · 合并时间 2026-05-02 01:02
添加 logprob_token_ids 支持到 V2 模型 Runner
值得精读,特别是 `compute_topk_logprobs` 的 fast/slow path 设计和 `_fill_logprob_token_ids_kernel` 的实现。njhill 的重构也体现了模块化原则。也可以关注 `gemini-code-assist` 的自动化 review 质量。
参与讨论