Prhub

vllm-project/vllm · 标签视图

标签列表

聚合结果

tool-calling 相关 PR

2026-08-18
缺陷修复 重要性 5.66 洞察度 4.00

对齐 Gemma4 parser 与模板的 enable_thinking 默认值

值得精读。虽然只有一行核心改动,但它清晰展示了“chat template、文档、parser 三方默认值必须一致”的设计原则,以及如何通过三态 parametrize 测试锁定行为边界。对维护 parser 或 reasoning 功能的开发者有参考价值。

2026-08-15
功能 重要性 9.17 洞察度 6.00

解析引擎支持 reasoning token 计数并输出到 usage 字段

值得精读。核心看点是 parser engine 管线的 token 计数设计:按字符摊分(`_char_token_counts`)+ 按切分回算(`_pop_token_count`)+ deferred 终端计数不丢失(scanner 侧前缀 / trailing 计数),是一套可复用的流式边界记账方法。另一个值得关注的设计决策是 ParserManager 对'同引擎合并、异引擎组合'的处理,以及围绕 DelegatingParser 语义保持的 review 讨论——这是理解 vLLM parser 子系统组合思想的关键材料。

2026-08-14

#51655 Add Muse Glimmer model support

原始 PR · 作者 xianbaoqian · 合并时间 2026-08-14 12:28

功能 重要性 9.18 洞察度 7.00

新增 Muse Glimmer VLM 支持:ATEM 工具解析、DFlash 投机解码

值得精读。三个设计点有很强的可迁移性:(1) 对非 JSON 协议模型,选择“分段 + 选择”替代“正则减法”解析工具调用,并在流式场景用 holdback 不动点保证输出只增不减;(2) config 双布局归一化(flat vs nested)防止 checkpoint 静默错配;(3) DFlash 的 RoPE 布局从目标模型推断而非依赖 draft 检查点。同时建议跟踪社区未决问题:draft buffer 越界修复、`is_reasoning_end_streaming` 增量解码、无工具结构化输出缺口,这三项都有对应后续 PR 或框架修复的空间。

缺陷修复 重要性 5.83 洞察度 4.00

清理 Harmony stop token 补丁并更新测试

建议结合 #49227 一起阅读,理解结构化输出后端(XgrammarBackend)的 stop token 掩码抽象,以及测试如何镜像生产路径。本 PR 小而清晰,是观察 vLLM 如何在后端能力落地后清理解析器 workaround 的好样例。

#52091 Auto-ping Cohere on related issues

原始 PR · 作者 DarkLight1337 · 合并时间 2026-08-14 00:40

基础设施 重要性 3.47 洞察度 2.00

为 Cohere 相关 PR/Issue 添加自动标签与 CC 提醒

值得快速浏览,理解 vLLM 自动化标签体系的设计。具体配置参考价值有限,但可以借鉴其按模型/模块划分维护者提醒的思路。

2026-08-13
缺陷修复 重要性 4.72 洞察度 3.00

修复 Anthropic disable_parallel_tool_use 被静默丢弃的问题

值得快速阅读:改动虽小,但展示了协议兼容层中“保留源字段 + 取反映射”的典型做法。建议关注 `_convert_tool_choice` 中先设置 `parallel_tool_calls` 再按 type 分支的顺序,以及 `None` 缺省值如何在不改动其他路径的前提下维持向后兼容。

缺陷修复 重要性 7.77 洞察度 6.00

上游化 Cohere 解析器修复并补 510 行测试

值得精读。重点看两处设计:一是 `no_tools()` 与 `start_in_answer()` 如何界定 reasoning parser 与 tool parser 的职责边界,二是测试中 `_token_deltas` 用 U+FFFD 缓冲不完整多字节字符、以字节粒度模拟流式输入的手法,可作为其他 streaming parser 测试的范本。建议维护者关注 melody 0.11.1 的版本约束是否需要在运行时文档和镜像构建中显式声明。

2026-08-12
功能 重要性 9.36 洞察度 7.00

为 vLLM 新增 Dots3 NOTE 全模态模型原生支持

值得精读。该 PR 展示了三类可复用的设计模式:一是混合 MLA 模型如何用“均匀填充物理 cache 行宽 + 模型私有稀疏 MLA 后端”复用现有混合 KV cache 分配器;二是显式 model-selected prefill backend class 让模型私有 FA3 实现无需模型名判断即可接入;三是 CPU 规划/GPU 重建的双层序列长度处理规避未分配页读取。建议重点核对 `mla_attention.py` 共享改动对既有 MLA 模型的回归,并跟进 FIPS sha1 与模型级 CI 测试两个遗留项。