Prhub

vllm-project/vllm · 标签视图

标签列表

聚合结果

feature 相关 PR

2026-08-20
功能 重要性 9.18 洞察度 6.00

新增 trace_decode_token_ids 实现确定性解码重放

值得精读。重点关注:采样后注入再算 logprob 的顺序设计、以 GPU 状态推导 step 避免 CPU 同步、UVA `StagedWriteTensor` 的批量写入模式、以及“配置开关 + 输入归一化 + 统一校验”三层防护。对想扩展 MRV2 sampler 或实现类似重放/调试功能的工程师是很好的参考。合并前建议在 GPU 上跑通 `examples/generate/trace_replay_offline.py` 端到端验证。

功能 重要性 5.64 洞察度 5.00

默认启用 FlashInfer all-reduce 并跳过批不变模式

值得精读,重点关注默认开启带来的性能变化以及批不变模式的兼容性处理。建议运行更多平台和形状的测试以验证鲁棒性。

功能 重要性 8.54 洞察度 7.00

Mooncake Store 消费者新增 decode KV 卸载能力

值得精读。重点关注 4 个设计决策:(1)用 `store_job_id` 账本替代按 req_id 计数,抵御 preemption 与请求 ID 复用带来的状态污染;(2)KV event 的 parent 关系从 request hash 链推导,而非依赖 Store 返回顺序;(3)增量 token 快照加按功能开关裁剪元数据,避免长请求全量拷贝;(4)异步 store 生命周期下“调度器只持有 token 后缀、GPU block 由 worker 报告完成才释放”的 pin 语义。

功能 重要性 6.86 洞察度 5.00

DeepSeek 骨干双向注意力嵌入模型支持,启用非 MLA 路径

该 PR 值得关注,尤其适合要新增 encoder-only 变体的模型维护者阅读:它展示了「HF 配置字段驱动注意力类型 + 全局 MLA 开关短路 + registry 复用已有因果模型实现」的组合套路,且与 Qwen2/Qwen3 双向 embedding 的处理方式一脉相承。不过运行时数值验证尚未自动化,建议在后续补一条针对双向 DeepSeek embedding 的回归测试。

#48918 [CT] Support Humming for WNA16 MoE

原始 PR · 作者 yiliu30 · 合并时间 2026-08-20 00:31

功能 重要性 8.28 洞察度 6.00

为 CT WNA16 MoE 开启 Humming 后端,支持子字节位宽

值得精读。重点关注三类设计决策:用 Fraction + ceil 处理 sub-byte 打包维度、Humming 支持判定如何与权重 key 数据契约结合、以及 torch.dtype 与 ScalarType 统一字符串化的处理方式。同时值得学习 review 中从 mock 测试演进到 e2e 测试的过程。

2026-08-19
功能 重要性 5.64 洞察度 4.00

新增 NemotronH_Omni_Reasoning_V3 架构支持并启用 MTP 推测解码

值得快速阅读,改动虽小但涉及模型注册和推测解码的关键路径。关注设计:通过简单映射和条件扩展实现新模型支持,体现了 vLLM 对向后兼容的重视。

功能 重要性 5.83 洞察度 5.00

pooling 模型默认启用 MRV2,全面切换执行路径

值得精读。虽然源码仅删除 3 行,但这是"以最小 diff 翻转大规模默认行为"的典范:通过参数化测试将各分支(文本/多模态、原生/Transformers 后端、encoder/decoder)拆成显式用例,再用渐进式 commit 逐步放宽范围,最后用完整测试矩阵兜底。值得关注的设计决策:删除整个 runner_type guard 而非添加 pooling 特判,让选择器回归"单一职责"(只关心 MoE/hybrid/attention-free 例外),以及 review 中 njhill 对 draft 模型检查的简化判断。

功能 重要性 7.64 洞察度 7.00

FlashMLA sparse 的 fp8 路径接入 DCP 与 MTP 推测解码

值得精读。这是 DCP 落地到 sparse MLA 后端的代表作品,重点关注三点设计决策: 1. **(0, -inf) 单位元中和**:用一句简洁的数值语义(`0 * NaN = NaN`)解释了为什么空行必须显式中和,并且用单元测试把行为钉死,这种“用测试固化数值不变量”的做法值得借鉴。 2. **fail-closed 守卫的写法**:把 DCP 支持限制在已验证的配置子集内(ag_rs、mixed-batch、head-envelope 一致),宁可拒绝也不静默损坏,是硬件后端特性的稳妥落地方式。 3. **与 #46076 的分工**:indexer 机制上游化后本 PR 主动砍掉自研部分,只保留 backend 侧接线,最终 diff 仅 3 个文件,收敛得非常干净。 建议阅读顺序:`flashmla_sparse.py` 的 builder 守卫 → `_forward_fp8_kv_mixed_batch` → `test_fp8_mixed_batch_dcp_neutralizes_empty_rows`。