Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-05-29

#43859 [Model]Support Step-3.7-Flash

原始 PR · 作者 ltd0924 · 合并时间 2026-05-29 08:01

功能 重要性 9.18 洞察度 6.00

支持 Step-3.7-Flash 多模态 MoE 模型及 MTP 推测解码

该 PR 值得精读,尤其是 Step3p5MTPProposer 中 per-group slot mapping 的实现,是处理多 KV cache group 推测解码的典型模式。配置层中通过 hf_config_override 自动转换模型类型的设计也值得借鉴。建议关注后续对该模型的测试覆盖和性能报告。

重构 重要性 3.65 洞察度 3.00

重构 CI 日志获取脚本输出文件名逻辑

该 PR 为维护性小改进,逻辑简单清晰,无需深入精读。CI 相关开发者可了解变化,确保下游脚本适配新行为(特别是文件名变更和覆盖保护)。

#43445 [Spec Decode] Allow causal DFlash

原始 PR · 作者 benchislett · 合并时间 2026-05-29 05:18

功能 重要性 6.61 洞察度 4.00

DFlash 支持可配置因果注意力

建议快速合入,改动清晰且风险低。设计上使用 property 而非构造函数注入,值得学习。

参与讨论