Prhub

vllm-project/vllm · 标签视图

标签列表

聚合结果

benchmark 相关 PR

2026-08-19
缺陷修复 重要性 7.50 洞察度 6.00

vllm-bench 启动依赖请求接入就绪超时重试

值得精读。这是一个典型的“review 驱动重构”案例:第一版直接把就绪探测提前,被 AI 审查发现合成 probe 的载荷代表性问题后,第二版改为让启动依赖请求自带重试,方案更稳。重点学习 `retry_with_timeout` 的泛型封装(`FnMut` + `Future` 的写法)、零超时语义设计,以及“保留原位探测以保证载荷真实”的取舍逻辑。

2026-08-06
重构 重要性 8.14 洞察度 6.00

throughput 复用 serve 数据集分发,删除 215 行 if-else

对 benchmark 工具维护者值得精读:`_to_serve_args` 适配器加共享分发模式可作为 CLI 复用范例,而 review 中未解决的 ASR、prefix-repetition、custom-audio 兼容性缺口建议在后续 PR 补齐(优先 prefix_repetition 的 `None` 默认值与 ASR 白名单)。普通用户无需关注。

2026-08-01

#50600 Add Understanding the Latency Metrics docs

原始 PR · 作者 mgoin · 合并时间 2026-08-01 14:22

文档 重要性 4.32 洞察度 4.00

新增延迟指标文档,澄清 TTFT/ITL/TPOT 口径

值得一读的文档型 PR:如果你使用 `vllm bench serve` 或需要对照其他推理框架的延迟指标,本小节是绕不开的参考。值得关注的设计决策:①全文强调"用测量点和公式而非指标名比较",是处理 benchmark 术语不一致的正解;②TPOT 公式明确排除首 token、ITL 不产生零时长 gap,澄清了规格解码下的常见误解;③双主题 SVG 配图把抽象定义可视化的做法值得在文档中推广。缺点是 PR body 缺动机描述,合并信息全部依赖文档自身,后续维护者需自行补读上下文。

2026-04-24
文档 重要性 5.55 洞察度 2.00

为 bench serve 可视化参数添加文档

建议合并,文档补全对用户友好。参数解析方式的变化(逗号分隔)是合理的改进,但应确保在发布说明中提及此 breaking change。代码改动量小且经过评审,正确性有保障。