重命名 KV offload 指标 block 为 chunk
该 PR 值得快速合并,因为它解决了发布前的命名一致性问题。虽然实现简单,但体现了及时处理发布候选问题的好习惯。
标签列表
聚合结果
重命名 KV offload 指标 block 为 chunk
该 PR 值得快速合并,因为它解决了发布前的命名一致性问题。虽然实现简单,但体现了及时处理发布候选问题的好习惯。
原始 PR · 作者 Srinivasoo7 · 合并时间 2026-08-10 10:23
为 KV 多级卸载新增分层指标,覆盖传输、查询、失败与活跃度
值得精读。重点学习:可观测性数据如何跨异步线程传递(JobResult.transfer_time)、追踪器与 orchestrator 的职责划分、per-block 异步延迟的语义定义,以及 NIXL telemetry 的接入方式。后续关注 #44008 的剩余指标项与 p2p telemetry follow-up。
原始 PR · 作者 puririshi98 · 合并时间 2026-08-09 09:58
修复离线 LLMEngine 零输出步丢弃 prefix-cache 计数
改动很小,值得花几分钟通读。重点学习点是「计数器由下游每步 drain,但记录有输出门控」这类统计丢失的根因模式,以及评审中对 iteration_stats 构造时机的简化(把 None 判断放到源头而不是调用点)。若团队依赖 prefix-cache 指标,建议后续补一个 zero-output step 的回归测试,防止此类丢失再次引入。
为 vllm:cache_config_info 添加 group-aware KV cache 容量指标
值得精读,特别是以下设计决策: - 如何将运行时计算的状态从 engine core 通过 ReadyResponse 同步到前端。 - `compute_hash` 忽略字段的处理确保新增字段不影响编译图。 - per-engine 与总和的取舍体现了对 DP 架构的正确建模。
精确化 vLLM 指标取消注册的范围
值得合并。改动虽小但解决了明确的兼容性问题,且经过充分讨论。建议合并后通知下游项目(vLLM-Omni)更新。
原始 PR · 作者 eicherseiji · 合并时间 2026-05-01 15:43
修复 Ray 指标标签分区共享 Bug
**值得精读**。该 PR 以极小改动揭示了使用可变共享状态封装库 API 的典型陷阱,并提供了干净的解耦模式(浅拷贝 + 独立标签字典)。对理解 Prometheus 客户端标签语义、以及如何在不可变标签框架下包装 Ray metric API 具有参考价值。推荐所有涉及指标开发的人员阅读。
为FinishedRequestStats添加request_id字段,支持指标与请求关联。
该PR值得精读,因为它展示了如何在vLLM中扩展指标系统以支持可观测性需求。关注点包括: 1. 设计决策:选择`external_req_id`而非内部ID,体现了与现有架构一致性的考量。 2. 接口演化:讨论中关于`StatLoggerBase`稳定性的担忧,是评估类似变更长期维护成本的好案例。 3. 实现简洁性:变更集中在三个文件,逻辑清晰,适合学习如何最小化地添加功能字段。
移除调度器统计中未使用的编码器缓存使用率字段,清理无用代码。
该PR变更简单直接,适合快速浏览以了解代码清理决策。值得关注的是团队对未使用代码的处理原则:优先移除而非保留,强调指标应面向用户设计。