Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-07-02
功能 重要性 8.83 洞察度 6.00

补齐 Rust 前端调度器日志统计对标 Python

建议阅读此 PR,尤其是 `SchedulerLogStatsAccumulator` 的设计:它展示了如何在 Prometheus 之外累积无法直接表达的数据,并通过 `drain` 模式定期消费。这种模式可推广到其他需要 interval 聚合的统计场景。关于 CUDAGraph 日志暂未输出的问题,团队应在收集反馈后做出取舍。

#47410 support GLM-5.2 gate use FP32

原始 PR · 作者 zRzRzRzRzRzRzR · 合并时间 2026-07-02 22:45

缺陷修复 重要性 6.20 洞察度 6.00

GLM-5.2 MoE 门控强制使用 FP32 路由

推荐精读。这是一个小而精的适配性修复,展示了在 vLLM 中如何优雅地处理模型变体的特殊配置。关键设计点: - 集中路由类型判断逻辑到一个函数 `_get_moe_router_dtype`,易于扩展。 - 利用 `force_fp32_compute` 统一处理 fallback,而不需要改动下游 kernel 选择逻辑。 - `allow_dsv3_router_gemm` 的条件修复也值得关注,说明谨慎的 kernel 路径前置检查是必要的。

缺陷修复 重要性 5.24 洞察度 3.00

修复 V2 ModelRunner 中 Mamba2 非投机解码崩溃

值得合并的快速 Bug 修复,逻辑清晰且风险低。对于关注 V2 ModelRunner 稳定性或 Mamba2 模型的团队,建议了解此修复。

功能 重要性 6.44 洞察度 5.00

默认对所有密集模型启用 V2 Model Runner

此 PR 设计清晰,增量迁移方式值得借鉴。建议读者关注 `_is_default_v2_model_runner_model` 中的决策树,以及测试中对 V1/V2 差异的抽象。推荐精读。

重构 重要性 9.18 洞察度 6.00

Rust 前端引擎输出和结构化输出改用枚举域类型

推荐阅读此 PR 以了解 'enum-backed domain type' 设计模式——一种在 Rust 中实现类型安全且向后兼容的多协议负载处理的典型方法。关键设计决策包括:私有 Wire 类型与公共域类型分离、自定义 ser/de 委托、`EnumAsInner` 简化模式匹配。此模式在构建复用外部协议输入的 Rust 接口时很有参考价值。

参与讨论