Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-06-23
缺陷修复 重要性 7.13 洞察度 6.00

提前预留 TurboQuant workspace 防止 CUDA graph 锁定断言

此 PR 修复了一个影响 TurboQuant 用户的关键 bug,代码简洁且测试充分。建议阅读了解如何通过提前预留 workspace 解决 graph capture 后的动态分配问题。设计上保持了关注点分离(逻辑在 attention backend 内)。推荐合入。

缺陷修复 重要性 7.27 洞察度 5.00

修复 static actorder 下 WNA16 MoE w2 scales sharding

值得精读的设计决策:将 sharding 规则提取为纯静态方法,方便单元测试和后续扩展;早失败原则(对不可整除 size 抛出异常)优于运行时 CUDA 崩溃。建议未来关注枚举替换字符串的后续 PR。

#39541 [CI] Add DGX Spark GPQA smoke test

原始 PR · 作者 mgoin · 合并时间 2026-06-23 05:52

测试 重要性 4.64 洞察度 3.00

为 DGX Spark 添加 GPQA 烟雾测试 CI 步骤

本 PR 属于常规 CI 基础设施扩展,无核心逻辑变更。值得关注的点: - DGX Spark(SM120)作为新硬件平台的支持入口。 - 镜像构建中 CUDA 架构列表的调整方法。 - 路径错误的修正应尽快合并以避免 CI 失败。 审阅者 @AndreasKaratzas 提出的配置复用建议可能驱动后续重构。

缺陷修复 重要性 6.56 洞察度 4.00

修复 FusedMoE 加载 shape-(1,) per-tensor scale 崩溃

值得精读:该 PR 虽然改动小,但展示了处理上下游数据格式不一致的典型模式:提取统一转换函数、扩展至所有潜在调用点、添加针对性的回归测试。设计决策如使用 `reshape(())` 而非 `squeeze()` 或 `view([])` 也体现了对维度安全的考虑(numel > 1 时失败)。推荐作为技术参考。

参与讨论