Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-07-01
功能 重要性 6.62 洞察度 5.00

在工具解析失败时添加输入片段上下文

建议合并此 PR。它虽小但切实提升了可调试性,且安全权衡已在讨论中明确。值得关注的是 80 字符截断和日志安全的设计取舍。

#47164 fix: skip cooperative top-K on SM120

原始 PR · 作者 lucifer1004 · 合并时间 2026-07-01 12:32

缺陷修复 重要性 4.20 洞察度 5.00

跳过 SM120 上的 cooperative top-K

可以安全合并。变更简单、目标明确,已由作者手工验证。建议在 SM120 上增加自动化测试覆盖,但非阻塞。

功能 重要性 9.36 洞察度 7.00

为 GLM5.2 添加 DCP 稀疏注意力索引器支持

值得精读,尤其是理解以下设计决策: 1. CuTeDSL 与 Triton 如何协作实现高效的跨 rank top-K 合并; 2. LSE 基数归一化在 DCP reduce 中的关键作用; 3. Triton 内核中利用原子加法实现有效槽位压缩的性能考量。 建议在合并后持续关注预填充 all_gather 优化和 interleave > 1 支持。

#46104 [Spec Decode] Support SWA + DFlash for MiMo

原始 PR · 作者 benchislett · 合并时间 2026-07-01 11:34

功能 重要性 8.66 洞察度 6.00

支持 DFlash 滑动窗口注意力与 MiMo 集成

建议重点关注 _maybe_symmetrize_window 的设计及其在 AOT 调度中的位置,以及 _resolve_layer_attention 对多种配置的解析逻辑。这些为未来混合注意力层支持奠定基础。

缺陷修复 重要性 6.67 洞察度 5.00

修复 Harmony 解析器非终端状态静默丢弃内容

值得精读。此 PR 展示了如何优雅地处理解析后端的静默失败:保持 HTTP 协议不变,仅做内容回退和日志记录。设计决策(try/finally、异常传播)以及 reviewer 提出的改进建议(去重警告、删除冗余注释)都是良好的工程实践。建议团队在日常开发中参考这种异常处理模式。

功能 重要性 7.73 洞察度 6.00

支持 FlashMLA FP8 KV 缓存与 BF16 query

值得细读,特别是 `kernels.py` 中的 fp8_ds_mla 写入分支和 `attention.py` 中的布局选择逻辑。理解该 PR 有助于掌握 DeepSeek V3.2 模型在 NVIDIA GPU 上的优化策略,以及如何在 Triton kernel 中支持两种不同的量化缓存布局。建议关注后续针对 Hopper 的性能测试结果。

参与讨论