Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 19:35 同步状态:空闲 下次计划:2026-08-21 20:35

PR 列表

更多筛选
2026-06-26
功能 重要性 6.88 洞察度 6.00

融合 DFlash 各层 K-norm 为单次 kernel 调用

该 PR 值得精读,展示了典型的 kernel 泛化 + 测试驱动重构模式。通过扩展底层 kernel 支持 batched weight 来消除循环,并用细粒度测试保证正确性,设计思路清晰。

性能优化 重要性 7.05 洞察度 5.00

减少推测解码中的 TP 通信开销

此 PR 是一次简洁高效的性能优化,改动小而收益明确。推荐阅读其实现思路:通过配置开关控制通信策略,避免全 vocab 的 all-gather,利用 `get_top_tokens` 接口只传递 top-1 token。该模式可推广到其他需要减少通信的场景。建议后续补充单元测试以覆盖新增的校验逻辑和采样路径。

#46405 [Refactor] Remove dead kernel code

原始 PR · 作者 yewentao256 · 合并时间 2026-06-26 09:09

重构 重要性 6.60 洞察度 2.00

移除死内核代码与过时测试

值得合入。清理死代码是良好的工程实践。无需额外测试,但建议在合并前确认 CI 通过(从已批准看应已通过)。

缺陷修复 重要性 6.34 洞察度 5.00

限制大 logprobs 请求时的显存爆炸

建议精读此 PR,以学习如何用分块方式避免 Triton 内核中编译时常量过大导致的显存问题。该设计模式可推广到其他类似的 gather/scatter 场景。

基础设施 重要性 6.86 洞察度 5.00

将 Rust 前端的 TLS 实现从 rustls 切换到 native-tls/OpenSSL,并添加依赖禁止检查。

该 PR 值得关注其依赖治理策略,特别是通过 cargo-deny 建立禁止列表和利用 Cargo feature unification 确保 TLS 一致性的方法。适合作为基础设施团队依赖管理的参考案例。

参与讨论