Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42

PR 列表

更多筛选
2026-06-30
性能优化 重要性 7.88 洞察度 7.00

优化 CuteDSL KKT 内核,融合逆与后处理

值得精读,尤其是对 Blackwell GPU 上 CuteDSL 内核开发感兴趣的工程师。该 PR 展示了性能 profiling 驱动的优化方法,和计算融合、warp 级流水解耦的设计模式。

缺陷修复 重要性 6.94 洞察度 6.00

修复 thinking_token_budget 在强制结束后的重入问题

值得精读:该 PR 展示了状态机重入问题的典型修复方法,通过引入扫描偏移和状态重置精确控制重入检测。实现简洁但有效,设计决策清晰,代码注释详尽。建议关注 reasoning 相关功能的团队仔细审查并学习。

缺陷修复 重要性 6.00 洞察度 3.00

修复 GLM5.2 非 torch.compile 路径 sparse attention 内存分配问题

该 PR 是典型的细小但关键的控制流修复,变更仅 4 行。对于维护 deepseek_v32 注意力模块的开发者可以快速理解,对于普通使用者无需深入。建议部署 GLM5.2 的用户及时合入此修改。

缺陷修复 重要性 5.73 洞察度 4.00

ROCm CI OTLP 测试改用 spawn 并清理资源

推荐阅读该 PR,它展示了如何处理 fork 与 gRPC 线程冲突的典型方法:通过检测平台切换到 spawn 模式,并注重资源释放。对于在其他平台需类似调整的场景有参考价值。

缺陷修复 重要性 2.84 洞察度 2.00

修复 ROCm CI 缺少 cohere_melody 依赖

建议合并无风险变更。可提醒团队将新依赖同步添加至其他平台(如 Intel GPU)的 requirements.in 文件,若其也运行相同测试。

缺陷修复 重要性 6.96 洞察度 6.00

修复ROCm DeepEP高吞吐DBO精度问题

建议精读,尤其是`_sync_dbo_comm_if_needed`的设计模式与CU分区禁用的权衡。该PR展示了在GPU通信与计算重叠场景下,如何通过细粒度同步解决竞态条件,对类似异构并行模式的开发者有参考价值。

参与讨论