Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 15:58 同步状态:空闲 下次计划:2026-08-20 16:58

PR 列表

更多筛选
2026-03-23
性能优化 重要性 5.00 洞察度 3.00

跳过 PW CUDA 图的隐藏状态分配以优化内存使用。

对于从事 CUDA 图优化或 MRV2 开发的工程师,建议精读此 PR 以了解内存优化技巧。关键设计决策在于区分 PW 和 full CUDA 图的处理路径,值得借鉴。

2026-03-22
2026-03-21
性能优化 重要性 5.00 洞察度 5.00

优化 Mamba 组获取逻辑,从每批次调用改为创建时一次性计算并重用。

工程师应关注此优化带来的性能收益,但需仔细阅读 review 中的风险提示,考虑在实际部署前评估配置变化的可能性,或未来添加断言以增强鲁棒性。

功能 重要性 6.00 洞察度 5.00

为Responses API添加kv_transfer_params支持,实现PD disaggregation功能。

建议工程师精读此PR,特别是context.py中guard的设计决策,以理解多回合agentic循环下的状态管理。对于负责Responses API或PD disaggregation的开发者,此PR是重要的功能扩展参考,展示了如何遵循现有模式进行API增强。

#37128 [MoE Refactor] Mxfp4 oracle rebased

原始 PR · 作者 zyongye · 合并时间 2026-03-21 11:37

重构 重要性 7.00 洞察度 7.00

重构 MXFP4 MoE 为 oracle 模式,统一后端选择并简化代码库。

建议工程师精读此 PR,特别是 oracle/mxfp4.py 和新的专家类,以理解 oracle 模式的设计决策和 MXFP4 的后端选择逻辑。关注 review 中解决的初始化和硬编码问题,以及如何统一不同后端的支持方法。对于维护者,需注意潜在的回归风险和测试覆盖。

#37694 Add get_device_uuid for rocm

原始 PR · 作者 tmm77 · 合并时间 2026-03-21 11:33

功能 重要性 4.00 洞察度 3.00

为ROCm平台新增get_device_uuid方法,支持Verl应用的PPO和异步用例。

这是一个小而精的PR,适合关注ROCm支持或平台抽象实现的工程师精读。注意错误处理的设计和边界检查的添加,这些是防御性编程的好例子。

缺陷修复 重要性 6.00 洞察度 5.00

修复混合模型使用 --calculate-kv-scales 时导致 FP8 KV 缓存比例损坏的 bug。

建议阅读此 PR,以了解混合模型与量化校准的交互问题,以及如何安全地处理弃用选项。重点关注 `HybridAttentionMambaModelConfig.verify_and_update_config()` 方法的设计决策,包括警告日志和配置修改的逻辑。

2026-03-20
缺陷修复 重要性 6.00 洞察度 5.00

修复 Eagle 投机解码在 CUDA 图重放时草稿 logits 未写入的问题,确保概率拒绝采样的正确性。

对于使用 Eagle 投机解码和 CUDA 图的工程师,建议精读此 PR,特别关注状态从 RequestState 移至 Speculator 的设计决策,以及 review 中关于数值精度的讨论。同时,可参考相关 PR 如 38045 以了解拒绝采样功能的更多上下文。

参与讨论