Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 19:35 同步状态:空闲 下次计划:2026-08-21 20:35

PR 列表

更多筛选
2026-06-06
功能 重要性 8.09 洞察度 5.00

新增 Phi-4 mini JSON 工具解析器(Rust 前端)

建议快速阅读以了解 Rust 前端添加新解析器的标准化流程(配置常量、结构体、注册、测试)。关于 whitespace 差异的设计决策(是否对齐 Python 行为)值得关注,体现了务实的技术权衡。

#44574 Preserve layout-changing clones

原始 PR · 作者 mikekg · 合并时间 2026-06-06 08:45

缺陷修复 重要性 6.58 洞察度 5.00

修复 unsafe clone 消除 pass 误删布局变更的 clone

该 PR 虽然仅有 48 行变更,但修复了一个编译器优化 pass 的安全性问题,值得相关开发者精读,尤其是涉及自定义算子或依赖 tensor 布局的场景。

#44021 [Cohere] fix RoutingMethodType

原始 PR · 作者 Terrencezzj · 合并时间 2026-06-06 07:25

缺陷修复 重要性 5.62 洞察度 4.00

修复 Cohere MoE 路由未考虑无 renormalize 场景

建议阅读 `custom_routing_router.py` 中路由类型判断逻辑,理解 `RoutingMethodType` 的设计;同时关注后续是否有其他 expert 实现补齐 `Sigmoid` 支持。

功能 重要性 8.35 洞察度 7.00

融合 RoPE 与静态 Q FP8 量化,提升 ROCm GPT-OSS 解码性能

该 PR 的设计模式值得精读,特别是 `auto_functionalized` 在编译 pass 中的正确使用、模式优先级注册机制以及能力检查模式。ROCm 开发者应重点关注,可作为 GPT-OSS 优化路径的参考实现。

参与讨论