缩小 CUDA 平台测试 CI 源依赖范围
建议合并。该 PR 遵循了与 #42059、#42055 等 CI 优化相同的模式,通过精确依赖缩小 CI 触发范围,是 CI 基础设施持续改进的良好实践。
A high-throughput and memory-efficient inference and serving engine for LLMs
缩小 CUDA 平台测试 CI 源依赖范围
建议合并。该 PR 遵循了与 #42059、#42055 等 CI 优化相同的模式,通过精确依赖缩小 CI 触发范围,是 CI 基础设施持续改进的良好实践。
缩小 PyTorch 编译 CI 作业的源依赖范围
建议合入。注意后续将定期审查依赖列表,考虑引入自动化工具检测实际导入关系,减少手动维护成本。
原始 PR · 作者 the-david-oy · 合并时间 2026-05-09 05:24
修复 Gemma4 工具解析器死循环和数组边界问题
建议精读此 PR,尤其是零进度保护的防御性编码风格,适用于类似自定义解析器的健壮性提升。
融合共享专家加速Qwen3-Next解码16%-24%
值得精读。展示了ROCm专有性能优化的一般模式:利用环境变量开关、运行时版本检查、fallback路径、以及通过独立路由器类避免污染通用代码。设计权衡(门控融合位置、条件判断缓存)值得参考。后续扩展FSE到其他模型时可以参考此框架。
修复弹性 EP 扩展测试中的标识冲突和工作区过小
值得精读,特别是 DP 标识统一和工作区重热的设计模式。但需注意性能开销,关注后续 PR #42203。对于弹性 EP 功能的使用者,建议合入此修复。
原始 PR · 作者 HiroakiMikami · 合并时间 2026-05-09 02:29
支持 Gemma3/4 门控 MLP 的 hidden_act 变体
此 PR 值得精读,特别是 `activation.py` 中的注册表扩展方式和模型层调用 `get_act_and_mul_fn` 的解耦设计,适合作为 vLLM 中支持模型配置变体的范例。
修复 OpenAI batch 示例中重复的 --model 参数
该 PR 值得合并,属于低风险文档修正,修复了明显的复制粘贴错误。无需精读,但可作为良好贡献的参考。
原始 PR · 作者 zhenwei-intel · 合并时间 2026-05-08 21:10
跳过 fork 依赖的 CPU logits 测试以修复 Intel CI
此 PR 是简单的 CI 修复,无需精读。但可关注 future improvement:将条件跳过逻辑迁移到测试文件内部,使用环境变量判断 XPU 并 skip,提高可维护性。
参与讨论