Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 20:44 同步状态:空闲 下次计划:2026-08-21 21:44

PR 列表

更多筛选
2026-06-24
性能优化 重要性 6.60 洞察度 6.00

增量搜索减少思考标记预算开销

值得精读。尽管改动量小,但展示了如何通过增量计算将 O(n²) 变为 O(1) 平摊的经典优化模式,且 review 中关于切片 vs 逐元素比较的性能讨论提供了 Python 微优化的实际经验。建议在类似序列扫描场景中复用该模式。

缺陷修复 重要性 4.12 洞察度 3.00

修复 XPU 上 auto-fit 测试因 block_size 差异失败

该 PR 是一个典型跨平台兼容性修复,代码改动简单但说明了测试中隐含的硬件假设问题。值得关注的是,类似测试中若依赖默认值应该显式指定以确保可移植性。

#46511 [Log] Update to log once

原始 PR · 作者 yewentao256 · 合并时间 2026-06-24 22:45

重构 重要性 5.20 洞察度 3.00

将重复日志改为只打印一次

值得合并的小而美的清理变更。对日常用户无感知,但显著改善了启动日志体验。可作为后续类似日志治理的范例。

#46339 [Bugfix] Re-enable FP8 MoE on NVIDIA Thor

原始 PR · 作者 DarkLight1337 · 合并时间 2026-06-24 22:35

缺陷修复 重要性 3.41 洞察度 4.00

修复 FP8 MoE 在 NVIDIA Thor 上的回归

该 PR 是必要的回归修复,变更简洁、风险低。建议阅读以了解 FP8 MoE kernel 的架构兼容性管理方式,特别是设备能力检查与 CMake 架构列表的同步机制。

#46414 [ROCm] Fix AITER FP8 quantization schema tests

原始 PR · 作者 djramic · 合并时间 2026-06-24 22:29

缺陷修复 重要性 6.54 洞察度 4.00

修复 AITER FP8 量化 schema 测试失败

建议合并。该 PR 解决了一个实际的 CI 问题,且修改审慎,通过使用共享工具和调整测试策略提高了测试的健壮性和可维护性。

#46535 [Model Runner V2][MM] Support EVS

原始 PR · 作者 njhill · 合并时间 2026-06-24 22:18

功能 重要性 8.95 洞察度 6.00

V1 模型状态机增加多模态嵌入剪枝(EVS)支持

建议精读本 PR,特别是 `MultiModalPruner` 的设计——它将模型特定的嵌入后处理抽象为独立组件,避免在主路径中散落条件分支,提升了可扩展性。同时也展示了如何通过基类默认方法减少重复代码(`gather_mm_embeddings` 上提)。对于多模态推理工程师有参考价值。

性能优化 重要性 8.60 洞察度 6.00

AArch64 MoE 加速,启用 NEON BFMMLA 微 kernel

推荐架构师和性能工程师阅读。该 PR 展示了如何在 vLLM 的 CPU kernel 框架中高效添加新的 ISA 分支,其 pack 策略和宏调度设计值得在未来的 kernel 优化中复用。

参与讨论