Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 20:44 同步状态:空闲 下次计划:2026-08-21 21:44

PR 列表

更多筛选
2026-06-28
缺陷修复 重要性 5.10 洞察度 5.00

修复 SM90 MXFP4 MoE 测试中的权重/缩放交错问题

该 PR 值得快速合并和精读,因为它展示了一个常见的测试陷阱:手写数据布局函数与 kernel 期望不一致导致测试假阴性。学习点是优先使用 kernel 配套库提供的官方助手函数,而非手动实现。

2026-06-27
性能优化 重要性 7.53 洞察度 6.00

融合共享专家至AITER MoE,提升MiniMax-M3 TPOT 4-17%

此PR值得精读,特别是它展示了如何在不破坏现有非AITER路径的前提下,引入AITER专属的优化路径。设计上采用多函数共存、条件分支清晰,是平台特定性能优化的良好案例。建议工程师关注`_aiter_moe_fused_shared_experts_enabled`的设计以及如何利用aiter的grouped top-k实现共享专家融合。如果后续需要为其他模型做类似优化,可以参考此模式。

为 gfx950 集成 AITER FlyDSL MXFP8 MoE 并实现后端选择

值得精读。展示了一个体系结构感知的 kernel 集成案例:如何通过 `is_supported_config` 实现自动设备/包检测、如何将自定义 kernel 优雅嵌入现有 MoE 后端选择框架、以及如何处理回退路径。对关注 ROCm 性能和 MoE kernel 集成的工程师有较大参考价值。

缺陷修复 重要性 3.98 洞察度 2.00

为 TRITON_ATTN 后端添加绝对容忍度下限

该 PR 属于典型的测试稳定性修复,技术含量低但实用。值得关注其处理小概率值漂移的策略——为相对容忍度设置绝对下限——在类似浮点精度测试中可复用。

性能优化 重要性 7.94 洞察度 5.00

融合Q RoPE、FP8量化与权重缩放Triton kernel,提升GLM-5.2吞吐1.9%-3.3%

值得精读该Triton kernel的融合实现,尤其是在attention量化场景下的编程技巧。对于未来支持其他模型(如DeepSeek系列)的类似优化有直接参考价值。

功能 重要性 5.79 洞察度 4.00

vllm chat/complete 添加--stats打印TTFT和TPS

该 PR 值得精读,展示了如何在 CLI 中优雅地添加性能统计,代码简洁、风险可控。对于需要快速验证性能的用户非常有用。

参与讨论