Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 20:44 同步状态:空闲 下次计划:2026-08-21 21:44

PR 列表

更多筛选
2026-06-27

#45924 [MoE Backend] add HPC-Ops MoE backend

原始 PR · 作者 thisjiang · 合并时间 2026-06-27 11:18

功能 重要性 9.00 洞察度 6.00

集成 HPC-Ops FP8 MoE 后端,适配 Hopper GPU

值得精读,特别是模块化 MoE 后端的注册机制和兼容层设计(`_supports_*` 模式)。对于使用 H20/H200 的用户,建议在 FP8 模型上评估性能后考虑启用。注意该后端依赖外部库,部署时需确保环境安装正确。

缺陷修复 重要性 5.88 洞察度 4.00

修复 ROCm DeepEP MoE 测试的 buffer 重用和精度检查

值得精读,特别是跨平台精度验证的设计模式(宽松 vs 严格)、测试工具函数提取以及 buffer 重用突破平台限制的策略。关注 `check_accuracy` 在测试工具箱中的价值。

缺陷修复 重要性 6.15 洞察度 5.00

放松 ROCm 融合层归一化量化测试的 ULP 容忍度

值得精读。PR 展示了处理跨平台精度问题的规范方法:分析根因(归约顺序)、定义 ULP 测量工具、在测试中设置平台特定容忍边界,并保持主要路径严格。其提取的 `bf16_ulp_distance` 和 `fp8_ulp_distance` 可作为后续 ROCm 测试中的公共组件。

#46762 [ModelRunner V2] Support realtime embeddings

原始 PR · 作者 njhill · 合并时间 2026-06-27 10:42

功能 重要性 7.24 洞察度 5.00

支持实时模型解码步嵌入收集

值得精读,特别是区分实时与非实时嵌入收集的设计、以及通过 dummy_inputs_embeds 解耦 CUDA 图捕获与编码器执行的方法。对理解 vLLM V2 多模态流程有参考价值。

参与讨论