Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-07-08
性能优化 重要性 4.72 洞察度 3.00

为 AMD MI355 添加 selective_state_update 的 float32 调优配置

低风险、低复杂度的性能优化 PR,值得合并。对于使用 Mamba 模型且部署在 MI355 上的团队,建议关注此配置以提升推理性能。同时也建议其他 AMD GPU(MI300X 等)提交类似的调优配置。

重构 重要性 4.89 洞察度 4.00

移除 DSv2 类模型路由器权重 FP32 上转型

建议合入。该 PR 是 Issue #47410 的合理后续优化,且经过作者数值验证。推荐关注后续可能对 BF16 MMA 累加精度的进一步改进。

性能优化 重要性 4.86 洞察度 3.00

为 MI300X 添加 fp32 的 selective_state_update 配置

值得合入。PR 小而明确,数据充分,验证完整,是 MI300X Mamba 性能优化的一个干净补丁。建议读者关注 SSM kernel 调优流程和配置生成脚本,未来可为其他 AMD GPU 补充类似配置。

#47729 [Model] Support MOSS-Transcribe-Diarize

原始 PR · 作者 gcanlin · 合并时间 2026-07-08 19:05

功能 重要性 9.18 洞察度 6.00

支持 MOSS-Transcribe-Diarize 语音转写模型

值得精读。该 PR 展示了 vLLM 多模态模型中音频路线(转录)的完整集成模式,包括 TensorSchema 定义、MultiModalProcessor 实现、WeightsMapper 使用。review 中关于多音频并发正确性的发现具有普遍参考价值,建议关注类似模型中的 batch 处理模式。

功能 重要性 5.29 洞察度 3.00

为 /v1/completions 端点添加 bad_words 支持

值得合并,作为小而清晰的功能对等性补丁。建议阅读 `CompletionRequest` 模型中新增字段的位置以及 `to_sampling_params()` 中对应的传参行,以理解 vLLM 中如何将前端请求参数映射到内部采样参数。

功能 重要性 5.84 洞察度 3.00

为更多 CLI 参数添加人类可读整数支持

值得快速合入。设计上采用集合而非分散的元组判断,提高了可读性和可扩展性。关注点在于确保 `SchedulerConfig` 已正确接收并处理该参数(由于未提供完整代码,需上下游确认)。

参与讨论