Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-05-29
性能优化 重要性 8.42 洞察度 6.00

优化 Rust 前端多模态提示扩展性能,最高 7.3x 加速

建议精读本 PR,尤其是从 splice 转向预分配单次遍历的优化模式,这对理解向量操作在性能敏感路径上的设计很有价值。同时也展示了如何利用 benchmark 数据驱动决策,以及及时清理临时文件保持代码质量。

#43356 Add Cosmos3 Reasoner model

原始 PR · 作者 MaciejBalaNV · 合并时间 2026-05-29 00:43

功能 重要性 8.29 洞察度 5.00

新增 Cosmos3 Reasoner 模型支持

此 PR 是模型集成的良好范例,展示了如何通过 WeightsMapper 和 secondary_weights 机制快速适配非标准 checkpoint 格式。其中的权重映射模式设计值得学习和参考。推荐在引入其他类似架构(如混合双塔模型)时参考此实现。

#43136 [ROCm] Bump ROCm to 7.2.3

原始 PR · 作者 micah-wil · 合并时间 2026-05-29 00:42

基础设施 重要性 3.79 洞察度 3.00

ROCm 7.2.3 升级,移除 profiler hotfix

值得快速审阅并通过,该 PR 是常规的平台依赖升级,逻辑清晰、改动集中,且经过充分验证。

功能 重要性 8.05 洞察度 5.00

为Intel XPU添加W4A16 INT4 MoE支持

值得精读,尤其是WNA16 oracle的可扩展设计(通过枚举和优先队列选择后端)以及XPUExpertsWNA16如何以最小改动集成到现有FusedMoE框架。关注`_process_weights_xpu`的布局转换逻辑和`apply`中的assert条件设计。

2026-05-28
缺陷修复 重要性 7.51 洞察度 6.00

修复 Ray DP 多 API-server 场景因端口分配导致挂起的 bug

值得精读以理解不同后端对地址分配机制的限制。设计清晰:后续若增加新后端,需类似评估其对延迟分配的兼容性。测试设计精巧,避免 GPU 依赖,可重复运行。

性能优化 重要性 4.37 洞察度 6.00

移除 Mamba SSD 内核死参数,TTFT 降低 17%

建议仔细审查以确保所有内核的 `seqlen` 参数均已移除,并考虑在类似内核中检查其他可能引发重编译的整型参数。

参与讨论