Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42

PR 列表

更多筛选
2026-05-03
2026-05-02
基础设施 重要性 5.04 洞察度 4.00

切换 CUDA 13.0 wheel 构建至 manylinux_2_28 基础镜像以兼容旧系统

值得精读。Dockerfile 中基于 BUILD_OS 的条件分支模式清晰展示了如何在同一构建流程中支持不同 OS 家族,可作为后续迁移其他 CUDA 版本的参考。同时建议跟进 jikunshang 关于稳定镜像标签的提议以增强构建可复现性。

重构 重要性 8.38 洞察度 4.00

Step3Text 权重加载改用 AutoWeightsLoader

建议合并。该 PR 是 #15697 标准化工作的一部分,结构清晰,作者已验证编译和导入。CI 通过后即可合并。阅读者可关注 AutoWeightsLoader 在 PP 下的行为以及该模式如何简化模型加载代码。

#41358 [Doc] Add Codex usage example

原始 PR · 作者 chaunceyjiang · 合并时间 2026-05-02 13:27

文档 重要性 3.77 洞察度 3.00

新增 Codex 集成使用文档

该 PR 是纯文档新增,内容结构清晰,但示例命令中存在遗留问题(模型名、参数)需要 fix。建议在后续 PR 中更新模型名为实际存在的版本,并补全 `--served-model-name` 等必要参数,同时修复 Codex 链接。值得参考其清晰的文档结构和配置说明。

功能 重要性 9.36 洞察度 7.00

为vLLM IR引入maybe_inplace重载并移植fused_add_rms_norm

值得精读,尤其关注 `maybe_inplace` 的设计模式、函数化处理方案以及在多平台间保持语义一致性的做法。对编译器开发者有重要参考价值。

参与讨论