Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 21:57 同步状态:空闲 下次计划:2026-08-21 22:57

PR 列表

更多筛选
2026-05-06
功能 重要性 7.28 洞察度 4.00

增强 Responses API 输入项验证,自动补全缺失字段

值得精读以理解如何在 Pydantic 模型中使用 `model_validator` 预处理复杂联合类型。该 PR 展示了通过前置预处理将裸 dict 转换为结构化的 OpenAI 对象,从而绕过 Pydantic 联合解析限制的桥接模式。

#41453 [CI] Route part of B200 jobs to b200-k8s

原始 PR · 作者 khluu · 合并时间 2026-05-06 10:00

基础设施 重要性 3.97 洞察度 2.00

将 B200 CI 作业路由到 Kubernetes 集群

建议 CI 维护者重点关注新运行器上的测试通过率,尤其是需要多 GPU 的作业。同时可考虑采纳 review 评论中的建议,显式声明 `num_devices` 以避免资源分配问题。对于其他后续迁移工作,可参考本 PR 的分批验证策略。

#40415 [CI] Automate Docker Hub release image publishing

原始 PR · 作者 khluu · 合并时间 2026-05-06 08:15

基础设施 重要性 5.62 洞察度 5.00

自动化 Docker Hub 发布镜像流程

建议 DevOps 和 CI 工程师精读此 PR,尤其是 review 中关于 shell 脚本错误处理、竞争条件和依赖管理的讨论。这些模式在自动化发布流程中非常典型,值得借鉴。发布负责人应关注 PyPI 上传问题是否被后续修复。

#39213 Fix DeepGEMM ep_scatter output address overflow

原始 PR · 作者 S1ro1 · 合并时间 2026-05-06 02:56

缺陷修复 重要性 5.85 洞察度 5.00

修复 DeepGEMM EP scatter 输出地址 32-bit 溢出

建议合入。该修复精准解决了长序列下 EP scatter 的地址溢出 bug,改动最小且经过本地验证。值得关注的是其设计原则:在保证正确性的前提下,仅扩宽必要的计算路径,避免全局 int64 带来的性能损失。对于使用 DeepGEMM 的 MoE 模型维护者可以精读此 PR。

参与讨论