Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 23:04 同步状态:空闲 下次计划:2026-08-22 00:04

PR 列表

更多筛选
2026-05-24
缺陷修复 重要性 4.88 洞察度 3.00

修复 input_audio 含 uuid 时的解析错误

该 PR 值得快速合并,是一个典型的一行 bugfix,修复了多模态 API 的兼容性问题。对于关注多模态前端实现的开发者,可以精读 `_InputAudioParser` 类的实现(不在本次变更中但位于同文件中),了解 uuid 处理的设计模式。

2026-05-23
功能 重要性 7.02 洞察度 5.00

为 NVFP4 CUTLASS 添加 batch invariant 模式

此 PR 展示了在已有 GPU kernel 上安全添加确定性模式的优秀实践:通过条件编译、静态断言和显式的 TileScheduler 指定来防止未来意外 break。值得精读以了解 vLLM 的 batch invariance 设计和 CUDA kernel 重构方法。

功能 重要性 7.21 洞察度 6.00

为 Qwen3.5/3.6 VLM 添加 ModelOpt 量化前缀映射

值得阅读 `_quantized_layer_prefix_candidates` 的设计模式,该模式通过静态方法生成候选列表,优雅地解决了跨模型前缀命名差异问题,可复用于其他类似的前缀兼容性场景。

参与讨论