Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 21:57 同步状态:空闲 下次计划:2026-08-21 22:57

PR 列表

更多筛选
2026-06-19
缺陷修复 重要性 5.92 洞察度 5.00

修复空 tool block 导致后续内容被丢弃的 bug

建议立即合并。该 PR 修复了在实际使用中已触发的严重 bug(输出截断),变更范围小,测试充分。关注其修复模式(状态机增加边缘 case 转移 + 引擎层条件放宽)值得在类似解析器中推广。

缺陷修复 重要性 6.33 洞察度 5.00

禁用 DCP>1 时 Mooncake TP put-striding 避免 key 丢失

值得阅读并理解 DCP 与 TP 交互的设计取舍。对于维护分布式推理管线的团队,应关注类似 namespace 隔离问题。PR 附带良好的测试实践,值得参考。

性能优化 重要性 8.23 洞察度 6.00

异步 Mooncake 缓存查找,减少调度开销

值得精读,尤其关注 `LookupKeyClient` 如何利用 `ThreadPoolExecutor` 实现非阻塞 RPC,以及调度器通过返回 `None` 与重试机制配合的实现模式。对于需要将同步 I/O 异步化的类似场景,本 PR 提供了一个简洁的参考样板。

缺陷修复 重要性 7.10 洞察度 6.00

自动检测模板是否支持中间 system 消息,兼容 Qwen 强制 system-first 模型

该 PR 值得精读,尤其是自动检测策略和 Jinja 沙箱的使用。设计上避免了模板配置爆炸,使服务器自适应。代码改动量小,测试覆盖充分。可作为 vLLM 处理用户自定义模板兼容性的参考模式。

缺陷修复 重要性 7.27 洞察度 7.00

使用 log1p(-u) 提高 FP32 Gumbel 采样精度

值得精读。该 PR 展示了通过数值变换解决浮点精度限制的精巧优化,适用于所有使用 Gumbel-max 采样的场景。推荐关注 MRV2 演进的同学阅读。

参与讨论