删除 Cohere parser 中冗余的 prepare_structured_tag 覆写
此 PR 清理干净,逻辑正确,可以安全合并。
A high-throughput and memory-efficient inference and serving engine for LLMs
删除 Cohere parser 中冗余的 prepare_structured_tag 覆写
此 PR 清理干净,逻辑正确,可以安全合并。
原始 PR · 作者 yewentao256 · 合并时间 2026-06-19 08:36
修复 MRv2 内存泄漏测试,调大 warmup 轮次
修改合理且安全,无需深入分析。可快速合并。
修复空 tool block 导致后续内容被丢弃的 bug
建议立即合并。该 PR 修复了在实际使用中已触发的严重 bug(输出截断),变更范围小,测试充分。关注其修复模式(状态机增加边缘 case 转移 + 引擎层条件放宽)值得在类似解析器中推广。
原始 PR · 作者 ByteFlowing1337 · 合并时间 2026-06-19 06:24
移除 reasoning/ 下未使用的日志器
可安全合并。建议类似清理在其他模块推广。
禁用 DCP>1 时 Mooncake TP put-striding 避免 key 丢失
值得阅读并理解 DCP 与 TP 交互的设计取舍。对于维护分布式推理管线的团队,应关注类似 namespace 隔离问题。PR 附带良好的测试实践,值得参考。
异步 Mooncake 缓存查找,减少调度开销
值得精读,尤其关注 `LookupKeyClient` 如何利用 `ThreadPoolExecutor` 实现非阻塞 RPC,以及调度器通过返回 `None` 与重试机制配合的实现模式。对于需要将同步 I/O 异步化的类似场景,本 PR 提供了一个简洁的参考样板。
自动检测模板是否支持中间 system 消息,兼容 Qwen 强制 system-first 模型
该 PR 值得精读,尤其是自动检测策略和 Jinja 沙箱的使用。设计上避免了模板配置爆炸,使服务器自适应。代码改动量小,测试覆盖充分。可作为 vLLM 处理用户自定义模板兼容性的参考模式。
原始 PR · 作者 WoosukKwon · 合并时间 2026-06-19 03:42
使用 log1p(-u) 提高 FP32 Gumbel 采样精度
值得精读。该 PR 展示了通过数值变换解决浮点精度限制的精巧优化,适用于所有使用 Gumbel-max 采样的场景。推荐关注 MRV2 演进的同学阅读。
参与讨论