#45128 [Model] Remove InternLMForCausalLM registry alias
原始 PR · 作者 xianbaoqian · 合并时间 2026-06-12 04:02
移除 InternLMForCausalLM 注册别名
值得一读以了解 vLLM 模型别名弃用流程。展示了如何平衡向后兼容与清理遗留代码,包括使用 `_PREVIOUSLY_SUPPORTED_MODELS` 进行优雅降级。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 xianbaoqian · 合并时间 2026-06-12 04:02
移除 InternLMForCausalLM 注册别名
值得一读以了解 vLLM 模型别名弃用流程。展示了如何平衡向后兼容与清理遗留代码,包括使用 `_PREVIOUSLY_SUPPORTED_MODELS` 进行优雅降级。
修复Anthropic流式tool_use参数因分块丢失
该 PR 值得精读,尤其是对实现 API 流式转换的开发者。其核心设计决策是引入**缓冲 + 延迟刷出**机制,而不是在 stop_active_block() 内尝试区分参数与内容,保持了原有块停止逻辑的简洁。这种模式可以推广到类似需要暂存并发内容的场景。测试用例的构造也值得参考。
原始 PR · 作者 ricky-chaoju · 合并时间 2026-06-12 01:51
为 Rust 前端新增 continuous_usage_stats 流式选项
该 PR 清晰实现了所需功能,设计决策合理(去除 CLI 默认值、使用宏简化),测试覆盖充分。推荐合并,可作为 Rust 前端后续流式选项实现的参考模式。
原始 PR · 作者 wentian-byte · 合并时间 2026-06-12 00:39
修复 cuDNN FP8 ViT 注意力对 Blackwell 的误检
该 PR 是典型的边界条件修复,变更量小但诊断价值高,值得精读。它展示了如何通过逆向分析底层库(strings libcudnn)来定位根本原因的工程实践。对于维护多模态或 FP8 相关功能的工程师,应了解此门控逻辑,以及 cuDNN 内部多条 FP8 路径的差异。
原始 PR · 作者 xiaohongchen1991 · 合并时间 2026-06-11 23:59
新增 per_token_group_fp8_quant Helion 核函数,性能提升 1.15-1.45x
该 PR 补充了一个重要的量化核函数,设计清晰、测试完善,建议所有使用 Helion 内核优化的开发者仔细阅读 `register.py` 中的 `mutates_args` 用法和 `pick_config` 选择策略。特别关注 review 中提出的 `use_ue8m0` 未调优风险以及测试环境覆盖度不足的问题,可在后续 PR 中提改进。
精确化 vLLM 指标取消注册的范围
值得合并。改动虽小但解决了明确的兼容性问题,且经过充分讨论。建议合并后通知下游项目(vLLM-Omni)更新。
新增 Triton DiffKV 注意力后端,支持 MiMo-V2.5 在 Blackwell 上运行
该 PR 对于需要在非 Hopper/特定 Blackwell GPU 上运行 MiMo 模型的用户至关重要。动态 backend 选择逻辑设计干净,值得借鉴。建议阅读内核实现以了解 DiffKV 场景下的 Triton 编程技巧。review 中提出的 dtype 限制和 batch invariant 问题需在后续 PR 中修复。
KV cache 水位线减少抢占 82%
建议有高并发长输出场景的用户测试此参数;团队可将其作为调度准入控制的参考设计。
参与讨论