#43488 [Docs] Fix stale version number in token_embed.md
原始 PR · 作者 fuergaosi233 · 合并时间 2026-05-24 01:06
更新 token_embed.md 中已废弃的版本号
建议合并,保持文档与代码实际状态的同步,避免用户困惑。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 fuergaosi233 · 合并时间 2026-05-24 01:06
更新 token_embed.md 中已废弃的版本号
建议合并,保持文档与代码实际状态的同步,避免用户困惑。
原始 PR · 作者 huanghua1994 · 合并时间 2026-05-24 00:08
为 Qwen2.5-VL 视觉注意力启用 FlashInfer 元数据支持
值得精读,尤其是涉及多模态模型注意力后端切换的开发者。设计上通过 Optional 参数和 padding size 区分不同后端,方法可以借鉴。
修复 input_audio 含 uuid 时的解析错误
该 PR 值得快速合并,是一个典型的一行 bugfix,修复了多模态 API 的兼容性问题。对于关注多模态前端实现的开发者,可以精读 `_InputAudioParser` 类的实现(不在本次变更中但位于同文件中),了解 uuid 处理的设计模式。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-05-23 23:31
删除 ROCm CI benchmark 组并分片长测试组
纯 CI 配置变更,无需深入精读;如需调整 ROCm CI 测试分组和分片策略,可参考此 PR 的实现方式。
为 NVFP4 CUTLASS 添加 batch invariant 模式
此 PR 展示了在已有 GPU kernel 上安全添加确定性模式的优秀实践:通过条件编译、静态断言和显式的 TileScheduler 指定来防止未来意外 break。值得精读以了解 vLLM 的 batch invariance 设计和 CUDA kernel 重构方法。
修复 NVIDIA Eagle3 检查点 norm_before_fc 配置解析
值得精读:小但关键的 bugfix,展示了配置兼容性处理的模式。对理解 Eagle3 配置加载有帮助。
原始 PR · 作者 lucifer1004 · 合并时间 2026-05-23 14:23
修复 KV connector 延迟释放时调度器活性中断
值得精读,展示了调度器活性设计与异步连接器的交互边界。
为 Qwen3.5/3.6 VLM 添加 ModelOpt 量化前缀映射
值得阅读 `_quantized_layer_prefix_candidates` 的设计模式,该模式通过静态方法生成候选列表,优雅地解决了跨模型前缀命名差异问题,可复用于其他类似的前缀兼容性场景。
参与讨论