增量搜索减少思考标记预算开销
值得精读。尽管改动量小,但展示了如何通过增量计算将 O(n²) 变为 O(1) 平摊的经典优化模式,且 review 中关于切片 vs 逐元素比较的性能讨论提供了 Python 微优化的实际经验。建议在类似序列扫描场景中复用该模式。
A high-throughput and memory-efficient inference and serving engine for LLMs
增量搜索减少思考标记预算开销
值得精读。尽管改动量小,但展示了如何通过增量计算将 O(n²) 变为 O(1) 平摊的经典优化模式,且 review 中关于切片 vs 逐元素比较的性能讨论提供了 Python 微优化的实际经验。建议在类似序列扫描场景中复用该模式。
原始 PR · 作者 Liangliang-Ma · 合并时间 2026-06-24 22:56
修复 XPU 上 auto-fit 测试因 block_size 差异失败
该 PR 是一个典型跨平台兼容性修复,代码改动简单但说明了测试中隐含的硬件假设问题。值得关注的是,类似测试中若依赖默认值应该显式指定以确保可移植性。
原始 PR · 作者 yewentao256 · 合并时间 2026-06-24 22:45
将重复日志改为只打印一次
值得合并的小而美的清理变更。对日常用户无感知,但显著改善了启动日志体验。可作为后续类似日志治理的范例。
原始 PR · 作者 DarkLight1337 · 合并时间 2026-06-24 22:35
修复 FP8 MoE 在 NVIDIA Thor 上的回归
该 PR 是必要的回归修复,变更简洁、风险低。建议阅读以了解 FP8 MoE kernel 的架构兼容性管理方式,特别是设备能力检查与 CMake 架构列表的同步机制。
原始 PR · 作者 harsha20032020 · 合并时间 2026-06-24 22:35
文档更新:Qwen3.6 系列已支持 ViT CUDA Graph
该 PR 为纯文档更新,内容简洁清晰。建议快速合并以消除用户疑惑。
修复 AITER FP8 量化 schema 测试失败
建议合并。该 PR 解决了一个实际的 CI 问题,且修改审慎,通过使用共享工具和调整测试策略提高了测试的健壮性和可维护性。
V1 模型状态机增加多模态嵌入剪枝(EVS)支持
建议精读本 PR,特别是 `MultiModalPruner` 的设计——它将模型特定的嵌入后处理抽象为独立组件,避免在主路径中散落条件分支,提升了可扩展性。同时也展示了如何通过基类默认方法减少重复代码(`gather_mm_embeddings` 上提)。对于多模态推理工程师有参考价值。
AArch64 MoE 加速,启用 NEON BFMMLA 微 kernel
推荐架构师和性能工程师阅读。该 PR 展示了如何在 vLLM 的 CPU kernel 框架中高效添加新的 ISA 分支,其 pack 策略和宏调度设计值得在未来的 kernel 优化中复用。
参与讨论