用标准ModelOpt配置统一 Inkling NVFP4 量化
值得精读,展示如何通过统一配置接口消除重复逻辑。特别关注 `_normalize_quantization_config` 中 legacy 检测的设计——这是支持旧版 checkpoint 的关键。同时 `InklingMoE` 从 per-layer 定制走向全局 quant_config 的模式也值得参考。
A high-throughput and memory-efficient inference and serving engine for LLMs
用标准ModelOpt配置统一 Inkling NVFP4 量化
值得精读,展示如何通过统一配置接口消除重复逻辑。特别关注 `_normalize_quantization_config` 中 legacy 检测的设计——这是支持旧版 checkpoint 的关键。同时 `InklingMoE` 从 per-layer 定制走向全局 quant_config 的模式也值得参考。
原始 PR · 作者 wangxingda · 合并时间 2026-07-18 06:09
Beam search beam 合并 O(n²) → O(n)
此类小而明确的性能优化值得及时合并,可作为团队“注重性能”的文化示范。
修复 B200 上 rms_norm 内核 Triton 编译崩溃
低洞察价值但高修复必要性。建议合并,并考虑将上游 Triton bug(triton-lang/triton#10901)加入已知问题列表,以便在修复后评估是否恢复配置。
修复 prompt_logprobs 忽略 logprobs_mode 配置
建议阅读此 PR,特别是函数重命名和配置门控移除的设计决策。review 中关于命名、类型安全和测试覆盖的讨论值得关注。如果使用 `logprobs_mode` 功能,请验证 `processed_*` 模式是否符合预期。
修复macOS wheel注释缺少上下文参数
可直接合并,属于典型的常规 CI 修复。值得注意的设计决策是新增的上下文参数用于将注释归类到特定发布集合中,保持了 CI 脚本调用的统一性。
原始 PR · 作者 devalshahamd · 合并时间 2026-07-18 04:39
新增 graph capture 阶段 profiler 和详细 trace annotation 配置
建议仔细阅读 `gpu_model_runner.py` 中 `capture_model` 和 `_warmup_and_capture` 的改动,理解如何将 profiler 注入 capture 流程。`gpu_worker.py` 中 detailed annotation 的 roofline metric 计算方式值得参考。整体设计清晰,类型提示方面的讨论(`AbstractContextManager` vs `ContextManager`)也值得关注。
原始 PR · 作者 yewentao256 · 合并时间 2026-07-18 04:35
优化 DSV4 路由专用 kernel,TPOT 提升 2.94%
建议精读。该 PR 展示了如何使用 Triton 将多步计算融合为单一 kernel,并配合条件守卫实现优雅的快速路径回退。对于关心 MoE 路由性能的工程师是很好的学习案例。
改进 InstantTensor 加载:显示吞吐量并移除冗余克隆
建议合并。该 PR 是轻量级改进,提升了 InstantTensor 加载器的可用性和可观测性,同时简化了代码。值得关注的设计决策是使用 `copy=True` 来让底层库管理内存所有权,这避免了 vLLM 侧的冗余拷贝,是一个良好的协作模式。
参与讨论