为 ROCm 添加 int4 量化模拟 MoE 后端
值得精读,尤其是 `Int4EmulationTritonExperts` 的反量化设计模式(加载时一次性转换,前向保持纯浮点),以及如何无侵入地在现有路由系统中插入新后端。对需要在无原生 int4 内核平台上运行量化模型的场景有参考价值。
A high-throughput and memory-efficient inference and serving engine for LLMs
为 ROCm 添加 int4 量化模拟 MoE 后端
值得精读,尤其是 `Int4EmulationTritonExperts` 的反量化设计模式(加载时一次性转换,前向保持纯浮点),以及如何无侵入地在现有路由系统中插入新后端。对需要在无原生 int4 内核平台上运行量化模型的场景有参考价值。
Triton MLA 添加 KV 缓存 dtype 硬件兼容性检查
该 PR 值得精读并合入。其实施方式与 Triton Attention 后端的检查一致(PR #43330),保证了代码的一致性。建议后续增加相应的单元测试以覆盖错误条件。
原始 PR · 作者 nemanjaudovic · 合并时间 2026-07-16 08:59
跳过带 dim 的 size() 节点,修复编译时 LoRA 崩溃
值得精读。本 PR 展示了一个典型的 FX 图编译边界问题修复过程,从错误的复杂方案最终收敛到最小改动方案。审查中的讨论体现了对 `torch.compile` 内部与 `torch.Size` 概念的理解。建议关注 `compilation` 模块的类似边界问题。
为 Step3VL 模型添加 Transformers v5.3 版本上限
值得精读,特别是对于参与 Transformers v5 升级的人员。此修复展示了如何处理上游 API 破坏性变更与 vLLM 内部 vendored 配置的关系,并强调了正确设置 `check_version_reason` 键的重要性。
将迭代细节日志从 EngineCore 移到前端统一输出
建议精读此 PR,尤其是数据流设计:EngineCore -> SchedulerStats -> EngineCoreOutputs -> LoggingStatLogger。其条件启用的开关设计和对多模态指标的模型无关处理方法值得参考。此外,编码器统计预计算位置的选择是一个值得关注的设计权衡。
原始 PR · 作者 majian4work · 合并时间 2026-07-16 08:59
为 DeepSeek-V4 添加 XPU DSpark 投机解码支持
值得精读,特别是 XPU 平台如何复用已有 MHC 自定义算子而非移植 tilelang 的设计决策。注意缺少测试覆盖,建议合并后尽快补充功能测试和性能基准。
优化DSv4稀疏注意力 prefill 内核约2倍
建议合并。该 PR 以极小的代码改动(+10/-3)实现了显著的性能提升,且经过充分验证(gsm8k 精度达标,E2E 基准测试全面改善)。值得关注的设计决策:手动管理 num_warps 以平衡并行度与同步开销,以及通过移除冗余 mask 来优化软件流水线。
修复本地投机模型名含点号被误判为自定义类路径
该 PR 修复了一个具体且易于复现的配置解析 bug,代码改动量小且逻辑清晰。建议阅读 `vllm/config/speculative.py` 中的 `_is_custom_proposer_path` 方法,其设计可以作为如何稳健判断导入路径的参考。建议后续为该静态方法补充单元测试,以覆盖各种边界情况(如 `None`、URL、含 `/`、合法导入路径、包含点号的本地目录名等),增强代码的健壮性。
参与讨论