#48802 [Docs] fix error key name
原始 PR · 作者 lengrongfu · 合并时间 2026-07-16 11:16
修复 Kubernetes 部署文档中的错误参数名
该 PR 是常规文档修正,变更简单明确,可直接合并。建议在相似文档中全局检查参数名一致性。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 lengrongfu · 合并时间 2026-07-16 11:16
修复 Kubernetes 部署文档中的错误参数名
该 PR 是常规文档修正,变更简单明确,可直接合并。建议在相似文档中全局检查参数名一致性。
通过字符串格式化修复 LoRA 测试 flaky
该 PR 是典型的 flaky 测试修复,改动小而直接。对于关注 vLLM ROCm 测试稳定性的同学值得一读。建议在 Quark v0.12 发布后重新启用测试以验证修复。
为 ROCm 添加 int4 量化模拟 MoE 后端
值得精读,尤其是 `Int4EmulationTritonExperts` 的反量化设计模式(加载时一次性转换,前向保持纯浮点),以及如何无侵入地在现有路由系统中插入新后端。对需要在无原生 int4 内核平台上运行量化模型的场景有参考价值。
Triton MLA 添加 KV 缓存 dtype 硬件兼容性检查
该 PR 值得精读并合入。其实施方式与 Triton Attention 后端的检查一致(PR #43330),保证了代码的一致性。建议后续增加相应的单元测试以覆盖错误条件。
原始 PR · 作者 nemanjaudovic · 合并时间 2026-07-16 08:59
跳过带 dim 的 size() 节点,修复编译时 LoRA 崩溃
值得精读。本 PR 展示了一个典型的 FX 图编译边界问题修复过程,从错误的复杂方案最终收敛到最小改动方案。审查中的讨论体现了对 `torch.compile` 内部与 `torch.Size` 概念的理解。建议关注 `compilation` 模块的类似边界问题。
为 Step3VL 模型添加 Transformers v5.3 版本上限
值得精读,特别是对于参与 Transformers v5 升级的人员。此修复展示了如何处理上游 API 破坏性变更与 vLLM 内部 vendored 配置的关系,并强调了正确设置 `check_version_reason` 键的重要性。
将迭代细节日志从 EngineCore 移到前端统一输出
建议精读此 PR,尤其是数据流设计:EngineCore -> SchedulerStats -> EngineCoreOutputs -> LoggingStatLogger。其条件启用的开关设计和对多模态指标的模型无关处理方法值得参考。此外,编码器统计预计算位置的选择是一个值得关注的设计权衡。
原始 PR · 作者 majian4work · 合并时间 2026-07-16 08:59
为 DeepSeek-V4 添加 XPU DSpark 投机解码支持
值得精读,特别是 XPU 平台如何复用已有 MHC 自定义算子而非移植 tilelang 的设计决策。注意缺少测试覆盖,建议合并后尽快补充功能测试和性能基准。
参与讨论