为 Qwen3.5 在 H20 上添加调优后的 MoE 配置
值得阅读,尤其是关注模型性能调优的工程师。PR 展示了如何通过自动调优结合基准测试来获得稳定的性能收益,是 vLLM 中模型特定配置的典型实践。
A high-throughput and memory-efficient inference and serving engine for LLMs
为 Qwen3.5 在 H20 上添加调优后的 MoE 配置
值得阅读,尤其是关注模型性能调优的工程师。PR 展示了如何通过自动调优结合基准测试来获得稳定的性能收益,是 vLLM 中模型特定配置的典型实践。
原始 PR · 作者 tanpinsiang · 合并时间 2026-07-13 10:27
为 MiniMax-M3 添加 ROCm AITER 稀疏分页注意力
值得精读,尤其关注 AITER paged attention 与 Triton 稀疏注意力的集成方式、KV 缓存布局兼容性处理以及 FP8 缩放因子传递的设计。展示了如何在 vLLM 中为特定硬件和模型组合添加自定义注意力后端,同时保持与通用框架的兼容。
原始 PR · 作者 tanish-malekar · 合并时间 2026-07-13 10:18
为ReLUSquaredActivation实现CUDA kernel
值得精读,展示了如何为 CustomOp 添加 CUDA kernel 并设计带有正确性验证的 Benchmark。评审中关于 XPU/IR 的讨论对跨平台开发有参考价值。
原始 PR · 作者 Alex-ai-future · 合并时间 2026-07-13 01:00
修复 reset_cache 后 transfer_jobs 残留导致请求永久卡住
值得精读两个点:1)单个字典未清理如何导致请求永久卡死——展示了分布式系统中状态一致性的微妙陷阱;2)reviewer 要求精简 PR(去掉注释、去掉测试)——反映了对小型修复追求最小变更的原则。
固定 Rust 前端 CI 工具版本号
该 PR 是标准 CI 基础设施改进,逻辑清晰,改动合理,可直接合并。建议团队后续建立定期更新工具版本的机制,避免版本固定后长期不更新。
为 EC Connector 添加 ec_transfer_params 传输管道
值得精读。该 PR 展示了如何在 vLLM 中新增一种跨节点传输参数(transfer params)的完整链路,从请求协议到调度、响应输出,并保持与已有 `kv_transfer_params` 模式一致。对于需要扩展相似功能的读者有很强的参考价值。review 中提出的高优先级问题应尽快修复。
CI 并行化 kernel 和 attention 测试,减少墙钟时间
值得合并。该 PR 是实现 CI 持续优化的重要步骤,改动极小且收益明确。建议后续关注各分片的实际耗时分布,必要时调整分片数量或方式。
原始 PR · 作者 liranschour · 合并时间 2026-07-12 18:10
使卸载区域 DP 副本感知,修复 multiprocessing 路径下 mmap 冲突
值得合并,修复了 DP 下 KV 卸载的关键冲突问题,设计决策清晰(复用已有 DP 感知的 engine_id)。建议关注 `create_worker` 中 rank 计算的假设是否普适,以及在非标准设备映射下的表现。
参与讨论