修复全注意力模型被误判为滑动窗口的问题
此 PR 值得精读,尤其是 `is_interleaved` 函数的移除和内联实现,展示了如何避免共享函数因上下文不足导致的误判。适合作为微调配置逻辑的参考案例。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复全注意力模型被误判为滑动窗口的问题
此 PR 值得精读,尤其是 `is_interleaved` 函数的移除和内联实现,展示了如何避免共享函数因上下文不足导致的误判。适合作为微调配置逻辑的参考案例。
原始 PR · 作者 yewentao256 · 合并时间 2026-07-26 00:36
移除 MTP 额外通信,恢复 5% E2E 吞吐
值得精读,设计决策:将 all_gather 从独立的恢复函数移到 forward 中条件执行,通信时机更明确;deepseek_v32 中区分 SP/non-SP 路径并合理调整通信顺序,避免了额外 all_gather。可作为性能调优的参考案例。
修复 Mergify 对已取消 CI 任务发送评论的问题
该 PR 为简单配置调整,无需仔细审查,但对了解 vLLM 的 CI 工作流和 Mergify 配置有参考价值。
为DP+EP MoE部署添加容错框架(简化版)
值得精读,尤其是sentinel模式将FT状态与主逻辑分离、以及外部驱动恢复的设计。建议关注认证绕过和状态广播问题的跟踪解决。生产部署前必须加固API认证。对于仅使用vLLM标准部署的用户,此PR无直接影响。
修复 MOSS-TD 长音频被拒绝问题
建议阅读此 PR 以了解基于时长估算 token 的通用模式;对 MOSS-TD 用户来说这是关键修复。但需注意缺少测试,建议后续补充相应测试。
统一文档生成方式为 gen-files
值得精读,尤其是 `generated_content.py` 的设计和 `fill_markers` 的严格校验理念;涉及文档自动化的团队可学习 `gen-files` 插件的使用模式。
原始 PR · 作者 lengrongfu · 合并时间 2026-07-25 21:45
修复 MiniMax-M3 Triton 路径 top-k 缓冲区布局不一致
值得精读,尤其是布局不一致的调试思路和平台隔离技巧。后续可考虑统一布局,消除平台特判。
修复Jamba和InternLM2流式工具调用参数丢失bug
建议快速合并。修复针对性强,测试恰当,已被 reviewer 批准。此 PR 也是更早修复 #48755 的改进版本。
参与讨论