修复 custom dataset 与 --skip-tokenizer-init 的兼容性
建议合入。修复明确,测试充分。类型签名调整值得关注,但已在合理范围内。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复 custom dataset 与 --skip-tokenizer-init 的兼容性
建议合入。修复明确,测试充分。类型签名调整值得关注,但已在合理范围内。
添加编码器缓存扩展钩子和配置
推荐阅读,尤其是需要了解在 vLLM 中如何以最小侵入添加平台级扩展点的工程师。设计模式(配置注入 + 保护钩子 + 元数据通道)值得在其他自定义组件中借鉴。
原始 PR · 作者 li-jinpeng · 合并时间 2026-07-24 16:53
跳过线性层 bias 的层间重载以避免数据损坏
该 PR 修复了一个关键但隐蔽的 bug,建议合并。虽然只改动了一行,但 root cause 分析详尽,值得精读以理解 layerwise-reload 机制的陷阱。
原始 PR · 作者 NickLucche · 合并时间 2026-07-24 16:41
修复 Push 模式下阻塞握手的性能问题
建议使用 NixlPush 模式的团队积极采用此修复,并优先在 staging 环境验证性能改善。PR 的异步握手设计模式值得借鉴,但需关注未来增加集成测试覆盖。
移除量化测试的并行分片配置
简单 CI 配置优化,无技术难度,可直接合并。但建议后续观察 CI 耗时变化,若串行运行导致 Pipeline 超时,需考虑其他优化方式(如减少测试范围或增加超时时间)。
GLM-5.2 Blackwell 解码优化及后续拆分
虽然该 PR 已被 revert,但其设计决策和优化技术值得精读: - **CuTeDSL fused Q 核**:如何利用 CuTe DSL 将多个小算子融合为单 kernel,减少全局内存往返。 - **PDL 的使用**:通过 GPU 硬件支持的依赖启动机制减少内核启动延迟,是 Blackwell 性能优化的关键之一。 - **bf16_skinny_gemm dispatch**:基于 shape 的 GEMM 调度策略,为小 M 问题选择定制实现,可作为类似场景的参考。 - **MTP 索引共享**:通过生命周期钩子实现在多步投机解码中复用预填充计算结果,减少冗余计算。 - **拆分策略**:从大型 PR 到多个聚焦 PR 的拆分模式,体现了如何管理高风险变更。 建议阅读该 PR 的 body(跟踪 checklist)和后续拆分 PR(#49790-#49793, #50230)的实现细节。
Transformers 升级到5.14.1
建议合并。常规依赖升级,已验证无破坏性影响。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-07-24 11:08
修复 IR 测试中设备显式传递问题
建议快速合并。这是一个 CI 稳定性修复,逻辑清晰,改动审慎。值得关注的设计决策是将全局状态依赖改为显式参数传递,这符合良好的测试实践。
参与讨论