#47132 [Misc] Mistral label alert
原始 PR · 作者 NickLucche · 合并时间 2026-06-30 17:02
更新 Mistral 标签告警成员列表
该 PR 为简单配置维护,无需精读。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 NickLucche · 合并时间 2026-06-30 17:02
更新 Mistral 标签告警成员列表
该 PR 为简单配置维护,无需精读。
原始 PR · 作者 bigPYJ1151 · 合并时间 2026-06-30 15:59
为 CPU 测试依赖添加 pre-commit 自动编译钩子
值得精读。该 PR 展示了一种多平台依赖管理的实用模式——通过 pre-commit 钩子和 `uv pip compile` 的 `--torch-backend` 参数,从单一源文件生成多平台锁文件,极大降低了维护成本。特别适合有多个硬件后端的项目参考。
修复 Harmony 模型 function_call 状态为 null 的问题
值得合并。该 PR 修复了一个明确的合规性问题,变更小、测试完备、无副作用。阅读者可以重点关注 `_parse_function_call()` 函数的构造模式,理解 Harmony 适配层的实现方式。
原始 PR · 作者 chaunceyjiang · 合并时间 2026-06-30 15:53
新增 Kimi K2 流式解析引擎和 Parser
值得精读。该 PR 展示了如何基于 ParserEngine 构建新模型解析器,并成功将旧的独立解析器迁移到统一框架,对后续模型支持有示范作用。
原始 PR · 作者 chaojun-zhang · 合并时间 2026-06-30 15:27
优化 XPU Worker 关闭逻辑,防止资源泄漏
此 PR 对于在 Intel XPU 上部署 vLLM 的用户是必须合入的修复,建议详细阅读 `xpu_worker.py` 和 `gpu_model_runner.py` 的 shutdown 实现,理解跨平台资源清理的设计模式。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-06-30 14:59
修复 ROCm Ray 权重传输 GPU 可见性问题
该 PR 属于 ROCm 平台特定 bugfix,值得相关平台开发者阅读,特别是 `_weight_transfer_ray_env_vars` 函数的设计可作为处理 ROCm+Ray GPU 可见性问题的通用模式。
原始 PR · 作者 umarkovi-amd · 合并时间 2026-06-30 14:47
修复 ROCm 上 unquantized MoE 权重 padding 被破坏的回归
值得合并的精准 bugfix。设计决策(依赖平台和 env 标志做条件判断)清晰且最小侵入。
原始 PR · 作者 jikunshang · 合并时间 2026-06-30 14:39
替换 torch.cuda.mem_get_info 为 torch.accelerator.get_memory_info
强烈推荐阅读此 PR,尤其是 shm.py 中的 CPU 兼容性补丁设计,以及如何平衡迁移进度与兼容性。后续应继续替换其他 backend 的 mem_get_info,并增加跨平台测试。该 PR 也展示了在 torch.accelerator 原生支持不足时,通过运行时补丁优雅降级的模式。
参与讨论