Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 19:35 同步状态:空闲 下次计划:2026-08-21 20:35

PR 列表

更多筛选
2026-06-25

#46101 [Bugfix] Normalize slashes in Helion GPU names

原始 PR · 作者 cyq1017 · 合并时间 2026-06-25 07:22

缺陷修复 重要性 4.71 洞察度 3.00

修复 Helion GPU 名称中的斜杠未归一化问题

该 PR 属于小范围 bugfix,变更简洁,测试覆盖了关键路径。建议快速合并。对于审核者,可关注正则表达式是否需引入 `regex` 库(与标准库 `re` 的差异)以及未来是否需支持更多 Unicode 分隔符。

缺陷修复 重要性 9.17 洞察度 6.00

修复 legacy Triton MoE 路由对非2次幂 top_k 的编译错误

值得精读,尤其是对 Triton JIT kernel 的 padding 技巧和 monkey-patching 策略感兴趣的同学。对于 MLE 和内核工程师,了解如何在不修改第三方库的情况下处理编译时约束有参考价值。

缺陷修复 重要性 8.63 洞察度 5.00

修复 Kimi K2 required tool choice ID 格式

**值得精读**。该 PR 展示了一次典型的"逻辑下沉+清理"重构:将特定模型的 ID 格式策略从高层服务移到低层 parser,使代码职责更单一、便于测试。新增的 `count_history_tool_calls` 系列函数设计通用,可用于未来其他模型。对于关注工具调用流程或 parser 架构的开发者来说,这是一个很好的设计决策参考。

功能 重要性 7.90 洞察度 6.00

支持 DCP + FP8 KV Cache 在 MLA 解码中协同

值得精读:展示了 DCP 与量化在 MLA 架构下的协同设计,特别是 head 计数修正对性能的影响。测试方法也值得借鉴。

参与讨论