Kimi-K3 在 ROCm 上默认启用 V2 model runner
建议阅读。该 PR 虽然代码量极小,但揭示了 V2 model runner 在特定平台与并发场景下的性能差距,值得关注后续的性能优化与回归复测。对维护者而言,应尽快为 ROCm + Kimi-K3 + V2 runner 建立自动化性能基准或测试,避免回归再次流入。
A high-throughput and memory-efficient inference and serving engine for LLMs
Kimi-K3 在 ROCm 上默认启用 V2 model runner
建议阅读。该 PR 虽然代码量极小,但揭示了 V2 model runner 在特定平台与并发场景下的性能差距,值得关注后续的性能优化与回归复测。对维护者而言,应尽快为 ROCm + Kimi-K3 + V2 runner 建立自动化性能基准或测试,避免回归再次流入。
修复 packed GDN decode 超大网格 CUDA 启动失败
值得精读。该 PR 展示了一个简洁的 Triton/CUDA 网格边界问题修复模式:用编译期常量切换二维/三维 grid,并保持常规路径不变。建议关注其后续是否补充 split 路径的数值正确性测试,以及 third_party 代码同步时的维护策略。
原始 PR · 作者 KurodaKanbei · 合并时间 2026-08-13 22:13
禁用 Dots3 NOTE 序列并行,修复 KV cache 分析崩溃
值得快速阅读,作为『父类重构后子类需显式导出新属性』的典型修复案例。改动小而精准,评审无争议;建议后续关注 DeepSeek V3.2 系列是否还有其他自定义初始化模型存在相同问题,并考虑为这类属性契约增加统一的默认值或测试覆盖。
Gemma4 多模态 LoRA 运行时管道与 token 计数接口
值得精读,重点看三处设计:一是 `get_mm_lora_token_counts` 如何用 `(tower_tokens, connector_tokens | None)` 统一不同模态的计数差异;二是 `models/gemma4_mm.py` 中图像 padding 与 LoRA mapping 对齐的取舍(禁用 bucketing 换正确性);三是 `model_manager.py` 按模态最大预算 size Punica wrapper 的做法。建议同时关注 `taroshi` 反馈的 `Gemma4ClippableLinear` 无法包装问题是否在后续 PR 修复,以及 `anshulkulhari7` 指出的 stub 返回 `None` 的健壮性缺口。
原始 PR · 作者 zexplorerhj · 合并时间 2026-08-13 21:46
Ling 混合量化 MXFP4 路由专家加载支持
该 PR 值得快速浏览,重点查看 `_configure_ling_fp8_quant_config` 的元数据解析和 `_LING_MXFP4_WEIGHTS_MAPPER` 正则设计。改动轻量且局限于模型加载路径,影响面可控。建议后续补充针对混量 checkpoint 的加载回归测试,并考虑在 `WeightsMapper` 注释中说明命名约定的来源。
原始 PR · 作者 ruirui6946 · 合并时间 2026-08-13 21:11
输出 token IDs 日志移至 DEBUG 级别,INFO 仅保留文本
值得快速阅读:其设计决策(复用既有 `log_inputs` 的级别拆分模式而非新增 CLI 标志)体现了最小化配置面的思路,对同类日志需求有参考价值;测试更新到位,新增了 DEBUG 开关的边界测试,是一个低风险的小特性。
原始 PR · 作者 vineetatiwari27 · 合并时间 2026-08-13 20:58
补全 outputs.py 中 from_base 与 __repr__ 返回类型注解
这是一个机械性、低风险的代码质量 PR,无需精读,但可关注其类型注解模式(字符串前向引用避免循环导入)以及签名换行规范,适合作为同类类型补齐工作的模板。
B70 新增 Mamba SSU 调优配置,修复 XPU 调优脚本
值得精读,重点看三个设计决策:float16 不复制 float32 而是独立调优(用数据说明精度对 kernel 最优解的影响)、以 10% 收益阈值决定是否采纳重调条目(防止 tuner 与模型 ngroups 不一致造成的过拟合)、以及把 torch.cuda.* API 迁移到 current_platform / torch.accelerator 的适配模式。对要在新硬件上做 kernel 调优的贡献者,这是一个完整可复制的流程:工具修复 → 搜索空间设计 → 权衡取舍 → 数值与 E2E 验证。
参与讨论