Kimi-K3 B300 测试小增强:缩短 CI 预估时长并更新配方参数
本 PR 为纯测试配置调整,不值得精读。若关注 Kimi-K3 B300 配方演进,建议将本 PR 与 #33612 一起查看,可观察到“文档配方 — CI 测试 — 底层实现”三者的同步演化模式;另外 est_time 随实测收敛的做法也值得在 CI 维护中借鉴。
SGLang is a high-performance serving framework for large language models and multimodal models.
Kimi-K3 B300 测试小增强:缩短 CI 预估时长并更新配方参数
本 PR 为纯测试配置调整,不值得精读。若关注 Kimi-K3 B300 配方演进,建议将本 PR 与 #33612 一起查看,可观察到“文档配方 — CI 测试 — 底层实现”三者的同步演化模式;另外 est_time 随实测收敛的做法也值得在 CI 维护中借鉴。
提取 rust-ext 下载操作,CI 安装回退到缓存
值得精读,特别是 download-rust-ext 的“artifact 优先、cache 兜底”设计,以及用 outputs.hit 门控工具链安装的思路。对维护大型 GitHub Actions 的团队有参考价值,可迁移到其他需要“预构建产物 + 缓存回退”的场景。
升级 ROCm 镜像 MORI pin,修复 EP16 分离启动不稳定
该 PR 适合快速浏览,重点不在代码而在上下游联动:阅读 ROCm/mori#493 可理解 bootstrap 超时为何是启动不稳定的根因。值得关注的设计决策是让默认超时从约 10 秒提升到 300 秒,并统一四个超时点,这是分布式 bootstrap 超时配置的一个合适示例。若团队维护 AMD/ROCm 镜像,应留意多节点验证补跑。
澄清 post-capture KV 预留日志,区分 VA 上界与物理分配
不值得精读,属于低风险日志澄清;关注点在于 post-capture KV 定容与虚拟地址预留的语义区分。可以作为观察 mem_cache 模块日志演进的参考。
修复 Laguna 分层头数致 LoRA 生成崩溃
值得精读。该 PR 展示了在非均匀 per-layer 注意力几何下如何正确扩展 LoRA 维度解析:提取公共 fallback 函数、在模型类实现按层 hook、并让所有非注意力模块委托回公共逻辑。review 中关于“错误的 fallback 比显式报错更危险”的讨论对错误处理设计有普遍启发;新增的 hermetic 测试(用真实 config 构造 fake model)也是很好的单测实践。后续可关注是否应将 per-layer 维度解析能力下沉到通用层,减少各模型重复实现。
原始 PR · 作者 JustinTong0323 · 合并时间 2026-08-05 05:45
聊天模板参数校验移入通用验证处理器
不建议精读(改动仅 13 行、行为等价);若关注 ServerArgs dispatcher 设计约定,可结合 PR #29579 一并阅读,重点体会“handler 命名要表达阶段而非 feature”“一次性校验收进通用处理器”两条约定。合并前 CI 的 extra 任务曾失败并触发重跑,建议观察合并后近期 CI 是否稳定,确认与本 PR 无关。
为 Laguna 模型与配置添加 codeowner,自动路由审查
可快速浏览,不值得精读。对仓库维护者来说,这是完善 CODEOWNERS 覆盖的合理小改动,符合仓库已有的 per-model 先例;可关注后续是否有更多模型文件加入 codeowner,以及 configs 目录级覆盖是否值得引入。
原始 PR · 作者 merrymercy · 合并时间 2026-08-05 04:23
乐观预填充兼容 L2 分层缓存写回策略
值得快速阅读:改动极小但揭示了乐观预填充与分层缓存写入策略之间的一致性契约。关注点:一是 `hicache_write_policy` 默认值为 `write_through`,因此不显式改配置就不会放开;二是未来 write_back 发布语义变化时需要重新评估该 guard。希望后续有对应单元测试补齐。
参与讨论