Cosmos3 动作模式迁移至通用 Action API
值得精读。三个看点:① protocol.py 的 Cosmos3 特化分支(capabilities 位 + 请求降级函数)展示了如何在统一 TI2V 管线上叠加通用 Action API;② Cosmos3DecodingStage 的 ACTION 短路设计避免动作请求为视频产物付费;③ vla→action 全局重命名对模块边界的整理。若你在维护对外 API 或计划接入新动作产出模型,可复用这套模式。
SGLang is a high-performance serving framework for large language models and multimodal models.
Cosmos3 动作模式迁移至通用 Action API
值得精读。三个看点:① protocol.py 的 Cosmos3 特化分支(capabilities 位 + 请求降级函数)展示了如何在统一 TI2V 管线上叠加通用 Action API;② Cosmos3DecodingStage 的 ACTION 短路设计避免动作请求为视频产物付费;③ vla→action 全局重命名对模块边界的整理。若你在维护对外 API 或计划接入新动作产出模型,可复用这套模式。
解包 staging 注册字段,显式化 ZMQ frame 布局
值得快速浏览。该 PR 展示了"不要把固定位置的 wire 字段包装成 Optional 对象"的解析层设计取舍:显式标量 + 位置解析,使 frame 布局在 dataclass 构造处一目了然,同时保持行为严格等价。可重点对照两个 `from_zmq()` 的一致性维护方式,以及发送方(decode worker)侧是否已有对应的对称处理。
新增 output_tag,避免补丁镜像覆盖 nightly 发布
值得精读,尤其是 GitHub Actions 输入安全加固的写法:用 env 注入 inputs、case 做整串字符集校验、前缀白名单代替 denylist、持久 runner 上清理临时文件。若后续要扩展其他发布流程,这套模式可以直接复用。
支持 Mamba 组件增量备份到 Host,避免重复拷贝 Full KV
建议精读。该 PR 展示了如何在不改变整体备份框架的前提下,通过组件委托(`needs_incremental_backup`)实现细粒度的增量持久化,是理解 HiCache 组件化备份扩展点的关键样例。值得关注的设计决策:备份规格生成与执行解耦、用零长度 anchor 表达 component-only 备份、以及并发备份的 pending 防护。若你正在做多模态/状态模型的缓存持久化,可参考此模式。
Inkling-Small cookbook 的 DSPARK draft 路径更新为正式版
不值得精读。若读者准备在 Inkling-Small 上部署 DSPARK 投机解码,可顺带查看该 jsx 配置块中的完整 flag 集合(如 `--mamba-radix-cache-strategy extra_buffer`、`--mem-fraction-static 0.68`、`--speculative-draft-model-quantization unquant`),理解独立 draft 权重不占 FP4 目标配额的显存设计;除此之外无技术含量。
原始 PR · 作者 whybeyoung · 合并时间 2026-08-10 16:58
修复 HiSparse 下长请求被设备池容量误截断
值得精读。核心价值在于把分散的容量判断收敛为 `ModelRunner.max_token_pool_size` 单一出口,并同步修正 capturer 缓冲与 decode 准入两个消费点;测试中「用 `object.__new__(ModelRunner)` 构造裸实例让 property 描述符正常解析」的夹具技巧也值得借鉴。阅读时建议对照 #34345 了解未覆盖的 `max_req_len` / `init_req_max_new_tokens` 路径,形成完整的容量语义地图。
修复 DFLASH draft KV 池按层数估算的预算偏差
建议精读。该 PR 是“显式验证假设适用范围”的典型样例:沿用的层数比例只在 draft 复用 target attention config 时才成立,新实现改为从 draft 自身几何精确计算并在失败时优雅回退。值得关注的设计:`_resolve_dflash_draft_cell_size` 的启动期一次性解析与 `None` 回退契约、`_dflash_draft_cell_size` 作为两个 configurator 的统一门控 accessor、以及 `configure_kv_cache_dtype` 的 `model=None` 类型放宽。测试对 0 层与 None 回退均有覆盖,后续可补充端到端显存验证。
CI 安装不再清空 Torch 编译缓存,消除并发竞态
该 PR 是一个小而精准的基础设施修复,值得 CI 相关维护者关注。它体现了“缓存按内容哈希寻址则无需手动清理”这一设计原则,并利用注释记录决策原因,对后续维护者友好。建议合并,并可在未来的 CI 磁盘管理策略中再统一考虑缓存清理策略。
参与讨论