Rust 前端多模态张量改走 ZMQ 辅助帧消除大拷贝
该 PR 值得精读,特别是 `PodVec` 零拷贝设计和分层提取模式(`extract_aux_frames` 递归),可作为 Rust 下高性能数据传输的参考。关注 `Bytes::from_owner` 的使用和阈值可配置的实践。建议在部署时测试默认阈值是否适合典型多媒体配置。
A high-throughput and memory-efficient inference and serving engine for LLMs
Rust 前端多模态张量改走 ZMQ 辅助帧消除大拷贝
该 PR 值得精读,特别是 `PodVec` 零拷贝设计和分层提取模式(`extract_aux_frames` 递归),可作为 Rust 下高性能数据传输的参考。关注 `Bytes::from_owner` 的使用和阈值可配置的实践。建议在部署时测试默认阈值是否适合典型多媒体配置。
原始 PR · 作者 stefankoncarevic · 合并时间 2026-07-29 20:15
修复 pooling truncation 测试异常类型不匹配
简单但必要的测试修复,值得快速合入以恢复 CI 稳定性。关注 PR #49665 引入的异常层次变化,确认其他类似测试是否需要同步调整。
原始 PR · 作者 yintong-lu · 合并时间 2026-07-29 18:59
XPU 无权重 RMSNorm 路由至 _C 内核
值得精读,作为 XPU 平台性能优化的小而精范例。展示了如何在外围库能力就绪后,干净地移除旧 fallback,简化代码并提升性能。
Fused kernel 支持 Mamba DS-conv 多 token 对齐迁移
值得精读。该 PR 展示了如何在 Triton kernel 中通过 `HAS_IDX_MAPPING` 编译期分支统一支持 V1/V2 两种 runner 布局,设计决策清晰。同时体现了为满足 MTP 多 token 接受而必须处理 DS layout 行感知偏移的底层细节。测试覆盖了 SD/DS 布局、单/多 accept token、V1/V2 等价性,具有参考价值。
原始 PR · 作者 guan404ming · 合并时间 2026-07-29 18:48
修复多模态缓存哈希忽略 media IO 配置导致的碰撞
此 PR 修复了多模态缓存的关键一致性问题,设计上采用“仅在改变时附加”的轻量方案,避免对未使用 IO 配置的路径引入开销。建议合并,并关注后续 `io_config` 在其他模态(如视频)的扩展。
CPUOffloadingSpec worker 改用 SharedOffloadRegion mmap 替代私有 tensor
值得精读,尤其是 `create_worker` 的改造思路——用共享 mmap 替换私有 pinned tensor 在大型部署中很典型,也展示了为未来功能预留扩展点的设计方法。
原始 PR · 作者 fallintoplace · 合并时间 2026-07-29 17:52
修复性能基准 JSON 配置格式错误
值得快速合并,属于高频阻塞型 bugfix。关注其中对预发布流程的教训:未来修改 benchmark 配置应确保 JSON 合法性校验被纳入 CI 流程。
原始 PR · 作者 cinnamonica02 · 合并时间 2026-07-29 17:21
Rust 前端新增 --limit-mm-per-prompt 限制多模态输入数量
该 PR 是 Rust 前端功能对齐的重要里程碑,设计上考虑了与 Python 的兼容性、类型安全和可扩展性。评审讨论深入,值得团队精读,尤其是数据类型的序列化策略和跨 crate 数据传递模式。
参与讨论