Rust 前端集成视频多模态并重构模态架构
值得精读,尤其对多模态扩展和 Rust 前端架构感兴趣的读者。注意 SSRF 风险需后续修复,架构设计(`ModalitySupport` + `PreparedMedia` + `expand_prompt_token_ids`)具有良好的可扩展性,可为将来添加新模态提供参考。
A high-throughput and memory-efficient inference and serving engine for LLMs
Rust 前端集成视频多模态并重构模态架构
值得精读,尤其对多模态扩展和 Rust 前端架构感兴趣的读者。注意 SSRF 风险需后续修复,架构设计(`ModalitySupport` + `PreparedMedia` + `expand_prompt_token_ids`)具有良好的可扩展性,可为将来添加新模态提供参考。
原始 PR · 作者 wendyliu235 · 合并时间 2026-07-10 15:56
新增 XPU 镜像的 nightly 和 release 发布流程
建议阅读此 PR 以了解 XPU 镜像发布流程的设计。如果团队计划增加其他硬件后端,可以参考此模式。值得关注的点是 `push-nightly-builds-xpu.sh` 中使用了 `docker manifest` 操作,以及如何在 pipeline 中组织依赖。
根据夜间CI数据调整所有测试域的超时时间
建议合并。该 PR 采用数据驱动方法精确调整超时,值得借鉴。未来可增加更频繁的自动调整机制。
原始 PR · 作者 chaojun-zhang · 合并时间 2026-07-10 15:40
XPU CI 启用 v1/sample 全量测试
该 PR 变更简单,适合快速合并。XPU 团队后续应关注 CI 执行情况,确保所有测试通过。
移除预分配缓冲,启用融合优化,提升 Qwen3.5 性能
值得精读,展示了一个常见的性能优化模式:移除临时缓冲区以解锁编译器融合。对于关注 Qwen3.5 模型或 PyTorch 编译优化的工程师有参考价值。
原始 PR · 作者 albertoperdomo2 · 合并时间 2026-07-10 15:34
支持 non-Harmony 模型 include_reasoning 参数
建议阅读该 PR 以理解 `include_reasoning` 的完整实现分层:解析器层负责抑制推理文本,serving 层负责抑制关联元数据。尤其关注 **元数据泄漏的修复提交**(如 `e6fdc09` 和 `23e716c`),以及 `depthfirst-app` 指出的多个安全边界。该设计可复用至其他需要按需过滤响应内容的场景。
原始 PR · 作者 GongLei-HW · 合并时间 2026-07-10 13:46
新增 full 模式报告 prefix 缓存复用 block 事件
这是一个设计干净、讨论充分的特性 PR。推荐后端和基础设施开发者精读,尤其是 `_build_block_stored_event` 的共享设计和 `resolve_block_hashes` 的提取过程,展示了良好的代码演进模式。对于使用 KV events 的外部项目(如 Dynamo、llm-d),建议关注此 PR 并测试 `full` 模式。
原始 PR · 作者 Yancey0623 · 合并时间 2026-07-10 12:34
DCP 支持混合注意力模型,非 DCP 层走本地缓存
值得精读。该 PR 是 DCP 支持混合注意力的关键里程碑,其中三处设计最值得关注:①把“分片 vs 复制”语义下沉到 `KVCacheSpec` 子类(`max_num_blocks_per_req`),解决 CP 缩放公式散落各处的问题;②rank-invariant 的 collective 门控原则(任何决定是否发起 DCP 通信的判定都必须基于全局、rank 无关的输入),这是分布式正确性的通用教训;③FA2 混合批次拆分的兼容性 workaround 思路。建议结合后续 #50823 一起阅读,观察该契约的演进。
参与讨论