为 KV 卸载持久缓存命名空间添加模型运行器标识
建议详细阅读该 PR 的 issue 讨论和测试代码,了解 KV 卸载缓存布局的差异及处理方式。核心设计决策(将 `parallel_agnostic` 纳入哈希字段而非引入独立标识)是值得借鉴的模式。
A high-throughput and memory-efficient inference and serving engine for LLMs
为 KV 卸载持久缓存命名空间添加模型运行器标识
建议详细阅读该 PR 的 issue 讨论和测试代码,了解 KV 卸载缓存布局的差异及处理方式。核心设计决策(将 `parallel_agnostic` 纳入哈希字段而非引入独立标识)是值得借鉴的模式。
原始 PR · 作者 athrael-soju · 合并时间 2026-07-26 12:08
让ColQwen3.5 checkpoint的注意力契约生效
值得精读。该 PR 展示了如何从硬编码假设转向显式数据契约,设计优雅且兼容多种训练范式。推荐关注 `verify_and_update_model_config` 的实现以及测试中对 `AttentionType` 的验证。
原始 PR · 作者 Achyuthan-S · 合并时间 2026-07-26 10:24
禁用 per-token-head 量化的跨层 KV 缓存布局
值得精读。本 PR 展示了如何通过一个门控修复跨组件不兼容,并体现了 Review 过程中从局部修复到统一修复的演进。对于维护者,守卫和注释是重要上下文,后续若要重新启用跨层优化需清除此守卫。
原始 PR · 作者 zhenwei-intel · 合并时间 2026-07-26 10:01
为 Intel GPU 添加异构 TP 测试
该 PR 可快速合并,变更简单透明。建议确认 4 卡 Intel GPU 资源在 CI 中充足,并关注后续 `run_xpu_disagg_accuracy_test.sh` 测试脚本是否兼容新环境变量。
用 jiwer 替换 evaluate 修复 WER 测试崩溃
这是一个直接且低风险的 bug 修复,值得快速合并。它解决了上游依赖不兼容导致的 CI 中断,且经过充分验证。无需精读,但值得关注如何通过直接使用底层库来消除间接依赖。
XPU batched MoE GEMM 新增 TD 加载路径,EP 场景吞吐翻倍
值得精读,尤其关注三处设计:TD 与 masked load 的性能差异机制及 gate 约束;三态开关的全局抽象(all-or-none 策略);向量化 dispatch/combine 与 per-expert 循环的取舍。建议合并顺序上先合 #45781(统一开关)再合本 PR,并跟进 #46871 合入后的 EP 端到端验证;后续补充量化路径的 TD 测试。
原始 PR · 作者 Palaiologos1453 · 合并时间 2026-07-26 04:58
推迟请求完成通知,防止KV卸载EngineCore崩溃
该 PR 修复了生产环境中的关键时序 bug,设计讨论体现了良好的信号集中化策略。值得阅读以理解 KV offloading 的请求生命周期管理。对于使用 KV offloading 的部署,建议尽快合入。
原始 PR · 作者 taneem-ibrahim · 合并时间 2026-07-26 04:53
用 ValueError 替换 assert 提升 DCP 配置验证
**值得合并**:这是对现有验证逻辑的清晰改进,消除了 `python -O` 下的安全缺口。建议快速合并后,由原作者或团队在后续 PR 中添加单元测试(例如使用 `pytest` 参数化覆盖三个无效场景),确保验证逻辑不被意外破坏。
参与讨论