#22894 fix(hicache): emit KV events for L2 host cache insertions
原始 PR · 作者 ishandhanani · 合并时间 2026-04-21 10:07
修复 HiCache L2 主机缓存插入时缺失 KV 事件发射的问题。
建议技术管理者和工程师精读此 PR,关注设计决策如存储介质枚举化和事件发射时机的优化。这些模式展示了如何扩展事件系统以支持多级缓存,对于类似事件驱动的架构有借鉴价值。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 ishandhanani · 合并时间 2026-04-21 10:07
修复 HiCache L2 主机缓存插入时缺失 KV 事件发射的问题。
建议技术管理者和工程师精读此 PR,关注设计决策如存储介质枚举化和事件发射时机的优化。这些模式展示了如何扩展事件系统以支持多级缓存,对于类似事件驱动的架构有借鉴价值。
原始 PR · 作者 ChangLiu0709 · 合并时间 2026-04-21 09:17
修复Qwen3.5 MoE模型在AMD平台使用推测解码时与基数树缓存的冲突,提升开箱即用性。
该PR值得精读,因为它展示了如何在多平台环境中优雅处理硬件限制导致的配置冲突。关注点在于`is_hip()`的使用和错误处理的设备感知设计,这对跨平台开发有借鉴意义。
将页面对齐逻辑重构为 RadixKey 类方法,统一缓存 API 并提升封装性。
值得精读,特别是关注 `RadixKey.page_aligned` 方法的设计和其在各缓存类中的集成方式,这体现了面向对象封装的优势。同时,提交历史中的返工展示了 API 设计迭代的过程,对理解技术决策有价值。
原始 PR · 作者 wisclmy0611 · 合并时间 2026-04-21 07:48
更新 CODEOWNERS 文件,为 docs 和 docs_new 目录添加文档负责人。
该 PR 变更简单,无需精读。对于技术管理者,可以关注其作为文档维护流程规范化的一个步骤。对于工程师,只需知晓文档目录的代码所有者已更新即可。
修复 CUDA Graph 推测解码扩展中隐藏状态更新逻辑,防止批次过大时内存访问越界。
建议精读该 PR,重点关注 `can_cuda_graph` 分支的设计,它展示了在 CUDA Graph 优化路径中处理运行时条件的模式。同时,注意作者在 PR 描述中提出的隐藏状态逻辑疑虑,这可能指向未来需要改进的设计决策。
为EAGLE推测解码工作者添加从磁盘和IPC更新权重的支持。
建议技术管理者关注此PR以理解推测解码模块的权重更新扩展。工程师可精读`multi_layer_eagle_worker_v2.py`中的循环更新逻辑,学习如何处理多步骤草案运行器;同时,注意review中讨论的参数传递问题,确保类型安全,并关注后续测试补充。
修复多层级EAGLE推测解码中预填充和解码阶段token池引用不一致的问题。
该PR值得快速浏览,重点关注token池引用一致性的设计决策。虽然变更小,但揭示了在多层推测解码中管理状态(如token池)的常见陷阱,对于理解EAGLE架构和避免类似bug有借鉴意义。
修复 GLM-5-MXFP4 模型在 quark 量化下 MTP 层权重加载的形状不匹配问题。
该 PR 值得精读,重点关注 DeepSeek NextN 模型初始化中量化配置的动态处理策略,以及 `ReplicatedLinear` 与 `nn.Linear` 在权重加载上的设计差异。建议结合 quark 量化模块的文档,理解 FP4-packed 格式的兼容性要求。
参与讨论