#27817 [AMD] ci: register 8 attention-backend unit tests to run on AMD CI
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-06-13 11:52
在 AMD CI 注册 8 个注意力后端单元测试
值得合并。变更模式清晰,验证充分,两条 AMD 流水线均通过。建议后续关注 PCG 在 ROCm 上的进展并及时恢复跳过。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-06-13 11:52
在 AMD CI 注册 8 个注意力后端单元测试
值得合并。变更模式清晰,验证充分,两条 AMD 流水线均通过。建议后续关注 PCG 在 ROCm 上的进展并及时恢复跳过。
Ray 最低版本提升至 2.55.1
该 PR 为常规依赖更新,不需深入阅读,但 RDT 支持是值得关注的新特性线索。
将共享专家融合检查移至 Quark 配置,并添加精确判断
该 PR 展示了将量化后端特殊逻辑从模型代码中分离的实践,值得关注。虽然改动较小,但 can_fuse_shared_expert 的深度比较设计为可复用模式。建议在类似涉及量化配置判断的场景中参考此方式。
原始 PR · 作者 evanderfff123-boop · 合并时间 2026-06-13 11:38
为 mem_cache/utils.py 添加 46 个单元测试
此 PR 是单元测试编写的优秀范例,值得参考其如何为工具函数构建轻量级、不依赖环境的测试。团队可在其他核心模块中推广类似模式。重点关注其中 mock 和精确断言的使用。
将 EAGLE verify 方法移出 dataclass 变为独立函数
值得精读的设计决策:将 stateless 行为从数据类中分离,符合“组合优于继承”原则,降低了数据类的耦合,提升了可测试性。建议类似模块也采用此模式。
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-06-13 11:30
移除 CUDA 同步点,优化 tensor 创建延迟
值得合并,这是一个清晰、低风险的优化,遵循了 PyTorch 官方推荐的做法。核心设计决策——在热路径上使用 pin memory 和异步传输——可以推广到其他张量创建上。
原始 PR · 作者 merrymercy · 合并时间 2026-06-13 11:26
添加 prajjwal1 到 CI 权限配置
可快速合并。权限授予类 PR 需确保配置格式正确且用户身份可信。
tokenspeed_mla 版本 0.1.1 → 0.1.6
值得合并,性能提升显著且风险低。推荐关注其他使用 tokenspeed_mla 的模型(如 DeepSeek V4)的回归测试结果。
参与讨论