#48746 [CI][ROCm] Stabilize ci_base hash calculation and image handoff
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-07-15 23:56
修复 ROCm CI base 镜像哈希计算与传递
该 PR 为 CI 稳定性修复,值得精读以了解 CI 镜像选型中的竞态问题及解决方案。关注其设计模式:通过多次计算并比对、显式失败代替静默默认值来提升确定性。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-07-15 23:56
修复 ROCm CI base 镜像哈希计算与传递
该 PR 为 CI 稳定性修复,值得精读以了解 CI 镜像选型中的竞态问题及解决方案。关注其设计模式:通过多次计算并比对、显式失败代替静默默认值来提升确定性。
原始 PR · 作者 xiaohongchen1991 · 合并时间 2026-07-15 23:43
新增 Helion 内核基准测试脚本与惰性注册
本 PR 值得精读,尤其是 `benchmark_helion_kernels.py` 的设计:如何选择基准测试方法(triton.do_bench vs tritonbench 的 cudagraph 实现)、如何组织基线映射。惰性注册的模式也值得在类似场景复用。风险较低,建议合入后通知相关开发者检查自定义脚本是否需要显式调用 `import_all_kernels()`。
原始 PR · 作者 xiaohongchen1991 · 合并时间 2026-07-15 23:42
Helion 内核注册改为惰性模式
建议此 PR 值得精读,因为它提供了一个清晰的惰性注册模式,适合其他类似的自定义内核或插件系统参考。关键设计决策是将注册与包导入解耦,提高了启动速度和日志清晰度。
原始 PR · 作者 tzielinski-habana · 合并时间 2026-07-15 23:19
为 XPU 注册批次不变核函数,支持强化学习
值得精读,尤其是其跨平台 dispatch key 抽象和测试基础设施的统一设计。评审中关于 `allow_override` 的讨论提醒了 dispatch 冲突处理,是值得关注的设计细节。建议在后续 PR 中尽快补齐 matmul/linear 的注册,并移除 E2E 测试的 xfail。
原始 PR · 作者 peizhang56 · 合并时间 2026-07-15 23:03
重新启用 ROCm cudagraph 内存分析并修复吞吐回归
建议精读该 PR,它展示了 GPU 内存流分配对性能影响的深刻分析,以及一个优雅的修复——通过调整捕获流(而非重写内存管理)来解决问题。审查在线讨论(特别是关于 AITER 缓冲区所有权和 torch 缓存的深入技术分析)非常有价值。
新增 RoBERTa/XLM-RoBERTa 的 Token 分类支持
值得查阅以了解如何添加新的 pooling 模型。设计决策包括:通过装饰器指定 attention 类型和池化类型,复用 BertModel 并替换 embedding_class,利用 AutoWeightsLoader 自动映射权重。这展示了一种低代码复用的模型注册模式。
原始 PR · 作者 liranschour · 合并时间 2026-07-15 20:22
为 P2P KV 卸载添加可配置监听地址与 DP 级端口偏移
该 PR 值得精读,尤其是环境变量驱动的配置回退模式、DP rank 偏移端口分配、以及 NIXL agent 名称与其身份的解耦设计。Review 中关于默认值安全性的 discussion 也体现了将安全 left-shift 到 API 设计的思路。对于部署大规模 PD 分离 + 数据并行的团队,此 PR 是必需的。
原始 PR · 作者 chaojun-zhang · 合并时间 2026-07-15 19:53
修复 test_fs_tier.py 中 drain() 竞态条件
值得合并,修复了明确竞态条件。但建议确认 `tier.drain_jobs()` 是否有内部超时机制,若没有可考虑添加测试级超时以防范 hang。
参与讨论