#40037 [ROCm] Add gfx1102/gfx1103 support
原始 PR · 作者 mgehre-amd · 合并时间 2026-04-23 16:32
新增gfx1102/gfx1103 GPU架构支持
建议合入。此修复对AMD RDNA 3 iGPU用户为必需,且改动简洁、风险低。值得注意的要点是采用编译器提供的通用宏而非手动枚举,这是一种更健壮的做法,未来新增架构时无需修改源代码。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 mgehre-amd · 合并时间 2026-04-23 16:32
新增gfx1102/gfx1103 GPU架构支持
建议合入。此修复对AMD RDNA 3 iGPU用户为必需,且改动简洁、风险低。值得注意的要点是采用编译器提供的通用宏而非手动枚举,这是一种更健壮的做法,未来新增架构时无需修改源代码。
原始 PR · 作者 zhenwei-intel · 合并时间 2026-04-23 16:22
移除 torchrun 测试中硬编码的 gloo 后端
该 PR 可作为基础设施改进的参考,但价值有限。建议关注 review bot 关于移除整个 `dist.init_process_group()` 调用的建议,考虑是否在后续 PR 中进一步清理。
原始 PR · 作者 Harry-Chen · 合并时间 2026-04-23 15:51
默认 CUDA 版本 12.9 → 13.0,重构架构列表
建议仔细阅读架构列表调整部分,特别是关于 SM86 和 SM89 纳入的决策理由。同时关注 Volta 用户迁移路径的文档说明是否充分。
原始 PR · 作者 NickLucche · 合并时间 2026-04-23 15:42
支持JSON CLI参数中的人类可读数字后缀(如1k、80m),提升用户体验。
建议工程师阅读此PR以了解如何扩展CLI参数解析,关注正则表达式设计(单词边界使用)和循环导入的解决方式(函数移动)。对于类似功能,可参考此实现模式。
原始 PR · 作者 shen-shanshan · 合并时间 2026-04-23 13:46
为视觉语言模型示例添加 CUDA 图编译支持选项。
建议关注 `maybe_add_vit_cuda_graph_compilation_config` 函数的配置逻辑和 `get_encoder_cudagraph_budget_range` 的设计权衡,了解 CUDA 图优化在多模态推理中的实现方式。
为Responses API添加tool_choice/tools验证,对齐OpenAI行为。
此PR展示了如何利用Pydantic的`model_validator`在API入口层实现业务规则校验,代码简洁且可测试性强。推荐所有涉及用户输入验证的模块参考此实现模式。对于使用Responses API的开发者,值得了解其`tool_choice`默认行为的变化。
通过跳过FX图反序列化,将热编译时间降低至亚2秒级别。
建议技术管理者和工程师精读此PR,重点关注`generate_execution_code_with_name`的设计决策,以及缓存反序列化的跳过逻辑。这些变更展示了如何通过代码生成优化编译性能,值得学习。
原始 PR · 作者 jikunshang · 合并时间 2026-04-23 13:21
重构GPTQMarlinMoEMethod以使用modular kernel框架,引入WNA16 MoE oracle后端选择。
该PR值得精读以了解oracle设计模式和modular kernel集成。关注`int_wna16.py`中的后端选择逻辑、层无关性实现,以及review中讨论的LoRA支持和回退路径问题,这些是未来类似重构的关键决策点。
参与讨论