#43670 [Rust Frontend] Optimize multimodal prompt expansion
原始 PR · 作者 ricky-chaoju · 合并时间 2026-05-29 00:46
优化 Rust 前端多模态提示扩展性能,最高 7.3x 加速
建议精读本 PR,尤其是从 splice 转向预分配单次遍历的优化模式,这对理解向量操作在性能敏感路径上的设计很有价值。同时也展示了如何利用 benchmark 数据驱动决策,以及及时清理临时文件保持代码质量。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 ricky-chaoju · 合并时间 2026-05-29 00:46
优化 Rust 前端多模态提示扩展性能,最高 7.3x 加速
建议精读本 PR,尤其是从 splice 转向预分配单次遍历的优化模式,这对理解向量操作在性能敏感路径上的设计很有价值。同时也展示了如何利用 benchmark 数据驱动决策,以及及时清理临时文件保持代码质量。
原始 PR · 作者 MaciejBalaNV · 合并时间 2026-05-29 00:43
新增 Cosmos3 Reasoner 模型支持
此 PR 是模型集成的良好范例,展示了如何通过 WeightsMapper 和 secondary_weights 机制快速适配非标准 checkpoint 格式。其中的权重映射模式设计值得学习和参考。推荐在引入其他类似架构(如混合双塔模型)时参考此实现。
ROCm 7.2.3 升级,移除 profiler hotfix
值得快速审阅并通过,该 PR 是常规的平台依赖升级,逻辑清晰、改动集中,且经过充分验证。
原始 PR · 作者 jasonboukheir · 合并时间 2026-05-29 00:30
为Intel XPU添加W4A16 INT4 MoE支持
值得精读,尤其是WNA16 oracle的可扩展设计(通过枚举和优先队列选择后端)以及XPUExpertsWNA16如何以最小改动集成到现有FusedMoE框架。关注`_process_weights_xpu`的布局转换逻辑和`apply`中的assert条件设计。
原始 PR · 作者 mgehre-amd · 合并时间 2026-05-29 00:28
ROCm 瘦 GEMM 内核支持 N=5,加速推测解码验证
值得合并的针对性性能优化。建议未来考虑自动化特化更多 N 值的方法,以减少手动添加 case 的工作量和编译时间。同时可关注 custom op 的优化机会。
重命名 get_finished 为 get_finished_jobs
该 PR 值得精读以了解团队对命名规范的重视。其核心设计决策是明确的命名表达意图,这种做法值得在类似模糊命名的场景下效仿。
原始 PR · 作者 vadiklyutiy · 合并时间 2026-05-28 23:55
修复 Ray DP 多 API-server 场景因端口分配导致挂起的 bug
值得精读以理解不同后端对地址分配机制的限制。设计清晰:后续若增加新后端,需类似评估其对延迟分配的兼容性。测试设计精巧,避免 GPU 依赖,可重复运行。
原始 PR · 作者 Majid-Taheri · 合并时间 2026-05-28 23:40
移除 Mamba SSD 内核死参数,TTFT 降低 17%
建议仔细审查以确保所有内核的 `seqlen` 参数均已移除,并考虑在类似内核中检查其他可能引发重编译的整型参数。
参与讨论