启用 H100 上 FA3 FP8 注意力测试覆盖
值得合入,作为测试覆盖补强和小型 dtype 处理学习点。建议关注后续 CI 运行结果,验证 H200 上的实际通过情况。
A high-throughput and memory-efficient inference and serving engine for LLMs
启用 H100 上 FA3 FP8 注意力测试覆盖
值得合入,作为测试覆盖补强和小型 dtype 处理学习点。建议关注后续 CI 运行结果,验证 H200 上的实际通过情况。
原始 PR · 作者 jikunshang · 合并时间 2026-07-21 10:11
更新 XPU Docker 镜像文档
该 PR 为常规文档更新,无需精读,可快速合并。
原始 PR · 作者 cleonard530 · 合并时间 2026-07-21 09:31
更新QuTLASS CMake集成以支持稳定ABI
建议合入。该PR使QuTLASS扩展成为ABI稳定版本,降低了维护成本。但需确认上游提交已稳定且无其他回归。
原始 PR · 作者 AlejandroParedesLT · 合并时间 2026-07-21 09:30
修复 WSL 平台循环导入导致 import vLLM 失败
此 PR 是紧急 bugfix,修复逻辑简单明确,值得快速合并。测试设计巧妙(伪造 uname 模拟 WSL),可作为类似场景的参考。对于阅读者,核心看点是理解循环导入的触发链。
修复 AWQ 预处理内核非合并 HBM 访问,提速 2.22x
建议仔细阅读以学习 GPU 内存合并优化模式。评审中 Copilot 对冗余检查和未使用参数的提醒展示了代码审查的价值,值得在其他内核优化中参考。
修复 STT 文档中协议定义链接
简单直接的文档修复,可快速合并。无需进一步审核。
修复 KV 缓存配置中 per-group 块计数错误
值得合并。改动简洁,测试充分,修复了一个潜伏且可能影响容量评估的 bug。设计上逐组计算块需求是更正确的做法,推荐关注 `UniformTypeKVCacheSpecs` 聚合行为的理解。
删除未使用的 status 字段
值得合并,清理死代码降低认知负担。
参与讨论