执行摘要
调整 MI300 score API 性能阈值
AMD CI 镜像更新 AITER c16d44b 后,MI300 score API 基准平均延迟稳定在 51–54 ms,超过共享的 48 ms 限制。虽然请求仍成功完成,但 CI 会因性能断言失败而报错,因此需要为 MI300 单独调整阈值。
值得快速浏览,但无深度技术内容。关注 AMD CI 性能基线的维护,建议记录放宽阈值的理由,并考虑在性能稳定后收紧。
无 review 评论。仅 HaiShaw 批准,未提出进一步讨论。
AMD CI 镜像更新 AITER c16d44b 后,MI300 score API 基准平均延迟稳定在 51–54 ms,超过共享的 48 ms 限制。虽然请求仍成功完成,但 CI 会因性能断言失败而报错,因此需要为 MI300 单独调整阈值。
值得快速浏览,但无深度技术内容。关注 AMD CI 性能基线的维护,建议记录放宽阈值的理由,并考虑在性能稳定后收紧。
无 review 评论。仅 HaiShaw 批准,未提出进一步讨论。
| 文件 | 模块 | 状态 | 重要度 |
|---|---|---|---|
test/registered/perf/test_bench_serving_1gpu_part2.py |
性能测试 | modified | 4.04 |
test/registered/perf/test_bench_serving_1gpu_part2.py
test-coverage
唯一变更文件,调整 MI300 score API 性能阈值
# 测试方法 test_score_api_latency_throughput 的断言部分
# 原断言为统一阈值,现按硬件平台区分
self.assertEqual(res["successful_requests"], res["total_requests"])
# relax for mi300x(AMD CI 专用)
if is_in_amd_ci():
# MI300 平均延迟放宽到 60 ms,p95 放宽到 65 ms,吞吐降至 16 req/s
self.assertLess(res["avg_latency_ms"], 60)
self.assertLess(res["p95_latency_ms"], 65)
self.assertGreater(res["throughput"], 16)
else:
# CUDA 仍保持原阈值,保证 NVIDIA 平台性能基线不变
self.assertLess(res["avg_latency_ms"], 48)
self.assertLess(res["p95_latency_ms"], 50)
self.assertGreater(res["throughput"], 20)
当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。
风险较低,仅放宽测试阈值,可能掩盖真实性能回归,使得 AMD 平台性能退化不易被 CI 捕获。建议后续关注 AMD 平台性能基线,必要时重新收紧阈值。
影响仅限于 AMD CI 测试,降低误报率;对用户和系统无直接影响。团队可减少因阈值过严导致的 CI 失败,但需注意性能监控灵敏度下降。
当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。
参与讨论