修复位相同张量 rel_diff 为 NaN 问题
值得合并。这是一个明确的正确性修复,逻辑清晰且测试覆盖充分。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复位相同张量 rel_diff 为 NaN 问题
值得合并。这是一个明确的正确性修复,逻辑清晰且测试覆盖充分。
为张量比较器添加 per-regex predicate 规则,替代单一浮点阈值
值得精读,特别是 `threshold_dsl.py` 中安全 eval 的设计模式(空 builtins、dummy 环境预校验)和 per-regex 规则解析的 fail-closed 策略,可作为类似工具 DSL 实现的参考。
从 NPU 文档移除不支持的模型
建议合并。作为一个简单的文档更新,目的是保持模型支持列表的准确性和时效性。
原始 PR · 作者 merrymercy · 合并时间 2026-07-09 18:46
EPLB 手动测试支持 FlashInfer A2A
值得合并,增强测试灵活性。建议后续采纳 review 中的 `.lower()` 建议以提升环境变量容错性。
DSA 缓存层分片,减少预填 CP 下每 rank 的 KV 内存
**建议精读**,尤其是对 ML 推理内存优化与分布式缓存设计感兴趣的工程师。PR 中关于专用 NCCL 通信器、异步广播、延迟同步的设计值得借鉴。当前主机池部分暂未完整,对于非 GLM5.2 的部署无需关注;若计划在生产环境启用,建议等待主机池改造完成后再全面验证。
原始 PR · 作者 billishyahao · 合并时间 2026-07-09 17:54
修复 gfx950 上 FP8 dtype 错误分发
本 PR 为平台特异性 bugfix,改动清晰简洁,值得快速合并。建议后续增加单元测试,验证 `is_fp8_fnuz()` 在不同 GPU 平台上的返回值及对应的 dtype 选择,防止回归。
提取聊天编码调度到共享模块,消除 serving 与 benchmark 镜像代码
值得精读作为代码重用和重构的范例。重点关注如何安全提取共享逻辑(AST 等价性验证方法)以及处理跨模块(serving vs benchmark)依赖的策略。建议之后为 `chat_encoding.py` 补充单元测试。
修复 prefetch 测试因导入变化导致的回归
值得合并。这是一个简单但必要的回归修复,确保测试基础设施正确同步,避免 CI 噪音。
参与讨论