从 NPU 文档移除不支持的模型
建议合并。作为一个简单的文档更新,目的是保持模型支持列表的准确性和时效性。
SGLang is a high-performance serving framework for large language models and multimodal models.
从 NPU 文档移除不支持的模型
建议合并。作为一个简单的文档更新,目的是保持模型支持列表的准确性和时效性。
原始 PR · 作者 merrymercy · 合并时间 2026-07-09 18:46
EPLB 手动测试支持 FlashInfer A2A
值得合并,增强测试灵活性。建议后续采纳 review 中的 `.lower()` 建议以提升环境变量容错性。
DSA 缓存层分片,减少预填 CP 下每 rank 的 KV 内存
**建议精读**,尤其是对 ML 推理内存优化与分布式缓存设计感兴趣的工程师。PR 中关于专用 NCCL 通信器、异步广播、延迟同步的设计值得借鉴。当前主机池部分暂未完整,对于非 GLM5.2 的部署无需关注;若计划在生产环境启用,建议等待主机池改造完成后再全面验证。
原始 PR · 作者 billishyahao · 合并时间 2026-07-09 17:54
修复 gfx950 上 FP8 dtype 错误分发
本 PR 为平台特异性 bugfix,改动清晰简洁,值得快速合并。建议后续增加单元测试,验证 `is_fp8_fnuz()` 在不同 GPU 平台上的返回值及对应的 dtype 选择,防止回归。
提取聊天编码调度到共享模块,消除 serving 与 benchmark 镜像代码
值得精读作为代码重用和重构的范例。重点关注如何安全提取共享逻辑(AST 等价性验证方法)以及处理跨模块(serving vs benchmark)依赖的策略。建议之后为 `chat_encoding.py` 补充单元测试。
修复 prefetch 测试因导入变化导致的回归
值得合并。这是一个简单但必要的回归修复,确保测试基础设施正确同步,避免 CI 噪音。
新增运行时上下文架构技能文档
强烈建议阅读该技能文档,以深入理解 SGLang 运行时上下文的架构设计和开发者契约。该文档是理解 #30489-#30493 等重构 PR 的关键辅助材料。项目管理人员应确保代码实现堆栈先合入,再合并此 PR。
统一配置访问器并迁移进程单例至运行时上下文
值得精读。PR 展示了如何在大型代码库中系统性地替除全局访问器、迁移全局单例,并提供了安全的测试覆盖模式。`_ServerArgsOverride` 的设计(明确使用普通类而非生成器)和 override 链路的实现是良好的工程实践。建议关注 `template_detection.py` 中 `setattr` → `override` 的权衡,以及 `trace_level` 的延迟初始化模式。
参与讨论