NPU 文档中命令行参数名称更新
该 PR 价值较低,仅为简单的文档同步更新,无需精读。若需了解 NPU 相关参数完整信息,可查阅该文档。
SGLang is a high-performance serving framework for large language models and multimodal models.
NPU 文档中命令行参数名称更新
该 PR 价值较低,仅为简单的文档同步更新,无需精读。若需了解 NPU 相关参数完整信息,可查阅该文档。
新增 Rust TokenizerManager、Ring 和 Runtime 模块
该 PR 是 SGLang Rust Server 基础架构的关键拼图,设计上在内存布局(列式数据)、并发模型(flume + select)和 GIL 管理方面有很多值得学习的权衡。建议团队内所有参与核心调度和通信的开发人员仔细阅读 `ring.rs` 和 `tokenizer_manager.rs` 的设计文档和代码注释。合并后应尽快补充集成测试,并考虑在 CI 中启用 Rust server 的端到端测试。
原始 PR · 作者 wirybeaver · 合并时间 2026-07-30 09:18
MLX 请求容量按 attention DP 大小分配,修复纯 DP 副本容量不足
建议:MLX 后端开发者和 CI 维护者审查此 PR,确保后续 #32101、#32102 可以无缝集成。测试覆盖较全,可放心合并。注意 @noob-se7en 正在重构 model_runner_stub,未来可能再次调整此逻辑。
添加内核注册库存防护并清理基准测试布局
推荐内核贡献者和基础设施维护者精读。`KernelRegistry.register()` 的语义变化与冲突检测设计值得学习,尤其是如何在不引入运行时依赖的前提下用 AST 进行结构性验证。此外,文件组织重构为基准测试提供了清晰布局。
文档首页和导航引入模型轮播组件并重新排序
对于文档和前端开发者,值得精读:数据与展示分离、可访问性处理、Mintlify 平台限制下的组件设计。对于核心引擎开发者可忽略。
修正 Kimi-K3 H200 吞吐配方为 4×8 TP32/EP32
作为纯文档修复,建议合并。无需精读,但可关注其数据驱动的配置校正方式(基于实际运行结果更新文档)。
新增 Rust egress 消息层与完成原因模块
该 PR 设计精巧,尤其关注了向前兼容(FinishReason::Unknown)和安全性(正则 admission 缓存、边界检查)。值得所有参与 Rust 服务器开发的成员精读,理解 egress 协议和数据类型约定。对于非 Rust 开发者,可以跳过实现细节,但应当通过 final_report 了解整体架构演进。
在SM120上启用GPT-OSS FlashInfer MXFP4 MoE
值得精读。本PR展示了如何为特定GPU架构添加新的MoE内核后端,包括初始化检测、对齐约束处理、权重后处理以及自动切换。对于涉及多架构内核支持的开发者有很好的参考价值。
参与讨论