SM100 上默认开启 CuteDSL BF16 GEMM
值得精读,尤其是关注内核自动选择策略的设计和梯度检查的添加。可作为后续其他后端默认启用的参考模式。
SGLang is a high-performance serving framework for large language models and multimodal models.
SM100 上默认开启 CuteDSL BF16 GEMM
值得精读,尤其是关注内核自动选择策略的设计和梯度检查的添加。可作为后续其他后端默认启用的参考模式。
修复 Standard allocator 过度驱逐问题
值得快速合并。建议后续补充针对 `evict_from_tree_cache` Standard allocator 分支的单元测试,验证驱逐量正确性。
统一优雅关闭时的 pinned host 内存释放路径
值得精读,因为展示了如何通过抽象基类统一资源释放路径,是良好的代码重构范例。关注点在于是否所有涉及 host pool 的缓存都已覆盖。
回滚 RuntimeContext 配置命名空间迁移上半部分修复正确性缺陷
强烈建议阅读 PR body 中列出的三项缺陷及回滚范围,理解配置系统设计中的加载时覆盖与多实例隔离难题。本 PR 是架构决策的宝贵反面案例,值得团队深入讨论。
修复 CI main 分支导入和测试断言问题
建议快速合并以恢复 CI 健康状态。该 PR 可作为示例:展示如何在引入新 API 后及时更新相关模块的导入,以及如何因生产代码变更而修正测试断言。
修复 qwen3.5 未导入 get_server_args
该 PR 是紧急导入修复,技术价值较低。但建议关注:①相似问题是否在其他模型文件中存在;②#24651 的 PR 审查是否漏检了导入。可以精读 #24651 的合并情况。
添加 Inkling per-commit 端到端服务器测试
该 PR 展示了如何为复杂模型设计快速端到端 CI 测试,值得借鉴在测试中启动服务器、配置特定参数、覆盖多模态等做法。但测试本身较为简单,没有深入验证数值正确性。建议后续可以增加对输出的结构验证和更广泛的多模态场景。
原始 PR · 作者 vedularaghu · 合并时间 2026-07-22 23:25
修复 streaming 中 partial JSON 解析断言异常
建议合入此 PR。它是一个典型的小型防御性修复,虽简单但有效防止了特定输入导致的请求中断。阅读 `_partial_json_loads` 的异常处理结构可获得防御性编程启发。
参与讨论