#30249 [mem_cache][6/N] refactor: move MHA host-pool into pool_host/mha.py
原始 PR · 作者 alphabetc1 · 合并时间 2026-07-08 20:12
MHA host pool 类机械迁移至独立模块
值得精读。PR 展示了如何通过可复现的机械转换脚本进行一次性大规模重构,保持 git blame 追溯,是大型项目的良好实践。关注其模块拆分策略、调用点扫描方法以及循环导入的预防措施。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 alphabetc1 · 合并时间 2026-07-08 20:12
MHA host pool 类机械迁移至独立模块
值得精读。PR 展示了如何通过可复现的机械转换脚本进行一次性大规模重构,保持 git blame 追溯,是大型项目的良好实践。关注其模块拆分策略、调用点扫描方法以及循环导入的预防措施。
修复 fused DSA top-k v2 在 tie 溢出时的 IMA 问题
建议合入。这是一次针对特定崩溃的精确定位和修复,逻辑清晰、影响面小、风险低。值得关注的是团队如何通过 GPU coredump 定位到稀疏注意力的 KV 索引问题,这种诊断方法对于 SGLang 的其他类似问题有借鉴意义。
原始 PR · 作者 IPostYellow · 合并时间 2026-07-08 19:06
重新命名 LingBot World V2 模型标识符
该 PR 属于纯命名对齐,无需精读。但可关注注册表文件中模型路径的命名规范。
更新 Ascend NPU 文档,移除不支持的功能和模型
这是一个简单的文档清理 PR,值得合并以确保文档准确性。不需要深入精读。
融合 sigmoid 和类型转换到 append 内核
值得阅读。该 PR 展示了如何通过内核融合消除小内核启动开销,设计思路清晰,且通过条件编译确保 CUDA 路径不受影响。对于理解 AMD 共享专家融合路径的优化方向有参考价值。
原始 PR · 作者 yctseng0211 · 合并时间 2026-07-08 15:41
修复 AMD CI 流水线 stage-c 门控缺失
值得合并,逻辑清晰,改动小且经过 NVIDIA 工作流验证。可快速合入。
允许 cutedsl 使用 modelopt_mixed 量化
建议阅读 PR body 中对 `modelopt_mixed` 配置形状的分析,了解不同 ModelOpt 检查点的结构差异。此 PR 修改简洁,适合作为理解 SGLang 量化与 MoE 后端交互的入门案例。
回退导致 IMA 崩溃的 KV cache 池改动
建议审慎合入,后续应在修复 IMA 的根因后以正确方式重新实现 indexer 容量优化。同时建议补充针对 DSA 模型 + indexShare 场景的回归测试。
参与讨论