Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

glm 相关 PR

2026-06-19
性能优化 重要性 5.57 洞察度 3.00

移除MoE FP8量化中的冗余类型转换和拷贝

建议合并。这是一个小而明确的性能优化,经过精度验证(GSM8K)和 CI 测试,无风险。两个优化点(移除降级拷贝和 .contiguous())在 FP8/FP4 MoE 前向路径上直接减少了开销。对于理解 `per_token_group_quant_fp8` 接口和 MoE 推理优化有参考价值。

2026-06-10

#26049 Fix GLM NextN draft value head dim

原始 PR · 作者 yueming-yuan · 合并时间 2026-06-10 07:13

缺陷修复 重要性 6.29 洞察度 6.00

修复 GLM NextN draft 的 v_head_dim 推导

值得精读。虽然改动了 11 行,但其背后的 root cause 揭示了 MHA/MLA 混合架构下的 `v_head_dim` 继承陷阱。核心设计要点是:当模型配置源自 MLA 架构时,`v_head_dim` 可能远大于 MHA draft 的真实 `head_dim`,必须在架构重写时显式修正。此模式可作为未来类似 MHA-over-MLA draft adapter 的参考。

2026-05-26
功能 重要性 9.18 洞察度 6.00

GLM-4.7-Flash 独立 MLA 实现及 NextN 推测解码

建议仔细审查 `glm4_moe_lite_nextn.py` 的 `__init__` 是否按 review 建议修复;若未修复,应及时补充。此 PR 的独立模型设计思路值得参考,尤其 MLA NextN 的 zero_allocator 传递模式。建议合并后补充针对模型加载和 pipeline 的测试。