Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 00:39 同步状态:空闲 下次计划:2026-09-04 01:39

PR 列表

更多筛选
2026-08-01

#32890 feat(kernels): port standalone Kimi K3 kernels

原始 PR · 作者 BBuf · 合并时间 2026-08-01 13:26

功能 重要性 7.75 洞察度 7.00

移植 Kimi K3 独立内核与四组硬件测试,为 Blackwell 集成铺路

值得精读,尤其适合内核与 JIT 基础设施维护者。建议重点看:(1) PR body 的移植边界切割与 #32624 的 kernel/runtime 分离策略;(2) `chunk_fwd.py` 的缓存设计(用 data_ptr/shape/stride 做 key 规避 id 复用陷阱、消除 GPU->CPU sync 的 50-200 us stall);(3) review 中 AOT vs JIT、PTX helper 组织、拷贝策略 benchmark 的讨论;(4) “恢复损失性导出”的逐文件审计方法,对任何跨分支移植都有借鉴价值。一般服务端工程师只需阅读执行摘要与风险章节。

基础设施 重要性 4.88 洞察度 3.00

DeepGEMM 0.1.5.post1 取代 Kimi K3 本地 SiTU 补丁

值得快速浏览,核心价值在于『上游正式支持后移除本地 hack』的维护模式:140 行补丁被两行 pip 安装替换。建议 K3 镜像维护者在合入后做一次 cu12/cu13 的端到端验证(至少启动与一轮生成),并用数值/输出对比确认官方 SiTU 与原补丁行为一致;另可确认 GitHub Releases 资产 URL 的长期可用性。

缺陷修复 重要性 5.81 洞察度 6.00

恢复序列化 MXFP4 MoE 权重 aiter 对齐维度

值得精读:PR body 的 bisect 过程和根因分析是排查此类静默精度回归的范例。建议合并后立即跟进补充形状一致性断言或序列化 + aiter padding 路径的单测,并关注 fxmarty-amd 提到的 #21097 与 #28291 冲突解决教训。

#33157 [Docs] Add RTX 5090 DeepSeek-V4 recipe

原始 PR · 作者 Fridge003 · 合并时间 2026-08-01 10:04

文档 重要性 5.55 洞察度 3.00

新增 RTX 5090 的 DeepSeek-V4 部署配置

值得快速浏览,用于理解 cookbook 配置数据如何组织(硬件登记与部署 cell 分离、verified 状态语义、flags 的注入约定)。设计上可借鉴的是把硬件元数据作为配置而非引擎代码,以及用 Not Verified 状态透明区分未经基准验证的命令。无需深入精读,因为不涉及运行时逻辑。

性能优化 重要性 9.19 洞察度 8.00

M3 注意力 GEMM 全面 fp8 化,prefill 最高提速 66%

值得精读。三个 commit 相互独立、各有用处:升序 topk 契约、page128 支持、fp8 模式。重点关注:`m3_fp8_attn_gemm_enabled` 的推导式开关与 kill switch 设计、per-tensor scale 以 `Optional[float] = None` 端到端传递并归一化到 `unit_scale()` 的边界约定、`q_scale` 折入 `sm_scale`(同时作用 QK dot 与 sink logit)而 `k_scale` 不能碰 sink 项的数学约束,以及 warp-wise 升序排序与 fmha_sm100 early-exit 机制的契约互动。测试方法论(fp8 vs 反量化 bf16 参考的 parity 策略 + CUDA graph 位精确断言)也值得直接复用。

重构 重要性 8.56 洞察度 7.00

Inkling 短卷积状态收敛到单 metadata,移除池级缓存

值得精读,尤其适合关注 attention backend metadata 生命周期与 CUDA graph buffer 管理的工程师。三个设计决策值得借鉴:(1) cache ownership 应该由调用方而非池来承担,且用 AST 扫描与微基准论证移除缓存的 blast radius;(2) per-step metadata 采用可变 `msgspec.Struct`、由 prep 就地填充,与 `FlashAttentionMetadata` 对齐;(3) 用构造性等价(`at_layer_idx(L).conv[s]` 与 `conv[s][L]` 等价)配合 bit-identical 模型校验,而不是用 mock 计数测试去钉死 wiring。

性能优化 重要性 8.03 洞察度 6.00

调度器侧扁平化 prompt top logprobs 数组,两跳 IPC 省约 30ms

值得精读。三个设计点尤其值得借鉴:(1) 把数据面“组装前移 + 可选字段 + 默认 None”的兼容策略——新字段只对 opt-in 请求非 None,未使用方 wire 不变;(2) 共享校验原语 `build_flat_input_top_logprobs_arrays` 在 scheduler 与 tokenizer 两个进程复用,保证 fallback 语义一致;(3) 提交了 env-gated 的可复现序列化 microbench。需要留意的是 ch-wan 提出的缓存遮蔽与 idx 校验两个未解决的健壮性问题,未来若把 flat 格式扩展到 MIS 或其他请求路径,应先补齐这些防御。

参与讨论