清理 DeepSeek V4 废弃环境变量,统一后端路径
值得精读,特别是 `compress_hip.py` 和 `deepseek_v4_backend.py` 的 diff,展示了如何通过删除历史开关来收敛配置面。推荐关注两点:一是 AMD 特有路径被回收时的取舍,二是 `use_swizzle` 从环境变量变为后端推导的依赖方向。
SGLang is a high-performance serving framework for large language models and multimodal models.
清理 DeepSeek V4 废弃环境变量,统一后端路径
值得精读,特别是 `compress_hip.py` 和 `deepseek_v4_backend.py` 的 diff,展示了如何通过删除历史开关来收敛配置面。推荐关注两点:一是 AMD 特有路径被回收时的取舍,二是 `use_swizzle` 从环境变量变为后端推导的依赖方向。
原始 PR · 作者 Lenoplus42 · 合并时间 2026-08-18 06:18
修复 prefill FLOPs 估算:按请求计入 prefix 因果对与 KV 读取
值得精读。本 PR 是 observability 指标"从数学正确性到物理真实性"的典型样本:数学修复本身直白,但 read_bytes 的演进(`sum(c*p)` → `sum(prefix_lens)`)展示了如何用 HBM 峰值带宽做合理性检验来校正建模假设。测试技巧也可借鉴——把所有系数清零、把 attention 系数置 1,让估计值归约成可断言的整数。建议关注 hnyls2002 对 FA 内核流式读取行为的分析,以及作者对 `prefix_lens` 索引对齐假设的明确声明。
DGX Spark 复用 RTX PRO 6000 配方并完成 36 项验证
这个 PR 值得精读。它展示了文档/配置类变更如何以真实硬件实测为支撑,并在 review 中坚持验证口径诚实;"弱验证标准明确声明、不借用强验证措辞"的做法尤其值得借鉴。关注 @Jiminator 对误导性注释的 re-audit 和 @zijiexia 对陈述准确性的把关。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-08-18 05:48
MI35x 新增 Kimi-K3 精度 nightly,替换 K2.6
值得精读,尤其是 6 个 commit 的演进过程。这个 PR 虽无源码逻辑,但展示了高质量的 CI 工程判断:精度先于性能、用硬件 ISA 约束校验"替换"决策、不 pin 废弃镜像、用 completion harness 规避 chat 模板陷阱。对想了解 sglang AMD nightly 编排(register_amd_ci、run_suite.py、job_select 联动)的读者是很好的范本。
原始 PR · 作者 merrymercy · 合并时间 2026-08-18 05:24
清理 sglang 顶层包结构:删 eval、迁移配置与内核日志
值得精读,尤其适合大型 Python 引擎包的维护团队。本 PR 体现了三类可复用的工程模式:1) 平台兼容桩用 PEP 451 meta-path finder + 按平台条件懒加载统一收敛,保持顶层包轻量;2) 公共模块迁移采用“顶层属性重导出 + 内部导入统一改源”的双轨策略,兼顾老用户与内部一致性;3) 纯结构性清理也借助 ratchet 类测试守住导入与模块状态,防止后续回归。建议 merge 后关注是否有外部 issue 反馈 `sglang.global_config` / `sglang.kernel_api_logging` 直接子模块导入失败,必要时补一层兼容 shim。
DSpark 路径启用 output logprobs,复用共享投机处理器
若您的业务在 DeepSeek-V4 DSpark 上依赖 `logprobs` 输出,本 PR 值得精读;值得关注的设计决策是"复用共享投机 v2 处理器而非复制实现",这与仓库内 specv2 统一化的方向一致。由于本次分析未获得 diff,建议以完整 patch 复核两点:accepted-token 的 logprob 到底取自 draft 分布还是 target 分布,以及放开限制后是否影响 DSpark 与其他投机后端共存的调度分支。
ngram 接受状态改走 FutureMap 中继,修复跨流竞态
值得精读,尤其是 `overlap_utils.py` 里 stash / resolve 的时序设计。它展示了一个典型的跨流竞态修复范式:让写者流负责读者流的数据准备,中间层只传索引。建议配合 #35059 一起阅读,理解 coarse / fine fence 的取舍,以及如何用 FutureMap 中继模式收敛多种 speculative 算法的状态传递。
Kimi-K3 部署面板新增 NVFP4 量化选项并联动镜像与 runner
值得精读,但重点不在改动量而在注释中沉淀的部署知识:它清晰解释了 NVFP4 checkpoint 对 MoE runner 的硬性约束(SiTU 内核、TRT-LLM deferred finalize、CUDA graph 捕获),以及 `stripPrefixes + flags` 这种正交 overlay 维度如何在不膨胀部署网格的前提下替换单元格参数。该模式对任何需要呈现"量化/精度选项"的 cookbook 面板都有参考价值。建议阅读时关注 `kimi-k3.jsx` 中 quant 维度的前后呼应写法(disabled → disableReason → stripPrefixes → flags → hints),这是一套完整的选项设计模板。
参与讨论