新增 RoPE 缓存 FP32 保留开关
建议关注 review 中指出的 forward 路径 dtype 覆盖问题,补充对 `forward_cuda` 和 `_match_cos_sin_cache_dtype` 的修改,并添加测试用例验证 FP32 缓存在整个生命周期中保持。可作为非 CUDA 数值稳定性改进的起点。
SGLang is a high-performance serving framework for large language models and multimodal models.
新增 RoPE 缓存 FP32 保留开关
建议关注 review 中指出的 forward 路径 dtype 覆盖问题,补充对 `forward_cuda` 和 `_match_cos_sin_cache_dtype` 的修改,并添加测试用例验证 FP32 缓存在整个生命周期中保持。可作为非 CUDA 数值稳定性改进的起点。
全局统一并行拓扑访问模式,启用采用检查
值得精读。该 PR 展示了如何系统性地统一代码库中的 API 访问模式:通过中心化 wrapper、逐步迁移、删除冗余、引入回归检查。其 `override()` 上下文管理器设计模式尤其值得借鉴。
拆分 DP 聚集缓冲区的元数据与 per-forward 状态
建议精读该 PR 以理解运行时标志分层模式,特别是 torch.compile 兼容性权衡部分(如何评估 dynamo 值守卫导致的重新编译限制),这对类似状态拆分设计有指导意义。
统一 per-forward flags 层,替代分散的模块级状态
本 PR 是运行时上下文模块的重要重构,值得架构师和核心开发者精读。重点关注 ForwardFlags 的双备份设计、scoped 的事务语义、以及如何平衡 torch.compile 兼容性与 contextvar 的隔离性。review 中的讨论涵盖了 PEP8 权衡、API 设计哲学和类型注解策略,也值得参考。
将 EP 和 FlashInfer 融合工作区状态迁移至 ctx.resources
值得精读。该 PR 展示了可测试的状态管理模式(从类属性到可注入上下文),以及行为保持迁移方法(不改变语义的情况下重构状态存储)。关于 None guard 的讨论提供了设计取舍的思辨:保持失败快还是添加防御性代码。
新增固定 prompt 模式与 per-request spec_accept_length 指标
该 PR 值得关注,特别是对从事 LLM 推理和投机解码评估的工程师。其中 `_encode_fixed_prompt` 的设计体现了对不同模型编码路径的抽象,FIXME 注释也暴露了客户-服务器编码逻辑重复的问题,未来可能需统一。
原始 PR · 作者 JessicaJiang-123 · 合并时间 2026-07-09 16:30
修复 ROCm AITER all-gather 在 torch_memory_saver 下的崩溃
值得合入。这是一个针对特定平台环境组合的小而关键的修复,遵循了与已合并的 all-reduce 修复相同的模式,逻辑清晰且风险极低。
原始 PR · 作者 AMD-yanfeiwang · 合并时间 2026-07-09 16:22
启用ROCm HiCache JIT分阶段写回并修复索引崩溃
该PR值得精读,尤其是JIT kernel平台适配和向量化技巧。对于维护多后端的团队,此PR展示了如何优雅处理PTX平台差异。建议关注后续是否回退#28473,以及是否需要在更多后端(如NPU)上推行类似模式。
参与讨论