#46452 Doc: fix missing GLM-5.x in supported models
原始 PR · 作者 ZichenYuan · 合并时间 2026-06-23 15:42
在支持模型表中添加GLM-5.x
可快速合入,无审查风险。对于关注 GLM 系列模型的用户,该文档更新提供了有用的参考信息。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 ZichenYuan · 合并时间 2026-06-23 15:42
在支持模型表中添加GLM-5.x
可快速合入,无审查风险。对于关注 GLM 系列模型的用户,该文档更新提供了有用的参考信息。
修正 Rust 前端的 reasoning-parser 语义
值得关注。PR 清晰地区分了两条启动路径的默认值语义,是 Rust 前端与 Python 后端深度集成的重要补丁。设计决策(使用 `default_py_bootstrap_parser_selection` 函数覆盖 serde 默认)可复用,`effective_engine_reasoning_parser` 的解析逻辑值得参考。
修复 allowed_token_ids 静默丢失的竞态 bug
该 PR 改动简洁、定位精准,值得所有 V2 Model Runner 使用者关注。推荐的阅读重点: - `_bias_kernel` 中竞态的分析方法(不同线程对相同地址的读写顺序问题)是 Triton 编程中一类典型 bug,值得学习。 - 屏障插入位置的权衡,以及为何不使用更重的同步原语。 - 扩展的测试用例设计,覆盖了从低到高的跨 vocab token id。
原始 PR · 作者 QwertyJack · 合并时间 2026-06-23 13:43
修复空 tool_calls 数组导致 OpenAI SDK 失败
该 PR 值得精读,原因如下: 1. 展示了如何利用 Pydantic V2 的 @model_serializer 优雅地调整序列化输出,同时保持模型定义不变。 2. 测试覆盖设计良好,既验证了 model_dump 又验证了 model_dump_json,并验证了 OpenAI SDK 模型解析。 3. 修复了一个真实影响用户的兼容性 bug,展现了良好的用户同理心。 4. review 中关于条件判断方式的讨论体现了对代码质量的关注。
原始 PR · 作者 chaunceyjiang · 合并时间 2026-06-23 13:42
将 Responses API 解析器状态移入 ConversationContext,复用单解析器实例
建议阅读此 PR,特别是 `_make_response_parser` 的引入和 `ConversationContext` 基类的设计。它展示了如何将外部状态(解析器)优雅地融入上下文中,是 Responses API 演进的重要一步。
原始 PR · 作者 WoosukKwon · 合并时间 2026-06-23 12:45
修复 DeepEP V2 未初始化 recv_topk_idx 导致的错误路由
建议精读,这是对 DeepEP V2 decode 路径的关键正确性修复。核心设计决策是将“无效行填充为 -1”与“局部 ID 转全局 ID”合并为一个融合 Triton 内核,既避免了未初始化数据被误用,又保持了 CUDA graph 捕获能力。如果团队使用 DeepEP V2 做推理,应升级至此版本。
原始 PR · 作者 tanpinsiang · 合并时间 2026-06-23 12:12
修复 MoRIIO WRITE 混合 KV 布局正确性问题
**值得精读**:此 PR 展示了如何在不改动上层调度逻辑的前提下,在分布式 KV 传输中处理异构缓存几何。`moriio_layout.py` 中的内核块布局检测算法和 `moriio_engine.py` 中的写入完成跟踪机制值得借鉴。使用 MoRIIO WRITE 模式的团队应关注此 PR 的变更。
分离 HTTP/请求/ZMQ 为独立 Tokio runtime,提升高并发性能
推荐精读此 PR,特别是 `BackgroundShutdownRuntime` 的设计、Tower middleware offload 模式以及 benchmark 方法。这些实践可复用于其他需要隔离工作负载的场景。团队应考虑将此模式推广到 Python 前端的类似瓶颈。
参与讨论