修复 CPU 推测解码因 USE_FP64_GUMBEL 崩溃
此 PR 是一次必要且安全的回归修复,改动极小(+3/-1 行),建议合入。值得关注的是:当为 GPU 内核添加新参数时,需同步更新所有 CPU / 回退封装函数以避免类似 API 不一致错误。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复 CPU 推测解码因 USE_FP64_GUMBEL 崩溃
此 PR 是一次必要且安全的回归修复,改动极小(+3/-1 行),建议合入。值得关注的是:当为 GPU 内核添加新参数时,需同步更新所有 CPU / 回退封装函数以避免类似 API 不一致错误。
拆分 ServingRender 为 OnlineRenderer/OnlineDerenderer,重构前端渲染架构
值得精读。展示了如何通过职责拆分降低模块耦合,并涉及多文件联动的系统工程。设计上采用 BaseServing 统一入口模式,为后续前端模块化提供了参考。但需注意在合并前确保导入问题已修复,并补充 render-only 场景的集成测试。
原始 PR · 作者 tanpinsiang · 合并时间 2026-06-23 18:33
支持 MoRIIO 异构 TP 的 ACK fan-in 与 rank 映射
值得精读,特别是 `get_moriio_remote_tp_rank` 的映射策略和 ACK fan-in 的设计。该设计为不同推理阶段的 TP 异构提供了可扩展的框架。测试覆盖全面,建议参考测试用例理解边界条件。
原始 PR · 作者 jperezdealgaba · 合并时间 2026-06-23 18:24
修复 NaN 音频导致 split_audio 无限循环的安全漏洞
建议精读,此 PR 展示了典型的数值安全性 bug 修复模式:IEEE 754 NaN 比较陷阱 + 循环进度保护。值得作为安全编码范例。
原始 PR · 作者 frida-andersson · 合并时间 2026-06-23 18:12
融合 MLA Q 拼接与 FP8 量化,减少 ROCm decode 延迟
该 PR 值得快速合入,性能效果明确且验证充分。但建议关注 Gemini 的架构建议,在后续清理 PR 中考虑使用 supports_quant_query_input 统一模式,以减少手动调用和潜在不一致。
修复 GPT-OSS 在 PP > 1 时 EP 权重加载失败
该 PR 是一行修复,逻辑清晰,风险低,建议合入。值得关注的是评审者的发现:GPT-OSS 是唯一错误使用 `get_ep_group().rank` 的模型,其他模型实现均正确。建议后续在代码审查中统一推广 `rank_in_group` 的使用,或在框架层面封装正确的方法以避免类似 bug。
Rust 前端拒绝空 allowed_token_ids,对齐 Python 校验
此 PR 是典型的跨语言行为对齐修复,代码简洁、构造清晰、测试完备,适合浏览以了解 Rust 前端的参数验证流程。特别值得注意的是错误类型的重构思路——通过枚举替代独立结构体,保持了错误层次的整洁。
支持 token-ID 类型 prompt 的 echo 回显
此 PR 值得精读,展示了在 Rust 前端中为 completions 端点添加新功能的清晰模式:调整验证层、新增转换函数、注入 tokenizer 依赖,并辅以集成测试。这种模式可复用于其他 feature parity 任务。
参与讨论