#46463 fix(security): prevent infinite loop in split_audio with NaN audio sa…
原始 PR · 作者 jperezdealgaba · 合并时间 2026-06-23 18:24
修复 NaN 音频导致 split_audio 无限循环的安全漏洞
建议精读,此 PR 展示了典型的数值安全性 bug 修复模式:IEEE 754 NaN 比较陷阱 + 循环进度保护。值得作为安全编码范例。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 jperezdealgaba · 合并时间 2026-06-23 18:24
修复 NaN 音频导致 split_audio 无限循环的安全漏洞
建议精读,此 PR 展示了典型的数值安全性 bug 修复模式:IEEE 754 NaN 比较陷阱 + 循环进度保护。值得作为安全编码范例。
原始 PR · 作者 frida-andersson · 合并时间 2026-06-23 18:12
融合 MLA Q 拼接与 FP8 量化,减少 ROCm decode 延迟
该 PR 值得快速合入,性能效果明确且验证充分。但建议关注 Gemini 的架构建议,在后续清理 PR 中考虑使用 supports_quant_query_input 统一模式,以减少手动调用和潜在不一致。
修复 GPT-OSS 在 PP > 1 时 EP 权重加载失败
该 PR 是一行修复,逻辑清晰,风险低,建议合入。值得关注的是评审者的发现:GPT-OSS 是唯一错误使用 `get_ep_group().rank` 的模型,其他模型实现均正确。建议后续在代码审查中统一推广 `rank_in_group` 的使用,或在框架层面封装正确的方法以避免类似 bug。
Rust 前端拒绝空 allowed_token_ids,对齐 Python 校验
此 PR 是典型的跨语言行为对齐修复,代码简洁、构造清晰、测试完备,适合浏览以了解 Rust 前端的参数验证流程。特别值得注意的是错误类型的重构思路——通过枚举替代独立结构体,保持了错误层次的整洁。
支持 token-ID 类型 prompt 的 echo 回显
此 PR 值得精读,展示了在 Rust 前端中为 completions 端点添加新功能的清晰模式:调整验证层、新增转换函数、注入 tokenizer 依赖,并辅以集成测试。这种模式可复用于其他 feature parity 任务。
原始 PR · 作者 ZichenYuan · 合并时间 2026-06-23 15:42
在支持模型表中添加GLM-5.x
可快速合入,无审查风险。对于关注 GLM 系列模型的用户,该文档更新提供了有用的参考信息。
修正 Rust 前端的 reasoning-parser 语义
值得关注。PR 清晰地区分了两条启动路径的默认值语义,是 Rust 前端与 Python 后端深度集成的重要补丁。设计决策(使用 `default_py_bootstrap_parser_selection` 函数覆盖 serde 默认)可复用,`effective_engine_reasoning_parser` 的解析逻辑值得参考。
修复 allowed_token_ids 静默丢失的竞态 bug
该 PR 改动简洁、定位精准,值得所有 V2 Model Runner 使用者关注。推荐的阅读重点: - `_bias_kernel` 中竞态的分析方法(不同线程对相同地址的读写顺序问题)是 Triton 编程中一类典型 bug,值得学习。 - 屏障插入位置的权衡,以及为何不使用更重的同步原语。 - 扩展的测试用例设计,覆盖了从低到高的跨 vocab token id。
参与讨论